diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a46f66f8e7127263a258d44ef30fcd801b89e551 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2cfbacf2981f3c2abe6ad7e2e648c659252392cdae3e51b3fd9c383d6a09704b +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..f99712f42bb2a9520c725c5da8b78b762c575f3a --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:12c014c517b6ff386814a4eaa791788b448d99ef758b1a0f0af2d05076e30b6f +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..c87f06fc4f5ae20f13cee83cf09a94ff02052a57 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a87c63b89cfbf114f156e5890b38a355cedd43c7e862789cccd5748ec62cc78a +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..b9fcb94cbd31a5eddd9576ce045930d31e542ed6 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5e8e2e4cc1ef1e53c969effff41dcad0107cf64a1b1018212d5b61170db41e00 +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2fbab0d0a741a7a5525ab8bbd1d0a39e18609c73 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/trainer_state.json @@ -0,0 +1,1038 @@ +{ + "best_global_step": 1200, + "best_metric": 0.12971985, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200", + "epoch": 0.7111111111111111, + "eval_steps": 300, + "global_step": 1200, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + }, + { + "epoch": 0.1837037037037037, + "grad_norm": 1.2620875835418701, + "learning_rate": 1.9577805521806358e-05, + "loss": 0.1300894260406494, + "step": 310, + "token_acc": 0.960536398467433 + }, + { + "epoch": 0.18962962962962962, + "grad_norm": 1.1361067295074463, + "learning_rate": 1.95163006586405e-05, + "loss": 0.16317719221115112, + "step": 320, + "token_acc": 0.9544095665171899 + }, + { + "epoch": 0.19555555555555557, + "grad_norm": 0.8173150420188904, + "learning_rate": 1.945072539751685e-05, + "loss": 0.17428743839263916, + "step": 330, + "token_acc": 0.94750656167979 + }, + { + "epoch": 0.20148148148148148, + "grad_norm": 0.8849798440933228, + "learning_rate": 1.93811077868776e-05, + "loss": 0.12995322942733764, + "step": 340, + "token_acc": 0.9658246656760773 + }, + { + "epoch": 0.2074074074074074, + "grad_norm": 0.6326722502708435, + "learning_rate": 1.9307477604195162e-05, + "loss": 0.1278319001197815, + "step": 350, + "token_acc": 0.9639468690702088 + }, + { + "epoch": 0.21333333333333335, + "grad_norm": 1.1027580499649048, + "learning_rate": 1.9229866343235427e-05, + "loss": 0.12902997732162474, + "step": 360, + "token_acc": 0.9652777777777778 + }, + { + "epoch": 0.21925925925925926, + "grad_norm": 0.7148353457450867, + "learning_rate": 1.914830720058701e-05, + "loss": 0.14380792379379273, + "step": 370, + "token_acc": 0.9572490706319703 + }, + { + "epoch": 0.22518518518518518, + "grad_norm": 1.1909170150756836, + "learning_rate": 1.9062835061462105e-05, + "loss": 0.15708266496658324, + "step": 380, + "token_acc": 0.9598788796366389 + }, + { + "epoch": 0.2311111111111111, + "grad_norm": 0.7275416254997253, + "learning_rate": 1.8973486484775037e-05, + "loss": 0.15604959726333617, + "step": 390, + "token_acc": 0.9558498896247241 + }, + { + "epoch": 0.23703703703703705, + "grad_norm": 0.9419987201690674, + "learning_rate": 1.888029968750498e-05, + "loss": 0.1431185483932495, + "step": 400, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.24296296296296296, + "grad_norm": 0.6928850412368774, + "learning_rate": 1.878331452834944e-05, + "loss": 0.15362846851348877, + "step": 410, + "token_acc": 0.9517941283073578 + }, + { + "epoch": 0.24888888888888888, + "grad_norm": 0.6290676593780518, + "learning_rate": 1.8682572490675524e-05, + "loss": 0.12896524667739867, + "step": 420, + "token_acc": 0.9619504987070557 + }, + { + "epoch": 0.2548148148148148, + "grad_norm": 0.7995588779449463, + "learning_rate": 1.8578116664776314e-05, + "loss": 0.14157743453979493, + "step": 430, + "token_acc": 0.9562071591774562 + }, + { + "epoch": 0.2607407407407407, + "grad_norm": 0.780008852481842, + "learning_rate": 1.8469991729439888e-05, + "loss": 0.16496583223342895, + "step": 440, + "token_acc": 0.9543109801031687 + }, + { + "epoch": 0.26666666666666666, + "grad_norm": 0.8067275881767273, + "learning_rate": 1.8358243932838914e-05, + "loss": 0.14944461584091187, + "step": 450, + "token_acc": 0.9509394572025052 + }, + { + "epoch": 0.2725925925925926, + "grad_norm": 0.8212175369262695, + "learning_rate": 1.8242921072748948e-05, + "loss": 0.12261044979095459, + "step": 460, + "token_acc": 0.9617764834364761 + }, + { + "epoch": 0.2785185185185185, + "grad_norm": 0.688872754573822, + "learning_rate": 1.8124072476103957e-05, + "loss": 0.12651515007019043, + "step": 470, + "token_acc": 0.9594694178334562 + }, + { + "epoch": 0.28444444444444444, + "grad_norm": 1.0954047441482544, + "learning_rate": 1.8001748977897754e-05, + "loss": 0.11215313673019409, + "step": 480, + "token_acc": 0.9634851771511207 + }, + { + "epoch": 0.2903703703703704, + "grad_norm": 0.8077743649482727, + "learning_rate": 1.787600289944039e-05, + "loss": 0.1215265154838562, + "step": 490, + "token_acc": 0.9642989959092599 + }, + { + "epoch": 0.2962962962962963, + "grad_norm": 0.9279748797416687, + "learning_rate": 1.7746888025978807e-05, + "loss": 0.11017097234725952, + "step": 500, + "token_acc": 0.9696060037523452 + }, + { + "epoch": 0.3022222222222222, + "grad_norm": 1.2479947805404663, + "learning_rate": 1.7614459583691346e-05, + "loss": 0.1296389102935791, + "step": 510, + "token_acc": 0.9566453447050463 + }, + { + "epoch": 0.30814814814814817, + "grad_norm": 1.1002650260925293, + "learning_rate": 1.7478774216065882e-05, + "loss": 0.13492013216018678, + "step": 520, + "token_acc": 0.9590994371482177 + }, + { + "epoch": 0.31407407407407406, + "grad_norm": 1.108170747756958, + "learning_rate": 1.733988995967179e-05, + "loss": 0.14083080291748046, + "step": 530, + "token_acc": 0.9592061742006616 + }, + { + "epoch": 0.32, + "grad_norm": 0.8783969879150391, + "learning_rate": 1.719786621933599e-05, + "loss": 0.12698700428009033, + "step": 540, + "token_acc": 0.9617927994121969 + }, + { + "epoch": 0.32592592592592595, + "grad_norm": 0.6896427273750305, + "learning_rate": 1.70527637427338e-05, + "loss": 0.11144465208053589, + "step": 550, + "token_acc": 0.9692820133234641 + }, + { + "epoch": 0.33185185185185184, + "grad_norm": 1.067499041557312, + "learning_rate": 1.690464459440538e-05, + "loss": 0.13314462900161744, + "step": 560, + "token_acc": 0.9597096188747731 + }, + { + "epoch": 0.3377777777777778, + "grad_norm": 0.6953498721122742, + "learning_rate": 1.6753572129208935e-05, + "loss": 0.11334860324859619, + "step": 570, + "token_acc": 0.9676190476190476 + }, + { + "epoch": 0.3437037037037037, + "grad_norm": 1.197219967842102, + "learning_rate": 1.6599610965222002e-05, + "loss": 0.1281804084777832, + "step": 580, + "token_acc": 0.9607272727272728 + }, + { + "epoch": 0.3496296296296296, + "grad_norm": 0.6708402633666992, + "learning_rate": 1.6442826956102424e-05, + "loss": 0.12322006225585938, + "step": 590, + "token_acc": 0.9628704034273474 + }, + { + "epoch": 0.35555555555555557, + "grad_norm": 1.0634019374847412, + "learning_rate": 1.628328716292082e-05, + "loss": 0.13818006515502929, + "step": 600, + "token_acc": 0.9580494801003944 + }, + { + "epoch": 0.35555555555555557, + "eval_loss": 0.14249637722969055, + "eval_runtime": 229.7535, + "eval_samples_per_second": 6.529, + "eval_steps_per_second": 6.529, + "eval_token_acc": 0.9576734025122884, + "step": 600 + }, + { + "epoch": 0.36148148148148146, + "grad_norm": 0.7200868129730225, + "learning_rate": 1.612105982547663e-05, + "loss": 0.13777921199798585, + "step": 610, + "token_acc": 0.9565537555228277 + }, + { + "epoch": 0.3674074074074074, + "grad_norm": 1.610889196395874, + "learning_rate": 1.595621433310997e-05, + "loss": 0.12660154104232788, + "step": 620, + "token_acc": 0.9658464928387808 + }, + { + "epoch": 0.37333333333333335, + "grad_norm": 1.7054650783538818, + "learning_rate": 1.5788821195021792e-05, + "loss": 0.13561646938323973, + "step": 630, + "token_acc": 0.9558277654046028 + }, + { + "epoch": 0.37925925925925924, + "grad_norm": 1.4907517433166504, + "learning_rate": 1.5618952010115057e-05, + "loss": 0.12502728700637816, + "step": 640, + "token_acc": 0.9623144271031595 + }, + { + "epoch": 0.3851851851851852, + "grad_norm": 1.1567004919052124, + "learning_rate": 1.544667943636981e-05, + "loss": 0.1149907112121582, + "step": 650, + "token_acc": 0.9643255295429208 + }, + { + "epoch": 0.39111111111111113, + "grad_norm": 1.0321091413497925, + "learning_rate": 1.527207715976525e-05, + "loss": 0.14286714792251587, + "step": 660, + "token_acc": 0.9604221635883905 + }, + { + "epoch": 0.397037037037037, + "grad_norm": 1.4016674757003784, + "learning_rate": 1.5095219862762091e-05, + "loss": 0.13563259840011596, + "step": 670, + "token_acc": 0.9618029029793735 + }, + { + "epoch": 0.40296296296296297, + "grad_norm": 1.089959979057312, + "learning_rate": 1.4916183192358717e-05, + "loss": 0.1207580804824829, + "step": 680, + "token_acc": 0.9630141721396475 + }, + { + "epoch": 0.4088888888888889, + "grad_norm": 1.045990228652954, + "learning_rate": 1.4735043727734762e-05, + "loss": 0.11743853092193604, + "step": 690, + "token_acc": 0.9632217727105553 + }, + { + "epoch": 0.4148148148148148, + "grad_norm": 1.4252482652664185, + "learning_rate": 1.455187894749597e-05, + "loss": 0.0928974449634552, + "step": 700, + "token_acc": 0.9683257918552036 + }, + { + "epoch": 0.42074074074074075, + "grad_norm": 1.1641786098480225, + "learning_rate": 1.436676719653435e-05, + "loss": 0.12940033674240112, + "step": 710, + "token_acc": 0.9638252148997135 + }, + { + "epoch": 0.4266666666666667, + "grad_norm": 0.7832347750663757, + "learning_rate": 1.4179787652517791e-05, + "loss": 0.12433557510375977, + "step": 720, + "token_acc": 0.9617952522255193 + }, + { + "epoch": 0.4325925925925926, + "grad_norm": 1.1413239240646362, + "learning_rate": 1.3991020292023474e-05, + "loss": 0.09806026816368103, + "step": 730, + "token_acc": 0.9669064748201439 + }, + { + "epoch": 0.43851851851851853, + "grad_norm": 0.8681485056877136, + "learning_rate": 1.3800545856329572e-05, + "loss": 0.14417175054550171, + "step": 740, + "token_acc": 0.9569114098586694 + }, + { + "epoch": 0.4444444444444444, + "grad_norm": 0.9045178294181824, + "learning_rate": 1.3608445816879865e-05, + "loss": 0.10493698120117187, + "step": 750, + "token_acc": 0.9662880175888604 + }, + { + "epoch": 0.45037037037037037, + "grad_norm": 1.1523085832595825, + "learning_rate": 1.3414802340436022e-05, + "loss": 0.12941417694091797, + "step": 760, + "token_acc": 0.9683060109289617 + }, + { + "epoch": 0.4562962962962963, + "grad_norm": 0.9145503640174866, + "learning_rate": 1.3219698253932518e-05, + "loss": 0.12189668416976929, + "step": 770, + "token_acc": 0.9584711503123852 + }, + { + "epoch": 0.4622222222222222, + "grad_norm": 1.0088993310928345, + "learning_rate": 1.3023217009049133e-05, + "loss": 0.10943882465362549, + "step": 780, + "token_acc": 0.9680624556422995 + }, + { + "epoch": 0.46814814814814815, + "grad_norm": 1.376142978668213, + "learning_rate": 1.2825442646516253e-05, + "loss": 0.10388659238815308, + "step": 790, + "token_acc": 0.9674435812060673 + }, + { + "epoch": 0.4740740740740741, + "grad_norm": 1.3877886533737183, + "learning_rate": 1.262645976016821e-05, + "loss": 0.1380447506904602, + "step": 800, + "token_acc": 0.9608202123764189 + }, + { + "epoch": 0.48, + "grad_norm": 0.8192164301872253, + "learning_rate": 1.2426353460760036e-05, + "loss": 0.11965352296829224, + "step": 810, + "token_acc": 0.9655172413793104 + }, + { + "epoch": 0.48592592592592593, + "grad_norm": 0.8384001851081848, + "learning_rate": 1.2225209339563144e-05, + "loss": 0.09073964357376099, + "step": 820, + "token_acc": 0.9659477866061293 + }, + { + "epoch": 0.4918518518518519, + "grad_norm": 1.1015766859054565, + "learning_rate": 1.2023113431755435e-05, + "loss": 0.10787882804870605, + "step": 830, + "token_acc": 0.9649122807017544 + }, + { + "epoch": 0.49777777777777776, + "grad_norm": 1.042965292930603, + "learning_rate": 1.1820152179621564e-05, + "loss": 0.13076914548873902, + "step": 840, + "token_acc": 0.960755275823769 + }, + { + "epoch": 0.5037037037037037, + "grad_norm": 0.8400379419326782, + "learning_rate": 1.161641239557907e-05, + "loss": 0.13471759557724, + "step": 850, + "token_acc": 0.9608513873052071 + }, + { + "epoch": 0.5096296296296297, + "grad_norm": 1.0256035327911377, + "learning_rate": 1.141198122504618e-05, + "loss": 0.11886721849441528, + "step": 860, + "token_acc": 0.9659887798036466 + }, + { + "epoch": 0.5155555555555555, + "grad_norm": 1.1291937828063965, + "learning_rate": 1.1206946109167189e-05, + "loss": 0.13678861856460572, + "step": 870, + "token_acc": 0.961859789320741 + }, + { + "epoch": 0.5214814814814814, + "grad_norm": 1.4508821964263916, + "learning_rate": 1.1001394747411347e-05, + "loss": 0.13137236833572388, + "step": 880, + "token_acc": 0.9597744360902256 + }, + { + "epoch": 0.5274074074074074, + "grad_norm": 0.6653353571891785, + "learning_rate": 1.0795415060061242e-05, + "loss": 0.11796672344207763, + "step": 890, + "token_acc": 0.9627539503386005 + }, + { + "epoch": 0.5333333333333333, + "grad_norm": 0.7665302753448486, + "learning_rate": 1.0589095150606747e-05, + "loss": 0.14120289087295532, + "step": 900, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5333333333333333, + "eval_loss": 0.1341869980096817, + "eval_runtime": 228.3025, + "eval_samples_per_second": 6.57, + "eval_steps_per_second": 6.57, + "eval_token_acc": 0.9593898728251541, + "step": 900 + }, + { + "epoch": 0.5392592592592592, + "grad_norm": 1.1279549598693848, + "learning_rate": 1.0382523268060612e-05, + "loss": 0.11883513927459717, + "step": 910, + "token_acc": 0.9647756766777902 + }, + { + "epoch": 0.5451851851851852, + "grad_norm": 1.0214804410934448, + "learning_rate": 1.0175787769211778e-05, + "loss": 0.11933118104934692, + "step": 920, + "token_acc": 0.959910078681154 + }, + { + "epoch": 0.5511111111111111, + "grad_norm": 0.8586761951446533, + "learning_rate": 9.968977080832633e-06, + "loss": 0.11430730819702148, + "step": 930, + "token_acc": 0.9654676258992806 + }, + { + "epoch": 0.557037037037037, + "grad_norm": 0.7968057990074158, + "learning_rate": 9.762179661856312e-06, + "loss": 0.13973416090011598, + "step": 940, + "token_acc": 0.9573529411764706 + }, + { + "epoch": 0.562962962962963, + "grad_norm": 1.0118746757507324, + "learning_rate": 9.555483965540238e-06, + "loss": 0.12812395095825196, + "step": 950, + "token_acc": 0.9614254224834681 + }, + { + "epoch": 0.5688888888888889, + "grad_norm": 1.1432191133499146, + "learning_rate": 9.348978401632101e-06, + "loss": 0.1379111647605896, + "step": 960, + "token_acc": 0.9561209439528023 + }, + { + "epoch": 0.5748148148148148, + "grad_norm": 0.7802894115447998, + "learning_rate": 9.142751298554436e-06, + "loss": 0.14111405611038208, + "step": 970, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5807407407407408, + "grad_norm": 0.741787314414978, + "learning_rate": 8.936890865624014e-06, + "loss": 0.10649667978286743, + "step": 980, + "token_acc": 0.9672929714683368 + }, + { + "epoch": 0.5866666666666667, + "grad_norm": 0.7642576694488525, + "learning_rate": 8.731485155322134e-06, + "loss": 0.10067906379699706, + "step": 990, + "token_acc": 0.9700443786982249 + }, + { + "epoch": 0.5925925925925926, + "grad_norm": 1.0362651348114014, + "learning_rate": 8.52662202563203e-06, + "loss": 0.12069357633590698, + "step": 1000, + "token_acc": 0.9607771260997068 + }, + { + "epoch": 0.5985185185185186, + "grad_norm": 0.7719289064407349, + "learning_rate": 8.322389102459458e-06, + "loss": 0.11699739694595337, + "step": 1010, + "token_acc": 0.9636767976278725 + }, + { + "epoch": 0.6044444444444445, + "grad_norm": 1.143441081047058, + "learning_rate": 8.118873742152574e-06, + "loss": 0.12428475618362426, + "step": 1020, + "token_acc": 0.9612553273924835 + }, + { + "epoch": 0.6103703703703703, + "grad_norm": 0.7593462467193604, + "learning_rate": 7.916162994137056e-06, + "loss": 0.114216148853302, + "step": 1030, + "token_acc": 0.9674105561459441 + }, + { + "epoch": 0.6162962962962963, + "grad_norm": 0.9898127317428589, + "learning_rate": 7.714343563682565e-06, + "loss": 0.12711145877838134, + "step": 1040, + "token_acc": 0.9625998547567175 + }, + { + "epoch": 0.6222222222222222, + "grad_norm": 1.3860629796981812, + "learning_rate": 7.513501774816362e-06, + "loss": 0.14218902587890625, + "step": 1050, + "token_acc": 0.9609863820390137 + }, + { + "epoch": 0.6281481481481481, + "grad_norm": 0.7516865134239197, + "learning_rate": 7.313723533400047e-06, + "loss": 0.1154281735420227, + "step": 1060, + "token_acc": 0.965135769359705 + }, + { + "epoch": 0.6340740740740741, + "grad_norm": 1.0139286518096924, + "learning_rate": 7.115094290385103e-06, + "loss": 0.12470541000366211, + "step": 1070, + "token_acc": 0.9648382559774965 + }, + { + "epoch": 0.64, + "grad_norm": 1.0060116052627563, + "learning_rate": 6.9176990052630465e-06, + "loss": 0.1165156364440918, + "step": 1080, + "token_acc": 0.9641779788838613 + }, + { + "epoch": 0.6459259259259259, + "grad_norm": 1.437506079673767, + "learning_rate": 6.721622109725799e-06, + "loss": 0.128699791431427, + "step": 1090, + "token_acc": 0.9611650485436893 + }, + { + "epoch": 0.6518518518518519, + "grad_norm": 1.0488654375076294, + "learning_rate": 6.526947471551799e-06, + "loss": 0.14162105321884155, + "step": 1100, + "token_acc": 0.9533483822422875 + }, + { + "epoch": 0.6577777777777778, + "grad_norm": 0.9438616633415222, + "learning_rate": 6.333758358733313e-06, + "loss": 0.14174394607543944, + "step": 1110, + "token_acc": 0.9583492548719909 + }, + { + "epoch": 0.6637037037037037, + "grad_norm": 1.2012673616409302, + "learning_rate": 6.142137403860301e-06, + "loss": 0.14388898611068726, + "step": 1120, + "token_acc": 0.9564558879212419 + }, + { + "epoch": 0.6696296296296296, + "grad_norm": 1.1282634735107422, + "learning_rate": 5.952166568776062e-06, + "loss": 0.11517893075942993, + "step": 1130, + "token_acc": 0.9685185185185186 + }, + { + "epoch": 0.6755555555555556, + "grad_norm": 0.8449248671531677, + "learning_rate": 5.763927109519784e-06, + "loss": 0.08853521943092346, + "step": 1140, + "token_acc": 0.9759211966435607 + }, + { + "epoch": 0.6814814814814815, + "grad_norm": 0.9580397009849548, + "learning_rate": 5.577499541570954e-06, + "loss": 0.14078164100646973, + "step": 1150, + "token_acc": 0.9634651600753296 + }, + { + "epoch": 0.6874074074074074, + "grad_norm": 0.7772520184516907, + "learning_rate": 5.3929636054105745e-06, + "loss": 0.10377205610275268, + "step": 1160, + "token_acc": 0.9701709712622771 + }, + { + "epoch": 0.6933333333333334, + "grad_norm": 1.3566169738769531, + "learning_rate": 5.210398232413824e-06, + "loss": 0.1568630576133728, + "step": 1170, + "token_acc": 0.9556422995031938 + }, + { + "epoch": 0.6992592592592592, + "grad_norm": 0.9245796203613281, + "learning_rate": 5.0298815110888566e-06, + "loss": 0.14888057708740235, + "step": 1180, + "token_acc": 0.9563852058618283 + }, + { + "epoch": 0.7051851851851851, + "grad_norm": 1.0345977544784546, + "learning_rate": 4.851490653676019e-06, + "loss": 0.1214102029800415, + "step": 1190, + "token_acc": 0.9646017699115044 + }, + { + "epoch": 0.7111111111111111, + "grad_norm": 1.1635781526565552, + "learning_rate": 4.675301963121998e-06, + "loss": 0.12966567277908325, + "step": 1200, + "token_acc": 0.9577946768060837 + }, + { + "epoch": 0.7111111111111111, + "eval_loss": 0.12971985340118408, + "eval_runtime": 229.3094, + "eval_samples_per_second": 6.541, + "eval_steps_per_second": 6.541, + "eval_token_acc": 0.9621596317390965, + "step": 1200 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.082426367157522e+17, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1200/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a8d6fed30420509e58c0441589a45eb1e62e93f6 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:662fb11b5e93ff923e74a6b426500a21b913bfef8b8354e21f4b73dc42cd4eea +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..e7d6da9d95e73a2cb5fb9a492d929ea464c7784a --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e6fbaee92c5609589b2907bccf446872d750360ce8839e253f8799f09784684a +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..7f85cd3736af3e99c72063713b52dd1b948bc0e5 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3459f36f23608cbd4d222126bf4d6a03bc7cf6c67a017764ca2382c5b4866ba0 +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..044476698ec2f600c39151a2438fc4e287ce1b74 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:321c72446eee54ca44622234aad979f81b307ef134c6dfe0b9cf09bacabd7b7a +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..8c9396fa6ed60b68a857bb459545a887186e9d00 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/trainer_state.json @@ -0,0 +1,1287 @@ +{ + "best_global_step": 1500, + "best_metric": 0.12762739, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500", + "epoch": 0.8888888888888888, + "eval_steps": 300, + "global_step": 1500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + }, + { + "epoch": 0.1837037037037037, + "grad_norm": 1.2620875835418701, + "learning_rate": 1.9577805521806358e-05, + "loss": 0.1300894260406494, + "step": 310, + "token_acc": 0.960536398467433 + }, + { + "epoch": 0.18962962962962962, + "grad_norm": 1.1361067295074463, + "learning_rate": 1.95163006586405e-05, + "loss": 0.16317719221115112, + "step": 320, + "token_acc": 0.9544095665171899 + }, + { + "epoch": 0.19555555555555557, + "grad_norm": 0.8173150420188904, + "learning_rate": 1.945072539751685e-05, + "loss": 0.17428743839263916, + "step": 330, + "token_acc": 0.94750656167979 + }, + { + "epoch": 0.20148148148148148, + "grad_norm": 0.8849798440933228, + "learning_rate": 1.93811077868776e-05, + "loss": 0.12995322942733764, + "step": 340, + "token_acc": 0.9658246656760773 + }, + { + "epoch": 0.2074074074074074, + "grad_norm": 0.6326722502708435, + "learning_rate": 1.9307477604195162e-05, + "loss": 0.1278319001197815, + "step": 350, + "token_acc": 0.9639468690702088 + }, + { + "epoch": 0.21333333333333335, + "grad_norm": 1.1027580499649048, + "learning_rate": 1.9229866343235427e-05, + "loss": 0.12902997732162474, + "step": 360, + "token_acc": 0.9652777777777778 + }, + { + "epoch": 0.21925925925925926, + "grad_norm": 0.7148353457450867, + "learning_rate": 1.914830720058701e-05, + "loss": 0.14380792379379273, + "step": 370, + "token_acc": 0.9572490706319703 + }, + { + "epoch": 0.22518518518518518, + "grad_norm": 1.1909170150756836, + "learning_rate": 1.9062835061462105e-05, + "loss": 0.15708266496658324, + "step": 380, + "token_acc": 0.9598788796366389 + }, + { + "epoch": 0.2311111111111111, + "grad_norm": 0.7275416254997253, + "learning_rate": 1.8973486484775037e-05, + "loss": 0.15604959726333617, + "step": 390, + "token_acc": 0.9558498896247241 + }, + { + "epoch": 0.23703703703703705, + "grad_norm": 0.9419987201690674, + "learning_rate": 1.888029968750498e-05, + "loss": 0.1431185483932495, + "step": 400, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.24296296296296296, + "grad_norm": 0.6928850412368774, + "learning_rate": 1.878331452834944e-05, + "loss": 0.15362846851348877, + "step": 410, + "token_acc": 0.9517941283073578 + }, + { + "epoch": 0.24888888888888888, + "grad_norm": 0.6290676593780518, + "learning_rate": 1.8682572490675524e-05, + "loss": 0.12896524667739867, + "step": 420, + "token_acc": 0.9619504987070557 + }, + { + "epoch": 0.2548148148148148, + "grad_norm": 0.7995588779449463, + "learning_rate": 1.8578116664776314e-05, + "loss": 0.14157743453979493, + "step": 430, + "token_acc": 0.9562071591774562 + }, + { + "epoch": 0.2607407407407407, + "grad_norm": 0.780008852481842, + "learning_rate": 1.8469991729439888e-05, + "loss": 0.16496583223342895, + "step": 440, + "token_acc": 0.9543109801031687 + }, + { + "epoch": 0.26666666666666666, + "grad_norm": 0.8067275881767273, + "learning_rate": 1.8358243932838914e-05, + "loss": 0.14944461584091187, + "step": 450, + "token_acc": 0.9509394572025052 + }, + { + "epoch": 0.2725925925925926, + "grad_norm": 0.8212175369262695, + "learning_rate": 1.8242921072748948e-05, + "loss": 0.12261044979095459, + "step": 460, + "token_acc": 0.9617764834364761 + }, + { + "epoch": 0.2785185185185185, + "grad_norm": 0.688872754573822, + "learning_rate": 1.8124072476103957e-05, + "loss": 0.12651515007019043, + "step": 470, + "token_acc": 0.9594694178334562 + }, + { + "epoch": 0.28444444444444444, + "grad_norm": 1.0954047441482544, + "learning_rate": 1.8001748977897754e-05, + "loss": 0.11215313673019409, + "step": 480, + "token_acc": 0.9634851771511207 + }, + { + "epoch": 0.2903703703703704, + "grad_norm": 0.8077743649482727, + "learning_rate": 1.787600289944039e-05, + "loss": 0.1215265154838562, + "step": 490, + "token_acc": 0.9642989959092599 + }, + { + "epoch": 0.2962962962962963, + "grad_norm": 0.9279748797416687, + "learning_rate": 1.7746888025978807e-05, + "loss": 0.11017097234725952, + "step": 500, + "token_acc": 0.9696060037523452 + }, + { + "epoch": 0.3022222222222222, + "grad_norm": 1.2479947805404663, + "learning_rate": 1.7614459583691346e-05, + "loss": 0.1296389102935791, + "step": 510, + "token_acc": 0.9566453447050463 + }, + { + "epoch": 0.30814814814814817, + "grad_norm": 1.1002650260925293, + "learning_rate": 1.7478774216065882e-05, + "loss": 0.13492013216018678, + "step": 520, + "token_acc": 0.9590994371482177 + }, + { + "epoch": 0.31407407407407406, + "grad_norm": 1.108170747756958, + "learning_rate": 1.733988995967179e-05, + "loss": 0.14083080291748046, + "step": 530, + "token_acc": 0.9592061742006616 + }, + { + "epoch": 0.32, + "grad_norm": 0.8783969879150391, + "learning_rate": 1.719786621933599e-05, + "loss": 0.12698700428009033, + "step": 540, + "token_acc": 0.9617927994121969 + }, + { + "epoch": 0.32592592592592595, + "grad_norm": 0.6896427273750305, + "learning_rate": 1.70527637427338e-05, + "loss": 0.11144465208053589, + "step": 550, + "token_acc": 0.9692820133234641 + }, + { + "epoch": 0.33185185185185184, + "grad_norm": 1.067499041557312, + "learning_rate": 1.690464459440538e-05, + "loss": 0.13314462900161744, + "step": 560, + "token_acc": 0.9597096188747731 + }, + { + "epoch": 0.3377777777777778, + "grad_norm": 0.6953498721122742, + "learning_rate": 1.6753572129208935e-05, + "loss": 0.11334860324859619, + "step": 570, + "token_acc": 0.9676190476190476 + }, + { + "epoch": 0.3437037037037037, + "grad_norm": 1.197219967842102, + "learning_rate": 1.6599610965222002e-05, + "loss": 0.1281804084777832, + "step": 580, + "token_acc": 0.9607272727272728 + }, + { + "epoch": 0.3496296296296296, + "grad_norm": 0.6708402633666992, + "learning_rate": 1.6442826956102424e-05, + "loss": 0.12322006225585938, + "step": 590, + "token_acc": 0.9628704034273474 + }, + { + "epoch": 0.35555555555555557, + "grad_norm": 1.0634019374847412, + "learning_rate": 1.628328716292082e-05, + "loss": 0.13818006515502929, + "step": 600, + "token_acc": 0.9580494801003944 + }, + { + "epoch": 0.35555555555555557, + "eval_loss": 0.14249637722969055, + "eval_runtime": 229.7535, + "eval_samples_per_second": 6.529, + "eval_steps_per_second": 6.529, + "eval_token_acc": 0.9576734025122884, + "step": 600 + }, + { + "epoch": 0.36148148148148146, + "grad_norm": 0.7200868129730225, + "learning_rate": 1.612105982547663e-05, + "loss": 0.13777921199798585, + "step": 610, + "token_acc": 0.9565537555228277 + }, + { + "epoch": 0.3674074074074074, + "grad_norm": 1.610889196395874, + "learning_rate": 1.595621433310997e-05, + "loss": 0.12660154104232788, + "step": 620, + "token_acc": 0.9658464928387808 + }, + { + "epoch": 0.37333333333333335, + "grad_norm": 1.7054650783538818, + "learning_rate": 1.5788821195021792e-05, + "loss": 0.13561646938323973, + "step": 630, + "token_acc": 0.9558277654046028 + }, + { + "epoch": 0.37925925925925924, + "grad_norm": 1.4907517433166504, + "learning_rate": 1.5618952010115057e-05, + "loss": 0.12502728700637816, + "step": 640, + "token_acc": 0.9623144271031595 + }, + { + "epoch": 0.3851851851851852, + "grad_norm": 1.1567004919052124, + "learning_rate": 1.544667943636981e-05, + "loss": 0.1149907112121582, + "step": 650, + "token_acc": 0.9643255295429208 + }, + { + "epoch": 0.39111111111111113, + "grad_norm": 1.0321091413497925, + "learning_rate": 1.527207715976525e-05, + "loss": 0.14286714792251587, + "step": 660, + "token_acc": 0.9604221635883905 + }, + { + "epoch": 0.397037037037037, + "grad_norm": 1.4016674757003784, + "learning_rate": 1.5095219862762091e-05, + "loss": 0.13563259840011596, + "step": 670, + "token_acc": 0.9618029029793735 + }, + { + "epoch": 0.40296296296296297, + "grad_norm": 1.089959979057312, + "learning_rate": 1.4916183192358717e-05, + "loss": 0.1207580804824829, + "step": 680, + "token_acc": 0.9630141721396475 + }, + { + "epoch": 0.4088888888888889, + "grad_norm": 1.045990228652954, + "learning_rate": 1.4735043727734762e-05, + "loss": 0.11743853092193604, + "step": 690, + "token_acc": 0.9632217727105553 + }, + { + "epoch": 0.4148148148148148, + "grad_norm": 1.4252482652664185, + "learning_rate": 1.455187894749597e-05, + "loss": 0.0928974449634552, + "step": 700, + "token_acc": 0.9683257918552036 + }, + { + "epoch": 0.42074074074074075, + "grad_norm": 1.1641786098480225, + "learning_rate": 1.436676719653435e-05, + "loss": 0.12940033674240112, + "step": 710, + "token_acc": 0.9638252148997135 + }, + { + "epoch": 0.4266666666666667, + "grad_norm": 0.7832347750663757, + "learning_rate": 1.4179787652517791e-05, + "loss": 0.12433557510375977, + "step": 720, + "token_acc": 0.9617952522255193 + }, + { + "epoch": 0.4325925925925926, + "grad_norm": 1.1413239240646362, + "learning_rate": 1.3991020292023474e-05, + "loss": 0.09806026816368103, + "step": 730, + "token_acc": 0.9669064748201439 + }, + { + "epoch": 0.43851851851851853, + "grad_norm": 0.8681485056877136, + "learning_rate": 1.3800545856329572e-05, + "loss": 0.14417175054550171, + "step": 740, + "token_acc": 0.9569114098586694 + }, + { + "epoch": 0.4444444444444444, + "grad_norm": 0.9045178294181824, + "learning_rate": 1.3608445816879865e-05, + "loss": 0.10493698120117187, + "step": 750, + "token_acc": 0.9662880175888604 + }, + { + "epoch": 0.45037037037037037, + "grad_norm": 1.1523085832595825, + "learning_rate": 1.3414802340436022e-05, + "loss": 0.12941417694091797, + "step": 760, + "token_acc": 0.9683060109289617 + }, + { + "epoch": 0.4562962962962963, + "grad_norm": 0.9145503640174866, + "learning_rate": 1.3219698253932518e-05, + "loss": 0.12189668416976929, + "step": 770, + "token_acc": 0.9584711503123852 + }, + { + "epoch": 0.4622222222222222, + "grad_norm": 1.0088993310928345, + "learning_rate": 1.3023217009049133e-05, + "loss": 0.10943882465362549, + "step": 780, + "token_acc": 0.9680624556422995 + }, + { + "epoch": 0.46814814814814815, + "grad_norm": 1.376142978668213, + "learning_rate": 1.2825442646516253e-05, + "loss": 0.10388659238815308, + "step": 790, + "token_acc": 0.9674435812060673 + }, + { + "epoch": 0.4740740740740741, + "grad_norm": 1.3877886533737183, + "learning_rate": 1.262645976016821e-05, + "loss": 0.1380447506904602, + "step": 800, + "token_acc": 0.9608202123764189 + }, + { + "epoch": 0.48, + "grad_norm": 0.8192164301872253, + "learning_rate": 1.2426353460760036e-05, + "loss": 0.11965352296829224, + "step": 810, + "token_acc": 0.9655172413793104 + }, + { + "epoch": 0.48592592592592593, + "grad_norm": 0.8384001851081848, + "learning_rate": 1.2225209339563144e-05, + "loss": 0.09073964357376099, + "step": 820, + "token_acc": 0.9659477866061293 + }, + { + "epoch": 0.4918518518518519, + "grad_norm": 1.1015766859054565, + "learning_rate": 1.2023113431755435e-05, + "loss": 0.10787882804870605, + "step": 830, + "token_acc": 0.9649122807017544 + }, + { + "epoch": 0.49777777777777776, + "grad_norm": 1.042965292930603, + "learning_rate": 1.1820152179621564e-05, + "loss": 0.13076914548873902, + "step": 840, + "token_acc": 0.960755275823769 + }, + { + "epoch": 0.5037037037037037, + "grad_norm": 0.8400379419326782, + "learning_rate": 1.161641239557907e-05, + "loss": 0.13471759557724, + "step": 850, + "token_acc": 0.9608513873052071 + }, + { + "epoch": 0.5096296296296297, + "grad_norm": 1.0256035327911377, + "learning_rate": 1.141198122504618e-05, + "loss": 0.11886721849441528, + "step": 860, + "token_acc": 0.9659887798036466 + }, + { + "epoch": 0.5155555555555555, + "grad_norm": 1.1291937828063965, + "learning_rate": 1.1206946109167189e-05, + "loss": 0.13678861856460572, + "step": 870, + "token_acc": 0.961859789320741 + }, + { + "epoch": 0.5214814814814814, + "grad_norm": 1.4508821964263916, + "learning_rate": 1.1001394747411347e-05, + "loss": 0.13137236833572388, + "step": 880, + "token_acc": 0.9597744360902256 + }, + { + "epoch": 0.5274074074074074, + "grad_norm": 0.6653353571891785, + "learning_rate": 1.0795415060061242e-05, + "loss": 0.11796672344207763, + "step": 890, + "token_acc": 0.9627539503386005 + }, + { + "epoch": 0.5333333333333333, + "grad_norm": 0.7665302753448486, + "learning_rate": 1.0589095150606747e-05, + "loss": 0.14120289087295532, + "step": 900, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5333333333333333, + "eval_loss": 0.1341869980096817, + "eval_runtime": 228.3025, + "eval_samples_per_second": 6.57, + "eval_steps_per_second": 6.57, + "eval_token_acc": 0.9593898728251541, + "step": 900 + }, + { + "epoch": 0.5392592592592592, + "grad_norm": 1.1279549598693848, + "learning_rate": 1.0382523268060612e-05, + "loss": 0.11883513927459717, + "step": 910, + "token_acc": 0.9647756766777902 + }, + { + "epoch": 0.5451851851851852, + "grad_norm": 1.0214804410934448, + "learning_rate": 1.0175787769211778e-05, + "loss": 0.11933118104934692, + "step": 920, + "token_acc": 0.959910078681154 + }, + { + "epoch": 0.5511111111111111, + "grad_norm": 0.8586761951446533, + "learning_rate": 9.968977080832633e-06, + "loss": 0.11430730819702148, + "step": 930, + "token_acc": 0.9654676258992806 + }, + { + "epoch": 0.557037037037037, + "grad_norm": 0.7968057990074158, + "learning_rate": 9.762179661856312e-06, + "loss": 0.13973416090011598, + "step": 940, + "token_acc": 0.9573529411764706 + }, + { + "epoch": 0.562962962962963, + "grad_norm": 1.0118746757507324, + "learning_rate": 9.555483965540238e-06, + "loss": 0.12812395095825196, + "step": 950, + "token_acc": 0.9614254224834681 + }, + { + "epoch": 0.5688888888888889, + "grad_norm": 1.1432191133499146, + "learning_rate": 9.348978401632101e-06, + "loss": 0.1379111647605896, + "step": 960, + "token_acc": 0.9561209439528023 + }, + { + "epoch": 0.5748148148148148, + "grad_norm": 0.7802894115447998, + "learning_rate": 9.142751298554436e-06, + "loss": 0.14111405611038208, + "step": 970, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5807407407407408, + "grad_norm": 0.741787314414978, + "learning_rate": 8.936890865624014e-06, + "loss": 0.10649667978286743, + "step": 980, + "token_acc": 0.9672929714683368 + }, + { + "epoch": 0.5866666666666667, + "grad_norm": 0.7642576694488525, + "learning_rate": 8.731485155322134e-06, + "loss": 0.10067906379699706, + "step": 990, + "token_acc": 0.9700443786982249 + }, + { + "epoch": 0.5925925925925926, + "grad_norm": 1.0362651348114014, + "learning_rate": 8.52662202563203e-06, + "loss": 0.12069357633590698, + "step": 1000, + "token_acc": 0.9607771260997068 + }, + { + "epoch": 0.5985185185185186, + "grad_norm": 0.7719289064407349, + "learning_rate": 8.322389102459458e-06, + "loss": 0.11699739694595337, + "step": 1010, + "token_acc": 0.9636767976278725 + }, + { + "epoch": 0.6044444444444445, + "grad_norm": 1.143441081047058, + "learning_rate": 8.118873742152574e-06, + "loss": 0.12428475618362426, + "step": 1020, + "token_acc": 0.9612553273924835 + }, + { + "epoch": 0.6103703703703703, + "grad_norm": 0.7593462467193604, + "learning_rate": 7.916162994137056e-06, + "loss": 0.114216148853302, + "step": 1030, + "token_acc": 0.9674105561459441 + }, + { + "epoch": 0.6162962962962963, + "grad_norm": 0.9898127317428589, + "learning_rate": 7.714343563682565e-06, + "loss": 0.12711145877838134, + "step": 1040, + "token_acc": 0.9625998547567175 + }, + { + "epoch": 0.6222222222222222, + "grad_norm": 1.3860629796981812, + "learning_rate": 7.513501774816362e-06, + "loss": 0.14218902587890625, + "step": 1050, + "token_acc": 0.9609863820390137 + }, + { + "epoch": 0.6281481481481481, + "grad_norm": 0.7516865134239197, + "learning_rate": 7.313723533400047e-06, + "loss": 0.1154281735420227, + "step": 1060, + "token_acc": 0.965135769359705 + }, + { + "epoch": 0.6340740740740741, + "grad_norm": 1.0139286518096924, + "learning_rate": 7.115094290385103e-06, + "loss": 0.12470541000366211, + "step": 1070, + "token_acc": 0.9648382559774965 + }, + { + "epoch": 0.64, + "grad_norm": 1.0060116052627563, + "learning_rate": 6.9176990052630465e-06, + "loss": 0.1165156364440918, + "step": 1080, + "token_acc": 0.9641779788838613 + }, + { + "epoch": 0.6459259259259259, + "grad_norm": 1.437506079673767, + "learning_rate": 6.721622109725799e-06, + "loss": 0.128699791431427, + "step": 1090, + "token_acc": 0.9611650485436893 + }, + { + "epoch": 0.6518518518518519, + "grad_norm": 1.0488654375076294, + "learning_rate": 6.526947471551799e-06, + "loss": 0.14162105321884155, + "step": 1100, + "token_acc": 0.9533483822422875 + }, + { + "epoch": 0.6577777777777778, + "grad_norm": 0.9438616633415222, + "learning_rate": 6.333758358733313e-06, + "loss": 0.14174394607543944, + "step": 1110, + "token_acc": 0.9583492548719909 + }, + { + "epoch": 0.6637037037037037, + "grad_norm": 1.2012673616409302, + "learning_rate": 6.142137403860301e-06, + "loss": 0.14388898611068726, + "step": 1120, + "token_acc": 0.9564558879212419 + }, + { + "epoch": 0.6696296296296296, + "grad_norm": 1.1282634735107422, + "learning_rate": 5.952166568776062e-06, + "loss": 0.11517893075942993, + "step": 1130, + "token_acc": 0.9685185185185186 + }, + { + "epoch": 0.6755555555555556, + "grad_norm": 0.8449248671531677, + "learning_rate": 5.763927109519784e-06, + "loss": 0.08853521943092346, + "step": 1140, + "token_acc": 0.9759211966435607 + }, + { + "epoch": 0.6814814814814815, + "grad_norm": 0.9580397009849548, + "learning_rate": 5.577499541570954e-06, + "loss": 0.14078164100646973, + "step": 1150, + "token_acc": 0.9634651600753296 + }, + { + "epoch": 0.6874074074074074, + "grad_norm": 0.7772520184516907, + "learning_rate": 5.3929636054105745e-06, + "loss": 0.10377205610275268, + "step": 1160, + "token_acc": 0.9701709712622771 + }, + { + "epoch": 0.6933333333333334, + "grad_norm": 1.3566169738769531, + "learning_rate": 5.210398232413824e-06, + "loss": 0.1568630576133728, + "step": 1170, + "token_acc": 0.9556422995031938 + }, + { + "epoch": 0.6992592592592592, + "grad_norm": 0.9245796203613281, + "learning_rate": 5.0298815110888566e-06, + "loss": 0.14888057708740235, + "step": 1180, + "token_acc": 0.9563852058618283 + }, + { + "epoch": 0.7051851851851851, + "grad_norm": 1.0345977544784546, + "learning_rate": 4.851490653676019e-06, + "loss": 0.1214102029800415, + "step": 1190, + "token_acc": 0.9646017699115044 + }, + { + "epoch": 0.7111111111111111, + "grad_norm": 1.1635781526565552, + "learning_rate": 4.675301963121998e-06, + "loss": 0.12966567277908325, + "step": 1200, + "token_acc": 0.9577946768060837 + }, + { + "epoch": 0.7111111111111111, + "eval_loss": 0.12971985340118408, + "eval_runtime": 229.3094, + "eval_samples_per_second": 6.541, + "eval_steps_per_second": 6.541, + "eval_token_acc": 0.9621596317390965, + "step": 1200 + }, + { + "epoch": 0.717037037037037, + "grad_norm": 0.6507232785224915, + "learning_rate": 4.501390800442783e-06, + "loss": 0.12880181074142455, + "step": 1210, + "token_acc": 0.9664481295796374 + }, + { + "epoch": 0.7229629629629629, + "grad_norm": 0.9675179123878479, + "learning_rate": 4.329831552489626e-06, + "loss": 0.12247174978256226, + "step": 1220, + "token_acc": 0.9622926093514329 + }, + { + "epoch": 0.7288888888888889, + "grad_norm": 0.9841185808181763, + "learning_rate": 4.160697600131568e-06, + "loss": 0.12777591943740846, + "step": 1230, + "token_acc": 0.9612147822905233 + }, + { + "epoch": 0.7348148148148148, + "grad_norm": 1.4565831422805786, + "learning_rate": 3.994061286868361e-06, + "loss": 0.13893853425979613, + "step": 1240, + "token_acc": 0.9622920517560074 + }, + { + "epoch": 0.7407407407407407, + "grad_norm": 1.1277369260787964, + "learning_rate": 3.8299938878870215e-06, + "loss": 0.09945087432861328, + "step": 1250, + "token_acc": 0.965828013518588 + }, + { + "epoch": 0.7466666666666667, + "grad_norm": 1.1658375263214111, + "learning_rate": 3.6685655795753836e-06, + "loss": 0.08901865482330322, + "step": 1260, + "token_acc": 0.9718995878606219 + }, + { + "epoch": 0.7525925925925926, + "grad_norm": 1.2467801570892334, + "learning_rate": 3.50984540950562e-06, + "loss": 0.12474504709243775, + "step": 1270, + "token_acc": 0.9593131765584173 + }, + { + "epoch": 0.7585185185185185, + "grad_norm": 1.2965892553329468, + "learning_rate": 3.3539012669005653e-06, + "loss": 0.12159136533737183, + "step": 1280, + "token_acc": 0.961352657004831 + }, + { + "epoch": 0.7644444444444445, + "grad_norm": 1.1689339876174927, + "learning_rate": 3.2007998535955774e-06, + "loss": 0.1344360113143921, + "step": 1290, + "token_acc": 0.9594349873234336 + }, + { + "epoch": 0.7703703703703704, + "grad_norm": 0.7894589304924011, + "learning_rate": 3.0506066555081683e-06, + "loss": 0.12788604497909545, + "step": 1300, + "token_acc": 0.963855421686747 + }, + { + "epoch": 0.7762962962962963, + "grad_norm": 1.2829697132110596, + "learning_rate": 2.90338591462782e-06, + "loss": 0.11962369680404664, + "step": 1310, + "token_acc": 0.9604395604395605 + }, + { + "epoch": 0.7822222222222223, + "grad_norm": 1.1379469633102417, + "learning_rate": 2.7592006015377937e-06, + "loss": 0.11098712682723999, + "step": 1320, + "token_acc": 0.9649507119386638 + }, + { + "epoch": 0.7881481481481482, + "grad_norm": 1.723992109298706, + "learning_rate": 2.6181123884808056e-06, + "loss": 0.13792314529418945, + "step": 1330, + "token_acc": 0.9560761346998536 + }, + { + "epoch": 0.794074074074074, + "grad_norm": 1.1304504871368408, + "learning_rate": 2.480181622980009e-06, + "loss": 0.10700693130493164, + "step": 1340, + "token_acc": 0.9640314724615962 + }, + { + "epoch": 0.8, + "grad_norm": 1.3609181642532349, + "learning_rate": 2.3454673020265973e-06, + "loss": 0.11214718818664551, + "step": 1350, + "token_acc": 0.967559411542814 + }, + { + "epoch": 0.8059259259259259, + "grad_norm": 0.7761492133140564, + "learning_rate": 2.2140270468450966e-06, + "loss": 0.09663894772529602, + "step": 1360, + "token_acc": 0.9720812182741116 + }, + { + "epoch": 0.8118518518518518, + "grad_norm": 1.143888235092163, + "learning_rate": 2.0859170782470873e-06, + "loss": 0.1209203839302063, + "step": 1370, + "token_acc": 0.9637912673056444 + }, + { + "epoch": 0.8177777777777778, + "grad_norm": 1.0649224519729614, + "learning_rate": 1.961192192583934e-06, + "loss": 0.14124363660812378, + "step": 1380, + "token_acc": 0.9554285714285714 + }, + { + "epoch": 0.8237037037037037, + "grad_norm": 1.3557066917419434, + "learning_rate": 1.8399057383087859e-06, + "loss": 0.11149574518203735, + "step": 1390, + "token_acc": 0.9653537563822028 + }, + { + "epoch": 0.8296296296296296, + "grad_norm": 1.064666748046875, + "learning_rate": 1.7221095931579091e-06, + "loss": 0.1278609037399292, + "step": 1400, + "token_acc": 0.9580903790087464 + }, + { + "epoch": 0.8355555555555556, + "grad_norm": 1.6276605129241943, + "learning_rate": 1.6078541419610716e-06, + "loss": 0.1316068649291992, + "step": 1410, + "token_acc": 0.961738484398217 + }, + { + "epoch": 0.8414814814814815, + "grad_norm": 1.0021592378616333, + "learning_rate": 1.4971882550904725e-06, + "loss": 0.12551895380020142, + "step": 1420, + "token_acc": 0.9635036496350365 + }, + { + "epoch": 0.8474074074074074, + "grad_norm": 1.2714834213256836, + "learning_rate": 1.3901592675574915e-06, + "loss": 0.11337714195251465, + "step": 1430, + "token_acc": 0.9627518053971874 + }, + { + "epoch": 0.8533333333333334, + "grad_norm": 1.2086464166641235, + "learning_rate": 1.286812958766106e-06, + "loss": 0.1030318260192871, + "step": 1440, + "token_acc": 0.9690611664295875 + }, + { + "epoch": 0.8592592592592593, + "grad_norm": 1.4665285348892212, + "learning_rate": 1.1871935329317363e-06, + "loss": 0.1136628270149231, + "step": 1450, + "token_acc": 0.9621955652490004 + }, + { + "epoch": 0.8651851851851852, + "grad_norm": 1.4833930730819702, + "learning_rate": 1.0913436001737953e-06, + "loss": 0.14109413623809813, + "step": 1460, + "token_acc": 0.9591619318181818 + }, + { + "epoch": 0.8711111111111111, + "grad_norm": 0.6605064868927002, + "learning_rate": 9.993041582901208e-07, + "loss": 0.13869184255599976, + "step": 1470, + "token_acc": 0.9622367465504721 + }, + { + "epoch": 0.8770370370370371, + "grad_norm": 1.142251968383789, + "learning_rate": 9.111145752210171e-07, + "loss": 0.15464030504226683, + "step": 1480, + "token_acc": 0.9590840840840841 + }, + { + "epoch": 0.882962962962963, + "grad_norm": 1.4246073961257935, + "learning_rate": 8.268125722104569e-07, + "loss": 0.137708580493927, + "step": 1490, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.8888888888888888, + "grad_norm": 1.4238859415054321, + "learning_rate": 7.46434207671598e-07, + "loss": 0.08925541639328002, + "step": 1500, + "token_acc": 0.9747899159663865 + }, + { + "epoch": 0.8888888888888888, + "eval_loss": 0.1276273876428604, + "eval_runtime": 229.1217, + "eval_samples_per_second": 6.547, + "eval_steps_per_second": 6.547, + "eval_token_acc": 0.9623546851837403, + "step": 1500 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 2.6017818173586662e+17, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1500/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7ca00b10032908aa0cef9bcb054d8e9b5ee5535c --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7e1afa8ea4b593f75e66d3a82957fad91222dba43a0f89fc2ee057a3ee4bfc09 +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..a8238661aacbecce7eb0df42add32175b5efb68d --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b4b7fcbf513203fcbab0d1e8f4b311b6b70369475e9046b63e978c48bac3b881 +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..522f4149d95471d2f3d5aea0f1894e942eb9fe9a --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a6239986128c5b3633dc0424948128e9f5ea5b332ee9e585be64c0a958313cdc +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..0326d26441d6f34354be94c95856b044bf0f9ecf --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ceef23c3406c5c7cabde148af9d5d6d9cedd33c1aeefb523c9db929ff154b250 +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..4e44981a666959932190cd58158db459671d9c7a --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/trainer_state.json @@ -0,0 +1,1440 @@ +{ + "best_global_step": 1688, + "best_metric": 0.12758993, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688", + "epoch": 1.0, + "eval_steps": 300, + "global_step": 1688, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + }, + { + "epoch": 0.1837037037037037, + "grad_norm": 1.2620875835418701, + "learning_rate": 1.9577805521806358e-05, + "loss": 0.1300894260406494, + "step": 310, + "token_acc": 0.960536398467433 + }, + { + "epoch": 0.18962962962962962, + "grad_norm": 1.1361067295074463, + "learning_rate": 1.95163006586405e-05, + "loss": 0.16317719221115112, + "step": 320, + "token_acc": 0.9544095665171899 + }, + { + "epoch": 0.19555555555555557, + "grad_norm": 0.8173150420188904, + "learning_rate": 1.945072539751685e-05, + "loss": 0.17428743839263916, + "step": 330, + "token_acc": 0.94750656167979 + }, + { + "epoch": 0.20148148148148148, + "grad_norm": 0.8849798440933228, + "learning_rate": 1.93811077868776e-05, + "loss": 0.12995322942733764, + "step": 340, + "token_acc": 0.9658246656760773 + }, + { + "epoch": 0.2074074074074074, + "grad_norm": 0.6326722502708435, + "learning_rate": 1.9307477604195162e-05, + "loss": 0.1278319001197815, + "step": 350, + "token_acc": 0.9639468690702088 + }, + { + "epoch": 0.21333333333333335, + "grad_norm": 1.1027580499649048, + "learning_rate": 1.9229866343235427e-05, + "loss": 0.12902997732162474, + "step": 360, + "token_acc": 0.9652777777777778 + }, + { + "epoch": 0.21925925925925926, + "grad_norm": 0.7148353457450867, + "learning_rate": 1.914830720058701e-05, + "loss": 0.14380792379379273, + "step": 370, + "token_acc": 0.9572490706319703 + }, + { + "epoch": 0.22518518518518518, + "grad_norm": 1.1909170150756836, + "learning_rate": 1.9062835061462105e-05, + "loss": 0.15708266496658324, + "step": 380, + "token_acc": 0.9598788796366389 + }, + { + "epoch": 0.2311111111111111, + "grad_norm": 0.7275416254997253, + "learning_rate": 1.8973486484775037e-05, + "loss": 0.15604959726333617, + "step": 390, + "token_acc": 0.9558498896247241 + }, + { + "epoch": 0.23703703703703705, + "grad_norm": 0.9419987201690674, + "learning_rate": 1.888029968750498e-05, + "loss": 0.1431185483932495, + "step": 400, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.24296296296296296, + "grad_norm": 0.6928850412368774, + "learning_rate": 1.878331452834944e-05, + "loss": 0.15362846851348877, + "step": 410, + "token_acc": 0.9517941283073578 + }, + { + "epoch": 0.24888888888888888, + "grad_norm": 0.6290676593780518, + "learning_rate": 1.8682572490675524e-05, + "loss": 0.12896524667739867, + "step": 420, + "token_acc": 0.9619504987070557 + }, + { + "epoch": 0.2548148148148148, + "grad_norm": 0.7995588779449463, + "learning_rate": 1.8578116664776314e-05, + "loss": 0.14157743453979493, + "step": 430, + "token_acc": 0.9562071591774562 + }, + { + "epoch": 0.2607407407407407, + "grad_norm": 0.780008852481842, + "learning_rate": 1.8469991729439888e-05, + "loss": 0.16496583223342895, + "step": 440, + "token_acc": 0.9543109801031687 + }, + { + "epoch": 0.26666666666666666, + "grad_norm": 0.8067275881767273, + "learning_rate": 1.8358243932838914e-05, + "loss": 0.14944461584091187, + "step": 450, + "token_acc": 0.9509394572025052 + }, + { + "epoch": 0.2725925925925926, + "grad_norm": 0.8212175369262695, + "learning_rate": 1.8242921072748948e-05, + "loss": 0.12261044979095459, + "step": 460, + "token_acc": 0.9617764834364761 + }, + { + "epoch": 0.2785185185185185, + "grad_norm": 0.688872754573822, + "learning_rate": 1.8124072476103957e-05, + "loss": 0.12651515007019043, + "step": 470, + "token_acc": 0.9594694178334562 + }, + { + "epoch": 0.28444444444444444, + "grad_norm": 1.0954047441482544, + "learning_rate": 1.8001748977897754e-05, + "loss": 0.11215313673019409, + "step": 480, + "token_acc": 0.9634851771511207 + }, + { + "epoch": 0.2903703703703704, + "grad_norm": 0.8077743649482727, + "learning_rate": 1.787600289944039e-05, + "loss": 0.1215265154838562, + "step": 490, + "token_acc": 0.9642989959092599 + }, + { + "epoch": 0.2962962962962963, + "grad_norm": 0.9279748797416687, + "learning_rate": 1.7746888025978807e-05, + "loss": 0.11017097234725952, + "step": 500, + "token_acc": 0.9696060037523452 + }, + { + "epoch": 0.3022222222222222, + "grad_norm": 1.2479947805404663, + "learning_rate": 1.7614459583691346e-05, + "loss": 0.1296389102935791, + "step": 510, + "token_acc": 0.9566453447050463 + }, + { + "epoch": 0.30814814814814817, + "grad_norm": 1.1002650260925293, + "learning_rate": 1.7478774216065882e-05, + "loss": 0.13492013216018678, + "step": 520, + "token_acc": 0.9590994371482177 + }, + { + "epoch": 0.31407407407407406, + "grad_norm": 1.108170747756958, + "learning_rate": 1.733988995967179e-05, + "loss": 0.14083080291748046, + "step": 530, + "token_acc": 0.9592061742006616 + }, + { + "epoch": 0.32, + "grad_norm": 0.8783969879150391, + "learning_rate": 1.719786621933599e-05, + "loss": 0.12698700428009033, + "step": 540, + "token_acc": 0.9617927994121969 + }, + { + "epoch": 0.32592592592592595, + "grad_norm": 0.6896427273750305, + "learning_rate": 1.70527637427338e-05, + "loss": 0.11144465208053589, + "step": 550, + "token_acc": 0.9692820133234641 + }, + { + "epoch": 0.33185185185185184, + "grad_norm": 1.067499041557312, + "learning_rate": 1.690464459440538e-05, + "loss": 0.13314462900161744, + "step": 560, + "token_acc": 0.9597096188747731 + }, + { + "epoch": 0.3377777777777778, + "grad_norm": 0.6953498721122742, + "learning_rate": 1.6753572129208935e-05, + "loss": 0.11334860324859619, + "step": 570, + "token_acc": 0.9676190476190476 + }, + { + "epoch": 0.3437037037037037, + "grad_norm": 1.197219967842102, + "learning_rate": 1.6599610965222002e-05, + "loss": 0.1281804084777832, + "step": 580, + "token_acc": 0.9607272727272728 + }, + { + "epoch": 0.3496296296296296, + "grad_norm": 0.6708402633666992, + "learning_rate": 1.6442826956102424e-05, + "loss": 0.12322006225585938, + "step": 590, + "token_acc": 0.9628704034273474 + }, + { + "epoch": 0.35555555555555557, + "grad_norm": 1.0634019374847412, + "learning_rate": 1.628328716292082e-05, + "loss": 0.13818006515502929, + "step": 600, + "token_acc": 0.9580494801003944 + }, + { + "epoch": 0.35555555555555557, + "eval_loss": 0.14249637722969055, + "eval_runtime": 229.7535, + "eval_samples_per_second": 6.529, + "eval_steps_per_second": 6.529, + "eval_token_acc": 0.9576734025122884, + "step": 600 + }, + { + "epoch": 0.36148148148148146, + "grad_norm": 0.7200868129730225, + "learning_rate": 1.612105982547663e-05, + "loss": 0.13777921199798585, + "step": 610, + "token_acc": 0.9565537555228277 + }, + { + "epoch": 0.3674074074074074, + "grad_norm": 1.610889196395874, + "learning_rate": 1.595621433310997e-05, + "loss": 0.12660154104232788, + "step": 620, + "token_acc": 0.9658464928387808 + }, + { + "epoch": 0.37333333333333335, + "grad_norm": 1.7054650783538818, + "learning_rate": 1.5788821195021792e-05, + "loss": 0.13561646938323973, + "step": 630, + "token_acc": 0.9558277654046028 + }, + { + "epoch": 0.37925925925925924, + "grad_norm": 1.4907517433166504, + "learning_rate": 1.5618952010115057e-05, + "loss": 0.12502728700637816, + "step": 640, + "token_acc": 0.9623144271031595 + }, + { + "epoch": 0.3851851851851852, + "grad_norm": 1.1567004919052124, + "learning_rate": 1.544667943636981e-05, + "loss": 0.1149907112121582, + "step": 650, + "token_acc": 0.9643255295429208 + }, + { + "epoch": 0.39111111111111113, + "grad_norm": 1.0321091413497925, + "learning_rate": 1.527207715976525e-05, + "loss": 0.14286714792251587, + "step": 660, + "token_acc": 0.9604221635883905 + }, + { + "epoch": 0.397037037037037, + "grad_norm": 1.4016674757003784, + "learning_rate": 1.5095219862762091e-05, + "loss": 0.13563259840011596, + "step": 670, + "token_acc": 0.9618029029793735 + }, + { + "epoch": 0.40296296296296297, + "grad_norm": 1.089959979057312, + "learning_rate": 1.4916183192358717e-05, + "loss": 0.1207580804824829, + "step": 680, + "token_acc": 0.9630141721396475 + }, + { + "epoch": 0.4088888888888889, + "grad_norm": 1.045990228652954, + "learning_rate": 1.4735043727734762e-05, + "loss": 0.11743853092193604, + "step": 690, + "token_acc": 0.9632217727105553 + }, + { + "epoch": 0.4148148148148148, + "grad_norm": 1.4252482652664185, + "learning_rate": 1.455187894749597e-05, + "loss": 0.0928974449634552, + "step": 700, + "token_acc": 0.9683257918552036 + }, + { + "epoch": 0.42074074074074075, + "grad_norm": 1.1641786098480225, + "learning_rate": 1.436676719653435e-05, + "loss": 0.12940033674240112, + "step": 710, + "token_acc": 0.9638252148997135 + }, + { + "epoch": 0.4266666666666667, + "grad_norm": 0.7832347750663757, + "learning_rate": 1.4179787652517791e-05, + "loss": 0.12433557510375977, + "step": 720, + "token_acc": 0.9617952522255193 + }, + { + "epoch": 0.4325925925925926, + "grad_norm": 1.1413239240646362, + "learning_rate": 1.3991020292023474e-05, + "loss": 0.09806026816368103, + "step": 730, + "token_acc": 0.9669064748201439 + }, + { + "epoch": 0.43851851851851853, + "grad_norm": 0.8681485056877136, + "learning_rate": 1.3800545856329572e-05, + "loss": 0.14417175054550171, + "step": 740, + "token_acc": 0.9569114098586694 + }, + { + "epoch": 0.4444444444444444, + "grad_norm": 0.9045178294181824, + "learning_rate": 1.3608445816879865e-05, + "loss": 0.10493698120117187, + "step": 750, + "token_acc": 0.9662880175888604 + }, + { + "epoch": 0.45037037037037037, + "grad_norm": 1.1523085832595825, + "learning_rate": 1.3414802340436022e-05, + "loss": 0.12941417694091797, + "step": 760, + "token_acc": 0.9683060109289617 + }, + { + "epoch": 0.4562962962962963, + "grad_norm": 0.9145503640174866, + "learning_rate": 1.3219698253932518e-05, + "loss": 0.12189668416976929, + "step": 770, + "token_acc": 0.9584711503123852 + }, + { + "epoch": 0.4622222222222222, + "grad_norm": 1.0088993310928345, + "learning_rate": 1.3023217009049133e-05, + "loss": 0.10943882465362549, + "step": 780, + "token_acc": 0.9680624556422995 + }, + { + "epoch": 0.46814814814814815, + "grad_norm": 1.376142978668213, + "learning_rate": 1.2825442646516253e-05, + "loss": 0.10388659238815308, + "step": 790, + "token_acc": 0.9674435812060673 + }, + { + "epoch": 0.4740740740740741, + "grad_norm": 1.3877886533737183, + "learning_rate": 1.262645976016821e-05, + "loss": 0.1380447506904602, + "step": 800, + "token_acc": 0.9608202123764189 + }, + { + "epoch": 0.48, + "grad_norm": 0.8192164301872253, + "learning_rate": 1.2426353460760036e-05, + "loss": 0.11965352296829224, + "step": 810, + "token_acc": 0.9655172413793104 + }, + { + "epoch": 0.48592592592592593, + "grad_norm": 0.8384001851081848, + "learning_rate": 1.2225209339563144e-05, + "loss": 0.09073964357376099, + "step": 820, + "token_acc": 0.9659477866061293 + }, + { + "epoch": 0.4918518518518519, + "grad_norm": 1.1015766859054565, + "learning_rate": 1.2023113431755435e-05, + "loss": 0.10787882804870605, + "step": 830, + "token_acc": 0.9649122807017544 + }, + { + "epoch": 0.49777777777777776, + "grad_norm": 1.042965292930603, + "learning_rate": 1.1820152179621564e-05, + "loss": 0.13076914548873902, + "step": 840, + "token_acc": 0.960755275823769 + }, + { + "epoch": 0.5037037037037037, + "grad_norm": 0.8400379419326782, + "learning_rate": 1.161641239557907e-05, + "loss": 0.13471759557724, + "step": 850, + "token_acc": 0.9608513873052071 + }, + { + "epoch": 0.5096296296296297, + "grad_norm": 1.0256035327911377, + "learning_rate": 1.141198122504618e-05, + "loss": 0.11886721849441528, + "step": 860, + "token_acc": 0.9659887798036466 + }, + { + "epoch": 0.5155555555555555, + "grad_norm": 1.1291937828063965, + "learning_rate": 1.1206946109167189e-05, + "loss": 0.13678861856460572, + "step": 870, + "token_acc": 0.961859789320741 + }, + { + "epoch": 0.5214814814814814, + "grad_norm": 1.4508821964263916, + "learning_rate": 1.1001394747411347e-05, + "loss": 0.13137236833572388, + "step": 880, + "token_acc": 0.9597744360902256 + }, + { + "epoch": 0.5274074074074074, + "grad_norm": 0.6653353571891785, + "learning_rate": 1.0795415060061242e-05, + "loss": 0.11796672344207763, + "step": 890, + "token_acc": 0.9627539503386005 + }, + { + "epoch": 0.5333333333333333, + "grad_norm": 0.7665302753448486, + "learning_rate": 1.0589095150606747e-05, + "loss": 0.14120289087295532, + "step": 900, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5333333333333333, + "eval_loss": 0.1341869980096817, + "eval_runtime": 228.3025, + "eval_samples_per_second": 6.57, + "eval_steps_per_second": 6.57, + "eval_token_acc": 0.9593898728251541, + "step": 900 + }, + { + "epoch": 0.5392592592592592, + "grad_norm": 1.1279549598693848, + "learning_rate": 1.0382523268060612e-05, + "loss": 0.11883513927459717, + "step": 910, + "token_acc": 0.9647756766777902 + }, + { + "epoch": 0.5451851851851852, + "grad_norm": 1.0214804410934448, + "learning_rate": 1.0175787769211778e-05, + "loss": 0.11933118104934692, + "step": 920, + "token_acc": 0.959910078681154 + }, + { + "epoch": 0.5511111111111111, + "grad_norm": 0.8586761951446533, + "learning_rate": 9.968977080832633e-06, + "loss": 0.11430730819702148, + "step": 930, + "token_acc": 0.9654676258992806 + }, + { + "epoch": 0.557037037037037, + "grad_norm": 0.7968057990074158, + "learning_rate": 9.762179661856312e-06, + "loss": 0.13973416090011598, + "step": 940, + "token_acc": 0.9573529411764706 + }, + { + "epoch": 0.562962962962963, + "grad_norm": 1.0118746757507324, + "learning_rate": 9.555483965540238e-06, + "loss": 0.12812395095825196, + "step": 950, + "token_acc": 0.9614254224834681 + }, + { + "epoch": 0.5688888888888889, + "grad_norm": 1.1432191133499146, + "learning_rate": 9.348978401632101e-06, + "loss": 0.1379111647605896, + "step": 960, + "token_acc": 0.9561209439528023 + }, + { + "epoch": 0.5748148148148148, + "grad_norm": 0.7802894115447998, + "learning_rate": 9.142751298554436e-06, + "loss": 0.14111405611038208, + "step": 970, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5807407407407408, + "grad_norm": 0.741787314414978, + "learning_rate": 8.936890865624014e-06, + "loss": 0.10649667978286743, + "step": 980, + "token_acc": 0.9672929714683368 + }, + { + "epoch": 0.5866666666666667, + "grad_norm": 0.7642576694488525, + "learning_rate": 8.731485155322134e-06, + "loss": 0.10067906379699706, + "step": 990, + "token_acc": 0.9700443786982249 + }, + { + "epoch": 0.5925925925925926, + "grad_norm": 1.0362651348114014, + "learning_rate": 8.52662202563203e-06, + "loss": 0.12069357633590698, + "step": 1000, + "token_acc": 0.9607771260997068 + }, + { + "epoch": 0.5985185185185186, + "grad_norm": 0.7719289064407349, + "learning_rate": 8.322389102459458e-06, + "loss": 0.11699739694595337, + "step": 1010, + "token_acc": 0.9636767976278725 + }, + { + "epoch": 0.6044444444444445, + "grad_norm": 1.143441081047058, + "learning_rate": 8.118873742152574e-06, + "loss": 0.12428475618362426, + "step": 1020, + "token_acc": 0.9612553273924835 + }, + { + "epoch": 0.6103703703703703, + "grad_norm": 0.7593462467193604, + "learning_rate": 7.916162994137056e-06, + "loss": 0.114216148853302, + "step": 1030, + "token_acc": 0.9674105561459441 + }, + { + "epoch": 0.6162962962962963, + "grad_norm": 0.9898127317428589, + "learning_rate": 7.714343563682565e-06, + "loss": 0.12711145877838134, + "step": 1040, + "token_acc": 0.9625998547567175 + }, + { + "epoch": 0.6222222222222222, + "grad_norm": 1.3860629796981812, + "learning_rate": 7.513501774816362e-06, + "loss": 0.14218902587890625, + "step": 1050, + "token_acc": 0.9609863820390137 + }, + { + "epoch": 0.6281481481481481, + "grad_norm": 0.7516865134239197, + "learning_rate": 7.313723533400047e-06, + "loss": 0.1154281735420227, + "step": 1060, + "token_acc": 0.965135769359705 + }, + { + "epoch": 0.6340740740740741, + "grad_norm": 1.0139286518096924, + "learning_rate": 7.115094290385103e-06, + "loss": 0.12470541000366211, + "step": 1070, + "token_acc": 0.9648382559774965 + }, + { + "epoch": 0.64, + "grad_norm": 1.0060116052627563, + "learning_rate": 6.9176990052630465e-06, + "loss": 0.1165156364440918, + "step": 1080, + "token_acc": 0.9641779788838613 + }, + { + "epoch": 0.6459259259259259, + "grad_norm": 1.437506079673767, + "learning_rate": 6.721622109725799e-06, + "loss": 0.128699791431427, + "step": 1090, + "token_acc": 0.9611650485436893 + }, + { + "epoch": 0.6518518518518519, + "grad_norm": 1.0488654375076294, + "learning_rate": 6.526947471551799e-06, + "loss": 0.14162105321884155, + "step": 1100, + "token_acc": 0.9533483822422875 + }, + { + "epoch": 0.6577777777777778, + "grad_norm": 0.9438616633415222, + "learning_rate": 6.333758358733313e-06, + "loss": 0.14174394607543944, + "step": 1110, + "token_acc": 0.9583492548719909 + }, + { + "epoch": 0.6637037037037037, + "grad_norm": 1.2012673616409302, + "learning_rate": 6.142137403860301e-06, + "loss": 0.14388898611068726, + "step": 1120, + "token_acc": 0.9564558879212419 + }, + { + "epoch": 0.6696296296296296, + "grad_norm": 1.1282634735107422, + "learning_rate": 5.952166568776062e-06, + "loss": 0.11517893075942993, + "step": 1130, + "token_acc": 0.9685185185185186 + }, + { + "epoch": 0.6755555555555556, + "grad_norm": 0.8449248671531677, + "learning_rate": 5.763927109519784e-06, + "loss": 0.08853521943092346, + "step": 1140, + "token_acc": 0.9759211966435607 + }, + { + "epoch": 0.6814814814814815, + "grad_norm": 0.9580397009849548, + "learning_rate": 5.577499541570954e-06, + "loss": 0.14078164100646973, + "step": 1150, + "token_acc": 0.9634651600753296 + }, + { + "epoch": 0.6874074074074074, + "grad_norm": 0.7772520184516907, + "learning_rate": 5.3929636054105745e-06, + "loss": 0.10377205610275268, + "step": 1160, + "token_acc": 0.9701709712622771 + }, + { + "epoch": 0.6933333333333334, + "grad_norm": 1.3566169738769531, + "learning_rate": 5.210398232413824e-06, + "loss": 0.1568630576133728, + "step": 1170, + "token_acc": 0.9556422995031938 + }, + { + "epoch": 0.6992592592592592, + "grad_norm": 0.9245796203613281, + "learning_rate": 5.0298815110888566e-06, + "loss": 0.14888057708740235, + "step": 1180, + "token_acc": 0.9563852058618283 + }, + { + "epoch": 0.7051851851851851, + "grad_norm": 1.0345977544784546, + "learning_rate": 4.851490653676019e-06, + "loss": 0.1214102029800415, + "step": 1190, + "token_acc": 0.9646017699115044 + }, + { + "epoch": 0.7111111111111111, + "grad_norm": 1.1635781526565552, + "learning_rate": 4.675301963121998e-06, + "loss": 0.12966567277908325, + "step": 1200, + "token_acc": 0.9577946768060837 + }, + { + "epoch": 0.7111111111111111, + "eval_loss": 0.12971985340118408, + "eval_runtime": 229.3094, + "eval_samples_per_second": 6.541, + "eval_steps_per_second": 6.541, + "eval_token_acc": 0.9621596317390965, + "step": 1200 + }, + { + "epoch": 0.717037037037037, + "grad_norm": 0.6507232785224915, + "learning_rate": 4.501390800442783e-06, + "loss": 0.12880181074142455, + "step": 1210, + "token_acc": 0.9664481295796374 + }, + { + "epoch": 0.7229629629629629, + "grad_norm": 0.9675179123878479, + "learning_rate": 4.329831552489626e-06, + "loss": 0.12247174978256226, + "step": 1220, + "token_acc": 0.9622926093514329 + }, + { + "epoch": 0.7288888888888889, + "grad_norm": 0.9841185808181763, + "learning_rate": 4.160697600131568e-06, + "loss": 0.12777591943740846, + "step": 1230, + "token_acc": 0.9612147822905233 + }, + { + "epoch": 0.7348148148148148, + "grad_norm": 1.4565831422805786, + "learning_rate": 3.994061286868361e-06, + "loss": 0.13893853425979613, + "step": 1240, + "token_acc": 0.9622920517560074 + }, + { + "epoch": 0.7407407407407407, + "grad_norm": 1.1277369260787964, + "learning_rate": 3.8299938878870215e-06, + "loss": 0.09945087432861328, + "step": 1250, + "token_acc": 0.965828013518588 + }, + { + "epoch": 0.7466666666666667, + "grad_norm": 1.1658375263214111, + "learning_rate": 3.6685655795753836e-06, + "loss": 0.08901865482330322, + "step": 1260, + "token_acc": 0.9718995878606219 + }, + { + "epoch": 0.7525925925925926, + "grad_norm": 1.2467801570892334, + "learning_rate": 3.50984540950562e-06, + "loss": 0.12474504709243775, + "step": 1270, + "token_acc": 0.9593131765584173 + }, + { + "epoch": 0.7585185185185185, + "grad_norm": 1.2965892553329468, + "learning_rate": 3.3539012669005653e-06, + "loss": 0.12159136533737183, + "step": 1280, + "token_acc": 0.961352657004831 + }, + { + "epoch": 0.7644444444444445, + "grad_norm": 1.1689339876174927, + "learning_rate": 3.2007998535955774e-06, + "loss": 0.1344360113143921, + "step": 1290, + "token_acc": 0.9594349873234336 + }, + { + "epoch": 0.7703703703703704, + "grad_norm": 0.7894589304924011, + "learning_rate": 3.0506066555081683e-06, + "loss": 0.12788604497909545, + "step": 1300, + "token_acc": 0.963855421686747 + }, + { + "epoch": 0.7762962962962963, + "grad_norm": 1.2829697132110596, + "learning_rate": 2.90338591462782e-06, + "loss": 0.11962369680404664, + "step": 1310, + "token_acc": 0.9604395604395605 + }, + { + "epoch": 0.7822222222222223, + "grad_norm": 1.1379469633102417, + "learning_rate": 2.7592006015377937e-06, + "loss": 0.11098712682723999, + "step": 1320, + "token_acc": 0.9649507119386638 + }, + { + "epoch": 0.7881481481481482, + "grad_norm": 1.723992109298706, + "learning_rate": 2.6181123884808056e-06, + "loss": 0.13792314529418945, + "step": 1330, + "token_acc": 0.9560761346998536 + }, + { + "epoch": 0.794074074074074, + "grad_norm": 1.1304504871368408, + "learning_rate": 2.480181622980009e-06, + "loss": 0.10700693130493164, + "step": 1340, + "token_acc": 0.9640314724615962 + }, + { + "epoch": 0.8, + "grad_norm": 1.3609181642532349, + "learning_rate": 2.3454673020265973e-06, + "loss": 0.11214718818664551, + "step": 1350, + "token_acc": 0.967559411542814 + }, + { + "epoch": 0.8059259259259259, + "grad_norm": 0.7761492133140564, + "learning_rate": 2.2140270468450966e-06, + "loss": 0.09663894772529602, + "step": 1360, + "token_acc": 0.9720812182741116 + }, + { + "epoch": 0.8118518518518518, + "grad_norm": 1.143888235092163, + "learning_rate": 2.0859170782470873e-06, + "loss": 0.1209203839302063, + "step": 1370, + "token_acc": 0.9637912673056444 + }, + { + "epoch": 0.8177777777777778, + "grad_norm": 1.0649224519729614, + "learning_rate": 1.961192192583934e-06, + "loss": 0.14124363660812378, + "step": 1380, + "token_acc": 0.9554285714285714 + }, + { + "epoch": 0.8237037037037037, + "grad_norm": 1.3557066917419434, + "learning_rate": 1.8399057383087859e-06, + "loss": 0.11149574518203735, + "step": 1390, + "token_acc": 0.9653537563822028 + }, + { + "epoch": 0.8296296296296296, + "grad_norm": 1.064666748046875, + "learning_rate": 1.7221095931579091e-06, + "loss": 0.1278609037399292, + "step": 1400, + "token_acc": 0.9580903790087464 + }, + { + "epoch": 0.8355555555555556, + "grad_norm": 1.6276605129241943, + "learning_rate": 1.6078541419610716e-06, + "loss": 0.1316068649291992, + "step": 1410, + "token_acc": 0.961738484398217 + }, + { + "epoch": 0.8414814814814815, + "grad_norm": 1.0021592378616333, + "learning_rate": 1.4971882550904725e-06, + "loss": 0.12551895380020142, + "step": 1420, + "token_acc": 0.9635036496350365 + }, + { + "epoch": 0.8474074074074074, + "grad_norm": 1.2714834213256836, + "learning_rate": 1.3901592675574915e-06, + "loss": 0.11337714195251465, + "step": 1430, + "token_acc": 0.9627518053971874 + }, + { + "epoch": 0.8533333333333334, + "grad_norm": 1.2086464166641235, + "learning_rate": 1.286812958766106e-06, + "loss": 0.1030318260192871, + "step": 1440, + "token_acc": 0.9690611664295875 + }, + { + "epoch": 0.8592592592592593, + "grad_norm": 1.4665285348892212, + "learning_rate": 1.1871935329317363e-06, + "loss": 0.1136628270149231, + "step": 1450, + "token_acc": 0.9621955652490004 + }, + { + "epoch": 0.8651851851851852, + "grad_norm": 1.4833930730819702, + "learning_rate": 1.0913436001737953e-06, + "loss": 0.14109413623809813, + "step": 1460, + "token_acc": 0.9591619318181818 + }, + { + "epoch": 0.8711111111111111, + "grad_norm": 0.6605064868927002, + "learning_rate": 9.993041582901208e-07, + "loss": 0.13869184255599976, + "step": 1470, + "token_acc": 0.9622367465504721 + }, + { + "epoch": 0.8770370370370371, + "grad_norm": 1.142251968383789, + "learning_rate": 9.111145752210171e-07, + "loss": 0.15464030504226683, + "step": 1480, + "token_acc": 0.9590840840840841 + }, + { + "epoch": 0.882962962962963, + "grad_norm": 1.4246073961257935, + "learning_rate": 8.268125722104569e-07, + "loss": 0.137708580493927, + "step": 1490, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.8888888888888888, + "grad_norm": 1.4238859415054321, + "learning_rate": 7.46434207671598e-07, + "loss": 0.08925541639328002, + "step": 1500, + "token_acc": 0.9747899159663865 + }, + { + "epoch": 0.8888888888888888, + "eval_loss": 0.1276273876428604, + "eval_runtime": 229.1217, + "eval_samples_per_second": 6.547, + "eval_steps_per_second": 6.547, + "eval_token_acc": 0.9623546851837403, + "step": 1500 + }, + { + "epoch": 0.8948148148148148, + "grad_norm": 1.1456782817840576, + "learning_rate": 6.700138617635577e-07, + "loss": 0.12536653280258178, + "step": 1510, + "token_acc": 0.9648377125193199 + }, + { + "epoch": 0.9007407407407407, + "grad_norm": 0.5869998931884766, + "learning_rate": 5.975842216860239e-07, + "loss": 0.11909486055374145, + "step": 1520, + "token_acc": 0.9651647103369936 + }, + { + "epoch": 0.9066666666666666, + "grad_norm": 0.8277629613876343, + "learning_rate": 5.291762676979917e-07, + "loss": 0.10322866439819336, + "step": 1530, + "token_acc": 0.9698861549761293 + }, + { + "epoch": 0.9125925925925926, + "grad_norm": 1.0630172491073608, + "learning_rate": 4.648192598666013e-07, + "loss": 0.1228654146194458, + "step": 1540, + "token_acc": 0.9670886075949368 + }, + { + "epoch": 0.9185185185185185, + "grad_norm": 0.8849966526031494, + "learning_rate": 4.0454072555176195e-07, + "loss": 0.08263896107673645, + "step": 1550, + "token_acc": 0.9724354501046755 + }, + { + "epoch": 0.9244444444444444, + "grad_norm": 1.4644533395767212, + "learning_rate": 3.4836644763190264e-07, + "loss": 0.10929735898971557, + "step": 1560, + "token_acc": 0.9660516605166052 + }, + { + "epoch": 0.9303703703703704, + "grad_norm": 1.3451666831970215, + "learning_rate": 2.9632045347588566e-07, + "loss": 0.0930831789970398, + "step": 1570, + "token_acc": 0.967948717948718 + }, + { + "epoch": 0.9362962962962963, + "grad_norm": 0.6276125907897949, + "learning_rate": 2.484250046658054e-07, + "loss": 0.0964022159576416, + "step": 1580, + "token_acc": 0.9702295552367288 + }, + { + "epoch": 0.9422222222222222, + "grad_norm": 0.964272141456604, + "learning_rate": 2.0470058747505516e-07, + "loss": 0.12160607576370239, + "step": 1590, + "token_acc": 0.961283571677712 + }, + { + "epoch": 0.9481481481481482, + "grad_norm": 1.202038049697876, + "learning_rate": 1.6516590410576628e-07, + "loss": 0.11407674551010132, + "step": 1600, + "token_acc": 0.9619465788510794 + }, + { + "epoch": 0.9540740740740741, + "grad_norm": 1.0892561674118042, + "learning_rate": 1.2983786468932503e-07, + "loss": 0.12073925733566285, + "step": 1610, + "token_acc": 0.962109955423477 + }, + { + "epoch": 0.96, + "grad_norm": 1.3103691339492798, + "learning_rate": 9.873158005341943e-08, + "loss": 0.10570030212402344, + "step": 1620, + "token_acc": 0.9626497533474278 + }, + { + "epoch": 0.965925925925926, + "grad_norm": 0.9008719325065613, + "learning_rate": 7.186035525870272e-08, + "loss": 0.1048168420791626, + "step": 1630, + "token_acc": 0.9678002894356006 + }, + { + "epoch": 0.9718518518518519, + "grad_norm": 1.2709956169128418, + "learning_rate": 4.9235683907833396e-08, + "loss": 0.16029913425445558, + "step": 1640, + "token_acc": 0.956964892412231 + }, + { + "epoch": 0.9777777777777777, + "grad_norm": 1.142215371131897, + "learning_rate": 3.086724322932111e-08, + "loss": 0.10578294992446899, + "step": 1650, + "token_acc": 0.9671545876472688 + }, + { + "epoch": 0.9837037037037037, + "grad_norm": 1.015450119972229, + "learning_rate": 1.6762889938303216e-08, + "loss": 0.1220880389213562, + "step": 1660, + "token_acc": 0.9671361502347418 + }, + { + "epoch": 0.9896296296296296, + "grad_norm": 1.1465100049972534, + "learning_rate": 6.928656875994089e-09, + "loss": 0.12359803915023804, + "step": 1670, + "token_acc": 0.963089802130898 + }, + { + "epoch": 0.9955555555555555, + "grad_norm": 0.6673016548156738, + "learning_rate": 1.3687504292692055e-09, + "loss": 0.10396100282669067, + "step": 1680, + "token_acc": 0.9718817591925017 + }, + { + "epoch": 1.0, + "eval_loss": 0.12758992612361908, + "eval_runtime": 231.1684, + "eval_samples_per_second": 6.489, + "eval_steps_per_second": 6.489, + "eval_token_acc": 0.9622766638058828, + "step": 1688 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 2.929447543828032e+17, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6653c502567eb35bc16819cc5ceb84cb141a7f8f --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0cf5a48e521068993dd9da41d132a20974d5753e5313eee444319810f5f61757 +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..29d9d1fc4cef3f2d5edec4ea4e92727c228b1c31 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b68b18e5461252104174f929b4449a4f5b8945111bfda257b87b0dd186045418 +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..8a3697475ed93a677f025d3a7749d55e25108cf8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:842daffb645025b02820ebabb2155b6b142a63dc5f33939702b9b825dcf03589 +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..776faf97a4ed29e73d0c360b4df08d520ba804e1 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:389f1187d2ea46f74eb31cb122f8387456383583ccc859272cc9a99b01de23c3 +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..2700f0a88483b2cd10c98a519da232b1ef109e84 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/trainer_state.json @@ -0,0 +1,291 @@ +{ + "best_global_step": 300, + "best_metric": 0.16300094, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300", + "epoch": 0.17777777777777778, + "eval_steps": 300, + "global_step": 300, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 5.192901387485568e+16, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-300/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..6f413558281b9df1de2534ae2d89abd78520c904 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b47a3eb420fb0eaa8ddb10cb1fd3a2d83a1295e18530d83c3cee18d57759a567 +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..b27e6a8b8ccdc0cea624ad9c3a5c3fa2c092ef3c --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:971b96994930a38e0dd79cfc4d1052170ff709d9c16e5862eda4d7aed978f207 +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..4ed74a9b35bd2b08eaa1d0648f7a8960345145c9 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fc843956e5df2dfce2e865b93d72500f141c62d6949cb4b4f897ca2fd8826c50 +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..c28fe2122cc899e7789f4b6ab1f1f366235b36da --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7628f6a28d4d606e1b4a4bc8623e5399d9a39373321dfb196f921da21d6070b7 +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..04627b46ef855189693118b6c2de5107016fdc44 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/trainer_state.json @@ -0,0 +1,540 @@ +{ + "best_global_step": 600, + "best_metric": 0.14249638, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600", + "epoch": 0.35555555555555557, + "eval_steps": 300, + "global_step": 600, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + }, + { + "epoch": 0.1837037037037037, + "grad_norm": 1.2620875835418701, + "learning_rate": 1.9577805521806358e-05, + "loss": 0.1300894260406494, + "step": 310, + "token_acc": 0.960536398467433 + }, + { + "epoch": 0.18962962962962962, + "grad_norm": 1.1361067295074463, + "learning_rate": 1.95163006586405e-05, + "loss": 0.16317719221115112, + "step": 320, + "token_acc": 0.9544095665171899 + }, + { + "epoch": 0.19555555555555557, + "grad_norm": 0.8173150420188904, + "learning_rate": 1.945072539751685e-05, + "loss": 0.17428743839263916, + "step": 330, + "token_acc": 0.94750656167979 + }, + { + "epoch": 0.20148148148148148, + "grad_norm": 0.8849798440933228, + "learning_rate": 1.93811077868776e-05, + "loss": 0.12995322942733764, + "step": 340, + "token_acc": 0.9658246656760773 + }, + { + "epoch": 0.2074074074074074, + "grad_norm": 0.6326722502708435, + "learning_rate": 1.9307477604195162e-05, + "loss": 0.1278319001197815, + "step": 350, + "token_acc": 0.9639468690702088 + }, + { + "epoch": 0.21333333333333335, + "grad_norm": 1.1027580499649048, + "learning_rate": 1.9229866343235427e-05, + "loss": 0.12902997732162474, + "step": 360, + "token_acc": 0.9652777777777778 + }, + { + "epoch": 0.21925925925925926, + "grad_norm": 0.7148353457450867, + "learning_rate": 1.914830720058701e-05, + "loss": 0.14380792379379273, + "step": 370, + "token_acc": 0.9572490706319703 + }, + { + "epoch": 0.22518518518518518, + "grad_norm": 1.1909170150756836, + "learning_rate": 1.9062835061462105e-05, + "loss": 0.15708266496658324, + "step": 380, + "token_acc": 0.9598788796366389 + }, + { + "epoch": 0.2311111111111111, + "grad_norm": 0.7275416254997253, + "learning_rate": 1.8973486484775037e-05, + "loss": 0.15604959726333617, + "step": 390, + "token_acc": 0.9558498896247241 + }, + { + "epoch": 0.23703703703703705, + "grad_norm": 0.9419987201690674, + "learning_rate": 1.888029968750498e-05, + "loss": 0.1431185483932495, + "step": 400, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.24296296296296296, + "grad_norm": 0.6928850412368774, + "learning_rate": 1.878331452834944e-05, + "loss": 0.15362846851348877, + "step": 410, + "token_acc": 0.9517941283073578 + }, + { + "epoch": 0.24888888888888888, + "grad_norm": 0.6290676593780518, + "learning_rate": 1.8682572490675524e-05, + "loss": 0.12896524667739867, + "step": 420, + "token_acc": 0.9619504987070557 + }, + { + "epoch": 0.2548148148148148, + "grad_norm": 0.7995588779449463, + "learning_rate": 1.8578116664776314e-05, + "loss": 0.14157743453979493, + "step": 430, + "token_acc": 0.9562071591774562 + }, + { + "epoch": 0.2607407407407407, + "grad_norm": 0.780008852481842, + "learning_rate": 1.8469991729439888e-05, + "loss": 0.16496583223342895, + "step": 440, + "token_acc": 0.9543109801031687 + }, + { + "epoch": 0.26666666666666666, + "grad_norm": 0.8067275881767273, + "learning_rate": 1.8358243932838914e-05, + "loss": 0.14944461584091187, + "step": 450, + "token_acc": 0.9509394572025052 + }, + { + "epoch": 0.2725925925925926, + "grad_norm": 0.8212175369262695, + "learning_rate": 1.8242921072748948e-05, + "loss": 0.12261044979095459, + "step": 460, + "token_acc": 0.9617764834364761 + }, + { + "epoch": 0.2785185185185185, + "grad_norm": 0.688872754573822, + "learning_rate": 1.8124072476103957e-05, + "loss": 0.12651515007019043, + "step": 470, + "token_acc": 0.9594694178334562 + }, + { + "epoch": 0.28444444444444444, + "grad_norm": 1.0954047441482544, + "learning_rate": 1.8001748977897754e-05, + "loss": 0.11215313673019409, + "step": 480, + "token_acc": 0.9634851771511207 + }, + { + "epoch": 0.2903703703703704, + "grad_norm": 0.8077743649482727, + "learning_rate": 1.787600289944039e-05, + "loss": 0.1215265154838562, + "step": 490, + "token_acc": 0.9642989959092599 + }, + { + "epoch": 0.2962962962962963, + "grad_norm": 0.9279748797416687, + "learning_rate": 1.7746888025978807e-05, + "loss": 0.11017097234725952, + "step": 500, + "token_acc": 0.9696060037523452 + }, + { + "epoch": 0.3022222222222222, + "grad_norm": 1.2479947805404663, + "learning_rate": 1.7614459583691346e-05, + "loss": 0.1296389102935791, + "step": 510, + "token_acc": 0.9566453447050463 + }, + { + "epoch": 0.30814814814814817, + "grad_norm": 1.1002650260925293, + "learning_rate": 1.7478774216065882e-05, + "loss": 0.13492013216018678, + "step": 520, + "token_acc": 0.9590994371482177 + }, + { + "epoch": 0.31407407407407406, + "grad_norm": 1.108170747756958, + "learning_rate": 1.733988995967179e-05, + "loss": 0.14083080291748046, + "step": 530, + "token_acc": 0.9592061742006616 + }, + { + "epoch": 0.32, + "grad_norm": 0.8783969879150391, + "learning_rate": 1.719786621933599e-05, + "loss": 0.12698700428009033, + "step": 540, + "token_acc": 0.9617927994121969 + }, + { + "epoch": 0.32592592592592595, + "grad_norm": 0.6896427273750305, + "learning_rate": 1.70527637427338e-05, + "loss": 0.11144465208053589, + "step": 550, + "token_acc": 0.9692820133234641 + }, + { + "epoch": 0.33185185185185184, + "grad_norm": 1.067499041557312, + "learning_rate": 1.690464459440538e-05, + "loss": 0.13314462900161744, + "step": 560, + "token_acc": 0.9597096188747731 + }, + { + "epoch": 0.3377777777777778, + "grad_norm": 0.6953498721122742, + "learning_rate": 1.6753572129208935e-05, + "loss": 0.11334860324859619, + "step": 570, + "token_acc": 0.9676190476190476 + }, + { + "epoch": 0.3437037037037037, + "grad_norm": 1.197219967842102, + "learning_rate": 1.6599610965222002e-05, + "loss": 0.1281804084777832, + "step": 580, + "token_acc": 0.9607272727272728 + }, + { + "epoch": 0.3496296296296296, + "grad_norm": 0.6708402633666992, + "learning_rate": 1.6442826956102424e-05, + "loss": 0.12322006225585938, + "step": 590, + "token_acc": 0.9628704034273474 + }, + { + "epoch": 0.35555555555555557, + "grad_norm": 1.0634019374847412, + "learning_rate": 1.628328716292082e-05, + "loss": 0.13818006515502929, + "step": 600, + "token_acc": 0.9580494801003944 + }, + { + "epoch": 0.35555555555555557, + "eval_loss": 0.14249637722969055, + "eval_runtime": 229.7535, + "eval_samples_per_second": 6.529, + "eval_steps_per_second": 6.529, + "eval_token_acc": 0.9576734025122884, + "step": 600 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.0364707786172774e+17, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-600/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/README.md b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/README.md new file mode 100644 index 0000000000000000000000000000000000000000..0dc381e8c70e910cad7154d218fe2316fe5a852b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/README.md @@ -0,0 +1,207 @@ +--- +base_model: /root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +library_name: peft +pipeline_tag: text-generation +tags: +- base_model:adapter:/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B +- lora +- transformers +--- + +# Model Card for Model ID + + + + + +## Model Details + +### Model Description + + + + + +- **Developed by:** [More Information Needed] +- **Funded by [optional]:** [More Information Needed] +- **Shared by [optional]:** [More Information Needed] +- **Model type:** [More Information Needed] +- **Language(s) (NLP):** [More Information Needed] +- **License:** [More Information Needed] +- **Finetuned from model [optional]:** [More Information Needed] + +### Model Sources [optional] + + + +- **Repository:** [More Information Needed] +- **Paper [optional]:** [More Information Needed] +- **Demo [optional]:** [More Information Needed] + +## Uses + + + +### Direct Use + + + +[More Information Needed] + +### Downstream Use [optional] + + + +[More Information Needed] + +### Out-of-Scope Use + + + +[More Information Needed] + +## Bias, Risks, and Limitations + + + +[More Information Needed] + +### Recommendations + + + +Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations. + +## How to Get Started with the Model + +Use the code below to get started with the model. + +[More Information Needed] + +## Training Details + +### Training Data + + + +[More Information Needed] + +### Training Procedure + + + +#### Preprocessing [optional] + +[More Information Needed] + + +#### Training Hyperparameters + +- **Training regime:** [More Information Needed] + +#### Speeds, Sizes, Times [optional] + + + +[More Information Needed] + +## Evaluation + + + +### Testing Data, Factors & Metrics + +#### Testing Data + + + +[More Information Needed] + +#### Factors + + + +[More Information Needed] + +#### Metrics + + + +[More Information Needed] + +### Results + +[More Information Needed] + +#### Summary + + + +## Model Examination [optional] + + + +[More Information Needed] + +## Environmental Impact + + + +Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700). + +- **Hardware Type:** [More Information Needed] +- **Hours used:** [More Information Needed] +- **Cloud Provider:** [More Information Needed] +- **Compute Region:** [More Information Needed] +- **Carbon Emitted:** [More Information Needed] + +## Technical Specifications [optional] + +### Model Architecture and Objective + +[More Information Needed] + +### Compute Infrastructure + +[More Information Needed] + +#### Hardware + +[More Information Needed] + +#### Software + +[More Information Needed] + +## Citation [optional] + + + +**BibTeX:** + +[More Information Needed] + +**APA:** + +[More Information Needed] + +## Glossary [optional] + + + +[More Information Needed] + +## More Information [optional] + +[More Information Needed] + +## Model Card Authors [optional] + +[More Information Needed] + +## Model Card Contact + +[More Information Needed] +### Framework versions + +- PEFT 0.17.1 \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_config.json new file mode 100644 index 0000000000000000000000000000000000000000..0d71ef797f0e38eed13910020f4c4616d326541b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_config.json @@ -0,0 +1,34 @@ +{ + "alpha_pattern": {}, + "auto_mapping": null, + "base_model_name_or_path": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "bias": "none", + "corda_config": null, + "eva_config": null, + "exclude_modules": null, + "fan_in_fan_out": false, + "inference_mode": true, + "init_lora_weights": true, + "layer_replication": null, + "layers_pattern": null, + "layers_to_transform": null, + "loftq_config": {}, + "lora_alpha": 32, + "lora_bias": false, + "lora_dropout": 0.05, + "megatron_config": null, + "megatron_core": "megatron.core", + "modules_to_save": [], + "peft_type": "LORA", + "qalora_group_size": 16, + "r": 8, + "rank_pattern": {}, + "revision": null, + "target_modules": "^(thinker.model.*\\.(o_proj|k_proj|gate_proj|down_proj|v_proj|up_proj|q_proj)|thinker.audio_tower.proj|thinker.visual.merger.*\\.(2|0))$", + "target_parameters": null, + "task_type": "CAUSAL_LM", + "trainable_token_indices": null, + "use_dora": false, + "use_qalora": false, + "use_rslora": false +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_model.safetensors b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_model.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..a93e725bb3cc1e8b836da9511903aa1cd7253ede --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/adapter_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:60fdceb381b71408dac74e47bc8bf13abb1e8569f022fc8bc432c5db8a7b9915 +size 81557840 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/additional_config.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/additional_config.json new file mode 100644 index 0000000000000000000000000000000000000000..bbe5159d1d10a158affb4d328c70025d891e16d8 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/additional_config.json @@ -0,0 +1 @@ +{"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/args.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/args.json new file mode 100644 index 0000000000000000000000000000000000000000..da2f9e181e35752c8af5f0dd74c8f7be2b56f6cc --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/args.json @@ -0,0 +1,345 @@ +{ + "output_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639", + "overwrite_output_dir": false, + "do_train": false, + "do_eval": false, + "do_predict": false, + "eval_strategy": "steps", + "prediction_loss_only": false, + "per_device_train_batch_size": 1, + "per_device_eval_batch_size": 1, + "per_gpu_train_batch_size": null, + "per_gpu_eval_batch_size": null, + "gradient_accumulation_steps": 16, + "eval_accumulation_steps": null, + "eval_delay": 0, + "torch_empty_cache_steps": null, + "learning_rate": 1e-05, + "weight_decay": 0.1, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "max_grad_norm": 1.0, + "num_train_epochs": 1.0, + "max_steps": -1, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_ratio": 0.1, + "warmup_steps": 0, + "log_level": "passive", + "log_level_replica": "warning", + "log_on_each_node": true, + "logging_dir": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs", + "logging_strategy": "steps", + "logging_first_step": true, + "logging_steps": 10, + "logging_nan_inf_filter": true, + "save_strategy": "steps", + "save_steps": 300.0, + "save_total_limit": 20, + "save_safetensors": true, + "save_on_each_node": false, + "save_only_model": false, + "restore_callback_states_from_checkpoint": false, + "no_cuda": false, + "use_cpu": false, + "use_mps_device": false, + "seed": 42, + "data_seed": 42, + "jit_mode_eval": false, + "bf16": true, + "fp16": false, + "fp16_opt_level": "O1", + "half_precision_backend": "auto", + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": null, + "local_rank": -1, + "ddp_backend": null, + "tpu_num_cores": null, + "tpu_metrics_debug": false, + "debug": null, + "dataloader_drop_last": false, + "eval_steps": 300.0, + "dataloader_num_workers": null, + "dataloader_prefetch_factor": null, + "past_index": -1, + "run_name": "omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1", + "disable_tqdm": null, + "remove_unused_columns": true, + "label_names": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "fsdp": null, + "fsdp_min_num_params": 0, + "fsdp_config": null, + "fsdp_transformer_layer_cls_to_wrap": null, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "deepspeed": null, + "label_smoothing_factor": 0.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "adafactor": false, + "group_by_length": false, + "length_column_name": "length", + "report_to": [ + "wandb" + ], + "project": "huggingface", + "trackio_space_id": "trackio", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": false, + "skip_memory_metrics": true, + "use_legacy_prediction_loop": false, + "push_to_hub": false, + "resume_from_checkpoint": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_token": null, + "hub_private_repo": null, + "hub_always_push": false, + "hub_revision": null, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "include_inputs_for_metrics": false, + "include_for_metrics": [], + "eval_do_concat_batches": true, + "fp16_backend": "auto", + "push_to_hub_model_id": null, + "push_to_hub_organization": null, + "push_to_hub_token": null, + "mp_parameters": "", + "auto_find_batch_size": false, + "full_determinism": false, + "torchdynamo": null, + "ray_scope": "last", + "ddp_timeout": 18000000, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "include_tokens_per_second": false, + "include_num_input_tokens_seen": false, + "neftune_noise_alpha": null, + "optim_target_modules": null, + "batch_eval_metrics": false, + "eval_on_start": false, + "use_liger_kernel": false, + "liger_kernel_config": null, + "eval_use_gather_object": false, + "average_tokens_across_devices": true, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": null, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "max_epochs": null, + "aligner_lr": 2e-05, + "vit_lr": 1e-05, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "metric": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "use_flash_ckpt": false, + "model": "Qwen/Qwen2.5-Omni-7B", + "model_type": "qwen2_5_omni", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen2_5_omni", + "system": null, + "max_length": 32768, + "truncation_strategy": "delete", + "max_pixels": null, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_free": false, + "padding_side": "right", + "loss_scale": "default", + "sequence_parallel_size": 1, + "response_prefix": null, + "template_backend": "swift", + "dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_train90.jsonl" + ], + "val_dataset": [ + "/workspace/intern/pangkaiyu/dg/out_scenes/far_field_val5.jsonl" + ], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 1, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "ckpt_dir": null, + "lora_modules": [], + "train_type": "lora", + "adapters": [], + "external_plugins": [], + "model_kwargs": {}, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "lazy_tokenize": true, + "cached_dataset": [], + "custom_register_path": [], + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": false, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": null, + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_lark_webhook_url": null, + "swanlab_lark_secret": null, + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "early_stop_interval": null, + "rank": -1, + "global_world_size": 1, + "local_world_size": 1, + "model_suffix": "Qwen2.5-Omni-7B", + "model_info": "ModelInfo(model_type='qwen2_5_omni', model_dir='/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B', torch_dtype=torch.bfloat16, max_model_len=32768, quant_method=None, quant_bits=None, rope_scaling={'mrope_section': [16, 24, 24], 'rope_type': 'default', 'type': 'default'}, is_moe_model=False, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen2_5_omni', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen2.5-Omni-3B', hf_model_id='Qwen/Qwen2.5-Omni-3B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen2.5-Omni-7B', hf_model_id='Qwen/Qwen2.5-Omni-7B', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='qwen2_5_omni', get_function=, model_arch=MultiModelKeys(arch_name='qwen2_5_omni', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['thinker.model'], aligner=['thinker.audio_tower.proj', 'thinker.visual.merger'], vision_tower=['thinker.audio_tower', 'thinker.visual'], generator=['talker', 'token2wav']), architectures=['Qwen2_5OmniModel', 'Qwen2_5OmniForConditionalGeneration'], additional_saved_files=['spk_dict.pt'], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=[], requires=['transformers>=4.50', 'soundfile', 'qwen_omni_utils', 'decord'], tags=['vision', 'video', 'audio'])", + "model_dir": "/root/.cache/modelscope/hub/models/Qwen/Qwen2___5-Omni-7B", + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=, prediction_loss_only=False, per_device_train_batch_size=1, per_device_eval_batch_size=1, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=1e-05, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=1.0, max_steps=-1, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_ratio=0.1, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/runs', logging_strategy=, logging_first_step=True, logging_steps=10, logging_nan_inf_filter=True, save_strategy=, save_steps=300, save_total_limit=20, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=1, dataloader_prefetch_factor=10, past_index=-1, run_name='omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, deepspeed=None, label_smoothing_factor=0.0, optim=, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['wandb'], project='huggingface', trackio_space_id='trackio', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=, hub_token=None, hub_private_repo=None, hub_always_push=False, hub_revision=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=18000000, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, liger_kernel_config=None, eval_use_gather_object=False, average_tokens_across_devices=None, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=True, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, max_epochs=None, aligner_lr=2e-05, vit_lr=1e-05, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer='multimodal', loss_type=None, metric=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, use_flash_ckpt=False, sft_alpha=0, chord_sft_dataset=[], chord_sft_per_device_train_batch_size=None, chord_enable_phi_function=False, chord_mu_warmup_steps=None, chord_mu_decay_steps=None, chord_mu_peak=None, chord_mu_valley=None, train_type='lora', local_repo_path=None, galore_config=None, padding_side='right', padding_free=False, task_type='causal_lm')" +} \ No newline at end of file diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/optimizer.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/optimizer.pt new file mode 100644 index 0000000000000000000000000000000000000000..3eb5cb40c49ec474cea3c21d63e66bb0cbb12b5b --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/optimizer.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e2d503219cd82195f00fd28a24411762e54ff020da75c5796c2fe195a27f8b26 +size 163345037 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/rng_state.pth b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/rng_state.pth new file mode 100644 index 0000000000000000000000000000000000000000..23c879a01fb164141cb43819630f7fb62c611942 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/rng_state.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:56322b555410f1333db3cf72a1e22413bc95e49a0869de024b9d488073dd59a5 +size 14645 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/scheduler.pt b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/scheduler.pt new file mode 100644 index 0000000000000000000000000000000000000000..97105bf87900135742af628a7e5db50bd3795945 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/scheduler.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f5a7f4c6eb1111e746e739946ef6374db762160f3f3c324acfed41a1c49f025f +size 1465 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/trainer_state.json b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..bec89da10730a9bef33bf17b156226c2df218b52 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/trainer_state.json @@ -0,0 +1,789 @@ +{ + "best_global_step": 900, + "best_metric": 0.134187, + "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900", + "epoch": 0.5333333333333333, + "eval_steps": 300, + "global_step": 900, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0005925925925925926, + "grad_norm": 1.32502019405365, + "learning_rate": 1.183431952662722e-07, + "loss": 0.38409245014190674, + "step": 1, + "token_acc": 0.9151943462897526 + }, + { + "epoch": 0.005925925925925926, + "grad_norm": 1.348962426185608, + "learning_rate": 1.183431952662722e-06, + "loss": 0.4804305500454373, + "step": 10, + "token_acc": 0.8925214548426645 + }, + { + "epoch": 0.011851851851851851, + "grad_norm": 1.474541187286377, + "learning_rate": 2.366863905325444e-06, + "loss": 0.4860693454742432, + "step": 20, + "token_acc": 0.8906647293861242 + }, + { + "epoch": 0.017777777777777778, + "grad_norm": 1.5195010900497437, + "learning_rate": 3.550295857988166e-06, + "loss": 0.4820727348327637, + "step": 30, + "token_acc": 0.8872207982424021 + }, + { + "epoch": 0.023703703703703703, + "grad_norm": 1.5887762308120728, + "learning_rate": 4.733727810650888e-06, + "loss": 0.4436625957489014, + "step": 40, + "token_acc": 0.8992023205221175 + }, + { + "epoch": 0.02962962962962963, + "grad_norm": 1.7676503658294678, + "learning_rate": 5.91715976331361e-06, + "loss": 0.473007869720459, + "step": 50, + "token_acc": 0.8852583586626139 + }, + { + "epoch": 0.035555555555555556, + "grad_norm": 2.005035161972046, + "learning_rate": 7.100591715976332e-06, + "loss": 0.4192169666290283, + "step": 60, + "token_acc": 0.8907309721175584 + }, + { + "epoch": 0.04148148148148148, + "grad_norm": 1.361005187034607, + "learning_rate": 8.284023668639054e-06, + "loss": 0.3096126079559326, + "step": 70, + "token_acc": 0.91939457937346 + }, + { + "epoch": 0.047407407407407405, + "grad_norm": 1.3007423877716064, + "learning_rate": 9.467455621301776e-06, + "loss": 0.28482446670532224, + "step": 80, + "token_acc": 0.9255202628696605 + }, + { + "epoch": 0.05333333333333334, + "grad_norm": 0.7848371863365173, + "learning_rate": 1.0650887573964498e-05, + "loss": 0.24792802333831787, + "step": 90, + "token_acc": 0.9363215937388829 + }, + { + "epoch": 0.05925925925925926, + "grad_norm": 0.5432378649711609, + "learning_rate": 1.183431952662722e-05, + "loss": 0.21306073665618896, + "step": 100, + "token_acc": 0.9468995010691376 + }, + { + "epoch": 0.06518518518518518, + "grad_norm": 0.64493727684021, + "learning_rate": 1.3017751479289941e-05, + "loss": 0.20164842605590821, + "step": 110, + "token_acc": 0.9505376344086022 + }, + { + "epoch": 0.07111111111111111, + "grad_norm": 0.9089162349700928, + "learning_rate": 1.4201183431952663e-05, + "loss": 0.22527461051940917, + "step": 120, + "token_acc": 0.9423220973782771 + }, + { + "epoch": 0.07703703703703704, + "grad_norm": 0.9455512762069702, + "learning_rate": 1.5384615384615387e-05, + "loss": 0.1824732780456543, + "step": 130, + "token_acc": 0.9536231884057971 + }, + { + "epoch": 0.08296296296296296, + "grad_norm": 0.6021348237991333, + "learning_rate": 1.6568047337278108e-05, + "loss": 0.18543678522109985, + "step": 140, + "token_acc": 0.9523099850968704 + }, + { + "epoch": 0.08888888888888889, + "grad_norm": 0.8500062227249146, + "learning_rate": 1.7751479289940828e-05, + "loss": 0.18889259099960326, + "step": 150, + "token_acc": 0.9432362698120162 + }, + { + "epoch": 0.09481481481481481, + "grad_norm": 1.0183658599853516, + "learning_rate": 1.8934911242603552e-05, + "loss": 0.1937463402748108, + "step": 160, + "token_acc": 0.9425625920471281 + }, + { + "epoch": 0.10074074074074074, + "grad_norm": 0.5574401021003723, + "learning_rate": 1.9999978612794268e-05, + "loss": 0.16474100351333618, + "step": 170, + "token_acc": 0.9523260284505959 + }, + { + "epoch": 0.10666666666666667, + "grad_norm": 0.7811685800552368, + "learning_rate": 1.9997412258797892e-05, + "loss": 0.14637688398361207, + "step": 180, + "token_acc": 0.9594446474241871 + }, + { + "epoch": 0.11259259259259259, + "grad_norm": 0.671356737613678, + "learning_rate": 1.9990569721450324e-05, + "loss": 0.12380313873291016, + "step": 190, + "token_acc": 0.9659009332376166 + }, + { + "epoch": 0.11851851851851852, + "grad_norm": 0.7796847224235535, + "learning_rate": 1.9979453927503366e-05, + "loss": 0.2040093183517456, + "step": 200, + "token_acc": 0.9489942528735632 + }, + { + "epoch": 0.12444444444444444, + "grad_norm": 1.0088781118392944, + "learning_rate": 1.9964069631504664e-05, + "loss": 0.1916598677635193, + "step": 210, + "token_acc": 0.9477272727272728 + }, + { + "epoch": 0.13037037037037036, + "grad_norm": 1.3728845119476318, + "learning_rate": 1.994442341376408e-05, + "loss": 0.13621771335601807, + "step": 220, + "token_acc": 0.9564245810055866 + }, + { + "epoch": 0.1362962962962963, + "grad_norm": 0.8439155220985413, + "learning_rate": 1.9920523677539076e-05, + "loss": 0.1574079394340515, + "step": 230, + "token_acc": 0.9541870071348104 + }, + { + "epoch": 0.14222222222222222, + "grad_norm": 1.2579078674316406, + "learning_rate": 1.9892380645440422e-05, + "loss": 0.13396313190460205, + "step": 240, + "token_acc": 0.9584548104956269 + }, + { + "epoch": 0.14814814814814814, + "grad_norm": 0.9577816724777222, + "learning_rate": 1.9860006355059656e-05, + "loss": 0.14859610795974731, + "step": 250, + "token_acc": 0.9541044776119403 + }, + { + "epoch": 0.15407407407407409, + "grad_norm": 1.2375385761260986, + "learning_rate": 1.982341465382029e-05, + "loss": 0.1562924861907959, + "step": 260, + "token_acc": 0.9559248554913294 + }, + { + "epoch": 0.16, + "grad_norm": 1.2553672790527344, + "learning_rate": 1.978262119305485e-05, + "loss": 0.12399486303329468, + "step": 270, + "token_acc": 0.9662838088180807 + }, + { + "epoch": 0.16592592592592592, + "grad_norm": 1.176658272743225, + "learning_rate": 1.9737643421310346e-05, + "loss": 0.14870967864990234, + "step": 280, + "token_acc": 0.9565873914684787 + }, + { + "epoch": 0.17185185185185184, + "grad_norm": 1.807876706123352, + "learning_rate": 1.9688500576885012e-05, + "loss": 0.11581240892410279, + "step": 290, + "token_acc": 0.9647544056992876 + }, + { + "epoch": 0.17777777777777778, + "grad_norm": 1.1867674589157104, + "learning_rate": 1.9635213679599562e-05, + "loss": 0.1393712043762207, + "step": 300, + "token_acc": 0.9596832253419726 + }, + { + "epoch": 0.17777777777777778, + "eval_loss": 0.1630009412765503, + "eval_runtime": 239.7168, + "eval_samples_per_second": 6.257, + "eval_steps_per_second": 6.257, + "eval_token_acc": 0.9527580557072638, + "step": 300 + }, + { + "epoch": 0.1837037037037037, + "grad_norm": 1.2620875835418701, + "learning_rate": 1.9577805521806358e-05, + "loss": 0.1300894260406494, + "step": 310, + "token_acc": 0.960536398467433 + }, + { + "epoch": 0.18962962962962962, + "grad_norm": 1.1361067295074463, + "learning_rate": 1.95163006586405e-05, + "loss": 0.16317719221115112, + "step": 320, + "token_acc": 0.9544095665171899 + }, + { + "epoch": 0.19555555555555557, + "grad_norm": 0.8173150420188904, + "learning_rate": 1.945072539751685e-05, + "loss": 0.17428743839263916, + "step": 330, + "token_acc": 0.94750656167979 + }, + { + "epoch": 0.20148148148148148, + "grad_norm": 0.8849798440933228, + "learning_rate": 1.93811077868776e-05, + "loss": 0.12995322942733764, + "step": 340, + "token_acc": 0.9658246656760773 + }, + { + "epoch": 0.2074074074074074, + "grad_norm": 0.6326722502708435, + "learning_rate": 1.9307477604195162e-05, + "loss": 0.1278319001197815, + "step": 350, + "token_acc": 0.9639468690702088 + }, + { + "epoch": 0.21333333333333335, + "grad_norm": 1.1027580499649048, + "learning_rate": 1.9229866343235427e-05, + "loss": 0.12902997732162474, + "step": 360, + "token_acc": 0.9652777777777778 + }, + { + "epoch": 0.21925925925925926, + "grad_norm": 0.7148353457450867, + "learning_rate": 1.914830720058701e-05, + "loss": 0.14380792379379273, + "step": 370, + "token_acc": 0.9572490706319703 + }, + { + "epoch": 0.22518518518518518, + "grad_norm": 1.1909170150756836, + "learning_rate": 1.9062835061462105e-05, + "loss": 0.15708266496658324, + "step": 380, + "token_acc": 0.9598788796366389 + }, + { + "epoch": 0.2311111111111111, + "grad_norm": 0.7275416254997253, + "learning_rate": 1.8973486484775037e-05, + "loss": 0.15604959726333617, + "step": 390, + "token_acc": 0.9558498896247241 + }, + { + "epoch": 0.23703703703703705, + "grad_norm": 0.9419987201690674, + "learning_rate": 1.888029968750498e-05, + "loss": 0.1431185483932495, + "step": 400, + "token_acc": 0.9590773809523809 + }, + { + "epoch": 0.24296296296296296, + "grad_norm": 0.6928850412368774, + "learning_rate": 1.878331452834944e-05, + "loss": 0.15362846851348877, + "step": 410, + "token_acc": 0.9517941283073578 + }, + { + "epoch": 0.24888888888888888, + "grad_norm": 0.6290676593780518, + "learning_rate": 1.8682572490675524e-05, + "loss": 0.12896524667739867, + "step": 420, + "token_acc": 0.9619504987070557 + }, + { + "epoch": 0.2548148148148148, + "grad_norm": 0.7995588779449463, + "learning_rate": 1.8578116664776314e-05, + "loss": 0.14157743453979493, + "step": 430, + "token_acc": 0.9562071591774562 + }, + { + "epoch": 0.2607407407407407, + "grad_norm": 0.780008852481842, + "learning_rate": 1.8469991729439888e-05, + "loss": 0.16496583223342895, + "step": 440, + "token_acc": 0.9543109801031687 + }, + { + "epoch": 0.26666666666666666, + "grad_norm": 0.8067275881767273, + "learning_rate": 1.8358243932838914e-05, + "loss": 0.14944461584091187, + "step": 450, + "token_acc": 0.9509394572025052 + }, + { + "epoch": 0.2725925925925926, + "grad_norm": 0.8212175369262695, + "learning_rate": 1.8242921072748948e-05, + "loss": 0.12261044979095459, + "step": 460, + "token_acc": 0.9617764834364761 + }, + { + "epoch": 0.2785185185185185, + "grad_norm": 0.688872754573822, + "learning_rate": 1.8124072476103957e-05, + "loss": 0.12651515007019043, + "step": 470, + "token_acc": 0.9594694178334562 + }, + { + "epoch": 0.28444444444444444, + "grad_norm": 1.0954047441482544, + "learning_rate": 1.8001748977897754e-05, + "loss": 0.11215313673019409, + "step": 480, + "token_acc": 0.9634851771511207 + }, + { + "epoch": 0.2903703703703704, + "grad_norm": 0.8077743649482727, + "learning_rate": 1.787600289944039e-05, + "loss": 0.1215265154838562, + "step": 490, + "token_acc": 0.9642989959092599 + }, + { + "epoch": 0.2962962962962963, + "grad_norm": 0.9279748797416687, + "learning_rate": 1.7746888025978807e-05, + "loss": 0.11017097234725952, + "step": 500, + "token_acc": 0.9696060037523452 + }, + { + "epoch": 0.3022222222222222, + "grad_norm": 1.2479947805404663, + "learning_rate": 1.7614459583691346e-05, + "loss": 0.1296389102935791, + "step": 510, + "token_acc": 0.9566453447050463 + }, + { + "epoch": 0.30814814814814817, + "grad_norm": 1.1002650260925293, + "learning_rate": 1.7478774216065882e-05, + "loss": 0.13492013216018678, + "step": 520, + "token_acc": 0.9590994371482177 + }, + { + "epoch": 0.31407407407407406, + "grad_norm": 1.108170747756958, + "learning_rate": 1.733988995967179e-05, + "loss": 0.14083080291748046, + "step": 530, + "token_acc": 0.9592061742006616 + }, + { + "epoch": 0.32, + "grad_norm": 0.8783969879150391, + "learning_rate": 1.719786621933599e-05, + "loss": 0.12698700428009033, + "step": 540, + "token_acc": 0.9617927994121969 + }, + { + "epoch": 0.32592592592592595, + "grad_norm": 0.6896427273750305, + "learning_rate": 1.70527637427338e-05, + "loss": 0.11144465208053589, + "step": 550, + "token_acc": 0.9692820133234641 + }, + { + "epoch": 0.33185185185185184, + "grad_norm": 1.067499041557312, + "learning_rate": 1.690464459440538e-05, + "loss": 0.13314462900161744, + "step": 560, + "token_acc": 0.9597096188747731 + }, + { + "epoch": 0.3377777777777778, + "grad_norm": 0.6953498721122742, + "learning_rate": 1.6753572129208935e-05, + "loss": 0.11334860324859619, + "step": 570, + "token_acc": 0.9676190476190476 + }, + { + "epoch": 0.3437037037037037, + "grad_norm": 1.197219967842102, + "learning_rate": 1.6599610965222002e-05, + "loss": 0.1281804084777832, + "step": 580, + "token_acc": 0.9607272727272728 + }, + { + "epoch": 0.3496296296296296, + "grad_norm": 0.6708402633666992, + "learning_rate": 1.6442826956102424e-05, + "loss": 0.12322006225585938, + "step": 590, + "token_acc": 0.9628704034273474 + }, + { + "epoch": 0.35555555555555557, + "grad_norm": 1.0634019374847412, + "learning_rate": 1.628328716292082e-05, + "loss": 0.13818006515502929, + "step": 600, + "token_acc": 0.9580494801003944 + }, + { + "epoch": 0.35555555555555557, + "eval_loss": 0.14249637722969055, + "eval_runtime": 229.7535, + "eval_samples_per_second": 6.529, + "eval_steps_per_second": 6.529, + "eval_token_acc": 0.9576734025122884, + "step": 600 + }, + { + "epoch": 0.36148148148148146, + "grad_norm": 0.7200868129730225, + "learning_rate": 1.612105982547663e-05, + "loss": 0.13777921199798585, + "step": 610, + "token_acc": 0.9565537555228277 + }, + { + "epoch": 0.3674074074074074, + "grad_norm": 1.610889196395874, + "learning_rate": 1.595621433310997e-05, + "loss": 0.12660154104232788, + "step": 620, + "token_acc": 0.9658464928387808 + }, + { + "epoch": 0.37333333333333335, + "grad_norm": 1.7054650783538818, + "learning_rate": 1.5788821195021792e-05, + "loss": 0.13561646938323973, + "step": 630, + "token_acc": 0.9558277654046028 + }, + { + "epoch": 0.37925925925925924, + "grad_norm": 1.4907517433166504, + "learning_rate": 1.5618952010115057e-05, + "loss": 0.12502728700637816, + "step": 640, + "token_acc": 0.9623144271031595 + }, + { + "epoch": 0.3851851851851852, + "grad_norm": 1.1567004919052124, + "learning_rate": 1.544667943636981e-05, + "loss": 0.1149907112121582, + "step": 650, + "token_acc": 0.9643255295429208 + }, + { + "epoch": 0.39111111111111113, + "grad_norm": 1.0321091413497925, + "learning_rate": 1.527207715976525e-05, + "loss": 0.14286714792251587, + "step": 660, + "token_acc": 0.9604221635883905 + }, + { + "epoch": 0.397037037037037, + "grad_norm": 1.4016674757003784, + "learning_rate": 1.5095219862762091e-05, + "loss": 0.13563259840011596, + "step": 670, + "token_acc": 0.9618029029793735 + }, + { + "epoch": 0.40296296296296297, + "grad_norm": 1.089959979057312, + "learning_rate": 1.4916183192358717e-05, + "loss": 0.1207580804824829, + "step": 680, + "token_acc": 0.9630141721396475 + }, + { + "epoch": 0.4088888888888889, + "grad_norm": 1.045990228652954, + "learning_rate": 1.4735043727734762e-05, + "loss": 0.11743853092193604, + "step": 690, + "token_acc": 0.9632217727105553 + }, + { + "epoch": 0.4148148148148148, + "grad_norm": 1.4252482652664185, + "learning_rate": 1.455187894749597e-05, + "loss": 0.0928974449634552, + "step": 700, + "token_acc": 0.9683257918552036 + }, + { + "epoch": 0.42074074074074075, + "grad_norm": 1.1641786098480225, + "learning_rate": 1.436676719653435e-05, + "loss": 0.12940033674240112, + "step": 710, + "token_acc": 0.9638252148997135 + }, + { + "epoch": 0.4266666666666667, + "grad_norm": 0.7832347750663757, + "learning_rate": 1.4179787652517791e-05, + "loss": 0.12433557510375977, + "step": 720, + "token_acc": 0.9617952522255193 + }, + { + "epoch": 0.4325925925925926, + "grad_norm": 1.1413239240646362, + "learning_rate": 1.3991020292023474e-05, + "loss": 0.09806026816368103, + "step": 730, + "token_acc": 0.9669064748201439 + }, + { + "epoch": 0.43851851851851853, + "grad_norm": 0.8681485056877136, + "learning_rate": 1.3800545856329572e-05, + "loss": 0.14417175054550171, + "step": 740, + "token_acc": 0.9569114098586694 + }, + { + "epoch": 0.4444444444444444, + "grad_norm": 0.9045178294181824, + "learning_rate": 1.3608445816879865e-05, + "loss": 0.10493698120117187, + "step": 750, + "token_acc": 0.9662880175888604 + }, + { + "epoch": 0.45037037037037037, + "grad_norm": 1.1523085832595825, + "learning_rate": 1.3414802340436022e-05, + "loss": 0.12941417694091797, + "step": 760, + "token_acc": 0.9683060109289617 + }, + { + "epoch": 0.4562962962962963, + "grad_norm": 0.9145503640174866, + "learning_rate": 1.3219698253932518e-05, + "loss": 0.12189668416976929, + "step": 770, + "token_acc": 0.9584711503123852 + }, + { + "epoch": 0.4622222222222222, + "grad_norm": 1.0088993310928345, + "learning_rate": 1.3023217009049133e-05, + "loss": 0.10943882465362549, + "step": 780, + "token_acc": 0.9680624556422995 + }, + { + "epoch": 0.46814814814814815, + "grad_norm": 1.376142978668213, + "learning_rate": 1.2825442646516253e-05, + "loss": 0.10388659238815308, + "step": 790, + "token_acc": 0.9674435812060673 + }, + { + "epoch": 0.4740740740740741, + "grad_norm": 1.3877886533737183, + "learning_rate": 1.262645976016821e-05, + "loss": 0.1380447506904602, + "step": 800, + "token_acc": 0.9608202123764189 + }, + { + "epoch": 0.48, + "grad_norm": 0.8192164301872253, + "learning_rate": 1.2426353460760036e-05, + "loss": 0.11965352296829224, + "step": 810, + "token_acc": 0.9655172413793104 + }, + { + "epoch": 0.48592592592592593, + "grad_norm": 0.8384001851081848, + "learning_rate": 1.2225209339563144e-05, + "loss": 0.09073964357376099, + "step": 820, + "token_acc": 0.9659477866061293 + }, + { + "epoch": 0.4918518518518519, + "grad_norm": 1.1015766859054565, + "learning_rate": 1.2023113431755435e-05, + "loss": 0.10787882804870605, + "step": 830, + "token_acc": 0.9649122807017544 + }, + { + "epoch": 0.49777777777777776, + "grad_norm": 1.042965292930603, + "learning_rate": 1.1820152179621564e-05, + "loss": 0.13076914548873902, + "step": 840, + "token_acc": 0.960755275823769 + }, + { + "epoch": 0.5037037037037037, + "grad_norm": 0.8400379419326782, + "learning_rate": 1.161641239557907e-05, + "loss": 0.13471759557724, + "step": 850, + "token_acc": 0.9608513873052071 + }, + { + "epoch": 0.5096296296296297, + "grad_norm": 1.0256035327911377, + "learning_rate": 1.141198122504618e-05, + "loss": 0.11886721849441528, + "step": 860, + "token_acc": 0.9659887798036466 + }, + { + "epoch": 0.5155555555555555, + "grad_norm": 1.1291937828063965, + "learning_rate": 1.1206946109167189e-05, + "loss": 0.13678861856460572, + "step": 870, + "token_acc": 0.961859789320741 + }, + { + "epoch": 0.5214814814814814, + "grad_norm": 1.4508821964263916, + "learning_rate": 1.1001394747411347e-05, + "loss": 0.13137236833572388, + "step": 880, + "token_acc": 0.9597744360902256 + }, + { + "epoch": 0.5274074074074074, + "grad_norm": 0.6653353571891785, + "learning_rate": 1.0795415060061242e-05, + "loss": 0.11796672344207763, + "step": 890, + "token_acc": 0.9627539503386005 + }, + { + "epoch": 0.5333333333333333, + "grad_norm": 0.7665302753448486, + "learning_rate": 1.0589095150606747e-05, + "loss": 0.14120289087295532, + "step": 900, + "token_acc": 0.9607002500893176 + }, + { + "epoch": 0.5333333333333333, + "eval_loss": 0.1341869980096817, + "eval_runtime": 228.3025, + "eval_samples_per_second": 6.57, + "eval_steps_per_second": 6.57, + "eval_token_acc": 0.9593898728251541, + "step": 900 + } + ], + "logging_steps": 10, + "max_steps": 1688, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 300, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 1.559270034570747e+17, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/training_args.bin b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/training_args.bin new file mode 100644 index 0000000000000000000000000000000000000000..72141f03b998b5ac85a68551a9005ebc66f80a25 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-900/training_args.bin @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:373517452fe5b4afd611e83a428a73a2e60bfea34aa4e86fa640ece3038da43d +size 7185 diff --git a/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/logging.jsonl b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/logging.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..75d64e0b95aa0faa9c4b14792d1258a2ebb74597 --- /dev/null +++ b/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/logging.jsonl @@ -0,0 +1,177 @@ +{"loss": 0.38409245, "grad_norm": 1.32502019, "learning_rate": 1.2e-07, "token_acc": 0.91519435, "epoch": 0.00059259, "global_step/max_steps": "1/1688", "percentage": "0.06%", "elapsed_time": "11s", "remaining_time": "5h 31m 14s", "memory(GiB)": 22.6, "train_speed(iter/s)": 0.084881} +{"loss": 0.48043055, "grad_norm": 1.34896243, "learning_rate": 1.18e-06, "token_acc": 0.89252145, "epoch": 0.00592593, "global_step/max_steps": "10/1688", "percentage": "0.59%", "elapsed_time": "1m 20s", "remaining_time": "3h 46m 0s", "memory(GiB)": 22.69, "train_speed(iter/s)": 0.123746} +{"loss": 0.48606935, "grad_norm": 1.47454119, "learning_rate": 2.37e-06, "token_acc": 0.89066473, "epoch": 0.01185185, "global_step/max_steps": "20/1688", "percentage": "1.18%", "elapsed_time": "2m 34s", "remaining_time": "3h 34m 21s", "memory(GiB)": 22.69, "train_speed(iter/s)": 0.129692} +{"loss": 0.48207273, "grad_norm": 1.51950109, "learning_rate": 3.55e-06, "token_acc": 0.8872208, "epoch": 0.01777778, "global_step/max_steps": "30/1688", "percentage": "1.78%", "elapsed_time": "3m 46s", "remaining_time": "3h 28m 53s", "memory(GiB)": 23.9, "train_speed(iter/s)": 0.132287} +{"loss": 0.4436626, "grad_norm": 1.58877623, "learning_rate": 4.73e-06, "token_acc": 0.89920232, "epoch": 0.0237037, "global_step/max_steps": "40/1688", "percentage": "2.37%", "elapsed_time": "4m 58s", "remaining_time": "3h 25m 11s", "memory(GiB)": 23.9, "train_speed(iter/s)": 0.133861} +{"loss": 0.47300787, "grad_norm": 1.76765037, "learning_rate": 5.92e-06, "token_acc": 0.88525836, "epoch": 0.02962963, "global_step/max_steps": "50/1688", "percentage": "2.96%", "elapsed_time": "6m 10s", "remaining_time": "3h 22m 27s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.134843} +{"loss": 0.41921697, "grad_norm": 2.00503516, "learning_rate": 7.1e-06, "token_acc": 0.89073097, "epoch": 0.03555556, "global_step/max_steps": "60/1688", "percentage": "3.55%", "elapsed_time": "7m 22s", "remaining_time": "3h 20m 4s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.135612} +{"loss": 0.30961261, "grad_norm": 1.36100519, "learning_rate": 8.28e-06, "token_acc": 0.91939458, "epoch": 0.04148148, "global_step/max_steps": "70/1688", "percentage": "4.15%", "elapsed_time": "8m 34s", "remaining_time": "3h 18m 7s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.136107} +{"loss": 0.28482447, "grad_norm": 1.30074239, "learning_rate": 9.47e-06, "token_acc": 0.92552026, "epoch": 0.04740741, "global_step/max_steps": "80/1688", "percentage": "4.74%", "elapsed_time": "9m 46s", "remaining_time": "3h 16m 36s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.136306} +{"loss": 0.24792802, "grad_norm": 0.78483719, "learning_rate": 1.065e-05, "token_acc": 0.93632159, "epoch": 0.05333333, "global_step/max_steps": "90/1688", "percentage": "5.33%", "elapsed_time": "10m 59s", "remaining_time": "3h 15m 10s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.136454} +{"loss": 0.21306074, "grad_norm": 0.54323786, "learning_rate": 1.183e-05, "token_acc": 0.9468995, "epoch": 0.05925926, "global_step/max_steps": "100/1688", "percentage": "5.92%", "elapsed_time": "12m 11s", "remaining_time": "3h 13m 42s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.136629} +{"loss": 0.20164843, "grad_norm": 0.64493728, "learning_rate": 1.302e-05, "token_acc": 0.95053763, "epoch": 0.06518519, "global_step/max_steps": "110/1688", "percentage": "6.52%", "elapsed_time": "13m 22s", "remaining_time": "3h 11m 57s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.137015} +{"loss": 0.22527461, "grad_norm": 0.90891623, "learning_rate": 1.42e-05, "token_acc": 0.9423221, "epoch": 0.07111111, "global_step/max_steps": "120/1688", "percentage": "7.11%", "elapsed_time": "14m 33s", "remaining_time": "3h 10m 13s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.137386} +{"loss": 0.18247328, "grad_norm": 0.94555128, "learning_rate": 1.538e-05, "token_acc": 0.95362319, "epoch": 0.07703704, "global_step/max_steps": "130/1688", "percentage": "7.70%", "elapsed_time": "15m 44s", "remaining_time": "3h 8m 42s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.137599} +{"loss": 0.18543679, "grad_norm": 0.60213482, "learning_rate": 1.657e-05, "token_acc": 0.95230999, "epoch": 0.08296296, "global_step/max_steps": "140/1688", "percentage": "8.29%", "elapsed_time": "16m 55s", "remaining_time": "3h 7m 6s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.137884} +{"loss": 0.18889259, "grad_norm": 0.85000622, "learning_rate": 1.775e-05, "token_acc": 0.94323627, "epoch": 0.08888889, "global_step/max_steps": "150/1688", "percentage": "8.89%", "elapsed_time": "18m 5s", "remaining_time": "3h 5m 29s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.138194} +{"loss": 0.19374634, "grad_norm": 1.01836586, "learning_rate": 1.893e-05, "token_acc": 0.94256259, "epoch": 0.09481481, "global_step/max_steps": "160/1688", "percentage": "9.48%", "elapsed_time": "19m 15s", "remaining_time": "3h 3m 50s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.138524} +{"loss": 0.164741, "grad_norm": 0.5574401, "learning_rate": 2e-05, "token_acc": 0.95232603, "epoch": 0.10074074, "global_step/max_steps": "170/1688", "percentage": "10.07%", "elapsed_time": "20m 24s", "remaining_time": "3h 2m 13s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.138837} +{"loss": 0.14637688, "grad_norm": 0.78116858, "learning_rate": 2e-05, "token_acc": 0.95944465, "epoch": 0.10666667, "global_step/max_steps": "180/1688", "percentage": "10.66%", "elapsed_time": "21m 35s", "remaining_time": "3h 0m 51s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.138966} +{"loss": 0.12380314, "grad_norm": 0.67135674, "learning_rate": 1.999e-05, "token_acc": 0.96590093, "epoch": 0.11259259, "global_step/max_steps": "190/1688", "percentage": "11.26%", "elapsed_time": "22m 45s", "remaining_time": "2h 59m 29s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139093} +{"loss": 0.20400932, "grad_norm": 0.77968472, "learning_rate": 1.998e-05, "token_acc": 0.94899425, "epoch": 0.11851852, "global_step/max_steps": "200/1688", "percentage": "11.85%", "elapsed_time": "23m 56s", "remaining_time": "2h 58m 8s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139221} +{"loss": 0.19165987, "grad_norm": 1.00887811, "learning_rate": 1.996e-05, "token_acc": 0.94772727, "epoch": 0.12444444, "global_step/max_steps": "210/1688", "percentage": "12.44%", "elapsed_time": "25m 6s", "remaining_time": "2h 56m 45s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139359} +{"loss": 0.13621771, "grad_norm": 1.37288451, "learning_rate": 1.994e-05, "token_acc": 0.95642458, "epoch": 0.13037037, "global_step/max_steps": "220/1688", "percentage": "13.03%", "elapsed_time": "26m 17s", "remaining_time": "2h 55m 23s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139492} +{"loss": 0.15740794, "grad_norm": 0.84391552, "learning_rate": 1.992e-05, "token_acc": 0.95418701, "epoch": 0.1362963, "global_step/max_steps": "230/1688", "percentage": "13.63%", "elapsed_time": "27m 27s", "remaining_time": "2h 54m 5s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139587} +{"loss": 0.13396313, "grad_norm": 1.25790787, "learning_rate": 1.989e-05, "token_acc": 0.95845481, "epoch": 0.14222222, "global_step/max_steps": "240/1688", "percentage": "14.22%", "elapsed_time": "28m 38s", "remaining_time": "2h 52m 45s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.13969} +{"loss": 0.14859611, "grad_norm": 0.95778167, "learning_rate": 1.986e-05, "token_acc": 0.95410448, "epoch": 0.14814815, "global_step/max_steps": "250/1688", "percentage": "14.81%", "elapsed_time": "29m 48s", "remaining_time": "2h 51m 29s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139751} +{"loss": 0.15629249, "grad_norm": 1.23753858, "learning_rate": 1.982e-05, "token_acc": 0.95592486, "epoch": 0.15407407, "global_step/max_steps": "260/1688", "percentage": "15.40%", "elapsed_time": "30m 59s", "remaining_time": "2h 50m 13s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139815} +{"loss": 0.12399486, "grad_norm": 1.25536728, "learning_rate": 1.978e-05, "token_acc": 0.96628381, "epoch": 0.16, "global_step/max_steps": "270/1688", "percentage": "16.00%", "elapsed_time": "32m 10s", "remaining_time": "2h 48m 57s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.139882} +{"loss": 0.14870968, "grad_norm": 1.17665827, "learning_rate": 1.974e-05, "token_acc": 0.95658739, "epoch": 0.16592593, "global_step/max_steps": "280/1688", "percentage": "16.59%", "elapsed_time": "33m 20s", "remaining_time": "2h 47m 40s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.13996} +{"loss": 0.11581241, "grad_norm": 1.80787671, "learning_rate": 1.969e-05, "token_acc": 0.96475441, "epoch": 0.17185185, "global_step/max_steps": "290/1688", "percentage": "17.18%", "elapsed_time": "34m 31s", "remaining_time": "2h 46m 23s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.140028} +{"loss": 0.1393712, "grad_norm": 1.18676746, "learning_rate": 1.964e-05, "token_acc": 0.95968323, "epoch": 0.17777778, "global_step/max_steps": "300/1688", "percentage": "17.77%", "elapsed_time": "35m 42s", "remaining_time": "2h 45m 11s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.140033} +{"eval_loss": 0.16300094, "eval_runtime": 239.7168, "eval_samples_per_second": 6.257, "eval_steps_per_second": 6.257, "eval_token_acc": 0.95275806, "epoch": 0.17777778, "global_step/max_steps": "300/1688", "percentage": "17.77%", "elapsed_time": "39m 42s", "remaining_time": "3h 3m 41s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.125941} +{"loss": 0.13008943, "grad_norm": 1.26208758, "learning_rate": 1.958e-05, "token_acc": 0.9605364, "epoch": 0.1837037, "global_step/max_steps": "310/1688", "percentage": "18.36%", "elapsed_time": "40m 53s", "remaining_time": "3h 1m 47s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.126334} +{"loss": 0.16317719, "grad_norm": 1.13610673, "learning_rate": 1.952e-05, "token_acc": 0.95440957, "epoch": 0.18962963, "global_step/max_steps": "320/1688", "percentage": "18.96%", "elapsed_time": "42m 4s", "remaining_time": "2h 59m 52s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.12676} +{"loss": 0.17428744, "grad_norm": 0.81731504, "learning_rate": 1.945e-05, "token_acc": 0.94750656, "epoch": 0.19555556, "global_step/max_steps": "330/1688", "percentage": "19.55%", "elapsed_time": "43m 15s", "remaining_time": "2h 57m 59s", "memory(GiB)": 24.71, "train_speed(iter/s)": 0.127161} +{"loss": 0.12995323, "grad_norm": 0.88497984, "learning_rate": 1.938e-05, "token_acc": 0.96582467, "epoch": 0.20148148, "global_step/max_steps": "340/1688", "percentage": "20.14%", "elapsed_time": "44m 25s", "remaining_time": "2h 56m 8s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127548} +{"loss": 0.1278319, "grad_norm": 0.63267225, "learning_rate": 1.931e-05, "token_acc": 0.96394687, "epoch": 0.20740741, "global_step/max_steps": "350/1688", "percentage": "20.73%", "elapsed_time": "45m 36s", "remaining_time": "2h 54m 21s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127902} +{"loss": 0.12902998, "grad_norm": 1.10275805, "learning_rate": 1.923e-05, "token_acc": 0.96527778, "epoch": 0.21333333, "global_step/max_steps": "360/1688", "percentage": "21.33%", "elapsed_time": "46m 47s", "remaining_time": "2h 52m 35s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128238} +{"loss": 0.14380792, "grad_norm": 0.71483535, "learning_rate": 1.915e-05, "token_acc": 0.95724907, "epoch": 0.21925926, "global_step/max_steps": "370/1688", "percentage": "21.92%", "elapsed_time": "47m 58s", "remaining_time": "2h 50m 52s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128559} +{"loss": 0.15708266, "grad_norm": 1.19091702, "learning_rate": 1.906e-05, "token_acc": 0.95987888, "epoch": 0.22518519, "global_step/max_steps": "380/1688", "percentage": "22.51%", "elapsed_time": "49m 8s", "remaining_time": "2h 49m 9s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128877} +{"loss": 0.1560496, "grad_norm": 0.72754163, "learning_rate": 1.897e-05, "token_acc": 0.95584989, "epoch": 0.23111111, "global_step/max_steps": "390/1688", "percentage": "23.10%", "elapsed_time": "50m 19s", "remaining_time": "2h 47m 28s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.12917} +{"loss": 0.14311855, "grad_norm": 0.94199872, "learning_rate": 1.888e-05, "token_acc": 0.95907738, "epoch": 0.23703704, "global_step/max_steps": "400/1688", "percentage": "23.70%", "elapsed_time": "51m 29s", "remaining_time": "2h 45m 49s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.12946} +{"loss": 0.15362847, "grad_norm": 0.69288504, "learning_rate": 1.878e-05, "token_acc": 0.95179413, "epoch": 0.24296296, "global_step/max_steps": "410/1688", "percentage": "24.29%", "elapsed_time": "52m 40s", "remaining_time": "2h 44m 10s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129742} +{"loss": 0.12896525, "grad_norm": 0.62906766, "learning_rate": 1.868e-05, "token_acc": 0.9619505, "epoch": 0.24888889, "global_step/max_steps": "420/1688", "percentage": "24.88%", "elapsed_time": "53m 50s", "remaining_time": "2h 42m 33s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130009} +{"loss": 0.14157743, "grad_norm": 0.79955888, "learning_rate": 1.858e-05, "token_acc": 0.95620716, "epoch": 0.25481481, "global_step/max_steps": "430/1688", "percentage": "25.47%", "elapsed_time": "55m 1s", "remaining_time": "2h 40m 58s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130245} +{"loss": 0.16496583, "grad_norm": 0.78000885, "learning_rate": 1.847e-05, "token_acc": 0.95431098, "epoch": 0.26074074, "global_step/max_steps": "440/1688", "percentage": "26.07%", "elapsed_time": "56m 12s", "remaining_time": "2h 39m 25s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130465} +{"loss": 0.14944462, "grad_norm": 0.80672759, "learning_rate": 1.836e-05, "token_acc": 0.95093946, "epoch": 0.26666667, "global_step/max_steps": "450/1688", "percentage": "26.66%", "elapsed_time": "57m 23s", "remaining_time": "2h 37m 53s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130684} +{"loss": 0.12261045, "grad_norm": 0.82121754, "learning_rate": 1.824e-05, "token_acc": 0.96177648, "epoch": 0.27259259, "global_step/max_steps": "460/1688", "percentage": "27.25%", "elapsed_time": "58m 33s", "remaining_time": "2h 36m 20s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130909} +{"loss": 0.12651515, "grad_norm": 0.68887275, "learning_rate": 1.812e-05, "token_acc": 0.95946942, "epoch": 0.27851852, "global_step/max_steps": "470/1688", "percentage": "27.84%", "elapsed_time": "59m 44s", "remaining_time": "2h 34m 48s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131124} +{"loss": 0.11215314, "grad_norm": 1.09540474, "learning_rate": 1.8e-05, "token_acc": 0.96348518, "epoch": 0.28444444, "global_step/max_steps": "480/1688", "percentage": "28.44%", "elapsed_time": "1h 0m 54s", "remaining_time": "2h 33m 17s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131339} +{"loss": 0.12152652, "grad_norm": 0.80777436, "learning_rate": 1.788e-05, "token_acc": 0.964299, "epoch": 0.29037037, "global_step/max_steps": "490/1688", "percentage": "29.03%", "elapsed_time": "1h 2m 5s", "remaining_time": "2h 31m 48s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131523} +{"loss": 0.11017097, "grad_norm": 0.92797488, "learning_rate": 1.775e-05, "token_acc": 0.969606, "epoch": 0.2962963, "global_step/max_steps": "500/1688", "percentage": "29.62%", "elapsed_time": "1h 3m 15s", "remaining_time": "2h 30m 19s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131718} +{"loss": 0.12963891, "grad_norm": 1.24799478, "learning_rate": 1.761e-05, "token_acc": 0.95664534, "epoch": 0.30222222, "global_step/max_steps": "510/1688", "percentage": "30.21%", "elapsed_time": "1h 4m 26s", "remaining_time": "2h 28m 51s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131897} +{"loss": 0.13492013, "grad_norm": 1.10026503, "learning_rate": 1.748e-05, "token_acc": 0.95909944, "epoch": 0.30814815, "global_step/max_steps": "520/1688", "percentage": "30.81%", "elapsed_time": "1h 5m 37s", "remaining_time": "2h 27m 24s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132058} +{"loss": 0.1408308, "grad_norm": 1.10817075, "learning_rate": 1.734e-05, "token_acc": 0.95920617, "epoch": 0.31407407, "global_step/max_steps": "530/1688", "percentage": "31.40%", "elapsed_time": "1h 6m 48s", "remaining_time": "2h 25m 58s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.13222} +{"loss": 0.126987, "grad_norm": 0.87839699, "learning_rate": 1.72e-05, "token_acc": 0.9617928, "epoch": 0.32, "global_step/max_steps": "540/1688", "percentage": "31.99%", "elapsed_time": "1h 7m 59s", "remaining_time": "2h 24m 31s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132384} +{"loss": 0.11144465, "grad_norm": 0.68964273, "learning_rate": 1.705e-05, "token_acc": 0.96928201, "epoch": 0.32592593, "global_step/max_steps": "550/1688", "percentage": "32.58%", "elapsed_time": "1h 9m 9s", "remaining_time": "2h 23m 5s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132543} +{"loss": 0.13314463, "grad_norm": 1.06749904, "learning_rate": 1.69e-05, "token_acc": 0.95970962, "epoch": 0.33185185, "global_step/max_steps": "560/1688", "percentage": "33.18%", "elapsed_time": "1h 10m 20s", "remaining_time": "2h 21m 40s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132698} +{"loss": 0.1133486, "grad_norm": 0.69534987, "learning_rate": 1.675e-05, "token_acc": 0.96761905, "epoch": 0.33777778, "global_step/max_steps": "570/1688", "percentage": "33.77%", "elapsed_time": "1h 11m 31s", "remaining_time": "2h 20m 16s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132827} +{"loss": 0.12818041, "grad_norm": 1.19721997, "learning_rate": 1.66e-05, "token_acc": 0.96072727, "epoch": 0.3437037, "global_step/max_steps": "580/1688", "percentage": "34.36%", "elapsed_time": "1h 12m 42s", "remaining_time": "2h 18m 52s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.132966} +{"loss": 0.12322006, "grad_norm": 0.67084026, "learning_rate": 1.644e-05, "token_acc": 0.9628704, "epoch": 0.34962963, "global_step/max_steps": "590/1688", "percentage": "34.95%", "elapsed_time": "1h 13m 51s", "remaining_time": "2h 17m 27s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.133131} +{"loss": 0.13818007, "grad_norm": 1.06340194, "learning_rate": 1.628e-05, "token_acc": 0.95804948, "epoch": 0.35555556, "global_step/max_steps": "600/1688", "percentage": "35.55%", "elapsed_time": "1h 15m 2s", "remaining_time": "2h 16m 4s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.133258} +{"eval_loss": 0.14249638, "eval_runtime": 229.7535, "eval_samples_per_second": 6.529, "eval_steps_per_second": 6.529, "eval_token_acc": 0.9576734, "epoch": 0.35555556, "global_step/max_steps": "600/1688", "percentage": "35.55%", "elapsed_time": "1h 18m 52s", "remaining_time": "2h 23m 1s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.126788} +{"loss": 0.13777921, "grad_norm": 0.72008681, "learning_rate": 1.612e-05, "token_acc": 0.95655376, "epoch": 0.36148148, "global_step/max_steps": "610/1688", "percentage": "36.14%", "elapsed_time": "1h 20m 3s", "remaining_time": "2h 21m 29s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.126979} +{"loss": 0.12660154, "grad_norm": 1.6108892, "learning_rate": 1.596e-05, "token_acc": 0.96584649, "epoch": 0.36740741, "global_step/max_steps": "620/1688", "percentage": "36.73%", "elapsed_time": "1h 21m 14s", "remaining_time": "2h 19m 57s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127186} +{"loss": 0.13561647, "grad_norm": 1.70546508, "learning_rate": 1.579e-05, "token_acc": 0.95582777, "epoch": 0.37333333, "global_step/max_steps": "630/1688", "percentage": "37.32%", "elapsed_time": "1h 22m 25s", "remaining_time": "2h 18m 25s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127386} +{"loss": 0.12502729, "grad_norm": 1.49075174, "learning_rate": 1.562e-05, "token_acc": 0.96231443, "epoch": 0.37925926, "global_step/max_steps": "640/1688", "percentage": "37.91%", "elapsed_time": "1h 23m 36s", "remaining_time": "2h 16m 54s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127583} +{"loss": 0.11499071, "grad_norm": 1.15670049, "learning_rate": 1.545e-05, "token_acc": 0.96432553, "epoch": 0.38518519, "global_step/max_steps": "650/1688", "percentage": "38.51%", "elapsed_time": "1h 24m 47s", "remaining_time": "2h 15m 23s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127773} +{"loss": 0.14286715, "grad_norm": 1.03210914, "learning_rate": 1.527e-05, "token_acc": 0.96042216, "epoch": 0.39111111, "global_step/max_steps": "660/1688", "percentage": "39.10%", "elapsed_time": "1h 25m 57s", "remaining_time": "2h 13m 53s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.127971} +{"loss": 0.1356326, "grad_norm": 1.40166748, "learning_rate": 1.51e-05, "token_acc": 0.9618029, "epoch": 0.39703704, "global_step/max_steps": "670/1688", "percentage": "39.69%", "elapsed_time": "1h 27m 8s", "remaining_time": "2h 12m 23s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128151} +{"loss": 0.12075808, "grad_norm": 1.08995998, "learning_rate": 1.492e-05, "token_acc": 0.96301417, "epoch": 0.40296296, "global_step/max_steps": "680/1688", "percentage": "40.28%", "elapsed_time": "1h 28m 17s", "remaining_time": "2h 10m 52s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128367} +{"loss": 0.11743853, "grad_norm": 1.04599023, "learning_rate": 1.474e-05, "token_acc": 0.96322177, "epoch": 0.40888889, "global_step/max_steps": "690/1688", "percentage": "40.88%", "elapsed_time": "1h 29m 27s", "remaining_time": "2h 9m 23s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128547} +{"loss": 0.09289744, "grad_norm": 1.42524827, "learning_rate": 1.455e-05, "token_acc": 0.96832579, "epoch": 0.41481481, "global_step/max_steps": "700/1688", "percentage": "41.47%", "elapsed_time": "1h 30m 38s", "remaining_time": "2h 7m 56s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128704} +{"loss": 0.12940034, "grad_norm": 1.16417861, "learning_rate": 1.437e-05, "token_acc": 0.96382521, "epoch": 0.42074074, "global_step/max_steps": "710/1688", "percentage": "42.06%", "elapsed_time": "1h 31m 49s", "remaining_time": "2h 6m 29s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.128866} +{"loss": 0.12433558, "grad_norm": 0.78323478, "learning_rate": 1.418e-05, "token_acc": 0.96179525, "epoch": 0.42666667, "global_step/max_steps": "720/1688", "percentage": "42.65%", "elapsed_time": "1h 33m 0s", "remaining_time": "2h 5m 2s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129029} +{"loss": 0.09806027, "grad_norm": 1.14132392, "learning_rate": 1.399e-05, "token_acc": 0.96690647, "epoch": 0.43259259, "global_step/max_steps": "730/1688", "percentage": "43.25%", "elapsed_time": "1h 34m 11s", "remaining_time": "2h 3m 36s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129178} +{"loss": 0.14417175, "grad_norm": 0.86814851, "learning_rate": 1.38e-05, "token_acc": 0.95691141, "epoch": 0.43851852, "global_step/max_steps": "740/1688", "percentage": "43.84%", "elapsed_time": "1h 35m 21s", "remaining_time": "2h 2m 9s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129339} +{"loss": 0.10493698, "grad_norm": 0.90451783, "learning_rate": 1.361e-05, "token_acc": 0.96628802, "epoch": 0.44444444, "global_step/max_steps": "750/1688", "percentage": "44.43%", "elapsed_time": "1h 36m 31s", "remaining_time": "2h 0m 43s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129492} +{"loss": 0.12941418, "grad_norm": 1.15230858, "learning_rate": 1.341e-05, "token_acc": 0.96830601, "epoch": 0.45037037, "global_step/max_steps": "760/1688", "percentage": "45.02%", "elapsed_time": "1h 37m 42s", "remaining_time": "1h 59m 18s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129645} +{"loss": 0.12189668, "grad_norm": 0.91455036, "learning_rate": 1.322e-05, "token_acc": 0.95847115, "epoch": 0.4562963, "global_step/max_steps": "770/1688", "percentage": "45.62%", "elapsed_time": "1h 38m 52s", "remaining_time": "1h 57m 52s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129796} +{"loss": 0.10943882, "grad_norm": 1.00889933, "learning_rate": 1.302e-05, "token_acc": 0.96806246, "epoch": 0.46222222, "global_step/max_steps": "780/1688", "percentage": "46.21%", "elapsed_time": "1h 40m 2s", "remaining_time": "1h 56m 28s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.129935} +{"loss": 0.10388659, "grad_norm": 1.37614298, "learning_rate": 1.283e-05, "token_acc": 0.96744358, "epoch": 0.46814815, "global_step/max_steps": "790/1688", "percentage": "46.80%", "elapsed_time": "1h 41m 13s", "remaining_time": "1h 55m 3s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.13007} +{"loss": 0.13804475, "grad_norm": 1.38778865, "learning_rate": 1.263e-05, "token_acc": 0.96082021, "epoch": 0.47407407, "global_step/max_steps": "800/1688", "percentage": "47.39%", "elapsed_time": "1h 42m 24s", "remaining_time": "1h 53m 40s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130205} +{"loss": 0.11965352, "grad_norm": 0.81921643, "learning_rate": 1.243e-05, "token_acc": 0.96551724, "epoch": 0.48, "global_step/max_steps": "810/1688", "percentage": "47.99%", "elapsed_time": "1h 43m 34s", "remaining_time": "1h 52m 16s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.13034} +{"loss": 0.09073964, "grad_norm": 0.83840019, "learning_rate": 1.223e-05, "token_acc": 0.96594779, "epoch": 0.48592593, "global_step/max_steps": "820/1688", "percentage": "48.58%", "elapsed_time": "1h 44m 45s", "remaining_time": "1h 50m 53s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130462} +{"loss": 0.10787883, "grad_norm": 1.10157669, "learning_rate": 1.202e-05, "token_acc": 0.96491228, "epoch": 0.49185185, "global_step/max_steps": "830/1688", "percentage": "49.17%", "elapsed_time": "1h 45m 55s", "remaining_time": "1h 49m 30s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130591} +{"loss": 0.13076915, "grad_norm": 1.04296529, "learning_rate": 1.182e-05, "token_acc": 0.96075528, "epoch": 0.49777778, "global_step/max_steps": "840/1688", "percentage": "49.76%", "elapsed_time": "1h 47m 5s", "remaining_time": "1h 48m 7s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.13072} +{"loss": 0.1347176, "grad_norm": 0.84003794, "learning_rate": 1.162e-05, "token_acc": 0.96085139, "epoch": 0.5037037, "global_step/max_steps": "850/1688", "percentage": "50.36%", "elapsed_time": "1h 48m 16s", "remaining_time": "1h 46m 44s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130846} +{"loss": 0.11886722, "grad_norm": 1.02560353, "learning_rate": 1.141e-05, "token_acc": 0.96598878, "epoch": 0.50962963, "global_step/max_steps": "860/1688", "percentage": "50.95%", "elapsed_time": "1h 49m 26s", "remaining_time": "1h 45m 21s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.130975} +{"loss": 0.13678862, "grad_norm": 1.12919378, "learning_rate": 1.121e-05, "token_acc": 0.96185979, "epoch": 0.51555556, "global_step/max_steps": "870/1688", "percentage": "51.54%", "elapsed_time": "1h 50m 35s", "remaining_time": "1h 43m 58s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131117} +{"loss": 0.13137237, "grad_norm": 1.4508822, "learning_rate": 1.1e-05, "token_acc": 0.95977444, "epoch": 0.52148148, "global_step/max_steps": "880/1688", "percentage": "52.13%", "elapsed_time": "1h 51m 45s", "remaining_time": "1h 42m 36s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131238} +{"loss": 0.11796672, "grad_norm": 0.66533536, "learning_rate": 1.08e-05, "token_acc": 0.96275395, "epoch": 0.52740741, "global_step/max_steps": "890/1688", "percentage": "52.73%", "elapsed_time": "1h 52m 55s", "remaining_time": "1h 41m 15s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.13135} +{"loss": 0.14120289, "grad_norm": 0.76653028, "learning_rate": 1.059e-05, "token_acc": 0.96070025, "epoch": 0.53333333, "global_step/max_steps": "900/1688", "percentage": "53.32%", "elapsed_time": "1h 54m 6s", "remaining_time": "1h 39m 54s", "memory(GiB)": 24.94, "train_speed(iter/s)": 0.131459} +{"eval_loss": 0.134187, "eval_runtime": 228.3025, "eval_samples_per_second": 6.57, "eval_steps_per_second": 6.57, "eval_token_acc": 0.95938987, "epoch": 0.53333333, "global_step/max_steps": "900/1688", "percentage": "53.32%", "elapsed_time": "1h 57m 54s", "remaining_time": "1h 43m 14s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127216} +{"loss": 0.11883514, "grad_norm": 1.12795496, "learning_rate": 1.038e-05, "token_acc": 0.96477568, "epoch": 0.53925926, "global_step/max_steps": "910/1688", "percentage": "53.91%", "elapsed_time": "1h 59m 5s", "remaining_time": "1h 41m 49s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127347} +{"loss": 0.11933118, "grad_norm": 1.02148044, "learning_rate": 1.018e-05, "token_acc": 0.95991008, "epoch": 0.54518519, "global_step/max_steps": "920/1688", "percentage": "54.50%", "elapsed_time": "2h 0m 16s", "remaining_time": "1h 40m 23s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127493} +{"loss": 0.11430731, "grad_norm": 0.8586762, "learning_rate": 9.97e-06, "token_acc": 0.96546763, "epoch": 0.55111111, "global_step/max_steps": "930/1688", "percentage": "55.09%", "elapsed_time": "2h 1m 26s", "remaining_time": "1h 38m 58s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127639} +{"loss": 0.13973416, "grad_norm": 0.7968058, "learning_rate": 9.76e-06, "token_acc": 0.95735294, "epoch": 0.55703704, "global_step/max_steps": "940/1688", "percentage": "55.69%", "elapsed_time": "2h 2m 37s", "remaining_time": "1h 37m 34s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127758} +{"loss": 0.12812395, "grad_norm": 1.01187468, "learning_rate": 9.56e-06, "token_acc": 0.96142542, "epoch": 0.56296296, "global_step/max_steps": "950/1688", "percentage": "56.28%", "elapsed_time": "2h 3m 48s", "remaining_time": "1h 36m 10s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127889} +{"loss": 0.13791116, "grad_norm": 1.14321911, "learning_rate": 9.35e-06, "token_acc": 0.95612094, "epoch": 0.56888889, "global_step/max_steps": "960/1688", "percentage": "56.87%", "elapsed_time": "2h 4m 59s", "remaining_time": "1h 34m 46s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128014} +{"loss": 0.14111406, "grad_norm": 0.78028941, "learning_rate": 9.14e-06, "token_acc": 0.96070025, "epoch": 0.57481481, "global_step/max_steps": "970/1688", "percentage": "57.46%", "elapsed_time": "2h 6m 9s", "remaining_time": "1h 33m 23s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128139} +{"loss": 0.10649668, "grad_norm": 0.74178731, "learning_rate": 8.94e-06, "token_acc": 0.96729297, "epoch": 0.58074074, "global_step/max_steps": "980/1688", "percentage": "58.06%", "elapsed_time": "2h 7m 20s", "remaining_time": "1h 31m 59s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128268} +{"loss": 0.10067906, "grad_norm": 0.76425767, "learning_rate": 8.73e-06, "token_acc": 0.97004438, "epoch": 0.58666667, "global_step/max_steps": "990/1688", "percentage": "58.65%", "elapsed_time": "2h 8m 30s", "remaining_time": "1h 30m 36s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128389} +{"loss": 0.12069358, "grad_norm": 1.03626513, "learning_rate": 8.53e-06, "token_acc": 0.96077713, "epoch": 0.59259259, "global_step/max_steps": "1000/1688", "percentage": "59.24%", "elapsed_time": "2h 9m 41s", "remaining_time": "1h 29m 13s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128517} +{"loss": 0.1169974, "grad_norm": 0.77192891, "learning_rate": 8.32e-06, "token_acc": 0.9636768, "epoch": 0.59851852, "global_step/max_steps": "1010/1688", "percentage": "59.83%", "elapsed_time": "2h 10m 51s", "remaining_time": "1h 27m 50s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128636} +{"loss": 0.12428476, "grad_norm": 1.14344108, "learning_rate": 8.12e-06, "token_acc": 0.96125533, "epoch": 0.60444444, "global_step/max_steps": "1020/1688", "percentage": "60.43%", "elapsed_time": "2h 12m 1s", "remaining_time": "1h 26m 28s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128757} +{"loss": 0.11421615, "grad_norm": 0.75934625, "learning_rate": 7.92e-06, "token_acc": 0.96741056, "epoch": 0.61037037, "global_step/max_steps": "1030/1688", "percentage": "61.02%", "elapsed_time": "2h 13m 12s", "remaining_time": "1h 25m 5s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128874} +{"loss": 0.12711146, "grad_norm": 0.98981273, "learning_rate": 7.71e-06, "token_acc": 0.96259985, "epoch": 0.6162963, "global_step/max_steps": "1040/1688", "percentage": "61.61%", "elapsed_time": "2h 14m 22s", "remaining_time": "1h 23m 43s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.128987} +{"loss": 0.14218903, "grad_norm": 1.38606298, "learning_rate": 7.51e-06, "token_acc": 0.96098638, "epoch": 0.62222222, "global_step/max_steps": "1050/1688", "percentage": "62.20%", "elapsed_time": "2h 15m 33s", "remaining_time": "1h 22m 22s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129093} +{"loss": 0.11542817, "grad_norm": 0.75168651, "learning_rate": 7.31e-06, "token_acc": 0.96513577, "epoch": 0.62814815, "global_step/max_steps": "1060/1688", "percentage": "62.80%", "elapsed_time": "2h 16m 43s", "remaining_time": "1h 21m 0s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129206} +{"loss": 0.12470541, "grad_norm": 1.01392865, "learning_rate": 7.12e-06, "token_acc": 0.96483826, "epoch": 0.63407407, "global_step/max_steps": "1070/1688", "percentage": "63.39%", "elapsed_time": "2h 17m 54s", "remaining_time": "1h 19m 39s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129307} +{"loss": 0.11651564, "grad_norm": 1.00601161, "learning_rate": 6.92e-06, "token_acc": 0.96417798, "epoch": 0.64, "global_step/max_steps": "1080/1688", "percentage": "63.98%", "elapsed_time": "2h 19m 5s", "remaining_time": "1h 18m 18s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129414} +{"loss": 0.12869979, "grad_norm": 1.43750608, "learning_rate": 6.72e-06, "token_acc": 0.96116505, "epoch": 0.64592593, "global_step/max_steps": "1090/1688", "percentage": "64.57%", "elapsed_time": "2h 20m 15s", "remaining_time": "1h 16m 56s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129524} +{"loss": 0.14162105, "grad_norm": 1.04886544, "learning_rate": 6.53e-06, "token_acc": 0.95334838, "epoch": 0.65185185, "global_step/max_steps": "1100/1688", "percentage": "65.17%", "elapsed_time": "2h 21m 25s", "remaining_time": "1h 15m 35s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129631} +{"loss": 0.14174395, "grad_norm": 0.94386166, "learning_rate": 6.33e-06, "token_acc": 0.95834925, "epoch": 0.65777778, "global_step/max_steps": "1110/1688", "percentage": "65.76%", "elapsed_time": "2h 22m 36s", "remaining_time": "1h 14m 15s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129725} +{"loss": 0.14388899, "grad_norm": 1.20126736, "learning_rate": 6.14e-06, "token_acc": 0.95645589, "epoch": 0.6637037, "global_step/max_steps": "1120/1688", "percentage": "66.35%", "elapsed_time": "2h 23m 47s", "remaining_time": "1h 12m 55s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129817} +{"loss": 0.11517893, "grad_norm": 1.12826347, "learning_rate": 5.95e-06, "token_acc": 0.96851852, "epoch": 0.66962963, "global_step/max_steps": "1130/1688", "percentage": "66.94%", "elapsed_time": "2h 24m 57s", "remaining_time": "1h 11m 34s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.129921} +{"loss": 0.08853522, "grad_norm": 0.84492487, "learning_rate": 5.76e-06, "token_acc": 0.9759212, "epoch": 0.67555556, "global_step/max_steps": "1140/1688", "percentage": "67.54%", "elapsed_time": "2h 26m 8s", "remaining_time": "1h 10m 14s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130018} +{"loss": 0.14078164, "grad_norm": 0.9580397, "learning_rate": 5.58e-06, "token_acc": 0.96346516, "epoch": 0.68148148, "global_step/max_steps": "1150/1688", "percentage": "68.13%", "elapsed_time": "2h 27m 18s", "remaining_time": "1h 8m 54s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130111} +{"loss": 0.10377206, "grad_norm": 0.77725202, "learning_rate": 5.39e-06, "token_acc": 0.97017097, "epoch": 0.68740741, "global_step/max_steps": "1160/1688", "percentage": "68.72%", "elapsed_time": "2h 28m 29s", "remaining_time": "1h 7m 35s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130201} +{"loss": 0.15686306, "grad_norm": 1.35661697, "learning_rate": 5.21e-06, "token_acc": 0.9556423, "epoch": 0.69333333, "global_step/max_steps": "1170/1688", "percentage": "69.31%", "elapsed_time": "2h 29m 39s", "remaining_time": "1h 6m 15s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130293} +{"loss": 0.14888058, "grad_norm": 0.92457962, "learning_rate": 5.03e-06, "token_acc": 0.95638521, "epoch": 0.69925926, "global_step/max_steps": "1180/1688", "percentage": "69.91%", "elapsed_time": "2h 30m 50s", "remaining_time": "1h 4m 56s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130383} +{"loss": 0.1214102, "grad_norm": 1.03459775, "learning_rate": 4.85e-06, "token_acc": 0.96460177, "epoch": 0.70518519, "global_step/max_steps": "1190/1688", "percentage": "70.50%", "elapsed_time": "2h 32m 0s", "remaining_time": "1h 3m 36s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.13047} +{"loss": 0.12966567, "grad_norm": 1.16357815, "learning_rate": 4.68e-06, "token_acc": 0.95779468, "epoch": 0.71111111, "global_step/max_steps": "1200/1688", "percentage": "71.09%", "elapsed_time": "2h 33m 11s", "remaining_time": "1h 2m 17s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.130557} +{"eval_loss": 0.12971985, "eval_runtime": 229.3094, "eval_samples_per_second": 6.541, "eval_steps_per_second": 6.541, "eval_token_acc": 0.96215963, "epoch": 0.71111111, "global_step/max_steps": "1200/1688", "percentage": "71.09%", "elapsed_time": "2h 37m 0s", "remaining_time": "1h 3m 51s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127379} +{"loss": 0.12880181, "grad_norm": 0.65072328, "learning_rate": 4.5e-06, "token_acc": 0.96644813, "epoch": 0.71703704, "global_step/max_steps": "1210/1688", "percentage": "71.68%", "elapsed_time": "2h 38m 11s", "remaining_time": "1h 2m 29s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127477} +{"loss": 0.12247175, "grad_norm": 0.96751791, "learning_rate": 4.33e-06, "token_acc": 0.96229261, "epoch": 0.72296296, "global_step/max_steps": "1220/1688", "percentage": "72.27%", "elapsed_time": "2h 39m 22s", "remaining_time": "1h 1m 8s", "memory(GiB)": 25.3, "train_speed(iter/s)": 0.127582} +{"loss": 0.12777592, "grad_norm": 0.98411858, "learning_rate": 4.16e-06, "token_acc": 0.96121478, "epoch": 0.72888889, "global_step/max_steps": "1230/1688", "percentage": "72.87%", "elapsed_time": "2h 40m 32s", "remaining_time": "59m 46s", "memory(GiB)": 25.66, "train_speed(iter/s)": 0.127689} +{"loss": 0.13893853, "grad_norm": 1.45658314, "learning_rate": 3.99e-06, "token_acc": 0.96229205, "epoch": 0.73481481, "global_step/max_steps": "1240/1688", "percentage": "73.46%", "elapsed_time": "2h 41m 43s", "remaining_time": "58m 25s", "memory(GiB)": 25.66, "train_speed(iter/s)": 0.12779} +{"loss": 0.09945087, "grad_norm": 1.12773693, "learning_rate": 3.83e-06, "token_acc": 0.96582801, "epoch": 0.74074074, "global_step/max_steps": "1250/1688", "percentage": "74.05%", "elapsed_time": "2h 42m 54s", "remaining_time": "57m 4s", "memory(GiB)": 25.66, "train_speed(iter/s)": 0.127886} +{"loss": 0.08901865, "grad_norm": 1.16583753, "learning_rate": 3.67e-06, "token_acc": 0.97189959, "epoch": 0.74666667, "global_step/max_steps": "1260/1688", "percentage": "74.64%", "elapsed_time": "2h 44m 4s", "remaining_time": "55m 43s", "memory(GiB)": 25.66, "train_speed(iter/s)": 0.127993} +{"loss": 0.12474505, "grad_norm": 1.24678016, "learning_rate": 3.51e-06, "token_acc": 0.95931318, "epoch": 0.75259259, "global_step/max_steps": "1270/1688", "percentage": "75.24%", "elapsed_time": "2h 45m 14s", "remaining_time": "54m 23s", "memory(GiB)": 25.66, "train_speed(iter/s)": 0.128089} +{"loss": 0.12159137, "grad_norm": 1.29658926, "learning_rate": 3.35e-06, "token_acc": 0.96135266, "epoch": 0.75851852, "global_step/max_steps": "1280/1688", "percentage": "75.83%", "elapsed_time": "2h 46m 25s", "remaining_time": "53m 2s", "memory(GiB)": 26.34, "train_speed(iter/s)": 0.128182} +{"loss": 0.13443601, "grad_norm": 1.16893399, "learning_rate": 3.2e-06, "token_acc": 0.95943499, "epoch": 0.76444444, "global_step/max_steps": "1290/1688", "percentage": "76.42%", "elapsed_time": "2h 47m 36s", "remaining_time": "51m 42s", "memory(GiB)": 26.34, "train_speed(iter/s)": 0.128279} +{"loss": 0.12788604, "grad_norm": 0.78945893, "learning_rate": 3.05e-06, "token_acc": 0.96385542, "epoch": 0.77037037, "global_step/max_steps": "1300/1688", "percentage": "77.01%", "elapsed_time": "2h 48m 46s", "remaining_time": "50m 22s", "memory(GiB)": 26.34, "train_speed(iter/s)": 0.12837} +{"loss": 0.1196237, "grad_norm": 1.28296971, "learning_rate": 2.9e-06, "token_acc": 0.96043956, "epoch": 0.7762963, "global_step/max_steps": "1310/1688", "percentage": "77.61%", "elapsed_time": "2h 49m 57s", "remaining_time": "49m 2s", "memory(GiB)": 26.34, "train_speed(iter/s)": 0.128463} +{"loss": 0.11098713, "grad_norm": 1.13794696, "learning_rate": 2.76e-06, "token_acc": 0.96495071, "epoch": 0.78222222, "global_step/max_steps": "1320/1688", "percentage": "78.20%", "elapsed_time": "2h 51m 8s", "remaining_time": "47m 42s", "memory(GiB)": 26.34, "train_speed(iter/s)": 0.128554} +{"loss": 0.13792315, "grad_norm": 1.72399211, "learning_rate": 2.62e-06, "token_acc": 0.95607613, "epoch": 0.78814815, "global_step/max_steps": "1330/1688", "percentage": "78.79%", "elapsed_time": "2h 52m 18s", "remaining_time": "46m 22s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.128643} +{"loss": 0.10700693, "grad_norm": 1.13045049, "learning_rate": 2.48e-06, "token_acc": 0.96403147, "epoch": 0.79407407, "global_step/max_steps": "1340/1688", "percentage": "79.38%", "elapsed_time": "2h 53m 29s", "remaining_time": "45m 3s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.128732} +{"loss": 0.11214719, "grad_norm": 1.36091816, "learning_rate": 2.35e-06, "token_acc": 0.96755941, "epoch": 0.8, "global_step/max_steps": "1350/1688", "percentage": "79.98%", "elapsed_time": "2h 54m 40s", "remaining_time": "43m 44s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.12881} +{"loss": 0.09663895, "grad_norm": 0.77614921, "learning_rate": 2.21e-06, "token_acc": 0.97208122, "epoch": 0.80592593, "global_step/max_steps": "1360/1688", "percentage": "80.57%", "elapsed_time": "2h 55m 51s", "remaining_time": "42m 24s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.128894} +{"loss": 0.12092038, "grad_norm": 1.14388824, "learning_rate": 2.09e-06, "token_acc": 0.96379127, "epoch": 0.81185185, "global_step/max_steps": "1370/1688", "percentage": "81.16%", "elapsed_time": "2h 57m 1s", "remaining_time": "41m 5s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.12898} +{"loss": 0.14124364, "grad_norm": 1.06492245, "learning_rate": 1.96e-06, "token_acc": 0.95542857, "epoch": 0.81777778, "global_step/max_steps": "1380/1688", "percentage": "81.75%", "elapsed_time": "2h 58m 12s", "remaining_time": "39m 46s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.129065} +{"loss": 0.11149575, "grad_norm": 1.35570669, "learning_rate": 1.84e-06, "token_acc": 0.96535376, "epoch": 0.8237037, "global_step/max_steps": "1390/1688", "percentage": "82.35%", "elapsed_time": "2h 59m 23s", "remaining_time": "38m 27s", "memory(GiB)": 27.05, "train_speed(iter/s)": 0.129144} +{"loss": 0.1278609, "grad_norm": 1.06466675, "learning_rate": 1.72e-06, "token_acc": 0.95809038, "epoch": 0.82962963, "global_step/max_steps": "1400/1688", "percentage": "82.94%", "elapsed_time": "3h 0m 33s", "remaining_time": "37m 8s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129227} +{"loss": 0.13160686, "grad_norm": 1.62766051, "learning_rate": 1.61e-06, "token_acc": 0.96173848, "epoch": 0.83555556, "global_step/max_steps": "1410/1688", "percentage": "83.53%", "elapsed_time": "3h 1m 44s", "remaining_time": "35m 49s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129304} +{"loss": 0.12551895, "grad_norm": 1.00215924, "learning_rate": 1.5e-06, "token_acc": 0.96350365, "epoch": 0.84148148, "global_step/max_steps": "1420/1688", "percentage": "84.12%", "elapsed_time": "3h 2m 54s", "remaining_time": "34m 31s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129387} +{"loss": 0.11337714, "grad_norm": 1.27148342, "learning_rate": 1.39e-06, "token_acc": 0.96275181, "epoch": 0.84740741, "global_step/max_steps": "1430/1688", "percentage": "84.72%", "elapsed_time": "3h 4m 5s", "remaining_time": "33m 12s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129465} +{"loss": 0.10303183, "grad_norm": 1.20864642, "learning_rate": 1.29e-06, "token_acc": 0.96906117, "epoch": 0.85333333, "global_step/max_steps": "1440/1688", "percentage": "85.31%", "elapsed_time": "3h 5m 15s", "remaining_time": "31m 54s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129543} +{"loss": 0.11366283, "grad_norm": 1.46652853, "learning_rate": 1.19e-06, "token_acc": 0.96219557, "epoch": 0.85925926, "global_step/max_steps": "1450/1688", "percentage": "85.90%", "elapsed_time": "3h 6m 27s", "remaining_time": "30m 36s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129611} +{"loss": 0.14109414, "grad_norm": 1.48339307, "learning_rate": 1.09e-06, "token_acc": 0.95916193, "epoch": 0.86518519, "global_step/max_steps": "1460/1688", "percentage": "86.49%", "elapsed_time": "3h 7m 37s", "remaining_time": "29m 18s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129687} +{"loss": 0.13869184, "grad_norm": 0.66050649, "learning_rate": 1e-06, "token_acc": 0.96223675, "epoch": 0.87111111, "global_step/max_steps": "1470/1688", "percentage": "87.09%", "elapsed_time": "3h 8m 48s", "remaining_time": "28m 0s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129762} +{"loss": 0.15464031, "grad_norm": 1.14225197, "learning_rate": 9.1e-07, "token_acc": 0.95908408, "epoch": 0.87703704, "global_step/max_steps": "1480/1688", "percentage": "87.68%", "elapsed_time": "3h 9m 59s", "remaining_time": "26m 42s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129835} +{"loss": 0.13770858, "grad_norm": 1.4246074, "learning_rate": 8.3e-07, "token_acc": 0.95907738, "epoch": 0.88296296, "global_step/max_steps": "1490/1688", "percentage": "88.27%", "elapsed_time": "3h 11m 9s", "remaining_time": "25m 24s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129909} +{"loss": 0.08925542, "grad_norm": 1.42388594, "learning_rate": 7.5e-07, "token_acc": 0.97478992, "epoch": 0.88888889, "global_step/max_steps": "1500/1688", "percentage": "88.86%", "elapsed_time": "3h 12m 19s", "remaining_time": "24m 6s", "memory(GiB)": 27.77, "train_speed(iter/s)": 0.129985} +{"eval_loss": 0.12762739, "eval_runtime": 229.1217, "eval_samples_per_second": 6.547, "eval_steps_per_second": 6.547, "eval_token_acc": 0.96235469, "epoch": 0.88888889, "global_step/max_steps": "1500/1688", "percentage": "88.86%", "elapsed_time": "3h 16m 8s", "remaining_time": "24m 35s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127455} +{"loss": 0.12536653, "grad_norm": 1.14567828, "learning_rate": 6.7e-07, "token_acc": 0.96483771, "epoch": 0.89481481, "global_step/max_steps": "1510/1688", "percentage": "89.45%", "elapsed_time": "3h 17m 20s", "remaining_time": "23m 15s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127526} +{"loss": 0.11909486, "grad_norm": 0.58699989, "learning_rate": 6e-07, "token_acc": 0.96516471, "epoch": 0.90074074, "global_step/max_steps": "1520/1688", "percentage": "90.05%", "elapsed_time": "3h 18m 31s", "remaining_time": "21m 56s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127607} +{"loss": 0.10322866, "grad_norm": 0.82776296, "learning_rate": 5.3e-07, "token_acc": 0.96988615, "epoch": 0.90666667, "global_step/max_steps": "1530/1688", "percentage": "90.64%", "elapsed_time": "3h 19m 42s", "remaining_time": "20m 37s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127688} +{"loss": 0.12286541, "grad_norm": 1.06301725, "learning_rate": 4.6e-07, "token_acc": 0.96708861, "epoch": 0.91259259, "global_step/max_steps": "1540/1688", "percentage": "91.23%", "elapsed_time": "3h 20m 53s", "remaining_time": "19m 18s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127764} +{"loss": 0.08263896, "grad_norm": 0.88499665, "learning_rate": 4e-07, "token_acc": 0.97243545, "epoch": 0.91851852, "global_step/max_steps": "1550/1688", "percentage": "91.82%", "elapsed_time": "3h 22m 4s", "remaining_time": "17m 59s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.12784} +{"loss": 0.10929736, "grad_norm": 1.46445334, "learning_rate": 3.5e-07, "token_acc": 0.96605166, "epoch": 0.92444444, "global_step/max_steps": "1560/1688", "percentage": "92.42%", "elapsed_time": "3h 23m 15s", "remaining_time": "16m 40s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.127919} +{"loss": 0.09308318, "grad_norm": 1.34516668, "learning_rate": 3e-07, "token_acc": 0.96794872, "epoch": 0.93037037, "global_step/max_steps": "1570/1688", "percentage": "93.01%", "elapsed_time": "3h 24m 25s", "remaining_time": "15m 21s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128001} +{"loss": 0.09640222, "grad_norm": 0.62761259, "learning_rate": 2.5e-07, "token_acc": 0.97022956, "epoch": 0.9362963, "global_step/max_steps": "1580/1688", "percentage": "93.60%", "elapsed_time": "3h 25m 35s", "remaining_time": "14m 3s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.12808} +{"loss": 0.12160608, "grad_norm": 0.96427214, "learning_rate": 2e-07, "token_acc": 0.96128357, "epoch": 0.94222222, "global_step/max_steps": "1590/1688", "percentage": "94.19%", "elapsed_time": "3h 26m 46s", "remaining_time": "12m 44s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128158} +{"loss": 0.11407675, "grad_norm": 1.20203805, "learning_rate": 1.7e-07, "token_acc": 0.96194658, "epoch": 0.94814815, "global_step/max_steps": "1600/1688", "percentage": "94.79%", "elapsed_time": "3h 27m 57s", "remaining_time": "11m 26s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128231} +{"loss": 0.12073926, "grad_norm": 1.08925617, "learning_rate": 1.3e-07, "token_acc": 0.96210996, "epoch": 0.95407407, "global_step/max_steps": "1610/1688", "percentage": "95.38%", "elapsed_time": "3h 29m 7s", "remaining_time": "10m 7s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.12831} +{"loss": 0.1057003, "grad_norm": 1.31036913, "learning_rate": 1e-07, "token_acc": 0.96264975, "epoch": 0.96, "global_step/max_steps": "1620/1688", "percentage": "95.97%", "elapsed_time": "3h 30m 17s", "remaining_time": "8m 49s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128392} +{"loss": 0.10481684, "grad_norm": 0.90087193, "learning_rate": 7e-08, "token_acc": 0.96780029, "epoch": 0.96592593, "global_step/max_steps": "1630/1688", "percentage": "96.56%", "elapsed_time": "3h 31m 28s", "remaining_time": "7m 31s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128467} +{"loss": 0.16029913, "grad_norm": 1.27099562, "learning_rate": 5e-08, "token_acc": 0.95696489, "epoch": 0.97185185, "global_step/max_steps": "1640/1688", "percentage": "97.16%", "elapsed_time": "3h 32m 38s", "remaining_time": "6m 13s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128542} +{"loss": 0.10578295, "grad_norm": 1.14221537, "learning_rate": 3e-08, "token_acc": 0.96715459, "epoch": 0.97777778, "global_step/max_steps": "1650/1688", "percentage": "97.75%", "elapsed_time": "3h 33m 49s", "remaining_time": "4m 55s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128613} +{"loss": 0.12208804, "grad_norm": 1.01545012, "learning_rate": 2e-08, "token_acc": 0.96713615, "epoch": 0.9837037, "global_step/max_steps": "1660/1688", "percentage": "98.34%", "elapsed_time": "3h 34m 59s", "remaining_time": "3m 37s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128683} +{"loss": 0.12359804, "grad_norm": 1.14651, "learning_rate": 1e-08, "token_acc": 0.9630898, "epoch": 0.98962963, "global_step/max_steps": "1670/1688", "percentage": "98.93%", "elapsed_time": "3h 36m 10s", "remaining_time": "2m 19s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128756} +{"loss": 0.103961, "grad_norm": 0.66730165, "learning_rate": 0.0, "token_acc": 0.97188176, "epoch": 0.99555556, "global_step/max_steps": "1680/1688", "percentage": "99.53%", "elapsed_time": "3h 37m 21s", "remaining_time": "1m 2s", "memory(GiB)": 28.26, "train_speed(iter/s)": 0.128824} +{"eval_loss": 0.12758993, "eval_runtime": 231.1684, "eval_samples_per_second": 6.489, "eval_steps_per_second": 6.489, "eval_token_acc": 0.96227666, "epoch": 1.0, "global_step/max_steps": "1688/1688", "percentage": "100.00%", "elapsed_time": "3h 42m 4s", "remaining_time": "0s", "memory(GiB)": 28.72, "train_speed(iter/s)": 0.126682} +{"train_runtime": 13328.4914, "train_samples_per_second": 2.026, "train_steps_per_second": 0.127, "total_flos": 2.929447543828032e+17, "train_loss": 0.14444039, "epoch": 1.0, "global_step/max_steps": "1688/1688", "percentage": "100.00%", "elapsed_time": "3h 42m 5s", "remaining_time": "0s", "memory(GiB)": 28.72, "train_speed(iter/s)": 0.126674} +{"model_parameter_info": "PeftModelForCausalLM: 10752.6010M Params (20.3756M Trainable [0.1895%]), 1.9261M Buffers.", "last_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688", "best_model_checkpoint": "/workspace/intern/pangkaiyu/dg/output_omni7B-LLM-aligner-ff-lora-1gpu-save300_linear1/v0-20251213-110639/checkpoint-1688", "best_metric": 0.12758993, "global_step": 1688, "log_history": [{"loss": 0.38409245014190674, "grad_norm": 1.32502019405365, "learning_rate": 1.183431952662722e-07, "token_acc": 0.9151943462897526, "epoch": 0.0005925925925925926, "step": 1}, {"loss": 0.4804305500454373, "grad_norm": 1.348962426185608, "learning_rate": 1.183431952662722e-06, "token_acc": 0.8925214548426645, "epoch": 0.005925925925925926, "step": 10}, {"loss": 0.4860693454742432, "grad_norm": 1.474541187286377, "learning_rate": 2.366863905325444e-06, "token_acc": 0.8906647293861242, "epoch": 0.011851851851851851, "step": 20}, {"loss": 0.4820727348327637, "grad_norm": 1.5195010900497437, "learning_rate": 3.550295857988166e-06, "token_acc": 0.8872207982424021, "epoch": 0.017777777777777778, "step": 30}, {"loss": 0.4436625957489014, "grad_norm": 1.5887762308120728, "learning_rate": 4.733727810650888e-06, "token_acc": 0.8992023205221175, "epoch": 0.023703703703703703, "step": 40}, {"loss": 0.473007869720459, "grad_norm": 1.7676503658294678, "learning_rate": 5.91715976331361e-06, "token_acc": 0.8852583586626139, "epoch": 0.02962962962962963, "step": 50}, {"loss": 0.4192169666290283, "grad_norm": 2.005035161972046, "learning_rate": 7.100591715976332e-06, "token_acc": 0.8907309721175584, "epoch": 0.035555555555555556, "step": 60}, {"loss": 0.3096126079559326, "grad_norm": 1.361005187034607, "learning_rate": 8.284023668639054e-06, "token_acc": 0.91939457937346, "epoch": 0.04148148148148148, "step": 70}, {"loss": 0.28482446670532224, "grad_norm": 1.3007423877716064, "learning_rate": 9.467455621301776e-06, "token_acc": 0.9255202628696605, "epoch": 0.047407407407407405, "step": 80}, {"loss": 0.24792802333831787, "grad_norm": 0.7848371863365173, "learning_rate": 1.0650887573964498e-05, "token_acc": 0.9363215937388829, "epoch": 0.05333333333333334, "step": 90}, {"loss": 0.21306073665618896, "grad_norm": 0.5432378649711609, "learning_rate": 1.183431952662722e-05, "token_acc": 0.9468995010691376, "epoch": 0.05925925925925926, "step": 100}, {"loss": 0.20164842605590821, "grad_norm": 0.64493727684021, "learning_rate": 1.3017751479289941e-05, "token_acc": 0.9505376344086022, "epoch": 0.06518518518518518, "step": 110}, {"loss": 0.22527461051940917, "grad_norm": 0.9089162349700928, "learning_rate": 1.4201183431952663e-05, "token_acc": 0.9423220973782771, "epoch": 0.07111111111111111, "step": 120}, {"loss": 0.1824732780456543, "grad_norm": 0.9455512762069702, "learning_rate": 1.5384615384615387e-05, "token_acc": 0.9536231884057971, "epoch": 0.07703703703703704, "step": 130}, {"loss": 0.18543678522109985, "grad_norm": 0.6021348237991333, "learning_rate": 1.6568047337278108e-05, "token_acc": 0.9523099850968704, "epoch": 0.08296296296296296, "step": 140}, {"loss": 0.18889259099960326, "grad_norm": 0.8500062227249146, "learning_rate": 1.7751479289940828e-05, "token_acc": 0.9432362698120162, "epoch": 0.08888888888888889, "step": 150}, {"loss": 0.1937463402748108, "grad_norm": 1.0183658599853516, "learning_rate": 1.8934911242603552e-05, "token_acc": 0.9425625920471281, "epoch": 0.09481481481481481, "step": 160}, {"loss": 0.16474100351333618, "grad_norm": 0.5574401021003723, "learning_rate": 1.9999978612794268e-05, "token_acc": 0.9523260284505959, "epoch": 0.10074074074074074, "step": 170}, {"loss": 0.14637688398361207, "grad_norm": 0.7811685800552368, "learning_rate": 1.9997412258797892e-05, "token_acc": 0.9594446474241871, "epoch": 0.10666666666666667, "step": 180}, {"loss": 0.12380313873291016, "grad_norm": 0.671356737613678, "learning_rate": 1.9990569721450324e-05, "token_acc": 0.9659009332376166, "epoch": 0.11259259259259259, "step": 190}, {"loss": 0.2040093183517456, "grad_norm": 0.7796847224235535, "learning_rate": 1.9979453927503366e-05, "token_acc": 0.9489942528735632, "epoch": 0.11851851851851852, "step": 200}, {"loss": 0.1916598677635193, "grad_norm": 1.0088781118392944, "learning_rate": 1.9964069631504664e-05, "token_acc": 0.9477272727272728, "epoch": 0.12444444444444444, "step": 210}, {"loss": 0.13621771335601807, "grad_norm": 1.3728845119476318, "learning_rate": 1.994442341376408e-05, "token_acc": 0.9564245810055866, "epoch": 0.13037037037037036, "step": 220}, {"loss": 0.1574079394340515, "grad_norm": 0.8439155220985413, "learning_rate": 1.9920523677539076e-05, "token_acc": 0.9541870071348104, "epoch": 0.1362962962962963, "step": 230}, {"loss": 0.13396313190460205, "grad_norm": 1.2579078674316406, "learning_rate": 1.9892380645440422e-05, "token_acc": 0.9584548104956269, "epoch": 0.14222222222222222, "step": 240}, {"loss": 0.14859610795974731, "grad_norm": 0.9577816724777222, "learning_rate": 1.9860006355059656e-05, "token_acc": 0.9541044776119403, "epoch": 0.14814814814814814, "step": 250}, {"loss": 0.1562924861907959, "grad_norm": 1.2375385761260986, "learning_rate": 1.982341465382029e-05, "token_acc": 0.9559248554913294, "epoch": 0.15407407407407409, "step": 260}, {"loss": 0.12399486303329468, "grad_norm": 1.2553672790527344, "learning_rate": 1.978262119305485e-05, "token_acc": 0.9662838088180807, "epoch": 0.16, "step": 270}, {"loss": 0.14870967864990234, "grad_norm": 1.176658272743225, "learning_rate": 1.9737643421310346e-05, "token_acc": 0.9565873914684787, "epoch": 0.16592592592592592, "step": 280}, {"loss": 0.11581240892410279, "grad_norm": 1.807876706123352, "learning_rate": 1.9688500576885012e-05, "token_acc": 0.9647544056992876, "epoch": 0.17185185185185184, "step": 290}, {"loss": 0.1393712043762207, "grad_norm": 1.1867674589157104, "learning_rate": 1.9635213679599562e-05, "token_acc": 0.9596832253419726, "epoch": 0.17777777777777778, "step": 300}, {"eval_loss": 0.1630009412765503, "eval_runtime": 239.7168, "eval_samples_per_second": 6.257, "eval_steps_per_second": 6.257, "eval_token_acc": 0.9527580557072638, "epoch": 0.17777777777777778, "step": 300}, {"loss": 0.1300894260406494, "grad_norm": 1.2620875835418701, "learning_rate": 1.9577805521806358e-05, "token_acc": 0.960536398467433, "epoch": 0.1837037037037037, "step": 310}, {"loss": 0.16317719221115112, "grad_norm": 1.1361067295074463, "learning_rate": 1.95163006586405e-05, "token_acc": 0.9544095665171899, "epoch": 0.18962962962962962, "step": 320}, {"loss": 0.17428743839263916, "grad_norm": 0.8173150420188904, "learning_rate": 1.945072539751685e-05, "token_acc": 0.94750656167979, "epoch": 0.19555555555555557, "step": 330}, {"loss": 0.12995322942733764, "grad_norm": 0.8849798440933228, "learning_rate": 1.93811077868776e-05, "token_acc": 0.9658246656760773, "epoch": 0.20148148148148148, "step": 340}, {"loss": 0.1278319001197815, "grad_norm": 0.6326722502708435, "learning_rate": 1.9307477604195162e-05, "token_acc": 0.9639468690702088, "epoch": 0.2074074074074074, "step": 350}, {"loss": 0.12902997732162474, "grad_norm": 1.1027580499649048, "learning_rate": 1.9229866343235427e-05, "token_acc": 0.9652777777777778, "epoch": 0.21333333333333335, "step": 360}, {"loss": 0.14380792379379273, "grad_norm": 0.7148353457450867, "learning_rate": 1.914830720058701e-05, "token_acc": 0.9572490706319703, "epoch": 0.21925925925925926, "step": 370}, {"loss": 0.15708266496658324, "grad_norm": 1.1909170150756836, "learning_rate": 1.9062835061462105e-05, "token_acc": 0.9598788796366389, "epoch": 0.22518518518518518, "step": 380}, {"loss": 0.15604959726333617, "grad_norm": 0.7275416254997253, "learning_rate": 1.8973486484775037e-05, "token_acc": 0.9558498896247241, "epoch": 0.2311111111111111, "step": 390}, {"loss": 0.1431185483932495, "grad_norm": 0.9419987201690674, "learning_rate": 1.888029968750498e-05, "token_acc": 0.9590773809523809, "epoch": 0.23703703703703705, "step": 400}, {"loss": 0.15362846851348877, "grad_norm": 0.6928850412368774, "learning_rate": 1.878331452834944e-05, "token_acc": 0.9517941283073578, "epoch": 0.24296296296296296, "step": 410}, {"loss": 0.12896524667739867, "grad_norm": 0.6290676593780518, "learning_rate": 1.8682572490675524e-05, "token_acc": 0.9619504987070557, "epoch": 0.24888888888888888, "step": 420}, {"loss": 0.14157743453979493, "grad_norm": 0.7995588779449463, "learning_rate": 1.8578116664776314e-05, "token_acc": 0.9562071591774562, "epoch": 0.2548148148148148, "step": 430}, {"loss": 0.16496583223342895, "grad_norm": 0.780008852481842, "learning_rate": 1.8469991729439888e-05, "token_acc": 0.9543109801031687, "epoch": 0.2607407407407407, "step": 440}, {"loss": 0.14944461584091187, "grad_norm": 0.8067275881767273, "learning_rate": 1.8358243932838914e-05, "token_acc": 0.9509394572025052, "epoch": 0.26666666666666666, "step": 450}, {"loss": 0.12261044979095459, "grad_norm": 0.8212175369262695, "learning_rate": 1.8242921072748948e-05, "token_acc": 0.9617764834364761, "epoch": 0.2725925925925926, "step": 460}, {"loss": 0.12651515007019043, "grad_norm": 0.688872754573822, "learning_rate": 1.8124072476103957e-05, "token_acc": 0.9594694178334562, "epoch": 0.2785185185185185, "step": 470}, {"loss": 0.11215313673019409, "grad_norm": 1.0954047441482544, "learning_rate": 1.8001748977897754e-05, "token_acc": 0.9634851771511207, "epoch": 0.28444444444444444, "step": 480}, {"loss": 0.1215265154838562, "grad_norm": 0.8077743649482727, "learning_rate": 1.787600289944039e-05, "token_acc": 0.9642989959092599, "epoch": 0.2903703703703704, "step": 490}, {"loss": 0.11017097234725952, "grad_norm": 0.9279748797416687, "learning_rate": 1.7746888025978807e-05, "token_acc": 0.9696060037523452, "epoch": 0.2962962962962963, "step": 500}, {"loss": 0.1296389102935791, "grad_norm": 1.2479947805404663, "learning_rate": 1.7614459583691346e-05, "token_acc": 0.9566453447050463, "epoch": 0.3022222222222222, "step": 510}, {"loss": 0.13492013216018678, "grad_norm": 1.1002650260925293, "learning_rate": 1.7478774216065882e-05, "token_acc": 0.9590994371482177, "epoch": 0.30814814814814817, "step": 520}, {"loss": 0.14083080291748046, "grad_norm": 1.108170747756958, "learning_rate": 1.733988995967179e-05, "token_acc": 0.9592061742006616, "epoch": 0.31407407407407406, "step": 530}, {"loss": 0.12698700428009033, "grad_norm": 0.8783969879150391, "learning_rate": 1.719786621933599e-05, "token_acc": 0.9617927994121969, "epoch": 0.32, "step": 540}, {"loss": 0.11144465208053589, "grad_norm": 0.6896427273750305, "learning_rate": 1.70527637427338e-05, "token_acc": 0.9692820133234641, "epoch": 0.32592592592592595, "step": 550}, {"loss": 0.13314462900161744, "grad_norm": 1.067499041557312, "learning_rate": 1.690464459440538e-05, "token_acc": 0.9597096188747731, "epoch": 0.33185185185185184, "step": 560}, {"loss": 0.11334860324859619, "grad_norm": 0.6953498721122742, "learning_rate": 1.6753572129208935e-05, "token_acc": 0.9676190476190476, "epoch": 0.3377777777777778, "step": 570}, {"loss": 0.1281804084777832, "grad_norm": 1.197219967842102, "learning_rate": 1.6599610965222002e-05, "token_acc": 0.9607272727272728, "epoch": 0.3437037037037037, "step": 580}, {"loss": 0.12322006225585938, "grad_norm": 0.6708402633666992, "learning_rate": 1.6442826956102424e-05, "token_acc": 0.9628704034273474, "epoch": 0.3496296296296296, "step": 590}, {"loss": 0.13818006515502929, "grad_norm": 1.0634019374847412, "learning_rate": 1.628328716292082e-05, "token_acc": 0.9580494801003944, "epoch": 0.35555555555555557, "step": 600}, {"eval_loss": 0.14249637722969055, "eval_runtime": 229.7535, "eval_samples_per_second": 6.529, "eval_steps_per_second": 6.529, "eval_token_acc": 0.9576734025122884, "epoch": 0.35555555555555557, "step": 600}, {"loss": 0.13777921199798585, "grad_norm": 0.7200868129730225, "learning_rate": 1.612105982547663e-05, "token_acc": 0.9565537555228277, "epoch": 0.36148148148148146, "step": 610}, {"loss": 0.12660154104232788, "grad_norm": 1.610889196395874, "learning_rate": 1.595621433310997e-05, "token_acc": 0.9658464928387808, "epoch": 0.3674074074074074, "step": 620}, {"loss": 0.13561646938323973, "grad_norm": 1.7054650783538818, "learning_rate": 1.5788821195021792e-05, "token_acc": 0.9558277654046028, "epoch": 0.37333333333333335, "step": 630}, {"loss": 0.12502728700637816, "grad_norm": 1.4907517433166504, "learning_rate": 1.5618952010115057e-05, "token_acc": 0.9623144271031595, "epoch": 0.37925925925925924, "step": 640}, {"loss": 0.1149907112121582, "grad_norm": 1.1567004919052124, "learning_rate": 1.544667943636981e-05, "token_acc": 0.9643255295429208, "epoch": 0.3851851851851852, "step": 650}, {"loss": 0.14286714792251587, "grad_norm": 1.0321091413497925, "learning_rate": 1.527207715976525e-05, "token_acc": 0.9604221635883905, "epoch": 0.39111111111111113, "step": 660}, {"loss": 0.13563259840011596, "grad_norm": 1.4016674757003784, "learning_rate": 1.5095219862762091e-05, "token_acc": 0.9618029029793735, "epoch": 0.397037037037037, "step": 670}, {"loss": 0.1207580804824829, "grad_norm": 1.089959979057312, "learning_rate": 1.4916183192358717e-05, "token_acc": 0.9630141721396475, "epoch": 0.40296296296296297, "step": 680}, {"loss": 0.11743853092193604, "grad_norm": 1.045990228652954, "learning_rate": 1.4735043727734762e-05, "token_acc": 0.9632217727105553, "epoch": 0.4088888888888889, "step": 690}, {"loss": 0.0928974449634552, "grad_norm": 1.4252482652664185, "learning_rate": 1.455187894749597e-05, "token_acc": 0.9683257918552036, "epoch": 0.4148148148148148, "step": 700}, {"loss": 0.12940033674240112, "grad_norm": 1.1641786098480225, "learning_rate": 1.436676719653435e-05, "token_acc": 0.9638252148997135, "epoch": 0.42074074074074075, "step": 710}, {"loss": 0.12433557510375977, "grad_norm": 0.7832347750663757, "learning_rate": 1.4179787652517791e-05, "token_acc": 0.9617952522255193, "epoch": 0.4266666666666667, "step": 720}, {"loss": 0.09806026816368103, "grad_norm": 1.1413239240646362, "learning_rate": 1.3991020292023474e-05, "token_acc": 0.9669064748201439, "epoch": 0.4325925925925926, "step": 730}, {"loss": 0.14417175054550171, "grad_norm": 0.8681485056877136, "learning_rate": 1.3800545856329572e-05, "token_acc": 0.9569114098586694, "epoch": 0.43851851851851853, "step": 740}, {"loss": 0.10493698120117187, "grad_norm": 0.9045178294181824, "learning_rate": 1.3608445816879865e-05, "token_acc": 0.9662880175888604, "epoch": 0.4444444444444444, "step": 750}, {"loss": 0.12941417694091797, "grad_norm": 1.1523085832595825, "learning_rate": 1.3414802340436022e-05, "token_acc": 0.9683060109289617, "epoch": 0.45037037037037037, "step": 760}, {"loss": 0.12189668416976929, "grad_norm": 0.9145503640174866, "learning_rate": 1.3219698253932518e-05, "token_acc": 0.9584711503123852, "epoch": 0.4562962962962963, "step": 770}, {"loss": 0.10943882465362549, "grad_norm": 1.0088993310928345, "learning_rate": 1.3023217009049133e-05, "token_acc": 0.9680624556422995, "epoch": 0.4622222222222222, "step": 780}, {"loss": 0.10388659238815308, "grad_norm": 1.376142978668213, "learning_rate": 1.2825442646516253e-05, "token_acc": 0.9674435812060673, "epoch": 0.46814814814814815, "step": 790}, {"loss": 0.1380447506904602, "grad_norm": 1.3877886533737183, "learning_rate": 1.262645976016821e-05, "token_acc": 0.9608202123764189, "epoch": 0.4740740740740741, "step": 800}, {"loss": 0.11965352296829224, "grad_norm": 0.8192164301872253, "learning_rate": 1.2426353460760036e-05, "token_acc": 0.9655172413793104, "epoch": 0.48, "step": 810}, {"loss": 0.09073964357376099, "grad_norm": 0.8384001851081848, "learning_rate": 1.2225209339563144e-05, "token_acc": 0.9659477866061293, "epoch": 0.48592592592592593, "step": 820}, {"loss": 0.10787882804870605, "grad_norm": 1.1015766859054565, "learning_rate": 1.2023113431755435e-05, "token_acc": 0.9649122807017544, "epoch": 0.4918518518518519, "step": 830}, {"loss": 0.13076914548873902, "grad_norm": 1.042965292930603, "learning_rate": 1.1820152179621564e-05, "token_acc": 0.960755275823769, "epoch": 0.49777777777777776, "step": 840}, {"loss": 0.13471759557724, "grad_norm": 0.8400379419326782, "learning_rate": 1.161641239557907e-05, "token_acc": 0.9608513873052071, "epoch": 0.5037037037037037, "step": 850}, {"loss": 0.11886721849441528, "grad_norm": 1.0256035327911377, "learning_rate": 1.141198122504618e-05, "token_acc": 0.9659887798036466, "epoch": 0.5096296296296297, "step": 860}, {"loss": 0.13678861856460572, "grad_norm": 1.1291937828063965, "learning_rate": 1.1206946109167189e-05, "token_acc": 0.961859789320741, "epoch": 0.5155555555555555, "step": 870}, {"loss": 0.13137236833572388, "grad_norm": 1.4508821964263916, "learning_rate": 1.1001394747411347e-05, "token_acc": 0.9597744360902256, "epoch": 0.5214814814814814, "step": 880}, {"loss": 0.11796672344207763, "grad_norm": 0.6653353571891785, "learning_rate": 1.0795415060061242e-05, "token_acc": 0.9627539503386005, "epoch": 0.5274074074074074, "step": 890}, {"loss": 0.14120289087295532, "grad_norm": 0.7665302753448486, "learning_rate": 1.0589095150606747e-05, "token_acc": 0.9607002500893176, "epoch": 0.5333333333333333, "step": 900}, {"eval_loss": 0.1341869980096817, "eval_runtime": 228.3025, "eval_samples_per_second": 6.57, "eval_steps_per_second": 6.57, "eval_token_acc": 0.9593898728251541, "epoch": 0.5333333333333333, "step": 900}, {"loss": 0.11883513927459717, "grad_norm": 1.1279549598693848, "learning_rate": 1.0382523268060612e-05, "token_acc": 0.9647756766777902, "epoch": 0.5392592592592592, "step": 910}, {"loss": 0.11933118104934692, "grad_norm": 1.0214804410934448, "learning_rate": 1.0175787769211778e-05, "token_acc": 0.959910078681154, "epoch": 0.5451851851851852, "step": 920}, {"loss": 0.11430730819702148, "grad_norm": 0.8586761951446533, "learning_rate": 9.968977080832633e-06, "token_acc": 0.9654676258992806, "epoch": 0.5511111111111111, "step": 930}, {"loss": 0.13973416090011598, "grad_norm": 0.7968057990074158, "learning_rate": 9.762179661856312e-06, "token_acc": 0.9573529411764706, "epoch": 0.557037037037037, "step": 940}, {"loss": 0.12812395095825196, "grad_norm": 1.0118746757507324, "learning_rate": 9.555483965540238e-06, "token_acc": 0.9614254224834681, "epoch": 0.562962962962963, "step": 950}, {"loss": 0.1379111647605896, "grad_norm": 1.1432191133499146, "learning_rate": 9.348978401632101e-06, "token_acc": 0.9561209439528023, "epoch": 0.5688888888888889, "step": 960}, {"loss": 0.14111405611038208, "grad_norm": 0.7802894115447998, "learning_rate": 9.142751298554436e-06, "token_acc": 0.9607002500893176, "epoch": 0.5748148148148148, "step": 970}, {"loss": 0.10649667978286743, "grad_norm": 0.741787314414978, "learning_rate": 8.936890865624014e-06, "token_acc": 0.9672929714683368, "epoch": 0.5807407407407408, "step": 980}, {"loss": 0.10067906379699706, "grad_norm": 0.7642576694488525, "learning_rate": 8.731485155322134e-06, "token_acc": 0.9700443786982249, "epoch": 0.5866666666666667, "step": 990}, {"loss": 0.12069357633590698, "grad_norm": 1.0362651348114014, "learning_rate": 8.52662202563203e-06, "token_acc": 0.9607771260997068, "epoch": 0.5925925925925926, "step": 1000}, {"loss": 0.11699739694595337, "grad_norm": 0.7719289064407349, "learning_rate": 8.322389102459458e-06, "token_acc": 0.9636767976278725, "epoch": 0.5985185185185186, "step": 1010}, {"loss": 0.12428475618362426, "grad_norm": 1.143441081047058, "learning_rate": 8.118873742152574e-06, "token_acc": 0.9612553273924835, "epoch": 0.6044444444444445, "step": 1020}, {"loss": 0.114216148853302, "grad_norm": 0.7593462467193604, "learning_rate": 7.916162994137056e-06, "token_acc": 0.9674105561459441, "epoch": 0.6103703703703703, "step": 1030}, {"loss": 0.12711145877838134, "grad_norm": 0.9898127317428589, "learning_rate": 7.714343563682565e-06, "token_acc": 0.9625998547567175, "epoch": 0.6162962962962963, "step": 1040}, {"loss": 0.14218902587890625, "grad_norm": 1.3860629796981812, "learning_rate": 7.513501774816362e-06, "token_acc": 0.9609863820390137, "epoch": 0.6222222222222222, "step": 1050}, {"loss": 0.1154281735420227, "grad_norm": 0.7516865134239197, "learning_rate": 7.313723533400047e-06, "token_acc": 0.965135769359705, "epoch": 0.6281481481481481, "step": 1060}, {"loss": 0.12470541000366211, "grad_norm": 1.0139286518096924, "learning_rate": 7.115094290385103e-06, "token_acc": 0.9648382559774965, "epoch": 0.6340740740740741, "step": 1070}, {"loss": 0.1165156364440918, "grad_norm": 1.0060116052627563, "learning_rate": 6.9176990052630465e-06, "token_acc": 0.9641779788838613, "epoch": 0.64, "step": 1080}, {"loss": 0.128699791431427, "grad_norm": 1.437506079673767, "learning_rate": 6.721622109725799e-06, "token_acc": 0.9611650485436893, "epoch": 0.6459259259259259, "step": 1090}, {"loss": 0.14162105321884155, "grad_norm": 1.0488654375076294, "learning_rate": 6.526947471551799e-06, "token_acc": 0.9533483822422875, "epoch": 0.6518518518518519, "step": 1100}, {"loss": 0.14174394607543944, "grad_norm": 0.9438616633415222, "learning_rate": 6.333758358733313e-06, "token_acc": 0.9583492548719909, "epoch": 0.6577777777777778, "step": 1110}, {"loss": 0.14388898611068726, "grad_norm": 1.2012673616409302, "learning_rate": 6.142137403860301e-06, "token_acc": 0.9564558879212419, "epoch": 0.6637037037037037, "step": 1120}, {"loss": 0.11517893075942993, "grad_norm": 1.1282634735107422, "learning_rate": 5.952166568776062e-06, "token_acc": 0.9685185185185186, "epoch": 0.6696296296296296, "step": 1130}, {"loss": 0.08853521943092346, "grad_norm": 0.8449248671531677, "learning_rate": 5.763927109519784e-06, "token_acc": 0.9759211966435607, "epoch": 0.6755555555555556, "step": 1140}, {"loss": 0.14078164100646973, "grad_norm": 0.9580397009849548, "learning_rate": 5.577499541570954e-06, "token_acc": 0.9634651600753296, "epoch": 0.6814814814814815, "step": 1150}, {"loss": 0.10377205610275268, "grad_norm": 0.7772520184516907, "learning_rate": 5.3929636054105745e-06, "token_acc": 0.9701709712622771, "epoch": 0.6874074074074074, "step": 1160}, {"loss": 0.1568630576133728, "grad_norm": 1.3566169738769531, "learning_rate": 5.210398232413824e-06, "token_acc": 0.9556422995031938, "epoch": 0.6933333333333334, "step": 1170}, {"loss": 0.14888057708740235, "grad_norm": 0.9245796203613281, "learning_rate": 5.0298815110888566e-06, "token_acc": 0.9563852058618283, "epoch": 0.6992592592592592, "step": 1180}, {"loss": 0.1214102029800415, "grad_norm": 1.0345977544784546, "learning_rate": 4.851490653676019e-06, "token_acc": 0.9646017699115044, "epoch": 0.7051851851851851, "step": 1190}, {"loss": 0.12966567277908325, "grad_norm": 1.1635781526565552, "learning_rate": 4.675301963121998e-06, "token_acc": 0.9577946768060837, "epoch": 0.7111111111111111, "step": 1200}, {"eval_loss": 0.12971985340118408, "eval_runtime": 229.3094, "eval_samples_per_second": 6.541, "eval_steps_per_second": 6.541, "eval_token_acc": 0.9621596317390965, "epoch": 0.7111111111111111, "step": 1200}, {"loss": 0.12880181074142455, "grad_norm": 0.6507232785224915, "learning_rate": 4.501390800442783e-06, "token_acc": 0.9664481295796374, "epoch": 0.717037037037037, "step": 1210}, {"loss": 0.12247174978256226, "grad_norm": 0.9675179123878479, "learning_rate": 4.329831552489626e-06, "token_acc": 0.9622926093514329, "epoch": 0.7229629629629629, "step": 1220}, {"loss": 0.12777591943740846, "grad_norm": 0.9841185808181763, "learning_rate": 4.160697600131568e-06, "token_acc": 0.9612147822905233, "epoch": 0.7288888888888889, "step": 1230}, {"loss": 0.13893853425979613, "grad_norm": 1.4565831422805786, "learning_rate": 3.994061286868361e-06, "token_acc": 0.9622920517560074, "epoch": 0.7348148148148148, "step": 1240}, {"loss": 0.09945087432861328, "grad_norm": 1.1277369260787964, "learning_rate": 3.8299938878870215e-06, "token_acc": 0.965828013518588, "epoch": 0.7407407407407407, "step": 1250}, {"loss": 0.08901865482330322, "grad_norm": 1.1658375263214111, "learning_rate": 3.6685655795753836e-06, "token_acc": 0.9718995878606219, "epoch": 0.7466666666666667, "step": 1260}, {"loss": 0.12474504709243775, "grad_norm": 1.2467801570892334, "learning_rate": 3.50984540950562e-06, "token_acc": 0.9593131765584173, "epoch": 0.7525925925925926, "step": 1270}, {"loss": 0.12159136533737183, "grad_norm": 1.2965892553329468, "learning_rate": 3.3539012669005653e-06, "token_acc": 0.961352657004831, "epoch": 0.7585185185185185, "step": 1280}, {"loss": 0.1344360113143921, "grad_norm": 1.1689339876174927, "learning_rate": 3.2007998535955774e-06, "token_acc": 0.9594349873234336, "epoch": 0.7644444444444445, "step": 1290}, {"loss": 0.12788604497909545, "grad_norm": 0.7894589304924011, "learning_rate": 3.0506066555081683e-06, "token_acc": 0.963855421686747, "epoch": 0.7703703703703704, "step": 1300}, {"loss": 0.11962369680404664, "grad_norm": 1.2829697132110596, "learning_rate": 2.90338591462782e-06, "token_acc": 0.9604395604395605, "epoch": 0.7762962962962963, "step": 1310}, {"loss": 0.11098712682723999, "grad_norm": 1.1379469633102417, "learning_rate": 2.7592006015377937e-06, "token_acc": 0.9649507119386638, "epoch": 0.7822222222222223, "step": 1320}, {"loss": 0.13792314529418945, "grad_norm": 1.723992109298706, "learning_rate": 2.6181123884808056e-06, "token_acc": 0.9560761346998536, "epoch": 0.7881481481481482, "step": 1330}, {"loss": 0.10700693130493164, "grad_norm": 1.1304504871368408, "learning_rate": 2.480181622980009e-06, "token_acc": 0.9640314724615962, "epoch": 0.794074074074074, "step": 1340}, {"loss": 0.11214718818664551, "grad_norm": 1.3609181642532349, "learning_rate": 2.3454673020265973e-06, "token_acc": 0.967559411542814, "epoch": 0.8, "step": 1350}, {"loss": 0.09663894772529602, "grad_norm": 0.7761492133140564, "learning_rate": 2.2140270468450966e-06, "token_acc": 0.9720812182741116, "epoch": 0.8059259259259259, "step": 1360}, {"loss": 0.1209203839302063, "grad_norm": 1.143888235092163, "learning_rate": 2.0859170782470873e-06, "token_acc": 0.9637912673056444, "epoch": 0.8118518518518518, "step": 1370}, {"loss": 0.14124363660812378, "grad_norm": 1.0649224519729614, "learning_rate": 1.961192192583934e-06, "token_acc": 0.9554285714285714, "epoch": 0.8177777777777778, "step": 1380}, {"loss": 0.11149574518203735, "grad_norm": 1.3557066917419434, "learning_rate": 1.8399057383087859e-06, "token_acc": 0.9653537563822028, "epoch": 0.8237037037037037, "step": 1390}, {"loss": 0.1278609037399292, "grad_norm": 1.064666748046875, "learning_rate": 1.7221095931579091e-06, "token_acc": 0.9580903790087464, "epoch": 0.8296296296296296, "step": 1400}, {"loss": 0.1316068649291992, "grad_norm": 1.6276605129241943, "learning_rate": 1.6078541419610716e-06, "token_acc": 0.961738484398217, "epoch": 0.8355555555555556, "step": 1410}, {"loss": 0.12551895380020142, "grad_norm": 1.0021592378616333, "learning_rate": 1.4971882550904725e-06, "token_acc": 0.9635036496350365, "epoch": 0.8414814814814815, "step": 1420}, {"loss": 0.11337714195251465, "grad_norm": 1.2714834213256836, "learning_rate": 1.3901592675574915e-06, "token_acc": 0.9627518053971874, "epoch": 0.8474074074074074, "step": 1430}, {"loss": 0.1030318260192871, "grad_norm": 1.2086464166641235, "learning_rate": 1.286812958766106e-06, "token_acc": 0.9690611664295875, "epoch": 0.8533333333333334, "step": 1440}, {"loss": 0.1136628270149231, "grad_norm": 1.4665285348892212, "learning_rate": 1.1871935329317363e-06, "token_acc": 0.9621955652490004, "epoch": 0.8592592592592593, "step": 1450}, {"loss": 0.14109413623809813, "grad_norm": 1.4833930730819702, "learning_rate": 1.0913436001737953e-06, "token_acc": 0.9591619318181818, "epoch": 0.8651851851851852, "step": 1460}, {"loss": 0.13869184255599976, "grad_norm": 0.6605064868927002, "learning_rate": 9.993041582901208e-07, "token_acc": 0.9622367465504721, "epoch": 0.8711111111111111, "step": 1470}, {"loss": 0.15464030504226683, "grad_norm": 1.142251968383789, "learning_rate": 9.111145752210171e-07, "token_acc": 0.9590840840840841, "epoch": 0.8770370370370371, "step": 1480}, {"loss": 0.137708580493927, "grad_norm": 1.4246073961257935, "learning_rate": 8.268125722104569e-07, "token_acc": 0.9590773809523809, "epoch": 0.882962962962963, "step": 1490}, {"loss": 0.08925541639328002, "grad_norm": 1.4238859415054321, "learning_rate": 7.46434207671598e-07, "token_acc": 0.9747899159663865, "epoch": 0.8888888888888888, "step": 1500}, {"eval_loss": 0.1276273876428604, "eval_runtime": 229.1217, "eval_samples_per_second": 6.547, "eval_steps_per_second": 6.547, "eval_token_acc": 0.9623546851837403, "epoch": 0.8888888888888888, "step": 1500}, {"loss": 0.12536653280258178, "grad_norm": 1.1456782817840576, "learning_rate": 6.700138617635577e-07, "token_acc": 0.9648377125193199, "epoch": 0.8948148148148148, "step": 1510}, {"loss": 0.11909486055374145, "grad_norm": 0.5869998931884766, "learning_rate": 5.975842216860239e-07, "token_acc": 0.9651647103369936, "epoch": 0.9007407407407407, "step": 1520}, {"loss": 0.10322866439819336, "grad_norm": 0.8277629613876343, "learning_rate": 5.291762676979917e-07, "token_acc": 0.9698861549761293, "epoch": 0.9066666666666666, "step": 1530}, {"loss": 0.1228654146194458, "grad_norm": 1.0630172491073608, "learning_rate": 4.648192598666013e-07, "token_acc": 0.9670886075949368, "epoch": 0.9125925925925926, "step": 1540}, {"loss": 0.08263896107673645, "grad_norm": 0.8849966526031494, "learning_rate": 4.0454072555176195e-07, "token_acc": 0.9724354501046755, "epoch": 0.9185185185185185, "step": 1550}, {"loss": 0.10929735898971557, "grad_norm": 1.4644533395767212, "learning_rate": 3.4836644763190264e-07, "token_acc": 0.9660516605166052, "epoch": 0.9244444444444444, "step": 1560}, {"loss": 0.0930831789970398, "grad_norm": 1.3451666831970215, "learning_rate": 2.9632045347588566e-07, "token_acc": 0.967948717948718, "epoch": 0.9303703703703704, "step": 1570}, {"loss": 0.0964022159576416, "grad_norm": 0.6276125907897949, "learning_rate": 2.484250046658054e-07, "token_acc": 0.9702295552367288, "epoch": 0.9362962962962963, "step": 1580}, {"loss": 0.12160607576370239, "grad_norm": 0.964272141456604, "learning_rate": 2.0470058747505516e-07, "token_acc": 0.961283571677712, "epoch": 0.9422222222222222, "step": 1590}, {"loss": 0.11407674551010132, "grad_norm": 1.202038049697876, "learning_rate": 1.6516590410576628e-07, "token_acc": 0.9619465788510794, "epoch": 0.9481481481481482, "step": 1600}, {"loss": 0.12073925733566285, "grad_norm": 1.0892561674118042, "learning_rate": 1.2983786468932503e-07, "token_acc": 0.962109955423477, "epoch": 0.9540740740740741, "step": 1610}, {"loss": 0.10570030212402344, "grad_norm": 1.3103691339492798, "learning_rate": 9.873158005341943e-08, "token_acc": 0.9626497533474278, "epoch": 0.96, "step": 1620}, {"loss": 0.1048168420791626, "grad_norm": 0.9008719325065613, "learning_rate": 7.186035525870272e-08, "token_acc": 0.9678002894356006, "epoch": 0.965925925925926, "step": 1630}, {"loss": 0.16029913425445558, "grad_norm": 1.2709956169128418, "learning_rate": 4.9235683907833396e-08, "token_acc": 0.956964892412231, "epoch": 0.9718518518518519, "step": 1640}, {"loss": 0.10578294992446899, "grad_norm": 1.142215371131897, "learning_rate": 3.086724322932111e-08, "token_acc": 0.9671545876472688, "epoch": 0.9777777777777777, "step": 1650}, {"loss": 0.1220880389213562, "grad_norm": 1.015450119972229, "learning_rate": 1.6762889938303216e-08, "token_acc": 0.9671361502347418, "epoch": 0.9837037037037037, "step": 1660}, {"loss": 0.12359803915023804, "grad_norm": 1.1465100049972534, "learning_rate": 6.928656875994089e-09, "token_acc": 0.963089802130898, "epoch": 0.9896296296296296, "step": 1670}, {"loss": 0.10396100282669067, "grad_norm": 0.6673016548156738, "learning_rate": 1.3687504292692055e-09, "token_acc": 0.9718817591925017, "epoch": 0.9955555555555555, "step": 1680}, {"eval_loss": 0.12758992612361908, "eval_runtime": 231.1684, "eval_samples_per_second": 6.489, "eval_steps_per_second": 6.489, "eval_token_acc": 0.9622766638058828, "epoch": 1.0, "step": 1688}, {"train_runtime": 13328.4914, "train_samples_per_second": 2.026, "train_steps_per_second": 0.127, "total_flos": 2.929447543828032e+17, "train_loss": 0.14444038999306646, "epoch": 1.0, "step": 1688}], "memory": 28.71875}