ddz16 commited on
Commit
692dea9
·
verified ·
1 Parent(s): 6468fd8

Clean args.json: remove private paths, keep inference-essential fields only

Browse files
Files changed (1) hide show
  1. args.json +1 -11
args.json CHANGED
@@ -1,5 +1,4 @@
1
  {
2
- "output_dir": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837",
3
  "per_device_train_batch_size": 2,
4
  "num_train_epochs": 2.0,
5
  "max_steps": -1,
@@ -46,7 +45,6 @@
46
  "report_to": [
47
  "wandb"
48
  ],
49
- "run_name": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837",
50
  "project": "huggingface",
51
  "trackio_space_id": null,
52
  "trackio_bucket_id": null,
@@ -144,7 +142,6 @@
144
  "do_predict": false,
145
  "resume_from_checkpoint": null,
146
  "warmup_ratio": 0.05,
147
- "logging_dir": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837/runs",
148
  "local_rank": 0,
149
  "sortish_sampler": false,
150
  "predict_with_generate": false,
@@ -234,9 +231,6 @@
234
  "enable_thinking": null,
235
  "preserve_thinking": null,
236
  "add_non_thinking_prefix": true,
237
- "dataset": [
238
- "/group/40009/dazhaodu/ms-swift/camera_movement_sft/train_data/camera_movement_train_diverse_50k_en.jsonl"
239
- ],
240
  "val_dataset": [],
241
  "cached_dataset": [],
242
  "cached_val_dataset": [],
@@ -369,12 +363,8 @@
369
  "global_world_size": 8,
370
  "local_world_size": 8,
371
  "model_suffix": "Qwen3-VL-8B-Instruct",
372
- "model_info": "ModelInfo(model_type='qwen3_vl_vggt_direct', model_dir='/apdcephfs_gy2/share_303094921/hunyuan/yujiazhang/dazhaodu/hf/hub/models--Qwen--Qwen3-VL-8B-Instruct/snapshots/0c351dd01ed87e9c1b53cbc748cba10e6187ff3b', torch_dtype=torch.bfloat16, max_model_len=262144, quant_method=None, quant_bits=None, rope_scaling=None, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)",
373
- "model_meta": "ModelMeta(model_type='qwen3_vl_vggt_direct', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen3-VL-4B-Instruct', hf_model_id='Qwen/Qwen3-VL-4B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3-VL-8B-Instruct', hf_model_id='Qwen/Qwen3-VL-8B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], template='qwen3_vl', ignore_patterns=None, requires=None, tags=[])], loader=<class 'camdistill_plugin.VGGTDirectQwen3VLLoader'>, template=None, model_arch=None, mcore_model_type=None, architectures=['Qwen3VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=[], tags=[])",
374
- "model_dir": "/apdcephfs_gy2/share_303094921/hunyuan/yujiazhang/dazhaodu/hf/hub/models--Qwen--Qwen3-VL-8B-Instruct/snapshots/0c351dd01ed87e9c1b53cbc748cba10e6187ff3b",
375
  "template_meta": "QwenTemplateMeta(template_type='qwen3_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=<class 'swift.template.templates.qwen.Qwen3VLTemplate'>, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system=None, auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='<think>\\n', non_thinking_prefix='', history_thinking_prefix='')",
376
  "_val_dataset_exists": true,
377
  "hub": "<class 'swift.hub.hub.HFHub'>",
378
- "evaluation_strategy": "no",
379
- "training_args": "Seq2SeqTrainingArguments(output_dir='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837', per_device_train_batch_size=2, num_train_epochs=2.0, max_steps=-1, learning_rate=1.5e-05, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_steps=0.05, optim=<OptimizerNames.ADAMW_TORCH_FUSED: 'adamw_torch_fused'>, optim_args=None, weight_decay=0.01, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, optim_target_modules=None, gradient_accumulation_steps=4, average_tokens_across_devices=None, max_grad_norm=1.0, label_smoothing_factor=0.0, bf16=True, fp16=False, bf16_full_eval=False, fp16_full_eval=False, tf32=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, use_liger_kernel=False, liger_kernel_config=None, use_cache=False, neftune_noise_alpha=None, torch_empty_cache_steps=None, auto_find_batch_size=False, logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_steps=10, logging_first_step=True, log_on_each_node=True, logging_nan_inf_filter=True, include_num_input_tokens_seen=None, log_level='passive', log_level_replica='warning', disable_tqdm=False, report_to=['wandb'], run_name='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837', project='huggingface', trackio_space_id=None, trackio_bucket_id=None, trackio_static_space_id=None, eval_strategy=<IntervalStrategy.NO: 'no'>, eval_steps=None, eval_delay=0, per_device_eval_batch_size=2, prediction_loss_only=False, eval_on_start=False, eval_do_concat_batches=True, eval_use_gather_object=False, eval_accumulation_steps=None, include_for_metrics=[], batch_eval_metrics=False, save_only_model=False, save_strategy=<SaveStrategy.EPOCH: 'epoch'>, save_steps=500, save_on_each_node=False, save_total_limit=1, enable_jit_checkpoint=False, push_to_hub=False, hub_token=None, hub_private_repo=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_always_push=False, hub_revision=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, restore_callback_states_from_checkpoint=False, full_determinism=False, seed=42, data_seed=42, use_cpu=False, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, dataloader_drop_last=False, dataloader_num_workers=8, dataloader_pin_memory=True, dataloader_persistent_workers=False, dataloader_prefetch_factor=2, remove_unused_columns=False, label_names=None, train_sampling_strategy='random', length_column_name='length', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, ddp_static_graph=None, ddp_backend=None, ddp_timeout=18000000, fsdp=[], fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, debug=[], skip_memory_metrics=True, do_train=False, do_eval=False, do_predict=False, resume_from_checkpoint=None, warmup_ratio=0.05, logging_dir='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837/runs', local_rank=0, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=False, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, group_by_length=False, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='full', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)"
380
  }
 
1
  {
 
2
  "per_device_train_batch_size": 2,
3
  "num_train_epochs": 2.0,
4
  "max_steps": -1,
 
45
  "report_to": [
46
  "wandb"
47
  ],
 
48
  "project": "huggingface",
49
  "trackio_space_id": null,
50
  "trackio_bucket_id": null,
 
142
  "do_predict": false,
143
  "resume_from_checkpoint": null,
144
  "warmup_ratio": 0.05,
 
145
  "local_rank": 0,
146
  "sortish_sampler": false,
147
  "predict_with_generate": false,
 
231
  "enable_thinking": null,
232
  "preserve_thinking": null,
233
  "add_non_thinking_prefix": true,
 
 
 
234
  "val_dataset": [],
235
  "cached_dataset": [],
236
  "cached_val_dataset": [],
 
363
  "global_world_size": 8,
364
  "local_world_size": 8,
365
  "model_suffix": "Qwen3-VL-8B-Instruct",
 
 
 
366
  "template_meta": "QwenTemplateMeta(template_type='qwen3_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=<class 'swift.template.templates.qwen.Qwen3VLTemplate'>, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system=None, auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='<think>\\n', non_thinking_prefix='', history_thinking_prefix='')",
367
  "_val_dataset_exists": true,
368
  "hub": "<class 'swift.hub.hub.HFHub'>",
369
+ "evaluation_strategy": "no"
 
370
  }