Video-Text-to-Text
Transformers
Safetensors
qwen3_vl
image-text-to-text
camera-movement
video-understanding
qwen3-vl
vggt-injection
Instructions to use ddz16/CamInject-8B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use ddz16/CamInject-8B with Transformers:
# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("ddz16/CamInject-8B") model = AutoModelForMultimodalLM.from_pretrained("ddz16/CamInject-8B", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Clean args.json: remove private paths, keep inference-essential fields only
Browse files
args.json
CHANGED
|
@@ -1,5 +1,4 @@
|
|
| 1 |
{
|
| 2 |
-
"output_dir": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837",
|
| 3 |
"per_device_train_batch_size": 2,
|
| 4 |
"num_train_epochs": 2.0,
|
| 5 |
"max_steps": -1,
|
|
@@ -46,7 +45,6 @@
|
|
| 46 |
"report_to": [
|
| 47 |
"wandb"
|
| 48 |
],
|
| 49 |
-
"run_name": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837",
|
| 50 |
"project": "huggingface",
|
| 51 |
"trackio_space_id": null,
|
| 52 |
"trackio_bucket_id": null,
|
|
@@ -144,7 +142,6 @@
|
|
| 144 |
"do_predict": false,
|
| 145 |
"resume_from_checkpoint": null,
|
| 146 |
"warmup_ratio": 0.05,
|
| 147 |
-
"logging_dir": "/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837/runs",
|
| 148 |
"local_rank": 0,
|
| 149 |
"sortish_sampler": false,
|
| 150 |
"predict_with_generate": false,
|
|
@@ -234,9 +231,6 @@
|
|
| 234 |
"enable_thinking": null,
|
| 235 |
"preserve_thinking": null,
|
| 236 |
"add_non_thinking_prefix": true,
|
| 237 |
-
"dataset": [
|
| 238 |
-
"/group/40009/dazhaodu/ms-swift/camera_movement_sft/train_data/camera_movement_train_diverse_50k_en.jsonl"
|
| 239 |
-
],
|
| 240 |
"val_dataset": [],
|
| 241 |
"cached_dataset": [],
|
| 242 |
"cached_val_dataset": [],
|
|
@@ -369,12 +363,8 @@
|
|
| 369 |
"global_world_size": 8,
|
| 370 |
"local_world_size": 8,
|
| 371 |
"model_suffix": "Qwen3-VL-8B-Instruct",
|
| 372 |
-
"model_info": "ModelInfo(model_type='qwen3_vl_vggt_direct', model_dir='/apdcephfs_gy2/share_303094921/hunyuan/yujiazhang/dazhaodu/hf/hub/models--Qwen--Qwen3-VL-8B-Instruct/snapshots/0c351dd01ed87e9c1b53cbc748cba10e6187ff3b', torch_dtype=torch.bfloat16, max_model_len=262144, quant_method=None, quant_bits=None, rope_scaling=None, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)",
|
| 373 |
-
"model_meta": "ModelMeta(model_type='qwen3_vl_vggt_direct', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen3-VL-4B-Instruct', hf_model_id='Qwen/Qwen3-VL-4B-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3-VL-8B-Instruct', hf_model_id='Qwen/Qwen3-VL-8B-Instruct', model_path=None, ms_revision=None, hf_revision=None)], template='qwen3_vl', ignore_patterns=None, requires=None, tags=[])], loader=<class 'camdistill_plugin.VGGTDirectQwen3VLLoader'>, template=None, model_arch=None, mcore_model_type=None, architectures=['Qwen3VLForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=[], tags=[])",
|
| 374 |
-
"model_dir": "/apdcephfs_gy2/share_303094921/hunyuan/yujiazhang/dazhaodu/hf/hub/models--Qwen--Qwen3-VL-8B-Instruct/snapshots/0c351dd01ed87e9c1b53cbc748cba10e6187ff3b",
|
| 375 |
"template_meta": "QwenTemplateMeta(template_type='qwen3_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=<class 'swift.template.templates.qwen.Qwen3VLTemplate'>, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system=None, auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='<think>\\n', non_thinking_prefix='', history_thinking_prefix='')",
|
| 376 |
"_val_dataset_exists": true,
|
| 377 |
"hub": "<class 'swift.hub.hub.HFHub'>",
|
| 378 |
-
"evaluation_strategy": "no"
|
| 379 |
-
"training_args": "Seq2SeqTrainingArguments(output_dir='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837', per_device_train_batch_size=2, num_train_epochs=2.0, max_steps=-1, learning_rate=1.5e-05, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_steps=0.05, optim=<OptimizerNames.ADAMW_TORCH_FUSED: 'adamw_torch_fused'>, optim_args=None, weight_decay=0.01, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, optim_target_modules=None, gradient_accumulation_steps=4, average_tokens_across_devices=None, max_grad_norm=1.0, label_smoothing_factor=0.0, bf16=True, fp16=False, bf16_full_eval=False, fp16_full_eval=False, tf32=None, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, use_liger_kernel=False, liger_kernel_config=None, use_cache=False, neftune_noise_alpha=None, torch_empty_cache_steps=None, auto_find_batch_size=False, logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_steps=10, logging_first_step=True, log_on_each_node=True, logging_nan_inf_filter=True, include_num_input_tokens_seen=None, log_level='passive', log_level_replica='warning', disable_tqdm=False, report_to=['wandb'], run_name='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837', project='huggingface', trackio_space_id=None, trackio_bucket_id=None, trackio_static_space_id=None, eval_strategy=<IntervalStrategy.NO: 'no'>, eval_steps=None, eval_delay=0, per_device_eval_batch_size=2, prediction_loss_only=False, eval_on_start=False, eval_do_concat_batches=True, eval_use_gather_object=False, eval_accumulation_steps=None, include_for_metrics=[], batch_eval_metrics=False, save_only_model=False, save_strategy=<SaveStrategy.EPOCH: 'epoch'>, save_steps=500, save_on_each_node=False, save_total_limit=1, enable_jit_checkpoint=False, push_to_hub=False, hub_token=None, hub_private_repo=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_always_push=False, hub_revision=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, restore_callback_states_from_checkpoint=False, full_determinism=False, seed=42, data_seed=42, use_cpu=False, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, dataloader_drop_last=False, dataloader_num_workers=8, dataloader_pin_memory=True, dataloader_persistent_workers=False, dataloader_prefetch_factor=2, remove_unused_columns=False, label_names=None, train_sampling_strategy='random', length_column_name='length', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, ddp_static_graph=None, ddp_backend=None, ddp_timeout=18000000, fsdp=[], fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, debug=[], skip_memory_metrics=True, do_train=False, do_eval=False, do_predict=False, resume_from_checkpoint=None, warmup_ratio=0.05, logging_dir='/group/40009/dazhaodu/ms-swift/output/camera_sft_qwen3vl_8b_vggt_direct/v0-20260708-145837/runs', local_rank=0, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=False, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, group_by_length=False, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='full', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)"
|
| 380 |
}
|
|
|
|
| 1 |
{
|
|
|
|
| 2 |
"per_device_train_batch_size": 2,
|
| 3 |
"num_train_epochs": 2.0,
|
| 4 |
"max_steps": -1,
|
|
|
|
| 45 |
"report_to": [
|
| 46 |
"wandb"
|
| 47 |
],
|
|
|
|
| 48 |
"project": "huggingface",
|
| 49 |
"trackio_space_id": null,
|
| 50 |
"trackio_bucket_id": null,
|
|
|
|
| 142 |
"do_predict": false,
|
| 143 |
"resume_from_checkpoint": null,
|
| 144 |
"warmup_ratio": 0.05,
|
|
|
|
| 145 |
"local_rank": 0,
|
| 146 |
"sortish_sampler": false,
|
| 147 |
"predict_with_generate": false,
|
|
|
|
| 231 |
"enable_thinking": null,
|
| 232 |
"preserve_thinking": null,
|
| 233 |
"add_non_thinking_prefix": true,
|
|
|
|
|
|
|
|
|
|
| 234 |
"val_dataset": [],
|
| 235 |
"cached_dataset": [],
|
| 236 |
"cached_val_dataset": [],
|
|
|
|
| 363 |
"global_world_size": 8,
|
| 364 |
"local_world_size": 8,
|
| 365 |
"model_suffix": "Qwen3-VL-8B-Instruct",
|
|
|
|
|
|
|
|
|
|
| 366 |
"template_meta": "QwenTemplateMeta(template_type='qwen3_vl', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=<class 'swift.template.templates.qwen.Qwen3VLTemplate'>, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system=None, auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='hermes', is_thinking=False, thinking_prefix='<think>\\n', non_thinking_prefix='', history_thinking_prefix='')",
|
| 367 |
"_val_dataset_exists": true,
|
| 368 |
"hub": "<class 'swift.hub.hub.HFHub'>",
|
| 369 |
+
"evaluation_strategy": "no"
|
|
|
|
| 370 |
}
|