PEFT
Safetensors
chen commited on
Commit
a30ea6e
·
verified ·
1 Parent(s): bcf5b7d

Upload folder using huggingface_hub

Browse files
adapter_config.json CHANGED
@@ -23,7 +23,7 @@
23
  "r": 8,
24
  "rank_pattern": {},
25
  "revision": null,
26
- "target_modules": "(?!^(multi_modal_projector))^(language_model|vision_model).*\\.(gate_proj|k_proj|v_proj|q_proj|down_proj|o_proj|up_proj|k_proj|q_proj|v_proj|fc1|o_proj|fc2)$",
27
  "task_type": "CAUSAL_LM",
28
  "trainable_token_indices": null,
29
  "use_dora": false,
 
23
  "r": 8,
24
  "rank_pattern": {},
25
  "revision": null,
26
+ "target_modules": "^(language_model).*\\.(k_proj|q_proj|gate_proj|v_proj|o_proj|down_proj|up_proj)$",
27
  "task_type": "CAUSAL_LM",
28
  "trainable_token_indices": null,
29
  "use_dora": false,
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:29da1679493dc132ba519d28993e9bbb6b8ab3a1d78e9ce4dde127c7297e4f85
3
- size 67330312
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f4fad12160d36d5d83e42ef1c395ceedd61fb9f6086f97954c644477e3d0dd3f
3
+ size 52511776
args.json CHANGED
@@ -12,9 +12,9 @@
12
  "max_memory": {},
13
  "local_repo_path": null,
14
  "template": "llama3_2_vision",
15
- "system": null,
16
- "max_length": 8092,
17
- "truncation_strategy": "left",
18
  "max_pixels": null,
19
  "agent_template": null,
20
  "norm_bbox": null,
@@ -25,12 +25,12 @@
25
  "use_chat_template": true,
26
  "template_backend": "swift",
27
  "dataset": [
28
- "new_task1_nothink_respone_full.json"
29
  ],
30
  "val_dataset": [],
31
  "split_dataset_ratio": 0.01,
32
- "data_seed": 123,
33
- "dataset_num_proc": 1,
34
  "dataset_shuffle": true,
35
  "val_dataset_shuffle": false,
36
  "streaming": false,
@@ -41,7 +41,7 @@
41
  "download_mode": "reuse_dataset_if_exists",
42
  "columns": {},
43
  "strict": false,
44
- "remove_unused_columns": false,
45
  "model_name": [
46
  null,
47
  null
@@ -59,10 +59,10 @@
59
  "bnb_4bit_use_double_quant": true,
60
  "bnb_4bit_quant_storage": null,
61
  "max_new_tokens": 64,
62
- "temperature": 1.0,
63
  "top_k": 50,
64
  "top_p": 0.9,
65
- "repetition_penalty": 1.1,
66
  "num_beams": 1,
67
  "stream": false,
68
  "stop_words": [],
@@ -74,10 +74,8 @@
74
  "tuner_backend": "peft",
75
  "train_type": "lora",
76
  "adapters": [],
77
- "external_plugins": [
78
- "/data/kdd/crag/cjz/ms-swift/examples/train/grpo/plugin/plugin.py"
79
- ],
80
- "seed": 123,
81
  "model_kwargs": {},
82
  "load_args": false,
83
  "load_data_args": false,
@@ -86,18 +84,18 @@
86
  "custom_register_path": [],
87
  "ignore_args_error": false,
88
  "use_swift_lora": false,
89
- "output_dir": "/data2/kdd/crag/cjz/agents/output/response/v67-20250515-170509",
90
  "overwrite_output_dir": false,
91
  "do_train": false,
92
  "do_eval": false,
93
  "do_predict": false,
94
  "eval_strategy": "steps",
95
  "prediction_loss_only": false,
96
- "per_device_train_batch_size": 8,
97
- "per_device_eval_batch_size": 8,
98
  "per_gpu_train_batch_size": null,
99
  "per_gpu_eval_batch_size": null,
100
- "gradient_accumulation_steps": 16,
101
  "eval_accumulation_steps": null,
102
  "eval_delay": 0,
103
  "torch_empty_cache_steps": null,
@@ -106,8 +104,8 @@
106
  "adam_beta1": 0.9,
107
  "adam_beta2": 0.95,
108
  "adam_epsilon": 1e-08,
109
- "max_grad_norm": 0.5,
110
- "num_train_epochs": 4.0,
111
  "max_steps": -1,
112
  "lr_scheduler_type": "cosine",
113
  "lr_scheduler_kwargs": null,
@@ -116,13 +114,13 @@
116
  "log_level": "passive",
117
  "log_level_replica": "warning",
118
  "log_on_each_node": true,
119
- "logging_dir": "/data2/kdd/crag/cjz/agents/output/response/v67-20250515-170509/runs",
120
  "logging_strategy": "steps",
121
  "logging_first_step": true,
122
  "logging_steps": 1,
123
  "logging_nan_inf_filter": true,
124
  "save_strategy": "steps",
125
- "save_steps": 5.0,
126
  "save_total_limit": null,
127
  "save_safetensors": true,
128
  "save_on_each_node": false,
@@ -145,8 +143,8 @@
145
  "tpu_num_cores": null,
146
  "tpu_metrics_debug": false,
147
  "debug": null,
148
- "dataloader_drop_last": true,
149
- "eval_steps": 500.0,
150
  "dataloader_num_workers": 4,
151
  "dataloader_prefetch_factor": null,
152
  "past_index": -1,
@@ -154,8 +152,8 @@
154
  "disable_tqdm": null,
155
  "label_names": null,
156
  "load_best_model_at_end": false,
157
- "metric_for_best_model": "reward",
158
- "greater_is_better": true,
159
  "ignore_data_skip": false,
160
  "fsdp": "",
161
  "fsdp_min_num_params": 0,
@@ -178,26 +176,17 @@
178
  "enabled": "auto"
179
  },
180
  "zero_optimization": {
181
- "stage": 3,
182
  "offload_optimizer": {
183
  "device": "none",
184
  "pin_memory": true
185
  },
186
- "offload_param": {
187
- "device": "none",
188
- "pin_memory": true
189
- },
190
  "overlap_comm": false,
191
- "contiguous_gradients": true,
192
- "sub_group_size": 1000000000.0,
193
- "reduce_bucket_size": "auto",
194
- "zero_quantized_weights": false,
195
- "zero_quantized_gradients": false,
196
- "stage3_prefetch_bucket_size": "auto",
197
- "stage3_param_persistence_threshold": "auto",
198
- "stage3_max_live_parameters": 1000000000.0,
199
- "stage3_max_reuse_distance": 1000000000.0,
200
- "stage3_gather_16bit_weights_on_model_save": true
201
  },
202
  "gradient_accumulation_steps": "auto",
203
  "gradient_clipping": "auto",
@@ -223,7 +212,7 @@
223
  "skip_memory_metrics": true,
224
  "use_legacy_prediction_loop": false,
225
  "push_to_hub": false,
226
- "resume_from_checkpoint": "/data2/kdd/crag/cjz/agents/output/response/v64-20250515-000005/checkpoint-245",
227
  "hub_model_id": null,
228
  "hub_strategy": "every_save",
229
  "hub_private_repo": null,
@@ -272,12 +261,13 @@
272
  "eval_datasets_args": null,
273
  "eval_generation_config": null,
274
  "freeze_parameters": [
 
275
  "multi_modal_projector"
276
  ],
277
  "freeze_parameters_ratio": 0.0,
278
  "trainable_parameters": [],
279
  "freeze_llm": false,
280
- "freeze_vit": false,
281
  "freeze_aligner": true,
282
  "target_modules": [
283
  "all-linear"
@@ -353,7 +343,7 @@
353
  "create_checkpoint_symlink": false,
354
  "packing": false,
355
  "lazy_tokenize": true,
356
- "loss_type": "grpo",
357
  "optimizer": null,
358
  "metric": null,
359
  "zero_hpz_partition_size": null,
@@ -375,14 +365,14 @@
375
  "response_length": 512,
376
  "missing_eos_penalty": null,
377
  "epsilon": 0.2,
378
- "epsilon_high": 0.28,
379
  "num_infer_workers": 1,
380
  "vllm_device": [
381
  "auto"
382
  ],
383
- "vllm_gpu_memory_utilization": 0.8,
384
- "vllm_max_model_len": 8192,
385
- "vllm_max_num_seqs": 8,
386
  "vllm_enforce_eager": false,
387
  "vllm_limit_mm_per_prompt": null,
388
  "vllm_enable_prefix_caching": true,
@@ -409,27 +399,25 @@
409
  "max_resample_times": 3,
410
  "overlong_filter": false,
411
  "soft_max_length": null,
412
- "soft_cache_length": 20,
413
  "scale_rewards": true,
414
  "wandb_log_unique_prompts": null,
415
  "vllm_server_host": null,
416
  "vllm_server_port": 8000,
417
  "vllm_server_timeout": 240.0,
418
  "num_generations": 8,
419
- "max_completion_length": 50,
420
  "ds3_gather_for_generation": true,
421
- "reward_funcs": [
422
- "Response_no_think_reward_1"
423
- ],
424
  "reward_weights": null,
425
- "log_completions": true,
426
- "use_vllm": true,
427
- "num_iterations": 2,
428
- "rlhf_type": "grpo",
429
  "ref_model": null,
430
  "ref_model_type": null,
431
  "ref_model_revision": null,
432
- "beta": 0.01,
433
  "label_smoothing": 0,
434
  "rpo_alpha": 1.0,
435
  "cpo_alpha": 1.0,
@@ -442,9 +430,9 @@
442
  "local_world_size": 1,
443
  "model_suffix": "Llama-3.2-11B-Vision-Instruct",
444
  "model_info": "ModelInfo(model_type='llama3_2_vision', model_dir='/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct', torch_dtype=torch.bfloat16, max_model_len=131072, quant_method=None, quant_bits=None, rope_scaling={'factor': 8.0, 'high_freq_factor': 4.0, 'low_freq_factor': 1.0, 'original_max_position_embeddings': 8192, 'rope_type': 'llama3'}, config=None, task_type='causal_lm', num_labels=None)",
445
- "model_meta": "ModelMeta(model_type='llama3_2_vision', model_groups=[ModelGroup(models=[Model(ms_model_id='LLM-Research/Llama-3.2-11B-Vision-Instruct', hf_model_id='meta-llama/Llama-3.2-11B-Vision-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-90B-Vision-Instruct', hf_model_id='meta-llama/Llama-3.2-90B-Vision-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-11B-Vision', hf_model_id='meta-llama/Llama-3.2-11B-Vision', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-90B-Vision', hf_model_id='meta-llama/Llama-3.2-90B-Vision', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='llama3_2_vision', get_function=<function get_model_tokenizer_llama3_2_vision at 0x763e328dbe20>, model_arch='llama3_2_vision', architectures=['MllamaForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.45'], tags=[])",
446
  "model_dir": "/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct",
447
  "hub": "<class 'swift.hub.hub.MSHub'>",
448
  "evaluation_strategy": "steps",
449
- "training_args": "GRPOConfig(output_dir='/data2/kdd/crag/cjz/agents/output/response/v67-20250515-170509', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=<IntervalStrategy.STEPS: 'steps'>, prediction_loss_only=False, per_device_train_batch_size=8, per_device_eval_batch_size=8, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=16, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=0.0002, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=0.5, num_train_epochs=4.0, max_steps=-1, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_ratio=0.05, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/data2/kdd/crag/cjz/agents/output/response/v67-20250515-170509/runs', logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=<SaveStrategy.STEPS: 'steps'>, save_steps=5, save_total_limit=None, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=123, data_seed=123, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=True, eval_steps=500, dataloader_num_workers=4, dataloader_prefetch_factor=10, past_index=-1, run_name='/data2/kdd/crag/cjz/agents/output/response/v67-20250515-170509', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='reward', greater_is_better=True, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, tp_size=0, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 3, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'offload_param': {'device': 'none', 'pin_memory': True}, 'overlap_comm': False, 'contiguous_gradients': True, 'sub_group_size': 1000000000.0, 'reduce_bucket_size': 'auto', 'zero_quantized_weights': False, 'zero_quantized_gradients': False, 'stage3_prefetch_bucket_size': 0, 'stage3_param_persistence_threshold': 'auto', 'stage3_max_live_parameters': 1000000000.0, 'stage3_max_reuse_distance': 1000000000.0, 'stage3_gather_16bit_weights_on_model_save': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=<OptimizerNames.ADAMW_TORCH: 'adamw_torch'>, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint='/data2/kdd/crag/cjz/agents/output/response/v64-20250515-000005/checkpoint-245', hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_token=None, hub_private_repo=None, hub_always_push=False, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=1800, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, eval_use_gather_object=False, average_tokens_across_devices=None, model_init_kwargs=None, disable_dropout=False, max_prompt_length=512, num_generations=8, max_completion_length=50, ds3_gather_for_generation=True, shuffle_dataset=True, temperature=1.0, top_p=0.9, top_k=50, min_p=None, repetition_penalty=1.1, cache_implementation=None, use_vllm=True, vllm_server_host=None, vllm_server_port=8000, vllm_server_timeout=240.0, vllm_guided_decoding_regex=None, beta=0.01, num_iterations=2, epsilon=0.2, epsilon_high=0.28, reward_weights=None, scale_rewards=True, loss_type='grpo', mask_truncated_completions=False, sync_ref_model=False, ref_model_mixup_alpha=0.6, ref_model_sync_steps=512, use_liger_loss=False, log_completions=True, num_completions_to_print=None, wandb_log_unique_prompts=None, vllm_device=['auto'], vllm_gpu_memory_utilization=0.8, vllm_dtype=None, vllm_max_model_len=8192, vllm_enable_prefix_caching=True, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, metric_warmup_step=0, fsdp_num=1, acc_steps=1, eval_use_evalscope=False, eval_datasets=[], eval_limit=None, eval_datasets_args=None, eval_generation_config=None, train_type='lora', optimizer=None, local_repo_path=None, galore_config=None, num_infer_workers=1, vllm_max_num_seqs=8, vllm_enforce_eager=False, vllm_limit_mm_per_prompt={}, cosine_min_len_value_wrong=-0.5, cosine_max_len_value_wrong=0.0, cosine_min_len_value_correct=1.0, cosine_max_len_value_correct=0.5, cosine_max_len=50, repetition_n_grams=3, repetition_max_penalty=-1.0, use_lmdeploy=False, lmdeploy_device='auto', lmdeploy_session_len=None, lmdeploy_cache_max_entry_count=0.8, async_generate=False, tensor_parallel_size=1, sleep_level=0, move_model_batches=None, offload_optimizer=False, offload_model=False, gc_collect_after_offload=False, multi_turn_func=None, dynamic_sample=False, max_resample_times=3, overlong_filter=False, soft_max_length=None, soft_cache_length=20, dataset_shuffle=True, stop_words=[])"
450
  }
 
12
  "max_memory": {},
13
  "local_repo_path": null,
14
  "template": "llama3_2_vision",
15
+ "system": "You are a helpful assistant that truthfully answers user questions about the provided image. Keep your response concise and to the point. Don't explain your answer. If you don't guarantee that the answer is completely correct, output 'I don't know.'",
16
+ "max_length": 2048,
17
+ "truncation_strategy": "delete",
18
  "max_pixels": null,
19
  "agent_template": null,
20
  "norm_bbox": null,
 
25
  "use_chat_template": true,
26
  "template_backend": "swift",
27
  "dataset": [
28
+ "task1_dpo_phase2_0528.json"
29
  ],
30
  "val_dataset": [],
31
  "split_dataset_ratio": 0.01,
32
+ "data_seed": 42,
33
+ "dataset_num_proc": 4,
34
  "dataset_shuffle": true,
35
  "val_dataset_shuffle": false,
36
  "streaming": false,
 
41
  "download_mode": "reuse_dataset_if_exists",
42
  "columns": {},
43
  "strict": false,
44
+ "remove_unused_columns": true,
45
  "model_name": [
46
  null,
47
  null
 
59
  "bnb_4bit_use_double_quant": true,
60
  "bnb_4bit_quant_storage": null,
61
  "max_new_tokens": 64,
62
+ "temperature": 0.9,
63
  "top_k": 50,
64
  "top_p": 0.9,
65
+ "repetition_penalty": 1.0,
66
  "num_beams": 1,
67
  "stream": false,
68
  "stop_words": [],
 
74
  "tuner_backend": "peft",
75
  "train_type": "lora",
76
  "adapters": [],
77
+ "external_plugins": [],
78
+ "seed": 42,
 
 
79
  "model_kwargs": {},
80
  "load_args": false,
81
  "load_data_args": false,
 
84
  "custom_register_path": [],
85
  "ignore_args_error": false,
86
  "use_swift_lora": false,
87
+ "output_dir": "/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105",
88
  "overwrite_output_dir": false,
89
  "do_train": false,
90
  "do_eval": false,
91
  "do_predict": false,
92
  "eval_strategy": "steps",
93
  "prediction_loss_only": false,
94
+ "per_device_train_batch_size": 2,
95
+ "per_device_eval_batch_size": 2,
96
  "per_gpu_train_batch_size": null,
97
  "per_gpu_eval_batch_size": null,
98
+ "gradient_accumulation_steps": 8,
99
  "eval_accumulation_steps": null,
100
  "eval_delay": 0,
101
  "torch_empty_cache_steps": null,
 
104
  "adam_beta1": 0.9,
105
  "adam_beta2": 0.95,
106
  "adam_epsilon": 1e-08,
107
+ "max_grad_norm": 1.0,
108
+ "num_train_epochs": 2.0,
109
  "max_steps": -1,
110
  "lr_scheduler_type": "cosine",
111
  "lr_scheduler_kwargs": null,
 
114
  "log_level": "passive",
115
  "log_level_replica": "warning",
116
  "log_on_each_node": true,
117
+ "logging_dir": "/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105/runs",
118
  "logging_strategy": "steps",
119
  "logging_first_step": true,
120
  "logging_steps": 1,
121
  "logging_nan_inf_filter": true,
122
  "save_strategy": "steps",
123
+ "save_steps": 50.0,
124
  "save_total_limit": null,
125
  "save_safetensors": true,
126
  "save_on_each_node": false,
 
143
  "tpu_num_cores": null,
144
  "tpu_metrics_debug": false,
145
  "debug": null,
146
+ "dataloader_drop_last": false,
147
+ "eval_steps": 300.0,
148
  "dataloader_num_workers": 4,
149
  "dataloader_prefetch_factor": null,
150
  "past_index": -1,
 
152
  "disable_tqdm": null,
153
  "label_names": null,
154
  "load_best_model_at_end": false,
155
+ "metric_for_best_model": "loss",
156
+ "greater_is_better": false,
157
  "ignore_data_skip": false,
158
  "fsdp": "",
159
  "fsdp_min_num_params": 0,
 
176
  "enabled": "auto"
177
  },
178
  "zero_optimization": {
179
+ "stage": 2,
180
  "offload_optimizer": {
181
  "device": "none",
182
  "pin_memory": true
183
  },
184
+ "allgather_partitions": true,
185
+ "allgather_bucket_size": 200000000.0,
 
 
186
  "overlap_comm": false,
187
+ "reduce_scatter": true,
188
+ "reduce_bucket_size": 200000000.0,
189
+ "contiguous_gradients": true
 
 
 
 
 
 
 
190
  },
191
  "gradient_accumulation_steps": "auto",
192
  "gradient_clipping": "auto",
 
212
  "skip_memory_metrics": true,
213
  "use_legacy_prediction_loop": false,
214
  "push_to_hub": false,
215
+ "resume_from_checkpoint": null,
216
  "hub_model_id": null,
217
  "hub_strategy": "every_save",
218
  "hub_private_repo": null,
 
261
  "eval_datasets_args": null,
262
  "eval_generation_config": null,
263
  "freeze_parameters": [
264
+ "vision_model",
265
  "multi_modal_projector"
266
  ],
267
  "freeze_parameters_ratio": 0.0,
268
  "trainable_parameters": [],
269
  "freeze_llm": false,
270
+ "freeze_vit": true,
271
  "freeze_aligner": true,
272
  "target_modules": [
273
  "all-linear"
 
343
  "create_checkpoint_symlink": false,
344
  "packing": false,
345
  "lazy_tokenize": true,
346
+ "loss_type": "sigmoid",
347
  "optimizer": null,
348
  "metric": null,
349
  "zero_hpz_partition_size": null,
 
365
  "response_length": 512,
366
  "missing_eos_penalty": null,
367
  "epsilon": 0.2,
368
+ "epsilon_high": null,
369
  "num_infer_workers": 1,
370
  "vllm_device": [
371
  "auto"
372
  ],
373
+ "vllm_gpu_memory_utilization": 0.9,
374
+ "vllm_max_model_len": null,
375
+ "vllm_max_num_seqs": 256,
376
  "vllm_enforce_eager": false,
377
  "vllm_limit_mm_per_prompt": null,
378
  "vllm_enable_prefix_caching": true,
 
399
  "max_resample_times": 3,
400
  "overlong_filter": false,
401
  "soft_max_length": null,
402
+ "soft_cache_length": null,
403
  "scale_rewards": true,
404
  "wandb_log_unique_prompts": null,
405
  "vllm_server_host": null,
406
  "vllm_server_port": 8000,
407
  "vllm_server_timeout": 240.0,
408
  "num_generations": 8,
409
+ "max_completion_length": 512,
410
  "ds3_gather_for_generation": true,
411
+ "reward_funcs": [],
 
 
412
  "reward_weights": null,
413
+ "log_completions": false,
414
+ "use_vllm": false,
415
+ "num_iterations": 1,
416
+ "rlhf_type": "dpo",
417
  "ref_model": null,
418
  "ref_model_type": null,
419
  "ref_model_revision": null,
420
+ "beta": 0.1,
421
  "label_smoothing": 0,
422
  "rpo_alpha": 1.0,
423
  "cpo_alpha": 1.0,
 
430
  "local_world_size": 1,
431
  "model_suffix": "Llama-3.2-11B-Vision-Instruct",
432
  "model_info": "ModelInfo(model_type='llama3_2_vision', model_dir='/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct', torch_dtype=torch.bfloat16, max_model_len=131072, quant_method=None, quant_bits=None, rope_scaling={'factor': 8.0, 'high_freq_factor': 4.0, 'low_freq_factor': 1.0, 'original_max_position_embeddings': 8192, 'rope_type': 'llama3'}, config=None, task_type='causal_lm', num_labels=None)",
433
+ "model_meta": "ModelMeta(model_type='llama3_2_vision', model_groups=[ModelGroup(models=[Model(ms_model_id='LLM-Research/Llama-3.2-11B-Vision-Instruct', hf_model_id='meta-llama/Llama-3.2-11B-Vision-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-90B-Vision-Instruct', hf_model_id='meta-llama/Llama-3.2-90B-Vision-Instruct', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-11B-Vision', hf_model_id='meta-llama/Llama-3.2-11B-Vision', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='LLM-Research/Llama-3.2-90B-Vision', hf_model_id='meta-llama/Llama-3.2-90B-Vision', model_path=None, ms_revision=None, hf_revision=None)], ignore_patterns=None, requires=None, tags=[])], template='llama3_2_vision', get_function=<function get_model_tokenizer_llama3_2_vision at 0x776c83836c20>, model_arch='llama3_2_vision', architectures=['MllamaForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=4.45'], tags=[])",
434
  "model_dir": "/data1/chenjiazun/LLM/Llama-3.2-11B-Vision-Instruct",
435
  "hub": "<class 'swift.hub.hub.MSHub'>",
436
  "evaluation_strategy": "steps",
437
+ "training_args": "DPOConfig(output_dir='/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105', overwrite_output_dir=False, do_train=False, do_eval=True, do_predict=False, eval_strategy=<IntervalStrategy.STEPS: 'steps'>, prediction_loss_only=False, per_device_train_batch_size=2, per_device_eval_batch_size=2, per_gpu_train_batch_size=None, per_gpu_eval_batch_size=None, gradient_accumulation_steps=8, eval_accumulation_steps=None, eval_delay=0, torch_empty_cache_steps=None, learning_rate=0.0002, weight_decay=0.1, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, max_grad_norm=1.0, num_train_epochs=2.0, max_steps=-1, lr_scheduler_type=<SchedulerType.COSINE: 'cosine'>, lr_scheduler_kwargs=None, warmup_ratio=0.05, warmup_steps=0, log_level='passive', log_level_replica='warning', log_on_each_node=True, logging_dir='/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105/runs', logging_strategy=<IntervalStrategy.STEPS: 'steps'>, logging_first_step=True, logging_steps=1, logging_nan_inf_filter=True, save_strategy=<SaveStrategy.STEPS: 'steps'>, save_steps=50, save_total_limit=None, save_safetensors=True, save_on_each_node=False, save_only_model=False, restore_callback_states_from_checkpoint=False, no_cuda=False, use_cpu=False, use_mps_device=False, seed=42, data_seed=42, jit_mode_eval=False, use_ipex=False, bf16=True, fp16=False, fp16_opt_level='O1', half_precision_backend='auto', bf16_full_eval=False, fp16_full_eval=False, tf32=None, local_rank=0, ddp_backend=None, tpu_num_cores=None, tpu_metrics_debug=False, debug=[], dataloader_drop_last=False, eval_steps=300, dataloader_num_workers=4, dataloader_prefetch_factor=10, past_index=-1, run_name='/data2/kdd/crag/cjz/output/dpo_phase2/v1-20250528-012105', disable_tqdm=False, remove_unused_columns=False, label_names=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, fsdp=[], fsdp_min_num_params=0, fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, tp_size=0, fsdp_transformer_layer_cls_to_wrap=None, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), deepspeed={'fp16': {'enabled': 'auto', 'loss_scale': 0, 'loss_scale_window': 1000, 'initial_scale_power': 16, 'hysteresis': 2, 'min_loss_scale': 1}, 'bf16': {'enabled': 'auto'}, 'zero_optimization': {'stage': 2, 'offload_optimizer': {'device': 'none', 'pin_memory': True}, 'allgather_partitions': True, 'allgather_bucket_size': 200000000.0, 'overlap_comm': False, 'reduce_scatter': True, 'reduce_bucket_size': 200000000.0, 'contiguous_gradients': True}, 'gradient_accumulation_steps': 'auto', 'gradient_clipping': 'auto', 'steps_per_print': 2000, 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'wall_clock_breakdown': False}, label_smoothing_factor=0.0, optim=<OptimizerNames.ADAMW_TORCH: 'adamw_torch'>, optim_args=None, adafactor=False, group_by_length=False, length_column_name='length', report_to=['tensorboard'], ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, dataloader_pin_memory=True, dataloader_persistent_workers=False, skip_memory_metrics=True, use_legacy_prediction_loop=False, push_to_hub=False, resume_from_checkpoint=None, hub_model_id=None, hub_strategy=<HubStrategy.EVERY_SAVE: 'every_save'>, hub_token=None, hub_private_repo=None, hub_always_push=False, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, include_inputs_for_metrics=False, include_for_metrics=[], eval_do_concat_batches=True, fp16_backend='auto', push_to_hub_model_id=None, push_to_hub_organization=None, push_to_hub_token=None, mp_parameters='', auto_find_batch_size=False, full_determinism=False, torchdynamo=None, ray_scope='last', ddp_timeout=1800, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, include_tokens_per_second=None, include_num_input_tokens_seen=None, neftune_noise_alpha=None, optim_target_modules=None, batch_eval_metrics=False, eval_on_start=False, use_liger_kernel=False, eval_use_gather_object=False, average_tokens_across_devices=None, model_init_kwargs=None, ref_model_init_kwargs=None, model_adapter_name=None, ref_adapter_name=None, force_use_ref_model=False, disable_dropout=True, use_logits_to_keep=False, dataset_num_proc=4, padding_value=None, label_pad_token_id=None, max_prompt_length=512, max_completion_length=512, max_length=2048, truncation_mode='keep_end', padding_free=False, precompute_ref_log_probs=False, precompute_ref_batch_size=None, tools=None, loss_type='sigmoid', beta=0.1, f_divergence_type=<FDivergenceType.REVERSE_KL: 'reverse_kl'>, f_alpha_divergence_coef=1.0, reference_free=False, label_smoothing=0, use_weighting=False, rpo_alpha=1.0, discopop_tau=0.05, sync_ref_model=False, ref_model_mixup_alpha=0.6, ref_model_sync_steps=512, generate_during_eval=False, check_model=True, acc_strategy='token', train_dataloader_shuffle=True, metric_warmup_step=0, fsdp_num=1, acc_steps=1, eval_use_evalscope=False, eval_datasets=[], eval_limit=None, eval_datasets_args=None, eval_generation_config=None, train_type='lora', optimizer=None, local_repo_path=None, galore_config=None)"
438
  }
latest CHANGED
@@ -1 +1 @@
1
- global_step280
 
1
+ global_step799
rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:02034183374b3378e32cb927af60ea7d3894665df94e961d4a00180b159e7087
3
- size 14498
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:964771ea4d152605618c22273abbcef8154a9735e5ca07daff1650a42df501c8
3
+ size 14244
scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:989cd45105b54e752d9e40372417e9cf25b8e10f3504638030af27d4f0e73897
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ab14d4c63ee0a9523bd9778d4168994a6d1557cfdd6f2268ed3eb4a755abd54d
3
  size 1064
trainer_state.json CHANGED
The diff for this file is too large to render. See raw diff
 
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:299721334abd93ccd8bac0f14076b8b992a0297f94b0fd973cb274ad848eb333
3
- size 10168
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ccd6adf03cbc28fcd10f8776e16882e610a76a0b5367ddbb5022d7e7f6de2b22
3
+ size 8632