| { | |
| "model_name": "Qwen/Qwen2-VL-7B-Instruct", | |
| "train_jsonl": "DPO/reasoning/Qwen2-VL-7B-Instruct_single__20250922_111950.json", | |
| "eval_jsonl": "", | |
| "output_dir": "./qwen2vl-dpo/20250922_191759", | |
| "epochs": 1, | |
| "batch_size": 1, | |
| "grad_accum_steps": 4, | |
| "lr": 1e-06, | |
| "weight_decay": 0.0, | |
| "warmup_ratio": 0.03, | |
| "beta": 0.1, | |
| "max_length": 1536, | |
| "max_grad_norm": 1.0, | |
| "logging_steps": 1, | |
| "save_steps": 0, | |
| "seed": 42, | |
| "fp16": false, | |
| "bf16": true, | |
| "clear_cache_every": 1 | |
| } |