{ "lr_mp": 5e-05, "lr_vision_backbone": 0.0, "lr_language_backbone": 5e-05, "batch_size": 24, "gradient_accumulation_steps": 5, "max_grad_norm": 1.0, "max_training_steps": 5000, "stop_after_step": null, "warmup_ratio": 0.03, "stats_log_interval": 100, "precision": "bf16", "compile": false, "do_eval": true, "eval_interval": 500, "max_val_batches": 32, "max_images_per_example": 1, "max_sample_length": 2048, "prompt_layout": "text_image_text", "train_dataset_path": "patrickamadeus/the_cauldron", "train_dataset_name": [ "all" ], "train_split": "train", "val_split": "validation", "stream_dataset": false, "enable_source_filter": false, "allowed_dataset_sources": [ "ocrvqa" ], "relevance_min_rating": 1, "image_correspondence_min_rating": 1, "visual_dependency_min_rating": 1, "formatting_min_rating": 1, "wandb_entity": "HuggingFace", "log_wandb": false, "push_checkpoints_to_hub": true, "save_training_state_to_hub": false, "checkpoint_repo_pattern": "patrickamadeus/picovlm-text-image-text-{i}", "hf_private": false, "push_final_model_to_hub": true, "resume_from_vlm_checkpoint": true, "resume_checkpoint_path": null }