Image-Text-to-Text
PEFT
Safetensors
vision
multimodal
image-to-text
qwen2-vl
sdxl
kokolok
conversational
Instructions to use OpenKLO/kokolok-2.0-Vision with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use OpenKLO/kokolok-2.0-Vision with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2-VL-2B-Instruct") model = PeftModel.from_pretrained(base_model, "OpenKLO/kokolok-2.0-Vision") - Notebooks
- Google Colab
- Kaggle
| license: apache-2.0 | |
| base_model: Qwen/Qwen2-VL-2B-Instruct | |
| tags: | |
| - vision | |
| - multimodal | |
| - image-to-text | |
| - qwen2-vl | |
| - sdxl | |
| - kokolok | |
| library_name: peft | |
| pipeline_tag: image-text-to-text | |
| # 🚀 kokolok-2.0-Vision | |
| **kokolok-2.0-Vision** — мультимодальный комбайн нового поколения, сочетающий в себе анализ изображений, кодинг, работу с документами и интеграцию со скоростным генератором артов SDXL Lightning. | |
| ## 🧠 Основные возможности | |
| - 👁️ **Vision & OCR:** Анализ скриншотов, считывание текста, схем и кода с изображений. | |
| - 💻 **Кодинг:** Понимание и генерация кода (Python, Luau для Roblox, Java, C++). | |
| - 📄 **Документы:** Анализ и конспектирование PDF/TXT файлов. | |
| - 🎨 **SDXL Integration:** Готовая связка со скоростным арт-движком. | |
| ## 🛠 Запуск в Python | |
| ```python | |
| import torch | |
| from transformers import Qwen2VLForConditionalGeneration, AutoProcessor | |
| from peft import PeftModel | |
| BASE_MODEL = "Qwen/Qwen2-VL-2B-Instruct" | |
| LORA_MODEL = "OpenKLO/kokolok-2.0-Vision" | |
| processor = AutoProcessor.from_pretrained(BASE_MODEL) | |
| base_model = Qwen2VLForConditionalGeneration.from_pretrained( | |
| BASE_MODEL, | |
| torch_dtype=torch.float16, | |
| device_map="cuda" | |
| ) | |
| model = PeftModel.from_pretrained(base_model, LORA_MODEL) | |
| ``` | |