--- license: apache-2.0 tags: - qwen - qwen2.5 - gguf - quantized - llm - conversational - chat model-index: - name: Qwen2.5-3B-GGUF results: [] --- # Qwen2.5-3B (Quantized 4-bit - Q4_0) Este repositorio contiene el modelo **Qwen2.5-3B** cuantizado en formato **GGUF** con el esquema **Q4_0**. Este modelo es ideal para ejecutar inferencia localmente con baja latencia y un uso eficiente de la memoria RAM/VRAM, gracias a herramientas como `llama.cpp`, `LM Studio`, `KoboldCPP` o `Ollama`. ## Detalles del Modelo - **Modelo Base**: Qwen2.5-3B (de Alibaba Cloud) - **Formato**: GGUF - **Nivel de Cuantización**: Q4_0 (4-bit) - **Tamaño de archivo**: Aprox. 1.8 GB - 2.0 GB (dependiendo del tokenizer) - **Capacidades**: Generación de texto, chat, razonamiento básico y seguimiento de instrucciones. - **Licencia**: Apache 2.0 (verifique la licencia específica del modelo base en el repositorio oficial de Qwen). ## Cómo usar este modelo Puedes cargar y ejecutar este modelo utilizando varias herramientas compatibles con GGUF. ### 1. Usando `llama.cpp` Si tienes compilado `llama.cpp`, puedes ejecutar la inferencia directamente: ```bash ./main -m qwen2.5-3b-q4_0.gguf -p "Hola, ¿cómo estás?" -n 256