andromeda / README.md
fiel1986's picture
Create README.md
6eb04df verified
|
Raw
History Blame Contribute Delete
1.24 kB
---
license: apache-2.0
tags:
- qwen
- qwen2.5
- gguf
- quantized
- llm
- conversational
- chat
model-index:
- name: Qwen2.5-3B-GGUF
results: []
---
# Qwen2.5-3B (Quantized 4-bit - Q4_0)
Este repositorio contiene el modelo **Qwen2.5-3B** cuantizado en formato **GGUF** con el esquema **Q4_0**.
Este modelo es ideal para ejecutar inferencia localmente con baja latencia y un uso eficiente de la memoria RAM/VRAM, gracias a herramientas como `llama.cpp`, `LM Studio`, `KoboldCPP` o `Ollama`.
## Detalles del Modelo
- **Modelo Base**: Qwen2.5-3B (de Alibaba Cloud)
- **Formato**: GGUF
- **Nivel de Cuantizaci贸n**: Q4_0 (4-bit)
- **Tama帽o de archivo**: Aprox. 1.8 GB - 2.0 GB (dependiendo del tokenizer)
- **Capacidades**: Generaci贸n de texto, chat, razonamiento b谩sico y seguimiento de instrucciones.
- **Licencia**: Apache 2.0 (verifique la licencia espec铆fica del modelo base en el repositorio oficial de Qwen).
## C贸mo usar este modelo
Puedes cargar y ejecutar este modelo utilizando varias herramientas compatibles con GGUF.
### 1. Usando `llama.cpp`
Si tienes compilado `llama.cpp`, puedes ejecutar la inferencia directamente:
```bash
./main -m qwen2.5-3b-q4_0.gguf -p "Hola, 驴c贸mo est谩s?" -n 256