File size: 1,236 Bytes
6eb04df
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
---
license: apache-2.0
tags:
  - qwen
  - qwen2.5
  - gguf
  - quantized
  - llm
  - conversational
  - chat
model-index:
  - name: Qwen2.5-3B-GGUF
    results: []
---

# Qwen2.5-3B (Quantized 4-bit - Q4_0)

Este repositorio contiene el modelo **Qwen2.5-3B** cuantizado en formato **GGUF** con el esquema **Q4_0**.
Este modelo es ideal para ejecutar inferencia localmente con baja latencia y un uso eficiente de la memoria RAM/VRAM, gracias a herramientas como `llama.cpp`, `LM Studio`, `KoboldCPP` o `Ollama`.

## Detalles del Modelo

- **Modelo Base**: Qwen2.5-3B (de Alibaba Cloud)
- **Formato**: GGUF
- **Nivel de Cuantizaci贸n**: Q4_0 (4-bit)
- **Tama帽o de archivo**: Aprox. 1.8 GB - 2.0 GB (dependiendo del tokenizer)
- **Capacidades**: Generaci贸n de texto, chat, razonamiento b谩sico y seguimiento de instrucciones.
- **Licencia**: Apache 2.0 (verifique la licencia espec铆fica del modelo base en el repositorio oficial de Qwen).

## C贸mo usar este modelo

Puedes cargar y ejecutar este modelo utilizando varias herramientas compatibles con GGUF.

### 1. Usando `llama.cpp`

Si tienes compilado `llama.cpp`, puedes ejecutar la inferencia directamente:

```bash
./main -m qwen2.5-3b-q4_0.gguf -p "Hola, 驴c贸mo est谩s?" -n 256