GPT / README.md
fiel1986's picture
Create README.md
fb18183 verified
|
Raw
History Blame Contribute Delete
2.5 kB
---
title: gpt-oss-20b Q4_K_M (Unsloth)
emoji: 🚀
colorFrom: purple
colorTo: green
sdk: gguf
sdk_version: 0.10.0
app_file: null
pinned: false
license: apache-2.0
tags:
- gguf
- gemma2
- unsloth
- q4_k_m
- llama.cpp
- text-generation
- ai-agent-security
- kaggle
- 20b
---
# gpt-oss-20b - Q4_K_M GGUF
Este repositorio contiene el modelo **gpt-oss-20b** cuantizado en formato **GGUF** (cuantización **Q4_K_M**), optimizado para inferencia rápida y eficiente en hardware consumer (CPU y GPU).
El modelo original es una arquitectura basada en **Gemma 2** de Google, adaptada por **Unsloth**.
## Detalles del Modelo
| Propiedad | Valor |
|-----------|-------|
| **Nombre Original** | `unsloth/gpt-oss-20b` |
| **Archivo** | `gpt-oss-20b-Q4_K_M.gguf` |
| **Tamaño** | ~11.6 GB |
| **Cuantización** | `Q4_K_M` (4-bit) |
| **Arquitectura** | Gemma 2 |
| **Capas** | 36 |
| **Hidden Size** | 2304 |
| **Contexto Máx.** | 8192 tokens |
| **Origen** | Kaggle (AI Agent Security competition) |
## Cómo usar este modelo
Este archivo está diseñado para funcionar con inferentes compatibles con **GGUF** (como `llama.cpp`, `Ollama`, `LM Studio` o `text-generation-webui`).
### 1. Con `llama.cpp` (Terminal)
```bash
# Descarga el modelo (si no lo tienes)
# Asegúrate de tener llama.cpp compilado
./main -m gpt-oss-20b-Q4_K_M.gguf -n 512 -t 8 --color -i --interactive-first
2. Con Ollama
Puedes importar este archivo a Ollama creando un Modelfile:
FROM ./gpt-oss-20b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9
ollama create gpt-oss-20b -f Modelfile
ollama run gpt-oss-20b
3. Con LM Studio
Abre LM Studio.
Ve a la pestaña de búsqueda y selecciona "Local Models".
Arrastra el archivo .gguf a la ventana o colócalo en la carpeta de modelos de LM Studio.
Carga el modelo y comienza a chatear.
Archivos Incluidos
gpt-oss-20b-Q4_K_M.gguf: El modelo cuantizado.
config.json: Configuración de la arquitectura (Gemma 2) para compatibilidad con herramientas de carga.
tokenizer.json: Tokenizer necesario para la pre-procesamiento de texto (compatible con transformers).
Notas Importantes
Este modelo es una versión cuantizada y no debe confundirse con el modelo de pesos completos (FP16/FP32).
La cuantización Q4_K_M ofrece un excelente equilibrio entre calidad y velocidad, reduciendo el uso de VRAM/RAM en un ~60% comparado con el modelo original.
Licencia: Revisa la licencia del modelo original en el repositorio de Unsloth antes de usarlo comercialmente.