gpt-oss-20b - Q4_K_M GGUF

Este repositorio contiene el modelo gpt-oss-20b cuantizado en formato GGUF (cuantizaciΓ³n Q4_K_M), optimizado para inferencia rΓ‘pida y eficiente en hardware consumer (CPU y GPU).

El modelo original es una arquitectura basada en Gemma 2 de Google, adaptada por Unsloth.

Detalles del Modelo

Propiedad Valor
Nombre Original unsloth/gpt-oss-20b
Archivo gpt-oss-20b-Q4_K_M.gguf
TamaΓ±o ~11.6 GB
CuantizaciΓ³n Q4_K_M (4-bit)
Arquitectura Gemma 2
Capas 36
Hidden Size 2304
Contexto MΓ‘x. 8192 tokens
Origen Kaggle (AI Agent Security competition)

CΓ³mo usar este modelo

Este archivo estΓ‘ diseΓ±ado para funcionar con inferentes compatibles con GGUF (como llama.cpp, Ollama, LM Studio o text-generation-webui).

1. Con llama.cpp (Terminal)

# Descarga el modelo (si no lo tienes)
# AsegΓΊrate de tener llama.cpp compilado

./main -m gpt-oss-20b-Q4_K_M.gguf -n 512 -t 8 --color -i --interactive-first

2. Con Ollama
Puedes importar este archivo a Ollama creando un Modelfile:

FROM ./gpt-oss-20b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9

ollama create gpt-oss-20b -f Modelfile
ollama run gpt-oss-20b

3. Con LM Studio

Abre LM Studio.
Ve a la pestaΓ±a de bΓΊsqueda y selecciona "Local Models".
Arrastra el archivo .gguf a la ventana o colΓ³calo en la carpeta de modelos de LM Studio.
Carga el modelo y comienza a chatear.
 Archivos Incluidos
gpt-oss-20b-Q4_K_M.gguf: El modelo cuantizado.
config.json: ConfiguraciΓ³n de la arquitectura (Gemma 2) para compatibilidad con herramientas de carga.
tokenizer.json: Tokenizer necesario para la pre-procesamiento de texto (compatible con transformers).
 Notas Importantes
Este modelo es una versiΓ³n cuantizada y no debe confundirse con el modelo de pesos completos (FP16/FP32).
La cuantizaciΓ³n Q4_K_M ofrece un excelente equilibrio entre calidad y velocidad, reduciendo el uso de VRAM/RAM en un ~60% comparado con el modelo original.
Licencia: Revisa la licencia del modelo original en el repositorio de Unsloth antes de usarlo comercialmente.
Downloads last month
120
GGUF
Model size
21B params
Architecture
gpt-oss
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support