How to use from
llama.cpp
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf fiel1986/GPT:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf fiel1986/GPT:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama serve -hf fiel1986/GPT:Q4_K_M
# Run inference directly in the terminal:
llama cli -hf fiel1986/GPT:Q4_K_M
Use pre-built binary
# Download pre-built binary from:
# https://github.com/ggerganov/llama.cpp/releases
# Start a local OpenAI-compatible server with a web UI:
./llama-server -hf fiel1986/GPT:Q4_K_M
# Run inference directly in the terminal:
./llama-cli -hf fiel1986/GPT:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
cmake -B build
cmake --build build -j --target llama-server llama-cli
# Start a local OpenAI-compatible server with a web UI:
./build/bin/llama-server -hf fiel1986/GPT:Q4_K_M
# Run inference directly in the terminal:
./build/bin/llama-cli -hf fiel1986/GPT:Q4_K_M
Use Docker
docker model run hf.co/fiel1986/GPT:Q4_K_M
Quick Links

gpt-oss-20b - Q4_K_M GGUF

Este repositorio contiene el modelo gpt-oss-20b cuantizado en formato GGUF (cuantizaciΓ³n Q4_K_M), optimizado para inferencia rΓ‘pida y eficiente en hardware consumer (CPU y GPU).

El modelo original es una arquitectura basada en Gemma 2 de Google, adaptada por Unsloth.

Detalles del Modelo

Propiedad Valor
Nombre Original unsloth/gpt-oss-20b
Archivo gpt-oss-20b-Q4_K_M.gguf
TamaΓ±o ~11.6 GB
CuantizaciΓ³n Q4_K_M (4-bit)
Arquitectura Gemma 2
Capas 36
Hidden Size 2304
Contexto MΓ‘x. 8192 tokens
Origen Kaggle (AI Agent Security competition)

CΓ³mo usar este modelo

Este archivo estΓ‘ diseΓ±ado para funcionar con inferentes compatibles con GGUF (como llama.cpp, Ollama, LM Studio o text-generation-webui).

1. Con llama.cpp (Terminal)

# Descarga el modelo (si no lo tienes)
# AsegΓΊrate de tener llama.cpp compilado

./main -m gpt-oss-20b-Q4_K_M.gguf -n 512 -t 8 --color -i --interactive-first

2. Con Ollama
Puedes importar este archivo a Ollama creando un Modelfile:

FROM ./gpt-oss-20b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9

ollama create gpt-oss-20b -f Modelfile
ollama run gpt-oss-20b

3. Con LM Studio

Abre LM Studio.
Ve a la pestaΓ±a de bΓΊsqueda y selecciona "Local Models".
Arrastra el archivo .gguf a la ventana o colΓ³calo en la carpeta de modelos de LM Studio.
Carga el modelo y comienza a chatear.
 Archivos Incluidos
gpt-oss-20b-Q4_K_M.gguf: El modelo cuantizado.
config.json: ConfiguraciΓ³n de la arquitectura (Gemma 2) para compatibilidad con herramientas de carga.
tokenizer.json: Tokenizer necesario para la pre-procesamiento de texto (compatible con transformers).
 Notas Importantes
Este modelo es una versiΓ³n cuantizada y no debe confundirse con el modelo de pesos completos (FP16/FP32).
La cuantizaciΓ³n Q4_K_M ofrece un excelente equilibrio entre calidad y velocidad, reduciendo el uso de VRAM/RAM en un ~60% comparado con el modelo original.
Licencia: Revisa la licencia del modelo original en el repositorio de Unsloth antes de usarlo comercialmente.
Downloads last month
120
GGUF
Model size
21B params
Architecture
gpt-oss
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support