--- title: gpt-oss-20b Q4_K_M (Unsloth) emoji: 馃殌 colorFrom: purple colorTo: green sdk: gguf sdk_version: 0.10.0 app_file: null pinned: false license: apache-2.0 tags: - gguf - gemma2 - unsloth - q4_k_m - llama.cpp - text-generation - ai-agent-security - kaggle - 20b --- # gpt-oss-20b - Q4_K_M GGUF Este repositorio contiene el modelo **gpt-oss-20b** cuantizado en formato **GGUF** (cuantizaci贸n **Q4_K_M**), optimizado para inferencia r谩pida y eficiente en hardware consumer (CPU y GPU). El modelo original es una arquitectura basada en **Gemma 2** de Google, adaptada por **Unsloth**. ## Detalles del Modelo | Propiedad | Valor | |-----------|-------| | **Nombre Original** | `unsloth/gpt-oss-20b` | | **Archivo** | `gpt-oss-20b-Q4_K_M.gguf` | | **Tama帽o** | ~11.6 GB | | **Cuantizaci贸n** | `Q4_K_M` (4-bit) | | **Arquitectura** | Gemma 2 | | **Capas** | 36 | | **Hidden Size** | 2304 | | **Contexto M谩x.** | 8192 tokens | | **Origen** | Kaggle (AI Agent Security competition) | ## C贸mo usar este modelo Este archivo est谩 dise帽ado para funcionar con inferentes compatibles con **GGUF** (como `llama.cpp`, `Ollama`, `LM Studio` o `text-generation-webui`). ### 1. Con `llama.cpp` (Terminal) ```bash # Descarga el modelo (si no lo tienes) # Aseg煤rate de tener llama.cpp compilado ./main -m gpt-oss-20b-Q4_K_M.gguf -n 512 -t 8 --color -i --interactive-first 2. Con Ollama Puedes importar este archivo a Ollama creando un Modelfile: FROM ./gpt-oss-20b-Q4_K_M.gguf PARAMETER temperature 0.7 PARAMETER top_p 0.9 ollama create gpt-oss-20b -f Modelfile ollama run gpt-oss-20b 3. Con LM Studio Abre LM Studio. Ve a la pesta帽a de b煤squeda y selecciona "Local Models". Arrastra el archivo .gguf a la ventana o col贸calo en la carpeta de modelos de LM Studio. Carga el modelo y comienza a chatear. Archivos Incluidos gpt-oss-20b-Q4_K_M.gguf: El modelo cuantizado. config.json: Configuraci贸n de la arquitectura (Gemma 2) para compatibilidad con herramientas de carga. tokenizer.json: Tokenizer necesario para la pre-procesamiento de texto (compatible con transformers). Notas Importantes Este modelo es una versi贸n cuantizada y no debe confundirse con el modelo de pesos completos (FP16/FP32). La cuantizaci贸n Q4_K_M ofrece un excelente equilibrio entre calidad y velocidad, reduciendo el uso de VRAM/RAM en un ~60% comparado con el modelo original. Licencia: Revisa la licencia del modelo original en el repositorio de Unsloth antes de usarlo comercialmente.