GPT / README.md
fiel1986's picture
Create README.md
fb18183 verified
|
Raw
History Blame Contribute Delete
2.5 kB
metadata
title: gpt-oss-20b Q4_K_M (Unsloth)
emoji: 🚀
colorFrom: purple
colorTo: green
sdk: gguf
sdk_version: 0.10.0
app_file: null
pinned: false
license: apache-2.0
tags:
  - gguf
  - gemma2
  - unsloth
  - q4_k_m
  - llama.cpp
  - text-generation
  - ai-agent-security
  - kaggle
  - 20b

gpt-oss-20b - Q4_K_M GGUF

Este repositorio contiene el modelo gpt-oss-20b cuantizado en formato GGUF (cuantización Q4_K_M), optimizado para inferencia rápida y eficiente en hardware consumer (CPU y GPU).

El modelo original es una arquitectura basada en Gemma 2 de Google, adaptada por Unsloth.

Detalles del Modelo

Propiedad Valor
Nombre Original unsloth/gpt-oss-20b
Archivo gpt-oss-20b-Q4_K_M.gguf
Tamaño ~11.6 GB
Cuantización Q4_K_M (4-bit)
Arquitectura Gemma 2
Capas 36
Hidden Size 2304
Contexto Máx. 8192 tokens
Origen Kaggle (AI Agent Security competition)

Cómo usar este modelo

Este archivo está diseñado para funcionar con inferentes compatibles con GGUF (como llama.cpp, Ollama, LM Studio o text-generation-webui).

1. Con llama.cpp (Terminal)

# Descarga el modelo (si no lo tienes)
# Asegúrate de tener llama.cpp compilado

./main -m gpt-oss-20b-Q4_K_M.gguf -n 512 -t 8 --color -i --interactive-first

2. Con Ollama
Puedes importar este archivo a Ollama creando un Modelfile:

FROM ./gpt-oss-20b-Q4_K_M.gguf
PARAMETER temperature 0.7
PARAMETER top_p 0.9

ollama create gpt-oss-20b -f Modelfile
ollama run gpt-oss-20b

3. Con LM Studio

Abre LM Studio.
Ve a la pestaña de búsqueda y selecciona "Local Models".
Arrastra el archivo .gguf a la ventana o colócalo en la carpeta de modelos de LM Studio.
Carga el modelo y comienza a chatear.
 Archivos Incluidos
gpt-oss-20b-Q4_K_M.gguf: El modelo cuantizado.
config.json: Configuración de la arquitectura (Gemma 2) para compatibilidad con herramientas de carga.
tokenizer.json: Tokenizer necesario para la pre-procesamiento de texto (compatible con transformers).
 Notas Importantes
Este modelo es una versión cuantizada y no debe confundirse con el modelo de pesos completos (FP16/FP32).
La cuantización Q4_K_M ofrece un excelente equilibrio entre calidad y velocidad, reduciendo el uso de VRAM/RAM en un ~60% comparado con el modelo original.
Licencia: Revisa la licencia del modelo original en el repositorio de Unsloth antes de usarlo comercialmente.