Instructions to use guell00/VELUM-Coder with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use guell00/VELUM-Coder with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf guell00/VELUM-Coder:Q4_K_M # Run inference directly in the terminal: llama cli -hf guell00/VELUM-Coder:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf guell00/VELUM-Coder:Q4_K_M # Run inference directly in the terminal: llama cli -hf guell00/VELUM-Coder:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf guell00/VELUM-Coder:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf guell00/VELUM-Coder:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf guell00/VELUM-Coder:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf guell00/VELUM-Coder:Q4_K_M
Use Docker
docker model run hf.co/guell00/VELUM-Coder:Q4_K_M
- LM Studio
- Jan
- Ollama
How to use guell00/VELUM-Coder with Ollama:
ollama run hf.co/guell00/VELUM-Coder:Q4_K_M
- Unsloth Studio
How to use guell00/VELUM-Coder with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for guell00/VELUM-Coder to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for guell00/VELUM-Coder to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for guell00/VELUM-Coder to start chatting
- Pi
How to use guell00/VELUM-Coder with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf guell00/VELUM-Coder:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "guell00/VELUM-Coder:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use guell00/VELUM-Coder with Docker Model Runner:
docker model run hf.co/guell00/VELUM-Coder:Q4_K_M
- Lemonade
How to use guell00/VELUM-Coder with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull guell00/VELUM-Coder:Q4_K_M
Run and chat with the model
lemonade run user.VELUM-Coder-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use guell00/VELUM-Coder with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf guell00/VELUM-Coder:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default guell00/VELUM-Coder:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use guell00/VELUM-Coder with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf guell00/VELUM-Coder:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "guell00/VELUM-Coder:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex
# Run unsloth studio
unsloth studio -H 0.0.0.0 -p 8888
# Then open http://localhost:8888 in your browser
# Search for guell00/VELUM-Coder to start chattingUsing HuggingFace Spaces for Unsloth
# No setup required# Open https://huggingface.co/spaces/unsloth/studio in your browser
# Search for guell00/VELUM-Coder to start chattingLEVUM
👉 Acesse a Landing Page do Velum AI
Local · Código · Software
Um modelo local baseado em Qwen 3.5 9B, direcionado para desenvolvimento de software.
Escrever. Entender. Corrigir. Refatorar. Construir.
Menos cerimônia. Mais código rodando.
Sobre
LEVUM é um modelo de 9 bilhões de parâmetros, baseado em Qwen 3.5 9B e direcionado para tarefas de desenvolvimento de software.
O objetivo é simples: trabalhar perto do projeto e transformar instruções em código útil.
O modelo foi pensado para tarefas como:
- geração de código;
- implementação de features;
- debugging;
- refatoração;
- explicação e leitura de código;
- criação de protótipos;
- estruturação de projetos;
- geração de aplicações completas;
- assistência durante desenvolvimento local.
LEVUM segue uma filosofia local-first: o modelo pode rodar próximo da IDE, dos arquivos e do contexto real do projeto, dependendo do runtime e da quantização escolhidos.
Software primeiro. Local por padrão.
Especificações
| Modelo | LEVUM |
| Base | Qwen 3.5 9B |
| Parâmetros | 9B |
| Foco | Código / Software |
| Uso principal | Desenvolvimento de software |
| Execução | Local |
| Idioma | Português + capacidades multilíngues da base |
| Origem | 🇧🇷 Brasil |
Quantizações
LEVUM é disponibilizado em diferentes níveis de quantização para permitir execução em uma variedade maior de hardware.
A escolha ideal depende principalmente de:
RAM / VRAM → velocidade → fidelidade
Comparação da qualidade relativa do modelo após diferentes níveis de quantização:
Valores definidos: Q8 = 99%, Q4 = 50%, Q3 = 30%, Q2 = 25% e Q1 = 10%.
Q8 — Fidelidade
Para máquinas com memória suficiente e usuários que querem preservar o máximo possível da qualidade do modelo.
Q8_0
Q4 / IQ4 — Equilíbrio
O ponto recomendado para muitos sistemas locais.
Boa relação entre tamanho, consumo de memória e qualidade.
Q4_K_M · Q4_K_S · IQ4_XS · IQ4_NL · Q4_1 · Q4_0
Q3 / IQ3 — Compacto
Para hardware mais limitado ou situações onde reduzir RAM/VRAM é prioridade.
Q3_K_L · Q3_K_M · Q3_K_S · IQ3_M · IQ3_S · IQ3_XS · IQ3_XXS
Q2 / IQ2 — Ultracompacto
Compressão agressiva para ambientes onde versões maiores simplesmente não cabem.
Q2_K · Q2_K_S · IQ2_M · IQ2_S · IQ2_XS · IQ2_XXS · Q2_0 · TQ2_0
IQ1 — Mínimo
A opção extrema.
IQ1_M
Indicada apenas quando economia de memória é mais importante do que preservar a fidelidade máxima do modelo.
Regra prática: comece com
Q4_K_M. Se houver memória sobrando, experimenteQ8_0. Se faltar memória, desça para Q3, Q2 ou IQ1.
Executando localmente
llama.cpp
Baixe uma das versões GGUF do LEVUM e execute com um runtime compatível com GGUF.
llama-cli \
-m ./LEVUM-Q4_K_M.gguf \
-p "Crie uma API REST em Python usando FastAPI."
Para iniciar um servidor local:
llama-server \
-m ./LEVUM-Q4_K_M.gguf \
-c 8192
Depois disso, o modelo pode ser integrado a ferramentas locais que suportem endpoints compatíveis.
Ollama
Crie um Modelfile apontando para o GGUF:
FROM ./LEVUM-Q4_K_M.gguf
PARAMETER temperature 0.6
PARAMETER top_p 0.9
Depois:
ollama create levum -f Modelfile
ollama run levum
Exemplo:
>>> Crie uma API em FastAPI para gerenciar projetos e tarefas.
LM Studio
- Baixe uma quantização GGUF do LEVUM.
- Importe o arquivo no LM Studio.
- Carregue o modelo.
- Ajuste o contexto de acordo com a memória disponível.
- Inicie uma conversa ou o servidor local.
Nenhuma infraestrutura remota é necessária para a inferência quando o modelo está sendo executado localmente.
Prompts
LEVUM funciona melhor quando a tarefa, o contexto e o formato esperado são explícitos.
Gerar um projeto
Crie um dashboard financeiro interativo em um único arquivo HTML.
Requisitos:
- HTML, CSS e JavaScript no mesmo arquivo
- gráficos interativos
- responsivo
- dados de exemplo
- sem dependências externas obrigatórias
Retorne somente o HTML completo.
Implementar uma feature
Analise o código abaixo e implemente autenticação JWT.
Requisitos:
- preserve a arquitetura atual
- valide tokens expirados
- adicione middleware de autenticação
- não altere endpoints públicos
- explique apenas decisões importantes
Código:
[cole o código aqui]
Debug
Encontre a causa do bug no código abaixo.
Comportamento esperado:
[descreva]
Comportamento atual:
[descreva]
Erro:
[cole o erro]
Código:
[cole o código]
Identifique a causa e retorne a correção completa.
Refatoração
Refatore este código.
Objetivos:
- reduzir duplicação
- melhorar legibilidade
- manter comportamento atual
- preservar a API pública
- evitar abstrações desnecessárias
Retorne primeiro o código refatorado e depois um resumo curto das mudanças.
Formato de prompt
Para tarefas maiores, uma estrutura simples costuma produzir resultados mais previsíveis:
OBJETIVO
O que precisa ser construído.
CONTEXTO
Stack, arquivos existentes e arquitetura.
REQUISITOS
Comportamentos obrigatórios.
RESTRIÇÕES
O que não deve ser alterado.
SAÍDA
Formato exato esperado.
Por exemplo:
OBJETIVO
Criar uma página de analytics.
CONTEXTO
Projeto React + TypeScript + Tailwind.
REQUISITOS
- gráfico de receita
- filtros por período
- cards de métricas
- tabela de transações
RESTRIÇÕES
- não adicionar novas dependências
- reutilizar componentes existentes
SAÍDA
Retorne os arquivos completos que precisam ser criados ou alterados.
Code-first
LEVUM foi pensado para trabalhar dentro do ciclo normal de desenvolvimento:
PROMPT / CÓDIGO
↓
LEVUM
↓
ENTENDER
↓
GERAR
↓
DEBUG
↓
REFATORAR
↓
SOFTWARE RODANDO
Geração
Projetos, componentes, APIs, scripts e features.
Debug
Análise de erros, comportamento inesperado e correções.
Refatoração
Estrutura, legibilidade e manutenção de código existente.
Prototipagem
Transformar uma ideia em algo executável rapidamente.
Exemplo
Prompt
Crie um jogo estilo Flappy Bird em um único HTML.
Use apenas HTML, CSS e JavaScript.
Inclua:
- física
- obstáculos
- colisão
- pontuação
- reinício
- controles por teclado e clique
Retorne somente o HTML completo.
Resultado esperado
prompt
↓
LEVUM
↓
HTML + CSS + JavaScript
↓
browser
↓
software rodando
Hardware
O consumo real depende de vários fatores, incluindo:
- quantização;
- tamanho do contexto;
- runtime;
- KV cache;
- CPU;
- GPU;
- quantidade de camadas descarregadas para GPU;
- configuração de inferência.
Por isso, os números de memória podem variar significativamente entre sistemas.
Como regra geral:
mais bits
↑
mais fidelidade
↑
mais memória
menos bits
↓
menos memória
↓
maior compressão
Escolha a quantização com base no hardware disponível e na qualidade necessária para a tarefa.
Limitações
LEVUM continua sendo um modelo de linguagem.
Isso significa que ele pode:
- gerar código incorreto;
- inventar APIs ou bibliotecas;
- produzir soluções inseguras;
- interpretar requisitos de forma errada;
- introduzir regressões;
- sugerir dependências inexistentes;
- gerar código que parece correto sem realmente funcionar.
Para software importante, revise, teste e valide o código antes de colocá-lo em produção.
Código gerado por IA não ganha poderes mágicos só porque compilou uma vez.
Uso responsável
Antes de executar código gerado pelo modelo:
- revise as alterações;
- verifique dependências;
- execute testes;
- valide entradas externas;
- revise operações de filesystem, rede e banco de dados;
- não exponha segredos ou credenciais desnecessariamente;
- use ambientes isolados quando estiver testando código desconhecido.
Para aplicações críticas, o modelo deve funcionar como ferramenta de assistência, não como única camada de revisão.
Modelo base
LEVUM é baseado em:
Qwen 3.5 9B
O modelo base fornece a capacidade geral sobre a qual o LEVUM é construído.
Consulte também o model card e a licença do modelo base antes de distribuir ou utilizar derivados.
Licença
O uso do LEVUM está sujeito à licença publicada neste repositório e, quando aplicável, aos termos e condições associados ao modelo base.
Consulte o arquivo LICENSE antes de uso comercial, redistribuição ou criação de derivados.
Brasil
- Downloads last month
- 166


Install Unsloth Studio (macOS, Linux, WSL)
# Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for guell00/VELUM-Coder to start chatting