WARMIND-200M V2

Prévia técnica experimental em português para pesquisa e inferência local

🇧🇷 Português · 🇺🇸 English documentation

Parâmetros Pré--treino Contexto Licença Status

⚠️ Aviso de uso: este checkpoint pode produzir informações incorretas, respostas incompletas e alucinações. Não utilize suas saídas para decisões médicas, jurídicas, financeiras, de segurança ou de alto impacto sem revisão humana qualificada.

Resumo visual do WARMIND-200M V2

English summary

WARMIND-200M V2 is an experimental, Portuguese-first causal language model developed by WAR Enterprise for compact-model research and local inference.

  • 203,263,872 parameters
  • 1,000,013,824 pretraining tokens
  • 23,751,277 supervised SFT tokens
  • 20 layers, hidden size 896
  • 14 attention heads and 2 KV heads
  • Grouped-Query Attention, SwiGLU, RMSNorm and RoPE
  • 24,576-token SentencePiece vocabulary
  • 1,024-token operational context
  • local CPU inference; CUDA is supported by the example script
  • Apache 2.0 license

This is a research checkpoint, not a production assistant. It can hallucinate, fail on simple reasoning tasks and produce incomplete or incorrect answers.

➡️ Open the full English documentation

Visão geral

O WARMIND-200M V2 é um modelo de linguagem causal compacto desenvolvido pela WAR Enterprise para pesquisa em geração de texto em português e inferência local.

A versão publicada é um artefato de pesquisa, não um assistente de produção. Seu objetivo principal foi validar uma cadeia completa de desenvolvimento: preparação de dados, tokenização, pré-treinamento, ajuste supervisionado, empacotamento, verificação de integridade e execução local.

Em um minuto

Item Valor
Parâmetros 203.263.872
Tokens de pré-treinamento 1.000.013.824
Tokens processados no SFT 23.751.277
Camadas 20
Dimensão do modelo 896
Cabeças de atenção / KV 14 / 2
Vocabulário 24.576 tokens SentencePiece
Contexto operacional 1.024 tokens
Pesos publicados safetensors FP32
Idioma principal Português
Execução CPU local; CUDA aceita pelo script de exemplo

Demonstração real — incluindo limitações

O vídeo abaixo mostra o comportamento real do checkpoint, sem esconder respostas fracas ou incorretas. Isso faz parte da avaliação técnica desta versão.

Abrir demonstração real do WARMIND-200M V2

O que aparece na demonstração:

  • geração básica em português;
  • recuperação de alguns fatos;
  • erros em contas e conhecimento factual;
  • respostas plausíveis, porém incorretas;
  • revisão explícita das falhas observadas.

Início rápido

Requisitos

  • Python 3.12
  • pelo menos 8 GB de RAM livres para uma experiência local confortável

Instalação

python -m venv .venv
python -m pip install -r requirements.txt

Windows PowerShell

.\.venv\Scripts\Activate.ps1

python generate_local.py `
  --prompt "Defina fotossíntese em uma frase." `
  --max-new-tokens 96

Linux ou macOS

source .venv/bin/activate

python generate_local.py \
  --prompt "Defina fotossíntese em uma frase." \
  --max-new-tokens 96

Geração mais controlada

python generate_local.py \
  --prompt "Explique em duas frases o que é inteligência artificial." \
  --temperature 0.2 \
  --top-k 20 \
  --top-p 0.9 \
  --repetition-penalty 1.12 \
  --max-new-tokens 160

Confirme no generate_local.py se o argumento publicado é --max-new-tokens ou --maximum-new-tokens e mantenha apenas a forma aceita pelo script.

Arquitetura

Componente Valor
Tipo Transformer decoder causal
Camadas 20
Dimensão do modelo 896
Cabeças de atenção 14
Cabeças KV 2
Atenção Grouped-Query Attention (GQA)
Dimensão da FFN 2.688
Ativação SwiGLU
Normalização RMSNorm
Posicionamento RoPE, θ = 10.000
Contexto treinado/operacional 1.024 tokens
Contexto estendido aceito pelo código até 2.048 tokens, sem homologação como contexto de treino

Treinamento

O checkpoint foi treinado em uma NVIDIA H100 80 GB HBM3, utilizando BF16. A execução principal do pré-treinamento levou aproximadamente 2 horas e 30 minutos; preparação dos dados, treinamento do tokenizer, SFT, empacotamento e testes locais foram realizados separadamente.

Etapa Registro
Pré-treinamento V2 1.000.013.824 tokens
Ajuste supervisionado encerrado no passo 1.200
Val loss no passo 100 2,1085
Val loss no passo 1.200 1,8038

Os números acima descrevem o treinamento registrado, mas não devem ser interpretados isoladamente como prova de qualidade geral.

Dados e proveniência

Pré-treinamento

Foi utilizada uma amostra em português de epfml/FineWeb2-HQ (por_Latn), sob ODC-By-1.0 e sujeita também aos termos do Common Crawl.

Composição aproximada da preparação:

  • 93,6% conteúdo geral;
  • 5,0% conteúdo jurídico;
  • 1,4% conteúdo técnico.

Ajuste supervisionado

O SFT combinou:

  • conversas em português de HuggingFaceTB/smoltalk2;
  • dados filtrados de OpenAssistant/oasst2;
  • exemplos próprios da WAR Enterprise.

As atribuições e os subconjuntos utilizados devem permanecer documentados em NOTICE.md.

Os dados podem conter erros, distorções, conteúdo sintético ou informações pessoais presentes nas fontes originais. O treinamento não transforma o modelo em uma fonte factual confiável.

Bate-papo local experimental

chat_calibrate.py acrescenta:

  • memória curta;
  • busca em arquivos locais;
  • calculadora determinística;
  • consulta opcional à Wikipédia e ao Wikidata.
python chat_calibrate.py

Esse orquestrador não altera os pesos e não representa acesso ao “pensamento interno” do Transformer.

Quando a consulta online está ativada, o texto da pergunta pode ser enviado às APIs públicas correspondentes. Use:

/online off

para manter a sessão offline.

Estado de maturidade

Status: EXPERIMENTAL_NOT_DEMO_READY / AWAITING_HUMAN_REVIEW

A V2 mostrou evolução em relação ao primeiro checkpoint, mas ainda apresentou:

  • alucinações de fatos, nomes, números e identidades;
  • repetição e deriva de assunto;
  • falhas em seguir limites de extensão;
  • respostas plausíveis, porém incorretas;
  • sensibilidade aos parâmetros de amostragem;
  • limitações em contas simples e raciocínio.

Por isso, esta publicação deve ser tratada como uma prévia técnica para pesquisa, aprendizado e reprodução local, não como benchmark de estado da arte.

Usos pretendidos

  • pesquisa com modelos compactos em português;
  • estudo de inferência local em CPU;
  • experimentos de geração com revisão humana;
  • prototipagem educacional;
  • comparação de técnicas de pós-processamento;
  • estudo de integração com ferramentas externas.

Usos não recomendados

  • decisões automatizadas ou de alto impacto;
  • aconselhamento médico, jurídico ou financeiro;
  • conteúdo factual sem verificação externa;
  • moderação, vigilância ou classificação de pessoas;
  • aplicações que exijam segurança, precisão ou disponibilidade garantidas.

Integridade dos arquivos

Os hashes SHA-256 estão em SHA256SUMS.

Hash esperado de model.safetensors:

42218dacd46c7a3d244856e664442822e002312bf871a57181379d9026a61045

Próximas investigações

A WAR Enterprise estuda uma próxima geração na faixa de 500 milhões de parâmetros, com uma campanha potencialmente maior de treinamento.

Isso é um objetivo de pesquisa, não uma promessa de lançamento. O avanço dependerá de infraestrutura, dados, avaliações e resultados técnicos.

Feedback técnico

Contribuições úteis incluem:

  • testes em diferentes CPUs;
  • medições de RAM e tokens por segundo;
  • benchmarks em português;
  • identificação de erros de tokenizer;
  • sugestões de quantização e GGUF;
  • exemplos reproduzíveis de falhas.

Use a aba Community do repositório para abrir uma discussão.

Citação

@software{warmind200mv2_2026,
  title  = {WARMIND-200M V2},
  author = {WAR Enterprise},
  year   = {2026},
  note   = {Prévia técnica experimental de modelo de linguagem em português},
  url    = {https://huggingface.co/warenterprise/WARMIND-200M-V2}
}

Desenvolvido pela WAR Enterprise
Pesquisa compacta, execução local e transparência técnica.

Downloads last month
116
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Datasets used to train warenterprise/WARMIND-200M-V2