- WARMIND-200M V2
- English summary
- Visão geral
- Em um minuto
- Demonstração real — incluindo limitações
- Início rápido
- Arquitetura
- Treinamento
- Dados e proveniência
- Bate-papo local experimental
- Estado de maturidade
- Usos pretendidos
- Usos não recomendados
- Integridade dos arquivos
- Próximas investigações
- Feedback técnico
- Citação
- English summary
WARMIND-200M V2
Prévia técnica experimental em português para pesquisa e inferência local
🇧🇷 Português · 🇺🇸 English documentation
⚠️ Aviso de uso: este checkpoint pode produzir informações incorretas, respostas incompletas e alucinações. Não utilize suas saídas para decisões médicas, jurídicas, financeiras, de segurança ou de alto impacto sem revisão humana qualificada.
English summary
WARMIND-200M V2 is an experimental, Portuguese-first causal language model developed by WAR Enterprise for compact-model research and local inference.
- 203,263,872 parameters
- 1,000,013,824 pretraining tokens
- 23,751,277 supervised SFT tokens
- 20 layers, hidden size 896
- 14 attention heads and 2 KV heads
- Grouped-Query Attention, SwiGLU, RMSNorm and RoPE
- 24,576-token SentencePiece vocabulary
- 1,024-token operational context
- local CPU inference; CUDA is supported by the example script
- Apache 2.0 license
This is a research checkpoint, not a production assistant. It can hallucinate, fail on simple reasoning tasks and produce incomplete or incorrect answers.
➡️ Open the full English documentation
Visão geral
O WARMIND-200M V2 é um modelo de linguagem causal compacto desenvolvido pela WAR Enterprise para pesquisa em geração de texto em português e inferência local.
A versão publicada é um artefato de pesquisa, não um assistente de produção. Seu objetivo principal foi validar uma cadeia completa de desenvolvimento: preparação de dados, tokenização, pré-treinamento, ajuste supervisionado, empacotamento, verificação de integridade e execução local.
Em um minuto
| Item | Valor |
|---|---|
| Parâmetros | 203.263.872 |
| Tokens de pré-treinamento | 1.000.013.824 |
| Tokens processados no SFT | 23.751.277 |
| Camadas | 20 |
| Dimensão do modelo | 896 |
| Cabeças de atenção / KV | 14 / 2 |
| Vocabulário | 24.576 tokens SentencePiece |
| Contexto operacional | 1.024 tokens |
| Pesos publicados | safetensors FP32 |
| Idioma principal | Português |
| Execução | CPU local; CUDA aceita pelo script de exemplo |
Demonstração real — incluindo limitações
O vídeo abaixo mostra o comportamento real do checkpoint, sem esconder respostas fracas ou incorretas. Isso faz parte da avaliação técnica desta versão.
O que aparece na demonstração:
- geração básica em português;
- recuperação de alguns fatos;
- erros em contas e conhecimento factual;
- respostas plausíveis, porém incorretas;
- revisão explícita das falhas observadas.
Início rápido
Requisitos
- Python 3.12
- pelo menos 8 GB de RAM livres para uma experiência local confortável
Instalação
python -m venv .venv
python -m pip install -r requirements.txt
Windows PowerShell
.\.venv\Scripts\Activate.ps1
python generate_local.py `
--prompt "Defina fotossíntese em uma frase." `
--max-new-tokens 96
Linux ou macOS
source .venv/bin/activate
python generate_local.py \
--prompt "Defina fotossíntese em uma frase." \
--max-new-tokens 96
Geração mais controlada
python generate_local.py \
--prompt "Explique em duas frases o que é inteligência artificial." \
--temperature 0.2 \
--top-k 20 \
--top-p 0.9 \
--repetition-penalty 1.12 \
--max-new-tokens 160
Confirme no
generate_local.pyse o argumento publicado é--max-new-tokensou--maximum-new-tokense mantenha apenas a forma aceita pelo script.
Arquitetura
| Componente | Valor |
|---|---|
| Tipo | Transformer decoder causal |
| Camadas | 20 |
| Dimensão do modelo | 896 |
| Cabeças de atenção | 14 |
| Cabeças KV | 2 |
| Atenção | Grouped-Query Attention (GQA) |
| Dimensão da FFN | 2.688 |
| Ativação | SwiGLU |
| Normalização | RMSNorm |
| Posicionamento | RoPE, θ = 10.000 |
| Contexto treinado/operacional | 1.024 tokens |
| Contexto estendido aceito pelo código | até 2.048 tokens, sem homologação como contexto de treino |
Treinamento
O checkpoint foi treinado em uma NVIDIA H100 80 GB HBM3, utilizando BF16. A execução principal do pré-treinamento levou aproximadamente 2 horas e 30 minutos; preparação dos dados, treinamento do tokenizer, SFT, empacotamento e testes locais foram realizados separadamente.
| Etapa | Registro |
|---|---|
| Pré-treinamento V2 | 1.000.013.824 tokens |
| Ajuste supervisionado | encerrado no passo 1.200 |
| Val loss no passo 100 | 2,1085 |
| Val loss no passo 1.200 | 1,8038 |
Os números acima descrevem o treinamento registrado, mas não devem ser interpretados isoladamente como prova de qualidade geral.
Dados e proveniência
Pré-treinamento
Foi utilizada uma amostra em português de epfml/FineWeb2-HQ (por_Latn), sob ODC-By-1.0 e sujeita também aos termos do Common Crawl.
Composição aproximada da preparação:
- 93,6% conteúdo geral;
- 5,0% conteúdo jurídico;
- 1,4% conteúdo técnico.
Ajuste supervisionado
O SFT combinou:
- conversas em português de
HuggingFaceTB/smoltalk2; - dados filtrados de
OpenAssistant/oasst2; - exemplos próprios da WAR Enterprise.
As atribuições e os subconjuntos utilizados devem permanecer documentados em NOTICE.md.
Os dados podem conter erros, distorções, conteúdo sintético ou informações pessoais presentes nas fontes originais. O treinamento não transforma o modelo em uma fonte factual confiável.
Bate-papo local experimental
chat_calibrate.py acrescenta:
- memória curta;
- busca em arquivos locais;
- calculadora determinística;
- consulta opcional à Wikipédia e ao Wikidata.
python chat_calibrate.py
Esse orquestrador não altera os pesos e não representa acesso ao “pensamento interno” do Transformer.
Quando a consulta online está ativada, o texto da pergunta pode ser enviado às APIs públicas correspondentes. Use:
/online off
para manter a sessão offline.
Estado de maturidade
Status: EXPERIMENTAL_NOT_DEMO_READY / AWAITING_HUMAN_REVIEW
A V2 mostrou evolução em relação ao primeiro checkpoint, mas ainda apresentou:
- alucinações de fatos, nomes, números e identidades;
- repetição e deriva de assunto;
- falhas em seguir limites de extensão;
- respostas plausíveis, porém incorretas;
- sensibilidade aos parâmetros de amostragem;
- limitações em contas simples e raciocínio.
Por isso, esta publicação deve ser tratada como uma prévia técnica para pesquisa, aprendizado e reprodução local, não como benchmark de estado da arte.
Usos pretendidos
- pesquisa com modelos compactos em português;
- estudo de inferência local em CPU;
- experimentos de geração com revisão humana;
- prototipagem educacional;
- comparação de técnicas de pós-processamento;
- estudo de integração com ferramentas externas.
Usos não recomendados
- decisões automatizadas ou de alto impacto;
- aconselhamento médico, jurídico ou financeiro;
- conteúdo factual sem verificação externa;
- moderação, vigilância ou classificação de pessoas;
- aplicações que exijam segurança, precisão ou disponibilidade garantidas.
Integridade dos arquivos
Os hashes SHA-256 estão em SHA256SUMS.
Hash esperado de model.safetensors:
42218dacd46c7a3d244856e664442822e002312bf871a57181379d9026a61045
Próximas investigações
A WAR Enterprise estuda uma próxima geração na faixa de 500 milhões de parâmetros, com uma campanha potencialmente maior de treinamento.
Isso é um objetivo de pesquisa, não uma promessa de lançamento. O avanço dependerá de infraestrutura, dados, avaliações e resultados técnicos.
Feedback técnico
Contribuições úteis incluem:
- testes em diferentes CPUs;
- medições de RAM e tokens por segundo;
- benchmarks em português;
- identificação de erros de tokenizer;
- sugestões de quantização e GGUF;
- exemplos reproduzíveis de falhas.
Use a aba Community do repositório para abrir uma discussão.
Citação
@software{warmind200mv2_2026,
title = {WARMIND-200M V2},
author = {WAR Enterprise},
year = {2026},
note = {Prévia técnica experimental de modelo de linguagem em português},
url = {https://huggingface.co/warenterprise/WARMIND-200M-V2}
}
Desenvolvido pela WAR Enterprise
Pesquisa compacta, execução local e transparência técnica.
- Downloads last month
- 116