Pocket-LM 269M
Collection
LM de 269M treinado do zero em portugues para rodar offline em celular de entrada, com os benchmarks pt-BR feitos para avalia-lo. • 8 items • Updated
conversa-v1)
Pré-treino do zero (286M efetivos, 12h de H100, 7,6 bi de tokens) com a fase de decay
dominada por diálogo pt-BR. Nome interno full-conversa-v1.
Mesma arquitetura da família: GPT 20 camadas / 16 cabeças / n_embd 1024 / contexto 512 / BPE 16.384. Pesos bf16 safetensors; código em MaxxArtes/pocket-lm-269m.
| métrica | valor |
|---|---|
| CALAME-PT | 48,55 |
| LAMBADA-PT | 32,23 |
| coerência de conversa (juiz binário, n=52) | 69,2 |
| manutenção de personagem | 82,7 |
| inventou fato | 6,7% |
| distinct-2 | 0,711 |
Aviso de receita (registrado em RECEITA.json): o dado premium de conversa rodou 81
épocas na fase de decay — acima do ponto (~40) onde a literatura e a nossa curva de dose
dizem que o valor zera. A régua e as lições estão no repositório.
Base para produtos de conversa curta em pt-BR (com SFT por cima). Sem alinhamento.