Pocket-LM 269M
Collection
LM de 269M treinado do zero em portugues para rodar offline em celular de entrada, com os benchmarks pt-BR feitos para avalia-lo. • 8 items • Updated
executor-v1)
Pré-treino do zero (286M efetivos, 12h de H100, 7,0 bi de tokens) com a fase de decay
dominada por ações de celular (intenção + campos estruturados). Nome interno
full-executor-v1.
O achado central: intenção 86,4% e saída bem-formada 98,2% saem direto do pré-treino, sem nenhum SFT. O SFT só fecha a extração de campos (F1 38→73,7 com parada correta).
Arquitetura GPT 20 camadas / 16 cabeças / n_embd 1024 / contexto 512 / BPE 16.384. Pesos bf16 safetensors; código em MaxxArtes/pocket-lm-269m.
| métrica | valor |
|---|---|
| CALAME-PT | 49,86 |
| LAMBADA-PT | 35,01 |
| intenção (sem SFT) | 86,4 |
| F1 de campos com parada (sem SFT) | 73,65 |
| saída bem-formada (sem SFT) | 98,2 |
| 5-shot (MASSIVE) | 35,67 |
Base recomendada para executores de ações on-device em pt-BR. Os adapters de produto
derivados (adapter-app-v1, adapter-whats-v1) estão na mesma coleção.