Pocket-LM 269M — base conversa (conversa-v1)

Pré-treino do zero (286M efetivos, 12h de H100, 7,6 bi de tokens) com a fase de decay dominada por diálogo pt-BR. Nome interno full-conversa-v1.

Mesma arquitetura da família: GPT 20 camadas / 16 cabeças / n_embd 1024 / contexto 512 / BPE 16.384. Pesos bf16 safetensors; código em MaxxArtes/pocket-lm-269m.

Números medidos

métrica valor
CALAME-PT 48,55
LAMBADA-PT 32,23
coerência de conversa (juiz binário, n=52) 69,2
manutenção de personagem 82,7
inventou fato 6,7%
distinct-2 0,711

Aviso de receita (registrado em RECEITA.json): o dado premium de conversa rodou 81 épocas na fase de decay — acima do ponto (~40) onde a literatura e a nossa curva de dose dizem que o valor zera. A régua e as lições estão no repositório.

Uso pretendido

Base para produtos de conversa curta em pt-BR (com SFT por cima). Sem alinhamento.

Downloads last month
-
Safetensors
Model size
0.3B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including Magurofg/pocket-lm-269m-conversa