goanime-auditor-ja
Auditor de legenda japonês (seq2seq) que limpa a transcrição crua do STT antes da tradução. Não é LLM nem tradutor — é um ByT5-small fine-tunado para corrigir erros típicos de ASR em anime/galgame:
- duplicação / laço de decodificação
- kanji vs kana pela leitura (ex.: 何 → なん)
- partícula faltando/errada, espaços espúrios
Arquivos
| arquivo | precisão | tamanho |
|---|---|---|
encoder.onnx |
int8 (per-channel, MatMul) | ~220 MB |
decoder.onnx |
fp32 | ~330 MB |
Por que essa mistura? O decoder int8 quebra o ByT5 (CER > 100%); o encoder int8 é seguro. fp16 não economiza RAM no ONNX Runtime CPU (ele expande p/ fp32). Esta é a menor combinação que preserva qualidade (~16,5% CER no conjunto de avaliação; fp32 puro dá ~13,9%).
Runtime
Byte-level: entrada = bytes UTF-8 + 3, com EOS(1); saída = id-3 → byte. Sem
tokenizer externo. Consumido pelo app goanime-tv via ONNX Runtime
(goanime/seq2seq_audit, ver audit_seq2seq.cpp).
Treino
Destilado/treinado a partir de pares (transcrição STT → referência humana) de
anime/galgame; base google/byt5-small. Pipeline em
github.com/JabsDev/goanime-tv (work/audit_train).