--- language: - ja license: mit library_name: pytorch pipeline_tag: text-generation tags: - causal-lm - japanese - from-scratch - tiny --- # evex-2 ある Discord サーバーの過去ログ **だけ** をゼロから学習した 5.87M パラメータの言語モデル。 既存モデルからの継続学習ではなく、tokenizer も含めて全部そのログから作った。 **このモデルにとって世界はそのログだけで、一般知識は一切持っていない。** [evex-1](https://huggingface.co/tako080614/evex-1) の第2世代。コーパスも語彙も構成も 同じで、変えたのは2つだけ。 ## evex-1 から変えたこと ### 1. 学習率 3e-4 → 1e-3 evex-1 は 10 epoch 通して val loss が単調に下がり続けていた = **収束していなかった**。 上げて 12 epoch 回したら val 4.2404 → 4.0384 (同じ尺度で測った値)。 ### 2. 正規化記号を損失から外した evex-1 の一番大きい問題は、**返答の 38.5% が `` や `` だけ**だったこと。 正規化で作った記号なので発言ではなく、bot は画像もリンクも実際には出せない。 原因は密度ではなく1トークンであること。添付だけの発言 (コーパスの 3.6%) が `` 1個に潰れていたので、発言の先頭で確率が1点に集中していた。 そこで `` `` `` `` `