Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -26,6 +26,12 @@ A small, open-weight language model built on the **BDH (Fast Weight Layers)** ar
|
|
| 26 |
|
| 27 |
**BDH-25M-PL** to mały, otwarty model językowy oparty na architekturze **BDH (Fast Weight Layers, ang. warstwy szybkich wag)**, który wprowadzono w rodzinie modeli pętlowanych z lokalną rekurencją ukrytą (*looped latent recurrence*). W przeciwieństwie do klasycznego transformera, BDH współdzieli reprezentację jako klucz i wartość (`Q==K`), dzięki czemu wewnętrzny stan staje się swego rodzaju **pamięcią roboczą adaptującą się do kontekstu w locie**, bez zmiany wag. Model działa bezpośrednio na bajtach UTF-8 (vocab 256, brak tokenizera) i został wytrenowany na czystym, zróżnicowanym polskim zbiorze `SlayerLab/polish-dynaword-mix` (100 mln tokenów, treść prawna ograniczona do ~7%). Jest to **baseline**: potwierdza, że architektura BDH trenuje i generuje poprawnie end-to-end, generując gramatycznie poprawne polskie zdania. Zgodnie z prawami skalowania model o rozmiarze 25M param. jest niedoćwiczony dla wysokiej jakości (wymagałby ~0.5–2 mld tokenów), pełni jednak rolę weryfikowalnego, publicznego punktu startowego pod większe warianty.
|
| 28 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 29 |
## Architecture
|
| 30 |
|
| 31 |
- `BDH` from [pathwaycom/bdh](https://github.com/pathwaycom/bdh) — looped latent recurrence / fast weights
|
|
|
|
| 26 |
|
| 27 |
**BDH-25M-PL** to mały, otwarty model językowy oparty na architekturze **BDH (Fast Weight Layers, ang. warstwy szybkich wag)**, który wprowadzono w rodzinie modeli pętlowanych z lokalną rekurencją ukrytą (*looped latent recurrence*). W przeciwieństwie do klasycznego transformera, BDH współdzieli reprezentację jako klucz i wartość (`Q==K`), dzięki czemu wewnętrzny stan staje się swego rodzaju **pamięcią roboczą adaptującą się do kontekstu w locie**, bez zmiany wag. Model działa bezpośrednio na bajtach UTF-8 (vocab 256, brak tokenizera) i został wytrenowany na czystym, zróżnicowanym polskim zbiorze `SlayerLab/polish-dynaword-mix` (100 mln tokenów, treść prawna ograniczona do ~7%). Jest to **baseline**: potwierdza, że architektura BDH trenuje i generuje poprawnie end-to-end, generując gramatycznie poprawne polskie zdania. Zgodnie z prawami skalowania model o rozmiarze 25M param. jest niedoćwiczony dla wysokiej jakości (wymagałby ~0.5–2 mld tokenów), pełni jednak rolę weryfikowalnego, publicznego punktu startowego pod większe warianty.
|
| 28 |
|
| 29 |
+
## Training curves
|
| 30 |
+
|
| 31 |
+
Train and validation loss over 10,000 byte-level steps (final val loss ≈ 1.41; random-init baseline ≈ 5.6).
|
| 32 |
+
|
| 33 |
+

|
| 34 |
+
|
| 35 |
## Architecture
|
| 36 |
|
| 37 |
- `BDH` from [pathwaycom/bdh](https://github.com/pathwaycom/bdh) — looped latent recurrence / fast weights
|