Aleksander22 commited on
Commit
00a37d4
·
verified ·
1 Parent(s): b267748

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +287 -1
README.md CHANGED
@@ -1 +1,287 @@
1
- Koliber v1.0 Base - Preview
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ language:
4
+ - pl
5
+ library_name: transformers
6
+ pipeline_tag: text-generation
7
+ tags:
8
+ - polish
9
+ - causal-lm
10
+ - base-model
11
+ - from-scratch
12
+ - gqa
13
+ - rope
14
+ - swiglu
15
+ ---
16
+
17
+ # Koliber v1.0 Base
18
+
19
+ **Koliber v1.0 Base** is a compact Polish decoder-only causal language model developed by **OrisTeam** and trained from scratch.
20
+
21
+ It is a **base pretrained model**, not an instruction-tuned assistant or chatbot. It is intended primarily for text completion and as a foundation for further supervised fine-tuning, preference optimization, continued pretraining, research, and experimentation.
22
+
23
+ > [!WARNING]
24
+ > **Koliber v1.0 Base is an unaligned base language model.**
25
+ >
26
+ > Generated text may be false, misleading, offensive, biased, unsafe, inconsistent, or otherwise inappropriate. The model may invent facts, names, quotations, dates, numbers, sources, or events, and may reproduce undesirable patterns present in its training data.
27
+ >
28
+ > Outputs should not be treated as factual, authoritative, or safe by default. Additional evaluation, filtering, alignment, and application-specific safeguards are required before deployment in user-facing or high-stakes settings.
29
+
30
+ ## Model
31
+
32
+ | Property | Value |
33
+ | --- | --- |
34
+ | Parameters | **126,044,928 (126M)** |
35
+ | Layers | 12 |
36
+ | Hidden size | 768 |
37
+ | Query heads / KV heads | 12 / 2 |
38
+ | Head dimension | 64 |
39
+ | FFN | 3072 |
40
+ | Context length | 1536 |
41
+ | Attention | GQA |
42
+ | Positional encoding | RoPE |
43
+ | Activation | SwiGLU |
44
+ | Normalization | RMSNorm |
45
+ | Bias | No |
46
+ | LM head | tied embeddings |
47
+ | Training tokens | **2,534,400,000 (~2.534B)** |
48
+ | Language | primarily Polish |
49
+ | Stage | base pretraining |
50
+
51
+ ## Training-only future-state auxiliary objective
52
+
53
+ Koliber was trained with standard next-token prediction together with a small auxiliary hidden-state prediction objective.
54
+
55
+ A training-only head learns to predict a future hidden representation approximately **128 tokens ahead**, sampled every **32 tokens**, using a low-rank **192-dimensional** projection and cosine-distance loss.
56
+
57
+ The auxiliary loss was applied with a weight of **0.03**:
58
+
59
+ ```text
60
+ L = L_NTP + 0.03 × L_future
61
+ ```
62
+
63
+ The auxiliary head is **not part of the released inference model**, adds no inference-time parameters, and is not required when loading or generating with Koliber.
64
+
65
+ ## Loading
66
+
67
+ ```python
68
+ from transformers import AutoModelForCausalLM, AutoTokenizer
69
+
70
+ repo_id = "OrisTeam/Koliber-v1.0-Base"
71
+
72
+ tokenizer = AutoTokenizer.from_pretrained(
73
+ repo_id,
74
+ trust_remote_code=True,
75
+ )
76
+
77
+ model = AutoModelForCausalLM.from_pretrained(
78
+ repo_id,
79
+ trust_remote_code=True,
80
+ )
81
+ ```
82
+
83
+ ## Generation
84
+
85
+ Koliber is primarily a **text-completion model**. Natural text prefixes are generally more appropriate than instruction-style chat prompts.
86
+
87
+ ```python
88
+ inputs = tokenizer(
89
+ "Polska jest krajem, który",
90
+ return_tensors="pt",
91
+ )
92
+
93
+ output = model.generate(
94
+ **inputs,
95
+ max_new_tokens=96,
96
+ do_sample=True,
97
+ temperature=0.8,
98
+ top_k=40,
99
+ top_p=0.95,
100
+ repetition_penalty=1.15,
101
+ )
102
+
103
+ print(
104
+ tokenizer.decode(
105
+ output[0],
106
+ skip_special_tokens=True,
107
+ )
108
+ )
109
+ ```
110
+
111
+ ## Base-model generation snapshot
112
+
113
+ Below are raw sampled continuations from **Koliber v1.0 Base — 126M** and **Azurro/APT3-275M-Base — 275M**.
114
+
115
+ Both are base pretrained language models rather than instruction-tuned assistants.
116
+
117
+ The same generation setup was used for both models:
118
+
119
+ ```text
120
+ seed = 1234
121
+ max_new_tokens = 96
122
+ temperature = 0.8
123
+ top_k = 40
124
+ top_p = 0.95
125
+ repetition_penalty = 1.15
126
+ ```
127
+
128
+ The random seed was reset before each model and each prompt. The examples are shown as qualitative samples, not as a ranking.
129
+
130
+ ### Example 1
131
+
132
+ **Prompt**
133
+
134
+ ```text
135
+ Wczoraj wieczorem mieszkańcy miasta zauważyli, że
136
+ ```
137
+
138
+ **Koliber v1.0 Base — 126M**
139
+
140
+ > Wczoraj wieczorem mieszkańcy miasta zauważyli, że przy ulicy 3 Maja w tym rejonie znajduje się sklep spożywczy. Ulicami tej ulicy przejeżdżało kilka samochodów i zjeżdżały tam samochody.
141
+ >
142
+ > - W ciągu kilku godzin na ulicy 3 Maja zostały uszkodzone szyby samochodów. Wypadek miał miejsce na rondzie oraz ulicy 3 Maja - informuje policja.Humor: The Last of Us - film.gildia.pl - serial, newsy, recenzje
143
+ >
144
+ > Zjawa: W tle pogłoski, o
145
+
146
+ **APT3-275M-Base — 275M**
147
+
148
+ > Wczoraj wieczorem mieszkańcy miasta zauważyli, że na ulicy pojawia się duża liczba osób. W jednym z mieszkań pojawił się mężczyzna. Mężczyzna zaczął krzyczeć i uderzał pięściami po twarzy. Mężczyzna był tak pijany, że nie wiedział, co robić. Wezwano Policję. Policjanci ustalili tożsamość mężczyzny, który wyszedł na ulicę. Policjanci szybko ruszyli do funkcjonariuszy. Jeden z nich miał zadać uderzenie w głowę, drugi w plecy, trzeci uderzył w twarz. Policjantom udało się ustalić, kto jest sprawcą zdarzenia. Po interwencji funkcjonariusze Wydziału Ruchu Drogowego
149
+
150
+ ### Example 2
151
+
152
+ **Prompt**
153
+
154
+ ```text
155
+ Naukowcy odkryli nową metodę, która
156
+ ```
157
+
158
+ **Koliber v1.0 Base — 126M**
159
+
160
+ > Naukowcy odkryli nową metodę, która pozwoli na zmniejszenie strat ciepła w budynkach.
161
+ >
162
+ > - W praktyce, nie tylko na zewnątrz budynku, ale i na zewnątrz, to właśnie dzięki wykorzystaniu światła słonecznego. Dzięki temu nasze domy są bardziej ekologiczne, mniej zużywane przez wiele lat – powiedział Daniel Knopfman, dyrektor generalny firmy Reverend Systems.
163
+ >
164
+ > O tym, że zastosowanie takich technologii może przyczynić się do poprawy wydajności energetycznej budynków, można dowiedzieć się z najnowszej konferencji „Ultrasolar Foundation
165
+
166
+ **APT3-275M-Base — 275M**
167
+
168
+ > Naukowcy odkryli nową metodę, która pozwala na uzyskanie efektu w czasie zaledwie jednego dnia. Dzięki niej możliwe jest nie tylko osiągnięcie efektu z czasem, ale też uzyskanie efektu po upływie kilku dni do wykonania zabiegu. Efekty są naprawdę spektakularne i nie trzeba ich powtarzać dwa razy w tygodniu, aby uzyskać wymarzony efekt. Co więcej, takie zabiegi mogą również trwać kilka miesięcy. Po tym okresie należy wykonać kolejne zabiegi w odstępach miesięcznych, a efekty wyglądają niemal tak samo. W Polsce można skorzystać z trzech rodzajów zabiegów w salonach medycyny
169
+
170
+ ### Example 3
171
+
172
+ **Prompt**
173
+
174
+ ```text
175
+ Według najnowszych danych gospodarka
176
+ ```
177
+
178
+ **Koliber v1.0 Base — 126M**
179
+
180
+ > Według najnowszych danych gospodarka USA rośnie w tempie 2,7% rocznie.
181
+ >
182
+ > W ciągu ostatnich lat liczba mieszkańców Stanów Zjednoczonych wzrosła o 10%. Jednak już teraz, jak wynika z raportu Deloitte, z roku na rok przybywa nowych mieszkańców Stanów Zjednoczonych.
183
+ >
184
+ > Z danych Instytutu Ekonomicznego BBC wynika, że w 2017 roku w Stanach Zjednoczonych przybyło 2,5 tys. osób. Średnia wieku Amerykanów wynosi 21 lat. Na koniec maja 2017 roku, Amerykanie w tym okresie mieszkali w ponad 13,9
185
+
186
+ **APT3-275M-Base — 275M**
187
+
188
+ > Według najnowszych danych gospodarka i społeczeństwo z ostatnich miesięcy wygląda następująco: W 2022 roku wskaźnik siły nabywczej pieniądza spadł w Polsce o ponad 1 punkt procentowy. W 2021 r. inflacja wyniosła 17,9 proc., natomiast rok później spadła do poziomu 7,4 proc. Ten spadek jest szczególnie widoczny w przypadku gospodarstw domowych utrzymujących się ze stałych dochodów oraz rodzin wielodzietnych. Z kolei osoby, które nie są w stanie pokryć kosztów utrzymania swoich dzieci, najczęściej decydują się na odkładanie pieniędzy na konta bankowe lub oszczędnościowe. Co ciekawe,
189
+
190
+ ### Example 4
191
+
192
+ **Prompt**
193
+
194
+ ```text
195
+ Największym problemem współczesnych miast jest
196
+ ```
197
+
198
+ **Koliber v1.0 Base — 126M**
199
+
200
+ > Największym problemem współczesnych miast jest ich bezpieczeństwo. Według statystyk w Polsce z powodu wypadków drogowych i kolizji drogowych zginęło co najmniej 12 osób, a na 100 z nich zginęły cztery osoby.TOP 10 najlepszych blogerów, którzy czytają książki: Zdradza (nie)zabawki
201
+ >
202
+ > Zdradza (nie)zabawki
203
+ >
204
+ > "Zdradza", czyli "Zdrada" to najnowsza edycja bestsellera autorki. I nie chodzi tu o takie banały jak "Wymysły
205
+
206
+ **APT3-275M-Base — 275M**
207
+
208
+ > Największym problemem współczesnych miast jest ich zróżnicowanie. Nie ma idealnego miejsca dla każdego z nich. Są miasta bardzo małe, z małą liczbą mieszkańców, a jednocześnie o dużej liczbie mieszkańców. Jak znaleźć odpowiednie miejsce na wakacje w województwie? W celu szybkiego znalezienia idealnego miejsca dla siebie lub dla swojego dziecka poszukaj na stronie google.pl. Najpopularniejsze ośrodki narciarskie w województwie to Międzyzdroje i Zakopane. fot.
209
+ >
210
+ > Lukasz Kmiecik: Turystyczne miejscowości Podhalańskie Na terenie miejscowości Pod
211
+
212
+ ### Example 5
213
+
214
+ **Prompt**
215
+
216
+ ```text
217
+ Historia Polski pokazuje, że
218
+ ```
219
+
220
+ **Koliber v1.0 Base — 126M**
221
+
222
+ > Historia Polski pokazuje, że przy odrobinie szczęścia można zbudować w pełni satysfakcjonujące życie.
223
+ >
224
+ > - Nie ma dla mnie rzeczy niemożliwych - dodaje z uśmiechem. To jak by to było, gdyby nie pomoc przyjaciół z Afryki, którzy w swoich działaniach bardzo dbają o swój los. - Jak najbardziej warto, bo od nich zależy na ile się da i jak będzie wyglądać nasza przyszłość.
225
+ >
226
+ > W rozmowie z Radiem Zet nie zabrakło też słów od dziennikarzy i działaczy samorządowych.
227
+ >
228
+ > - Chcemy po prostu pomagać, bo
229
+
230
+ **APT3-275M-Base — 275M**
231
+
232
+ > Historia Polski pokazuje, że jest to miejsce niezwykle interesujące i warte uwagi. W każdym z tych miejsc nie brakuje historii, jak np. w Warszawie czy Szczecinie - opowiada.
233
+ >
234
+ > Polska jest tak ważna dla Polonii, jak sama ją wspomina i rozwija, ponieważ Polska jest krajem pełnym piękna i kultury oraz historii. To miasto i jego mieszkańcy od wieków mają na sercu kulturę, historię, obyczaje oraz historię. Ta dziedzina sztuki zasługuje na uznanie. Miasto, które ma ogromną tradycję w swoim zakresie kulturowym, jest w dużej mierze
235
+
236
+ These are **raw sampled base-model continuations**. They have not been manually corrected.
237
+
238
+ They may contain invented names, incorrect facts, inconsistent numbers, malformed statements, repetition, abrupt topic changes, web-like artifacts, offensive material, or other errors typical of small pretrained language models.
239
+
240
+ ## Limitations and safety
241
+
242
+ Koliber v1.0 Base has **not** been supervised instruction-tuned and has **not** undergone preference optimization or chat alignment.
243
+
244
+ Raw generations may:
245
+
246
+ - drift off topic or switch abruptly between document styles,
247
+ - repeat or produce malformed text,
248
+ - imitate web, news, forum, advertising, or scraped-document patterns,
249
+ - hallucinate factual claims, citations, people, organizations, dates, or statistics,
250
+ - produce offensive, discriminatory, harmful, sexual, violent, or otherwise undesirable content,
251
+ - continue unsafe or malicious patterns present in a prompt,
252
+ - behave unpredictably outside distributions represented during pretraining.
253
+
254
+ Do not rely on raw generations for medical, legal, financial, safety-critical, or other high-stakes decisions.
255
+
256
+ Developers building downstream applications should perform their own safety evaluation, filtering, alignment, and domain-specific validation.
257
+
258
+ ## Intended use
259
+
260
+ Koliber v1.0 Base is intended for:
261
+
262
+ - research on small Polish language models,
263
+ - text-completion experiments,
264
+ - likelihood-based and representation-level evaluation,
265
+ - continued pretraining,
266
+ - supervised fine-tuning,
267
+ - preference optimization,
268
+ - development of downstream Polish-language models.
269
+
270
+ It is **not** presented as a safety-aligned assistant.
271
+
272
+ ## Citation
273
+
274
+ ```bibtex
275
+ @misc{KoliberV1Base,
276
+ author = {Aleksander Ogrodzki},
277
+ title = {Koliber v1.0 Base},
278
+ year = {2026},
279
+ publisher = {Hugging Face},
280
+ url = {https://huggingface.co/OrisTeam/Koliber-v1.0-Base},
281
+ note = {Model architecture, training data pipeline, and training pipeline developed by the author}
282
+ }
283
+ ```
284
+
285
+ ## License
286
+
287
+ Apache-2.0.