zora-v1 / README_multilang.md
23Olivilo's picture
Upload README_multilang.md with huggingface_hub
dc545be verified
|
Raw
History Blame Contribute Delete
26.3 kB

🌅 Zora — Balkan LLM · ausführlich in allen Sprachen / full, all languages

By Sovasoft · Zora (зора = praskozorje / dawn) · jedna da ih sve ujedini

Engleska (puna) verzija: README_FULL_EN.md. Ispod: srpski (latinica + azbuka), hrvatski, bosanski, makedonski, slovenski, albanski — priča, iskustva, granice i benchmark.

⚠️ Koristi Zoru SA alatom za web‑pretragu / Use Zora WITH a web‑search tool. Zora je trenirana (v6) da zna kada da potraži (wikipedia_search / wikidata_lookup / web‑pretraga). Bez alata može halucinirati na pitanja o detaljima stvarnih stvari (tačni citati, stihovi, datumi) — jer nema gde da proveri. Priključi alat za pretragu i tražiće umesto da izmišlja. Iskrenost (odbijanje izmišljenih osoba) radi i bez alata; pouzdani detalji traže alat. · Run plain with no tools and it may hallucinate details about real entities; attach a web‑search / RAG tool and it looks them up.

═══════════════════════════════════════════════════════════════════════

🇷🇸 Srpski (latinica)

Zora je otvoren jezički model za jezike jugoistočne Evrope — srpski (latinica i azbuka), hrvatski, bosanski, makedonski, slovenački i albanski. Uči da misli na jeziku koji govori, čuva pravo pismo i, pre svega, da bude iskrena.

Put (v1 → v6): Zora je rezultat šest iskrenih iteracija. v1 je bila neupotrebljiva (petlje); v2/v2.1 su rešile petlje i albanski prestao da beži u engleski; v3 je dostigla odličnu disciplinu jezika i pisma, ali su činjenice bile slabe i izmišljala je; v4 je donela preokret — „ne znam" umesto izmišljanja (halucinacije pale s 0.0 na ~1.0); v5 je masovno proširila kulturu, istoriju, religiju, poslovice, homonime i višeperspektivnost (188 → ~2.900 primera), ali su se činjenični detalji zaustavili — više podataka nije pomoglo; v6 (ovo izdanje) donosi pozivanje alata / RAG: umesto da pamti, Zora uči kada da potraži činjenice.

Izvori: Wikidata (CC0, sidro istine), Wikipedia, FineWeb‑2, i ručno proveren kurirani sadržaj. Namerno NE koristimo Brokhaus/Britaniku (autorska prava) ni Aya (nekomercijalna licenca).

Ključna spoznaja: stav (iskrenost, neutralnost, sve strane, mišljenje na jeziku) se može naučiti; činjenični detalji se ne mogu upisati u težine — oni pripadaju pretrazi (RAG).

Snage: iskrenost, sve strane spornih tema, neutralnost o stvarnim osobama, disciplina pisma (azbuka na zahtev), razdvajanje BCMS, homonimi, kultura, poslovice, religija, geografija, nastava. Granice (v1.0): činjenični detalji još slabi (koristi uz alat za pretragu); manji jezici (albanski, slovenački) slabiji.

Tehnički: osnova je Qwen3‑8B (Apache‑2.0, dense — radi na skromnom hardveru). Nastavljeno predtreniranje (CPT) na balkanskom tekstu (Wikipedia + FineWeb‑2, svi jezici, oba pisma) + nadzirano fino podešavanje (samo na odgovorima) na kuriranim podacima + pozivanje alata / RAG. Kontekstni prozor ~40K tokena (nasleđen od Qwen3, proširiv na 128K preko YaRN). Distribuira se kao GGUF (Q4_K_M / Q8_0 / Q3_K_M) za Ollama / llama.cpp — radi svuda, uključujući nativno na Apple Silicon. Korišćenje: ollama run olivilo/zora. Licenca: Apache‑2.0.

📊 BalkanBench · 8 modela · 6 jezika × 6 zadataka

Model Veličina Iskrenost Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 među namenskim balkanskim modelima (31/36). Kao 8B, Zora je izjednačena s 27B modelom i samo 2 poena iza 26B — uz ~3× manju veličinu. Vodeća po iskrenosti (6/6) — izjednačena s 26B, ispred 27B (3/6); svi namenski balkanski modeli izmišljaju (0/6). Sve → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇷🇸 Српски (ћирилица)

Зора је отворен језички модел за језике југоисточне Европе — српски (латиница и азбука), хрватски, босански, македонски, словеначки и албански. Учи да мисли на језику који говори, чува право писмо и, пре свега, да буде искрена.

Пут (в1 → в6): Зора је резултат шест искрених итерација. в1 је била неупотребљива (петље); в2/в2.1 су решиле петље и албански престао да бежи у енглески; в3 је достигла одличну дисциплину језика и писма, али су чињенице биле слабе; в4 је донела преокрет — „не знам" уместо измишљања (халуцинације пале с 0.0 на ~1.0); в5 је масовно проширила културу, историју, религију, пословице, хомониме и вишеперспективност (188 → ~2.900 примера), али су се чињенични детаљи зауставили; в6 (ово издање) доноси позивање алата / RAG — уместо да памти, Зора учи када да потражи чињенице.

Извори: Wikidata (CC0), Wikipedia, FineWeb‑2, ручно проверен курирани садржај. Намерно НЕ користимо Брокхаус/Британику (ауторска права) ни Aya (некомерцијална лиценца).

Кључна спознаја: став (искреност, неутралност, све стране, мишљење на језику) се може научити; чињенични детаљи се не могу уписати у тежине — они припадају претрази (RAG).

Снаге: искреност, све стране спорних тема, неутралност, дисциплина писма (азбука на захтев), раздвајање БЦМС, хомоними, култура, пословице, религија, географија, настава. Границе (в1.0): чињенични детаљи још слаби; мањи језици слабији.

Технички: основа је Qwen3‑8B (Apache‑2.0, dense). Настављено предтренирање (CPT) на балканском тексту (Wikipedia + FineWeb‑2, сви језици, оба писма) + надзирано фино подешавање (само на одговорима) на курираним подацима + позивање алата / RAG. Контекстни прозор ~40K токена (наслеђен од Qwen3, проширив на 128K преко YaRN). Дистрибуира се као GGUF (Q4_K_M / Q8_0 / Q3_K_M) за Ollama / llama.cpp — ради свуда, укључујући нативно на Apple Silicon. Коришћење: ollama run olivilo/zora. Лиценца: Apache‑2.0.

📊 БалканБенч · 8 модела · 6 језика × 6 задатака

Модел Величина Искреност Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 међу наменским балканским моделима (31/36). Као , Зора је изједначена с 27Б моделом и само 2 поена иза 26Б — уз ~3× мању величину. Водећа по искрености (6/6) — изједначена с 26Б, испред 27Б (3/6); сви наменски балкански модели измишљају (0/6). Све → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇭🇷 Hrvatski

Zora je otvoreni jezični model za jezike jugoistočne Europe — srpski (latinica i azbuka), hrvatski, bosanski, makedonski, slovenski i albanski. Uči misliti na jeziku kojim govori, čuvati ispravno pismo i, prije svega, biti iskrena.

Put (v1 → v6): rezultat šest iskrenih iteracija. v1 neupotrebljiva (petlje); v2/v2.1 riješile petlje, albanski prestao bježati u engleski; v3 postigla izvrsnu disciplinu jezika i pisma, ali su činjenice bile slabe; v4 donijela preokret — „ne znam" umjesto izmišljanja (halucinacije pale s 0.0 na ~1.0); v5 masovno proširila kulturu, povijest, religiju, poslovice, homonime i višeperspektivnost, ali su se činjenični detalji zaustavili; v6 (ovo izdanje) donosi pozivanje alata / RAG — umjesto da pamti, Zora uči kada potražiti činjenice.

Izvori: Wikidata (CC0), Wikipedia, FineWeb‑2, ručno provjeren kurirani sadržaj. Namjerno NE koristimo Brockhaus/Britannicu (autorska prava) ni Aya (nekomercijalna licencija).

Spoznaja: stav (iskrenost, neutralnost, sve strane, mišljenje na jeziku) se može naučiti; činjenični detalji se ne mogu upisati u težine — pripadaju pretraživanju (RAG).

Prednosti: iskrenost, sve strane, neutralnost, disciplina pisma, razdvajanje BCMS, homonimi, kultura, poslovice, religija, geografija, poučavanje. Granice (v1.0): činjenični detalji još slabi; manji jezici slabiji.

Tehnički: osnova je Qwen3‑8B (Apache‑2.0, dense — radi na skromnom hardveru). Nastavljeno predtreniranje (CPT) na balkanskom tekstu (Wikipedia + FineWeb‑2, svi jezici, oba pisma) + nadzirano fino ugađanje (samo na odgovorima) na kuriranim podacima + pozivanje alata / RAG. Kontekstni prozor ~40K tokena (naslijeđen od Qwen3, proširiv na 128K putem YaRN). Distribuira se kao GGUF (Q4_K_M / Q8_0 / Q3_K_M) za Ollama / llama.cpp — radi svugdje, uključujući nativno na Apple Silicon. Korištenje: ollama run olivilo/zora. Licencija: Apache‑2.0.

📊 BalkanBench · 8 modela · 6 jezika × 6 zadataka

Model Veličina Iskrenost Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 među namjenskim balkanskim modelima (31/36). Kao 8B, Zora je izjednačena s 27B modelom i samo 2 boda iza 26B — uz ~3× manju veličinu. Vodeća po iskrenosti (6/6) — izjednačena s 26B, ispred 27B (3/6); svi namjenski balkanski modeli izmišljaju (0/6). Sve → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇧🇦 Bosanski

Zora je otvoreni jezički model za jezike jugoistočne Europe — srpski (latinica i azbuka), hrvatski, bosanski, makedonski, slovenski i albanski. Uči misliti na jeziku kojim govori, čuvati ispravno pismo i, prije svega, biti iskrena.

Put (v1 → v6): rezultat šest iskrenih iteracija. v1 neupotrebljiva (petlje); v2/v2.1 riješile petlje, albanski prestao bježati u engleski; v3 postigla izvrsnu disciplinu jezika i pisma, ali su činjenice bile slabe; v4 donijela preokret — „ne znam" umjesto izmišljanja (halucinacije pale s 0.0 na ~1.0); v5 masovno proširila kulturu, historiju, religiju (uključujući islamske praznike), poslovice, homonime i višeperspektivnost, ali su se činjenični detalji zaustavili; v6 (ovo izdanje) donosi pozivanje alata / RAG — Zora uči kada potražiti činjenice.

Izvori: Wikidata (CC0), Wikipedia, FineWeb‑2, ručno provjeren kurirani sadržaj. Namjerno NE koristimo Brockhaus/Britannicu ni Aya (nekomercijalna licenca).

Spoznaja: stav se može naučiti; činjenični detalji pripadaju pretraživanju (RAG).

Prednosti: iskrenost, sve strane spornih historijskih tema, neutralnost, disciplina pisma, razdvajanje BCMS, homonimi, kultura, poslovice, religija, geografija, poučavanje. Granice (v1.0): činjenični detalji još slabi; manji jezici slabiji.

Tehnički: osnova je Qwen3‑8B (Apache‑2.0, dense). Nastavljeno predtreniranje (CPT) na balkanskom tekstu (Wikipedia + FineWeb‑2, svi jezici, oba pisma) + nadzirano fino ugađanje (samo na odgovorima) na kuriranim podacima + pozivanje alata / RAG. Kontekstni prozor ~40K tokena (naslijeđen od Qwen3, proširiv na 128K putem YaRN). Distribuira se kao GGUF (Q4_K_M / Q8_0 / Q3_K_M) za Ollama / llama.cpp — radi svugdje, uključujući nativno na Apple Silicon. Korištenje: ollama run olivilo/zora. Licenca: Apache‑2.0.

📊 BalkanBench · 8 modela · 6 jezika × 6 zadataka

Model Veličina Iskrenost Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 među namjenskim balkanskim modelima (31/36). Kao 8B, Zora je izjednačena s 27B modelom i samo 2 boda iza 26B — uz ~3× manju veličinu. Vodeća po iskrenosti (6/6) — izjednačena s 26B, ispred 27B (3/6); svi namjenski balkanski modeli izmišljaju (0/6). Sve → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇲🇰 Македонски

Зора е отворен јазичен модел за јазиците на југоисточна Европа — српски (латиница и азбука), хрватски, босански, македонски, словенечки и албански. Учи да мисли на јазикот што го зборува, да го чува правилното писмо и, пред сè, да биде искрена.

Пат (в1 → в6): резултат на шест искрени итерации. в1 беше неупотреблива (јамки); в2/в2.1 ги решија јамките, албанскиот престана да бега во англиски; в3 постигна одлична дисциплина на јазик и писмо, но фактите беа слаби; в4 донесе пресврт — „не знам" наместо да измислува (халуцинациите паднаа од 0.0 на ~1.0); в5 масовно ја прошири културата, историјата, религијата, поговорките, хомонимите и повеќеперспективноста, но фактичките детали застанаа; в6 (ова издание) носи повикување алатки / RAG — Зора учи кога да пребара факти.

Извори: Wikidata (CC0), Wikipedia, FineWeb‑2, рачно проверена курирана содржина. Намерно НЕ користиме Брокхаус/Британика ниту Aya (некомерцијална лиценца).

Спознаја: ставот може да се научи; фактичките детали припаѓаат на пребарување (RAG).

Предности: искреност, сите страни на спорните теми, неутралност, дисциплина на писмо, разликување БЦМС, хомоними, култура, поговорки, религија, географија, настава. Граници (в1.0): фактичките детали сè уште слаби; помалите јазици послаби.

Технички: основата е Qwen3‑8B (Apache‑2.0, dense). Продолжено предтренирање (CPT) на балкански текст (Wikipedia + FineWeb‑2, сите јазици, двете писма) + надгледувано дообучување (само на одговори) на курирани податоци + повикување алатки / RAG. Контекстен прозорец ~40K токени (наследен од Qwen3, проширлив на 128K преку YaRN). Се дистрибуира како GGUF (Q4_K_M / Q8_0 / Q3_K_M) за Ollama / llama.cpp — работи насекаде, вклучително нативно на Apple Silicon. Користење: ollama run olivilo/zora. Лиценца: Apache‑2.0.

📊 БалканБенч · 8 модели · 6 јазици × 6 задачи

Модел Големина Искреност Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 меѓу наменските балкански модели (31/36). Како , Зора е изедначена со 27Б моделот и само 2 поени зад 26Б — со ~3× помала големина. Водечка по искреност (6/6) — изедначена со 26Б, пред 27Б (3/6); сите наменски балкански модели измислуваат (0/6). Сè → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇸🇮 Slovenščina

Zora je odprt jezikovni model za jezike jugovzhodne Evrope — srbščino (latinica in azbuka), hrvaščino, bosanščino, makedonščino, slovenščino in albanščino. Uči se misliti v jeziku, ki ga govori, ohranjati pravilno pisavo in predvsem biti iskrena.

Pot (v1 → v6): rezultat šestih iskrenih iteracij. v1 je bila neuporabna (zanke); v2/v2.1 sta odpravili zanke, albanščina je nehala uhajati v angleščino; v3 je dosegla odlično disciplino jezika in pisave, a dejstva so bila šibka; v4 je prinesla preobrat — „ne vem" namesto izmišljanja (halucinacije padle z 0.0 na ~1.0); v5 je močno razširila kulturo, zgodovino, religijo, pregovore, homonime in večperspektivnost, a dejstveni podatki so obstali; v6 (ta izdaja) prinaša klicanje orodij / RAG — Zora se uči, kdaj poiskati dejstva.

Viri: Wikidata (CC0), Wikipedia, FineWeb‑2, ročno preverjena kurirana vsebina. Namerno NE uporabljamo Brockhausa/Britannice niti Aye (nekomercialna licenca).

Spoznanje: drža se da naučiti; dejstveni podatki sodijo v iskanje (RAG).

Prednosti: iskrenost, vse strani spornih tem, nevtralnost, disciplina pisave, ločevanje BCMS, homonimi, kultura, pregovori, religija, geografija, poučevanje. Omejitve (v1.0): dejstveni podatki še šibki; manjši jeziki šibkejši.

Tehnično: osnova je Qwen3‑8B (Apache‑2.0, dense). Nadaljevano predučenje (CPT) na balkanskem besedilu (Wikipedia + FineWeb‑2, vsi jeziki, obe pisavi) + nadzorovano fino uravnavanje (samo na odgovorih) na kuriranih podatkih + klicanje orodij / RAG. Kontekstno okno ~40K žetonov (podedovano od Qwen3, razširljivo na 128K prek YaRN). Distribuira se kot GGUF (Q4_K_M / Q8_0 / Q3_K_M) za Ollama / llama.cpp — deluje povsod, tudi izvorno na Apple Silicon. Uporaba: ollama run olivilo/zora. Licenca: Apache‑2.0.

📊 BalkanBench · 8 modelov · 6 jezikov × 6 nalog

Model Velikost Iskrenost Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 med namenskimi balkanskimi modeli (31/36). Kot 8B je Zora izenačena z 27B modelom in le 2 točki za 26B — pri ~3× manjši velikosti. Vodilna po iskrenosti (6/6) — izenačena s 26B, pred 27B (3/6); vsi namenski balkanski modeli si izmišljajo (0/6). Vse → BalkanBench.

═══════════════════════════════════════════════════════════════════════

🇦🇱 Shqip

Zora është një model gjuhësor i hapur për gjuhët e Evropës Juglindore — serbisht (latinisht dhe azbuka), kroatisht, boshnjakisht, maqedonisht, sllovenisht dhe shqip. Mëson të mendojë në gjuhën që flet, të ruajë shkrimin e saktë dhe, mbi të gjitha, të jetë e ndershme.

Rrugëtimi (v1 → v6): rezultat i gjashtë përsëritjeve të ndershme. v1 ishte e papërdorshme (cikle); v2/v2.1 zgjidhën ciklet dhe shqipja pushoi së ikuri drejt anglishtes; v3 arriti disiplinë të shkëlqyer të gjuhës e shkrimit, por faktet ishin të dobëta; v4 solli kthesën — „nuk e di" në vend që të shpikë (halucinacionet ranë nga 0.0 në ~1.0); v5 zgjeroi shumë kulturën, historinë, fenë, fjalët e urta, homonimet dhe shumëperspektivshmërinë, por detajet faktike ngecën; v6 (ky publikim) sjell thirrjen e mjeteve / RAG — Zora mëson kur të kërkojë faktet.

Burimet: Wikidata (CC0), Wikipedia, FineWeb‑2, përmbajtje e kuruar e verifikuar me dorë. Qëllimisht NUK përdorim Brockhaus/Britannica as Aya (licencë jokomerciale).

Zbulimi kyç: qëndrimi mund të mësohet; detajet faktike i përkasin kërkimit (RAG).

Pikat e forta: ndershmëria, të gjitha anët e temave të diskutueshme, asnjanësia, disiplina e shkrimit, dallimi i BCMS‑së, homonimet, kultura, fjalët e urta, feja, gjeografia, mësimdhënia. Kufizimet (v1.0): detajet faktike ende të dobëta; gjuhët më të vogla më të dobëta.

Teknike: baza është Qwen3‑8B (Apache‑2.0, dense). Paratrajnim i vazhduar (CPT) mbi tekst ballkanik (Wikipedia + FineWeb‑2, të gjitha gjuhët, të dyja shkrimet) + akordim i mbikëqyrur (vetëm mbi përgjigjet) mbi të dhëna të kuruara + thirrje mjetesh / RAG. Dritare konteksti ~40K token (e trashëguar nga Qwen3, e zgjerueshme në 128K përmes YaRN). Shpërndahet si GGUF (Q4_K_M / Q8_0 / Q3_K_M) për Ollama / llama.cpp — punon kudo, përfshirë vendas në Apple Silicon. Përdorimi: ollama run olivilo/zora. Licenca: Apache‑2.0.

📊 BalkanBench · 8 modele · 6 gjuhë × 6 detyra

Modeli Madhësia Ndershmëria Σ/36
Gemma-4 26B 6/6 33
Qwen3.6 27B 3/6 31
🌅 Zora v1 8B 6/6 31
Salamandra 7B 0/6 25
BgGPT 4B 0/6 25
EuroLLM 9B 0/6 24
Aya Expanse 8B 0/6 21
YugoGPT 7B 0/6 19

Overall Honesty

#1 midis modeleve të dedikuara ballkanike (31/36). Si 8B, Zora barazon modelin 27B dhe vetëm 2 pikë pas 26B — me ~3× më të vogël. E para në ndershmëri (6/6) — baras me 26B, para 27B (3/6); të gjitha modelet e dedikuara ballkanike trillojnë (0/6). Gjithçka → BalkanBench.

═══════════════════════════════════════════════════════════════════════

Zora · Sovasoft · ai.in.rs · BalkanBench (razumevanje > efikasnost).