Mankei

Mankei-1B-Chat (experimentell)

Deutsches Chat-Sprachmodell mit 1,01 Mrd. Parametern, von Grund auf in Deutschland trainiert — eigener deutscher Tokenizer (32k), auf einer einzelnen Karte. Gebaut für den CPU-Betrieb, und die Grundlage der Mankei-326M-Embedder- und Mankei-326M-Reranker-Modelle.

Fähigkeiten

  • Deutsche Faktenabfragen (z. B. „Hauptstadt von Bayern" → „München")
  • Rückfrage bzw. Zurückhaltung bei Unsicherheit statt erfundener Antworten
  • Flüssiges, grammatisches Deutsch

Benchmark — deutsches MMLU (deutsche From-Scratch-Modelle)

Multiple-Choice per Log-Likelihood auf deutschem MMLU, verglichen mit anderen von Grund auf trainierten deutschen Modellen (faire Klasse):

Modell Größe Accuracy
Mankei-1B-Chat 1,01 B 23,0 %
gpt2-xl-wechsel-german 1,56 B 20,2 %
LLäMmlein-1B 1,10 B 20,0 %
german-gpt2 (dbmdz) 0,12 B 20,0 %

Mankei-1B führt das deutsche From-Scratch-Feld an. Kleine From-Scratch-Modelle liegen bei reinem Faktenwissen generell nahe dem Zufallsniveau (25 %) — Mankeis Stärke sind deutscher Sprachfluss und souveräner lokaler Betrieb, nicht der Wissens-Benchmark.

Mankei-Benchmarks — Retrieval, Reranking, Chat

Verwendung

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
tok = AutoTokenizer.from_pretrained("keyvan-ai/Mankei-1B-Chat")
model = AutoModelForCausalLM.from_pretrained("keyvan-ai/Mankei-1B-Chat", dtype=torch.bfloat16)
msgs = [{"role": "user", "content": "Was ist die Hauptstadt von Bayern?"}]
ids = tok.apply_chat_template(msgs, add_generation_prompt=True, return_tensors="pt")
out = model.generate(ids, max_new_tokens=64, temperature=0.7, top_p=0.9,
                     repetition_penalty=1.15, do_sample=True)
print(tok.decode(out[0][ids.shape[1]:], skip_special_tokens=True))

Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.

Lokaler Betrieb (GGUF)

GGUF-Quantisierungen (f16 → Q3_K_M) direkt in diesem Repo — und gespiegelt im eigenen keyvan-ai/Mankei-1B-Chat-GGUF (Model-Tree):

Quantisierung Größe Download
f16 1,9 GB Mankei-1B-Chat-f16.gguf
Q8_0 1,0 GB Mankei-1B-Chat-q8_0.gguf
Q6_K 854 MB Mankei-1B-Chat-q6_k.gguf
Q5_K_M 727 MB Mankei-1B-Chat-q5_k_m.gguf
Q4_K_M 637 MB Mankei-1B-Chat-q4_k_m.gguf
Q3_K_M 512 MB Mankei-1B-Chat-q3_k_m.gguf
# Ollama
ollama run hf.co/keyvan-ai/Mankei-1B-Chat:Q4_K_M

# llama.cpp
llama-cli -hf keyvan-ai/Mankei-1B-Chat:Q4_K_M

Empfohlenes Sampling: temperature 0.7 · top_p 0.9 · repetition_penalty 1.15.

Architektur

Llama-Architektur · 1,013 Mrd. Parameter · hidden 1536 · 32 Layer · 24/6 Heads (GQA) · SwiGLU · RMSNorm · RoPE θ 500 000 · Kontext 4096 · Vokabular 32 768 · tied embeddings.

Trainingsdaten

Pretraining auf lizenzgeprüften deutschen und englischen Quellen (EN gezielt für Mathematik, Wissenschaft, Bildung):

Quelle Domäne Lizenz
FineWeb2-HQ DE Web (Top-Filter) ODC-By 1.0
FinePDFs DE PDF-Volltext ODC-By 1.0
FineMath EN Mathematik ODC-By 1.0
OpenWebMath EN Mathematik ODC-By 1.0
FineWeb-Edu EN Web (Bildung) ODC-By 1.0
Wikipedia (de) DE Enzyklopädie CC-BY-SA 4.0
German Commons (openlegaldata / openalex) DE Recht & Wissenschaft ≥ CC-BY-SA 4.0

Chat-SFT: selbst erzeugt und CC0, gegen ein festes Prüfset dekontaminiert.

Downloads last month
-
Safetensors
Model size
1B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for keyvan-ai/Mankei-1B-Chat

Quantizations
1 model

Datasets used to train keyvan-ai/Mankei-1B-Chat