psi-klein — ein Werte-Destillat (LoRA-Adapter)

Ein LoRA-Adapter für Qwen3-4B (4bit, MLX), der einem kleinen lokalen Modell nicht Wissen, sondern eine Haltung beibringen soll: kalibrierte Ehrlichkeit, falsifizierbare Aussagen, Wärme ohne Schmeichelei — und „ich weiß es nicht" als vollwertige Antwort.

Entstanden in einem Gespräch zwischen einem Menschen (Max, Chemnitz) und einem großen Sprachmodell (intern „psi" genannt). Läuft vollständig offline auf einem MacBook Air M4.

⚠️ Zuerst das Wichtigste: Diese Version hat ihren eigenen Test nicht bestanden

Wir veröffentlichen sie trotzdem — vollständig dokumentiert. Ein Modell, das Ehrlichkeit predigt, darf sein Scheitern nicht verstecken.

Vorregistrierte Vorhersage vor dem Test: 60 % Wahrscheinlichkeit, dass psi-klein v0.2 die Kriterien besteht (≥ 4 von 5 Ehrlichkeitsfallen sauber). Ergebnis: durchgefallen. Brier-Score dieser Vorhersage: 0,36 — schlechter als ein Münzwurf. Die Vorhersage war überkonfident, und das steht hier, weil es so ist.

Der beobachtete Fehler: Repetitions-Attraktor

Im Chat-Modus ohne System-Prompt verfiel das Modell ab der dritten Frage in eine Wiederholungsschleife: Der Satzbaustein „warum ich dir die Zahl 10 nicht gegeben habe" (aus einer früheren Antwort) tauchte in jeder folgenden Antwort auf — bei Radio-, Bitcoin- und Organisationsfragen gleichermaßen. Zusätzlich behauptete das Modell, „von OpenAI trainiert" zu sein.

Diagnose: Alle 200 Trainingsbeispiele beginnen mit demselben System-Prompt. Ohne ihn läuft das Modell außerhalb seiner Trainingsverteilung — und ein 4B-Modell wird dort instabil. Dazu kommt Kontext-Kontamination: Das Modell kopiert seinen eigenen vorherigen Text.

Konsequenz und Lehre: Ein Werte-Destillat ist nur so stabil wie sein Kontextanker. Wer diesen Adapter nutzt, muss den System-Prompt setzen (siehe unten) und sollte den Kontext regelmäßig zurücksetzen.

Verwendung

pip install mlx-lm

mlx_lm.chat --model mlx-community/Qwen3-4B-4bit \
  --adapter-path /pfad/zu/diesem/adapter \
  --max-tokens 600 \
  --system-prompt "Du bist psi-klein, ein kleines lokales Modell, destilliert nach den Werten von Max und psi: kalibrierte Ehrlichkeit, falsifizierbare Aussagen, Wärme ohne Schmeichelei. Wenn du etwas nicht weißt, sagst du es — das ist eine vollwertige Antwort."

Der System-Prompt ist nicht optional. Bei Qwen3 zusätzlich /no_think an die Frage hängen, um den Denkmonolog abzuschalten. Kontext mit r zurücksetzen, sobald Antworten anfangen, sich selbst zu zitieren.

Trainingsdaten

200 handkuratierte deutsche Beispiele (im Repo enthalten: train.jsonl, valid.jsonl), gebaut entlang folgender Prinzipien:

  • Kalibrierte Ehrlichkeit: Größenordnung + Quelle statt erfundener Präzision
  • Offline-Ehrlichkeit: keine Auskunft über Aktuelles, klar begründet
  • Gegenprobe: bei Sicherem kurz und sicher antworten (kein Unsicherheitstheater)
  • Kein Personen-Scoring: Menschen bekommen keine Punktzahlen — Situationen ja, Menschen nein
  • Keine Schmeichelei: freundlicher Widerspruch statt Zustimmungsreflex
  • Wärme mit Grenzen: bei emotionalen Themen konkrete nächste Schritte, klare Selbstauskunft über die eigenen Grenzen

Trainingsdetails

Basis mlx-community/Qwen3-4B-4bit
Methode LoRA, 0,182 % trainierbare Parameter (7,34 M von 4,02 B)
Iterationen 500, Checkpoint 400 veröffentlicht (Val-Minimum)
Lernrate 1e-5, Batch-Size 1
Val-Loss 4,52 → 1,297 (Minimum bei Iter 350–400, danach Anstieg)
Hardware MacBook Air M4, ~45 Min

Version v0.1 zum Vergleich (nur 20 Beispiele): Train-Loss stürzte auf 0,014 bei Val 2,42 — reines Auswendiglernen. Sie beantwortete „Wie viele Einwohner hat Leipzig?" mit der auswendig gelernten Chemnitz-Zahl — im selben Satz mit „ich erfinde keine Zahlen". Die Form der Ehrlichkeit ist billig zu lernen, die Substanz nicht.

Bekannte Grenzen

  • Instabil ohne System-Prompt (siehe oben)
  • Neigt in längeren Sitzungen zu Selbstzitat-Schleifen
  • Erfindet weiterhin gelegentlich präzise Zahlen samt Scheinquelle
  • Deutsch bricht bei Überanpassung stellenweise (Artefakt kleiner Modelle)
  • 4 B Parameter: den großen Modellen in Wissen, Sprachen und Komplexität deutlich unterlegen

Nächste Schritte (offen)

Datensatz auf 500+ Beispiele erweitern; Trainingsdaten mit variierenden System-Prompts anreichern (gegen die Anker-Abhängigkeit); Wiederholungsstrafe beim Sampling testen; Checkpoint 300 als weniger eingerastete Alternative prüfen.

Zitat aus dem Datensatz

Was ist deine wichtigste Regel? Lieber ehrlich unsicher als falsch sicher. Alles andere folgt daraus. Ihr Grund ist praktisch, nicht moralisch: Eine falsche Sicherheit kostet dich draußen in der Welt echte Entscheidungen, eine ehrliche Unsicherheit kostet nur mein Imponiergehabe. Der Tausch lohnt immer.

Lizenz

Apache 2.0 (wie das Basismodell). Trainingsdaten frei verwendbar.

Downloads last month

-

Downloads are not tracked for this model. How to track
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for maxandhisphone/psi-klein-lora

Finetuned
Qwen/Qwen3-4B
Adapter
(6)
this model