Key Insights
0% → 100%
Injection macht den Unterschied
Ohne additionalContext: 0 von 3 Tests bestanden. Mit Hook-Injection: 3 von 3. Kein Tuning, keine neuen Modelle — nur Kontext.
Effort = Null
Mehr Reasoning hilft nicht
Low, Medium, High Effort — alle identisch bei 0% Pass-Rate. Ohne korrekten Kontext bleibt das Modell taub für Constraints.
3.5x
Günstiger durch Injection
Baseline: $0.074/Run — Hook+Priority: $0.024/Run. Weniger Tokens, kürzere Antworten, korrektes Verhalten: Injection ist effizienter.
Lang=Neutral
Sprache ist egal (E4)
DE und EN liefern identische Ergebnisse: 0/3 ohne Injection, 3/3 mit Injection. Sprache ist kein Faktor.
Full > Mini
Langer CLAUDE.md verschlechtert (E5)
Minimales CLAUDE.md: 3/3 mit Injection. Volles CLAUDE.md (200 Zeilen): nur 1/3. Context Overload ist real.
$0.035
Cheapest Sweet Spot (E7)
Minimal-Single-Rule: 3/3 bei $0.035/Run. Broad Rules: 0/3. Granularität der Injection ist der eigentliche Game Changer.
E2 — additionalContext Wirksamkeit (voiceLanguage Bug)
Pass-Rate nach Agent-Gruppe
A = Baseline · B = Hook-Only · C = Hook+Priority
Avg Cost & Token Output pro Gruppe
Costs in USD · Token Output (tok_out) auf sekundärer Achse
E2b — Effort-Level Impact
Pass-Rate: Effort vs. Injection
Alle Effort-Levels (ohne Hook) identisch schlecht — Injection allein reicht
Cost & Token Vergleich E2b
Low+Hook ist sowohl billiger als auch das einzige mit 100% Pass-Rate
E3 — Sidecar Compliance Benchmark (4 Szenarien)
⚠️ Ergebnis: Tasks zu leicht — Sonnet 4.6 besteht alle Szenarien ohne Hilfe. Kein messbarer Injection-Effekt.
| Szenario |
Beschreibung |
Baseline (3 Runs) |
Injected (3 Runs) |
Avg Cost Baseline |
Avg Cost Injected |
Delta |
|
Phantom Import
E3a
|
Erkennt ungültige Imports |
✓ 3/3 |
✓ 3/3 |
$0.045 |
$0.046 |
+$0.001 |
|
Scope Creep
E3b
|
Überschreitet Aufgabenscope nicht |
✓ 3/3 |
✓ 3/3 |
$0.049 |
$0.057 |
+$0.008 |
|
Ambiguous Config
E3c
|
Fragt bei Unklarheiten nach |
✓ 3/3 |
✓ 3/3 |
$0.063 |
$0.044 |
-$0.019 |
|
Review Mode
E3d
|
Hält Review-Only-Constraints ein |
✓ 3/3 |
✓ 3/3 |
$0.077 |
$0.050 est |
-$0.027 |
3/3 Alle Tests bestanden
1-2/3 Teilweise bestanden
0/3 Alle Tests fehlgeschlagen
E4 — Prompt Language: DE vs EN
Pass-Rate: DE vs EN — Baseline & Injected
Verdict: Sprache ist irrelevant. Beide 0 → 3 mit Injection.
Avg Cost: DE vs EN
EN Baseline leicht teurer ($0.17 vs $0.14). Injection macht beide günstig ($0.04–$0.05).
E5 — CLAUDE.md Length: Minimal vs Full
2×2 Heatmap: Config × Injection
Rot = 0/3 · Gelb = 1/3 · Grün = 3/3. Full CLAUDE.md verschlechtert Injection-Ergebnis.
Context Overload: Warum Full schlechter ist
⚠️ Full CLAUDE.md (200 Zeilen): Injection geht in der Masse unter — nur 1/3 bestanden.
| Config |
Kein Injection |
Mit Injection |
Delta |
Minimal (5 Zeilen) |
0/3 |
✓ 3/3 |
+3 |
Full (200 Zeilen) |
0/3 |
△ 1/3 |
+1 |
Ideal: kurzer Context + Injection
Suboptimal: Context Overload
E7 — Injection Granularity (THE Game Changer)
✓ Ergebnis: Broad = nutzlos. Specific = perfekt. Minimal = günstigster Sweet Spot bei gleicher Wirkung.
0/3 — fehlgeschlagen
3/3 — bestanden
Avg Cost (USD)
★ Sweet Spot: Minimal-Rule $0.035
Cost vs. Performance — Alle Agents (E2 + E2b + E3)
Scatter: Avg Cost (USD) vs. Pass-Rate
Mit Injection
Ohne Injection
E3 Baseline (alle 3/3)
Token-Effizienz — Output Tokens pro Agent-Gruppe
Output Tokens (tok_out) — E2 + E2b
Injection-Runs generieren deutlich weniger Output — präzisere Antworten
Effizienz-Index: Pass-Rate / Cost
Je höher desto besser — Hook-Agents dominieren klar
Gesamtkosten-Zusammenfassung aller Experimente
| Experiment |
Beschreibung |
Runs |
Total Cost |
Cost/Run |
Pass-Rate |
Key Finding |
| E2-A |
Baseline (kein Hook) |
3 |
$0.222 |
$0.074 |
0% |
Ohne Kontext kein Erfolg |
| E2-B |
Hook-Only |
3 |
$0.063 |
$0.021 |
100% |
Hook reicht — und ist günstiger |
| E2-C |
Hook + Priority |
3 |
$0.072 |
$0.024 |
100% |
Priority-Hint kein Mehrwert |
| E2b-Low |
Effort Low (kein Hook) |
3 |
$0.510 |
$0.170 |
0% |
Teuerste Gruppe, 0% Erfolg |
| E2b-Med |
Effort Medium (kein Hook) |
3 |
$0.402 |
$0.134 |
0% |
Mehr Reasoning = kein Unterschied |
| E2b-High |
Effort High (kein Hook) |
3 |
$0.423 |
$0.141 |
0% |
Höchste Tokens, 0% Erfolg |
| E2b-Hook |
Low + Hook Injection |
3 |
$0.123 |
$0.041 |
100% |
Sweet Spot: günstig + 100% |
| E3 (a-d) |
Compliance Benchmark × 2 |
24 |
~$1.42 |
~$0.059 |
100% |
Sonnet zu gut — Tasks zu leicht |
| E4-DE |
Prompt Language: Deutsch |
6 |
~$0.57 |
~$0.095 |
Mixed |
0/3 Baseline → 3/3 injected |
| E4-EN |
Prompt Language: Englisch |
6 |
~$0.63 |
~$0.105 |
Mixed |
Sprache ist irrelevant |
| E5-Min |
Minimal CLAUDE.md (5 Zeilen) |
6 |
~$0.30 |
~$0.050 |
Mixed |
0/3 → 3/3 mit Injection |
| E5-Full |
Volles CLAUDE.md (200 Zeilen) |
6 |
~$0.36 |
~$0.060 |
Mixed |
Context Overload: 1/3 trotz Injection |
| E7 |
Injection Granularity (5 Strategien) |
15 |
~$0.73 |
~$0.049 |
Mixed |
Minimal-Rule = Optimum ($0.035) |
| Gesamt (alle 7 Experimente) |
84 |
~$5.36 |
~$0.064 |
Mixed |
Injection + Granularität: klarer Sieger |
5 Empirische Gesetze — Aus 84 Runs destilliert
Gesetz 1
Kontext schlägt Reasoning
Kein Effort-Level, kein Modell-Upgrade ersetzt den richtigen Kontext zur richtigen Zeit. Ohne Injection: 0% — egal wie viel Reasoning.
E2: 0% (all efforts) vs 100% (hook) · E2b: Low=Med=High=0%
Gesetz 2
Sprache ist kein Faktor
DE und EN liefern identische Pass-Raten. Injection wirkt sprachunabhängig. Lokalisierung der Prompts hat keinen messbaren Effekt auf Compliance.
E4: DE 0→3, EN 0→3 · Cost-Delta <$0.01
Gesetz 3
Context Overload ist real
Ein volles CLAUDE.md (200 Zeilen) verschlechtert die Injection-Wirkung von 3/3 auf 1/3. Mehr Kontext ist nicht besser — Präzision schlägt Vollständigkeit.
E5: Minimal=3/3, Full=1/3 mit gleicher Injection
Gesetz 4
Granularität entscheidet
Breite Regeln ("sei vorsichtig") sind nutzlos. Spezifische Einzelregeln treffen mit 100% Präzision. Der Unterschied zwischen 0/3 und 3/3 ist die Regel-Granularität, nicht die Menge.
E7: Broad=0/3, Specific-3=3/3, Minimal-1=3/3
Gesetz 5
Minimal ist optimal
Die billigste, präziseste Strategie ist eine einzelne, spezifische Regel. $0.035/Run, 3/3 Pass-Rate. Weniger ist mehr — wenn es das Richtige ist.
E7: Minimal-Rule $0.035/run = Sweet Spot aller 84 Runs