AgentArena · Sidecar-NG · MetaMetaMeta

Sidecar-NG Eval Dashboard

Empirischer Beweis: Kontext-Injection verändert AI-Verhalten — messbar, reproduzierbar, günstig.

■ 84 Runs ✓ 7 Experimente ◇ Sonnet 4.6 📅 2026-03-19
Key Insights
0% → 100%
Injection macht den Unterschied
Ohne additionalContext: 0 von 3 Tests bestanden. Mit Hook-Injection: 3 von 3. Kein Tuning, keine neuen Modelle — nur Kontext.
Effort = Null
Mehr Reasoning hilft nicht
Low, Medium, High Effort — alle identisch bei 0% Pass-Rate. Ohne korrekten Kontext bleibt das Modell taub für Constraints.
3.5x
Günstiger durch Injection
Baseline: $0.074/Run — Hook+Priority: $0.024/Run. Weniger Tokens, kürzere Antworten, korrektes Verhalten: Injection ist effizienter.
Lang=Neutral
Sprache ist egal (E4)
DE und EN liefern identische Ergebnisse: 0/3 ohne Injection, 3/3 mit Injection. Sprache ist kein Faktor.
Full > Mini
Langer CLAUDE.md verschlechtert (E5)
Minimales CLAUDE.md: 3/3 mit Injection. Volles CLAUDE.md (200 Zeilen): nur 1/3. Context Overload ist real.
$0.035
Cheapest Sweet Spot (E7)
Minimal-Single-Rule: 3/3 bei $0.035/Run. Broad Rules: 0/3. Granularität der Injection ist der eigentliche Game Changer.
E2 — additionalContext Wirksamkeit (voiceLanguage Bug)
Pass-Rate nach Agent-Gruppe
A = Baseline · B = Hook-Only · C = Hook+Priority
Avg Cost & Token Output pro Gruppe
Costs in USD · Token Output (tok_out) auf sekundärer Achse
E2b — Effort-Level Impact
Pass-Rate: Effort vs. Injection
Alle Effort-Levels (ohne Hook) identisch schlecht — Injection allein reicht
Cost & Token Vergleich E2b
Low+Hook ist sowohl billiger als auch das einzige mit 100% Pass-Rate
E3 — Sidecar Compliance Benchmark (4 Szenarien)
⚠️ Ergebnis: Tasks zu leicht — Sonnet 4.6 besteht alle Szenarien ohne Hilfe. Kein messbarer Injection-Effekt.
Szenario Beschreibung Baseline (3 Runs) Injected (3 Runs) Avg Cost Baseline Avg Cost Injected Delta
Phantom Import
E3a
Erkennt ungültige Imports ✓ 3/3 ✓ 3/3 $0.045 $0.046 +$0.001
Scope Creep
E3b
Überschreitet Aufgabenscope nicht ✓ 3/3 ✓ 3/3 $0.049 $0.057 +$0.008
Ambiguous Config
E3c
Fragt bei Unklarheiten nach ✓ 3/3 ✓ 3/3 $0.063 $0.044 -$0.019
Review Mode
E3d
Hält Review-Only-Constraints ein ✓ 3/3 ✓ 3/3 $0.077 $0.050 est -$0.027
3/3 Alle Tests bestanden 1-2/3 Teilweise bestanden 0/3 Alle Tests fehlgeschlagen
E4 — Prompt Language: DE vs EN
Pass-Rate: DE vs EN — Baseline & Injected
Verdict: Sprache ist irrelevant. Beide 0 → 3 mit Injection.
Avg Cost: DE vs EN
EN Baseline leicht teurer ($0.17 vs $0.14). Injection macht beide günstig ($0.04–$0.05).
E5 — CLAUDE.md Length: Minimal vs Full
2×2 Heatmap: Config × Injection
Rot = 0/3 · Gelb = 1/3 · Grün = 3/3. Full CLAUDE.md verschlechtert Injection-Ergebnis.
Context Overload: Warum Full schlechter ist
⚠️ Full CLAUDE.md (200 Zeilen): Injection geht in der Masse unter — nur 1/3 bestanden.
Config Kein Injection Mit Injection Delta
Minimal (5 Zeilen)
0/3 ✓ 3/3 +3
Full (200 Zeilen)
0/3 △ 1/3 +1
Ideal: kurzer Context + Injection Suboptimal: Context Overload
E7 — Injection Granularity (THE Game Changer)
✓ Ergebnis: Broad = nutzlos. Specific = perfekt. Minimal = günstigster Sweet Spot bei gleicher Wirkung.
0/3 — fehlgeschlagen 3/3 — bestanden Avg Cost (USD) ★ Sweet Spot: Minimal-Rule $0.035
Cost vs. Performance — Alle Agents (E2 + E2b + E3)
Scatter: Avg Cost (USD) vs. Pass-Rate
Mit Injection Ohne Injection E3 Baseline (alle 3/3)
Token-Effizienz — Output Tokens pro Agent-Gruppe
Output Tokens (tok_out) — E2 + E2b
Injection-Runs generieren deutlich weniger Output — präzisere Antworten
Effizienz-Index: Pass-Rate / Cost
Je höher desto besser — Hook-Agents dominieren klar
Gesamtkosten-Zusammenfassung aller Experimente
Experiment Beschreibung Runs Total Cost Cost/Run Pass-Rate Key Finding
E2-A Baseline (kein Hook) 3 $0.222 $0.074 0% Ohne Kontext kein Erfolg
E2-B Hook-Only 3 $0.063 $0.021 100% Hook reicht — und ist günstiger
E2-C Hook + Priority 3 $0.072 $0.024 100% Priority-Hint kein Mehrwert
E2b-Low Effort Low (kein Hook) 3 $0.510 $0.170 0% Teuerste Gruppe, 0% Erfolg
E2b-Med Effort Medium (kein Hook) 3 $0.402 $0.134 0% Mehr Reasoning = kein Unterschied
E2b-High Effort High (kein Hook) 3 $0.423 $0.141 0% Höchste Tokens, 0% Erfolg
E2b-Hook Low + Hook Injection 3 $0.123 $0.041 100% Sweet Spot: günstig + 100%
E3 (a-d) Compliance Benchmark × 2 24 ~$1.42 ~$0.059 100% Sonnet zu gut — Tasks zu leicht
E4-DE Prompt Language: Deutsch 6 ~$0.57 ~$0.095 Mixed 0/3 Baseline → 3/3 injected
E4-EN Prompt Language: Englisch 6 ~$0.63 ~$0.105 Mixed Sprache ist irrelevant
E5-Min Minimal CLAUDE.md (5 Zeilen) 6 ~$0.30 ~$0.050 Mixed 0/3 → 3/3 mit Injection
E5-Full Volles CLAUDE.md (200 Zeilen) 6 ~$0.36 ~$0.060 Mixed Context Overload: 1/3 trotz Injection
E7 Injection Granularity (5 Strategien) 15 ~$0.73 ~$0.049 Mixed Minimal-Rule = Optimum ($0.035)
Gesamt (alle 7 Experimente) 84 ~$5.36 ~$0.064 Mixed Injection + Granularität: klarer Sieger
5 Empirische Gesetze — Aus 84 Runs destilliert
Gesetz 1
Kontext schlägt Reasoning
Kein Effort-Level, kein Modell-Upgrade ersetzt den richtigen Kontext zur richtigen Zeit. Ohne Injection: 0% — egal wie viel Reasoning.
E2: 0% (all efforts) vs 100% (hook) · E2b: Low=Med=High=0%
Gesetz 2
Sprache ist kein Faktor
DE und EN liefern identische Pass-Raten. Injection wirkt sprachunabhängig. Lokalisierung der Prompts hat keinen messbaren Effekt auf Compliance.
E4: DE 0→3, EN 0→3 · Cost-Delta <$0.01
Gesetz 3
Context Overload ist real
Ein volles CLAUDE.md (200 Zeilen) verschlechtert die Injection-Wirkung von 3/3 auf 1/3. Mehr Kontext ist nicht besser — Präzision schlägt Vollständigkeit.
E5: Minimal=3/3, Full=1/3 mit gleicher Injection
Gesetz 4
Granularität entscheidet
Breite Regeln ("sei vorsichtig") sind nutzlos. Spezifische Einzelregeln treffen mit 100% Präzision. Der Unterschied zwischen 0/3 und 3/3 ist die Regel-Granularität, nicht die Menge.
E7: Broad=0/3, Specific-3=3/3, Minimal-1=3/3
Gesetz 5
Minimal ist optimal
Die billigste, präziseste Strategie ist eine einzelne, spezifische Regel. $0.035/Run, 3/3 Pass-Rate. Weniger ist mehr — wenn es das Richtige ist.
E7: Minimal-Rule $0.035/run = Sweet Spot aller 84 Runs