Ledger needle — comparación hasta 1.5B
100 turnos guionados (seed 21) · 15 hechos, 5 correcciones, 10 sondas a
distancia 3–96 · scoring por núcleo del valor, idéntico para todos · baselines con historia
completa, decoding greedy e instrucción explícita de memoria
| sistema |
tamaño (B) |
recall |
d 3–10 |
d 11–50 |
d 51+ |
test total (s) |
s/turno |
prefijo máx |
click en una cabecera reordena; por defecto: más aciertos primero
Sonda por sonda
| turno | dist | esperado | Qwen2.5-1.5B-Instruct · full | Qwen3-0.6B + thinking · full | Marimo Diffusion (ledger, nuestro) | Qwen2.5-0.5B-Instruct · full | SmolLM2-360M-Instruct · full | TinyLlama-1.1B-Chat · full | Qwen3-0.6B + thinking · budget 512 | Qwen3-0.6B sin thinking · full | Qwen3-0.6B sin thinking · budget 512 |
|---|
| 6 | 5 | code 4805 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| 17 | 6 | $6,400 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✗ | ✗ |
| 28 | 3 | 7:15pm | ✓ | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ |
| 61 | 57 | harbor858 | ✓ | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ |
| 72 | 37 | $4,000 | ✓ | ✓ | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ |
| 83 | 47 | day 97 | ✗ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| 94 | 83 | $6,400 | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| 98 | 59 | room 411 | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| 99 | 60 | room 411 | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
| 100 | 96 | harbor858 | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ | ✗ |
Advertencias de lectura
- Un solo seed y 10 sondas por sistema: las diferencias chicas son ruido; las grandes
sobreviven a ese margen.
- La comparación mide el paquete mecanismo+entrenamiento: el sistema de ledger fue entrenado
en este registro conversacional y los baselines no. Muestra que el paquete funciona, no que el
mecanismo solo cause la diferencia.
- Los baselines reciben la mayor ventaja razonable: historia completa en contexto, greedy,
instrucción de memoria, y el modo thinking nativo donde existe. El sistema de ledger corre con
sampling a temperatura 0.7 y un prefijo constante de ~500 tokens.
- El guion es sintético y sus valores son arbitrarios por diseño; un valor sin sentido
("day 97") puede penalizar a un modelo que se resiste a repetir datos absurdos.