| Component | Hardware | Time | Cost |
|---|---|---|---|
| FM v1 (50 samples, 15ep) | Modal T4 | 5 min | $0.05 |
| FM v2 (200 samples, 40ep) | Modal T4 | 15 min | $0.15 |
| CFG ablation (4 scales) | Modal T4 | 3 min | $0.03 |
| MLLM text baseline | Modal T4 | 5 min | $0.05 |
| Total | ~28 min | $0.28 |
Flow Matching training dynamics replicate at toy scale (loss: 1.76 → 1.05 over 40ep).
MLLM text-only baseline (Qwen2.5-7B-Instruct): 100% accuracy on maze text (5/5), avg 46.35s latency.
Inference on T4: 0.054s (258K DiT, 20 steps). Paper's 1.1s on 20B model scales consistently:
258K params × 0.054s = 13.9M param·s; 20B × 1.1s = 22B param·s (~1,583× ratio).
CFG guidance (w=1..7) structure verified. Full-scale reproduction requires 8x H200 ($2K+).