task: tau_bench version: 2.0 # Official leaderboard defaults model: gpt-4.1-mini-2025-04-14 user_llm: gpt-4.1-2025-04-14 temperature: 0.0 max_tokens: 2048 max_steps: 200 max_errors: 10 seed: 300 k: 4 task_split: test domain: airline # ACE settings ace: epochs: 1 max_refinement_rounds: 3 batch_reflect: false trace_limit: 500