| \begin{table}[t] |
| \centering |
| \small |
| \caption{Objective Evaluation Results on Public Subset (All Languages). Higher Accuracy and lower Calibration Error are better.} |
| \label{tab:objective_public_CalibErr} |
| \begin{tabular}{lcc} |
| \toprule |
| \textbf{Model} & \textbf{Accuracy (\%)} & \textbf{Calibration Error (\%)} \\ |
| \midrule |
| OpenClaw(+GPT-5.5) & 58.75 & 46.23 \\ |
| DeerFlow(+GPT-5.5) & 56.25 & 47.83 \\ |
| Gemini-deep-research & 51.25 & 50.77 \\ |
| MiroThinker & 48.75 & 55.57 \\ |
| OpenClaw(+DeepSeek-V4-Pro) & 47.50 & 56.57 \\ |
| DeerFlow(+DeepSeek-V4-Pro) & 41.25 & 64.52 \\ |
| Jina-deepsearch & 36.25 & 65.67 \\ |
| OpenAI-o3-deep-research & 35.00 & 61.11 \\ |
| Kimi-deep-research & 35.00 & 62.94 \\ |
| Doubao-deep-research & 28.75 & 71.30 \\ |
| GPT-5.5 & 27.50 & 52.32 \\ |
| Claude-opus-4-7 & 22.50 & 39.24 \\ |
| Perplexity-deep-research & 22.50 & 55.65 \\ |
| Gemini-3.1-pro-preview & 17.50 & 75.60 \\ |
| Kimi-k2.5 & 13.75 & 77.62 \\ |
| DeepSeek-V4-Pro & 10.00 & 76.12 \\ |
| Qwen-deep-research & 10.00 & 83.37 \\ |
| Grok-3-deepsearch & 7.50 & 84.70 \\ |
| Tongyi-deepresearch-30b-a3b & 3.75 & 87.92 \\ |
| \bottomrule |
| \end{tabular} |
| \end{table} |