\begin{table}[t] \centering \small \caption{Objective Evaluation Results on Public Subset (All Languages). Higher Accuracy and lower Calibration Error are better.} \label{tab:objective_public_CalibErr} \begin{tabular}{lcc} \toprule \textbf{Model} & \textbf{Accuracy (\%)} & \textbf{Calibration Error (\%)} \\ \midrule OpenClaw(+GPT-5.5) & 58.75 & 46.23 \\ DeerFlow(+GPT-5.5) & 56.25 & 47.83 \\ Gemini-deep-research & 51.25 & 50.77 \\ MiroThinker & 48.75 & 55.57 \\ OpenClaw(+DeepSeek-V4-Pro) & 47.50 & 56.57 \\ DeerFlow(+DeepSeek-V4-Pro) & 41.25 & 64.52 \\ Jina-deepsearch & 36.25 & 65.67 \\ OpenAI-o3-deep-research & 35.00 & 61.11 \\ Kimi-deep-research & 35.00 & 62.94 \\ Doubao-deep-research & 28.75 & 71.30 \\ GPT-5.5 & 27.50 & 52.32 \\ Claude-opus-4-7 & 22.50 & 39.24 \\ Perplexity-deep-research & 22.50 & 55.65 \\ Gemini-3.1-pro-preview & 17.50 & 75.60 \\ Kimi-k2.5 & 13.75 & 77.62 \\ DeepSeek-V4-Pro & 10.00 & 76.12 \\ Qwen-deep-research & 10.00 & 83.37 \\ Grok-3-deepsearch & 7.50 & 84.70 \\ Tongyi-deepresearch-30b-a3b & 3.75 & 87.92 \\ \bottomrule \end{tabular} \end{table}