ICBCBench-Leaderboard / objective_public_CalibErr.tex
Leonnel1220's picture
Upload folder using huggingface_hub
5148820 verified
Raw
History Blame Contribute Delete
1.08 kB
\begin{table}[t]
\centering
\small
\caption{Objective Evaluation Results on Public Subset (All Languages). Higher Accuracy and lower Calibration Error are better.}
\label{tab:objective_public_CalibErr}
\begin{tabular}{lcc}
\toprule
\textbf{Model} & \textbf{Accuracy (\%)} & \textbf{Calibration Error (\%)} \\
\midrule
OpenClaw(+GPT-5.5) & 58.75 & 46.23 \\
DeerFlow(+GPT-5.5) & 56.25 & 47.83 \\
Gemini-deep-research & 51.25 & 50.77 \\
MiroThinker & 48.75 & 55.57 \\
OpenClaw(+DeepSeek-V4-Pro) & 47.50 & 56.57 \\
DeerFlow(+DeepSeek-V4-Pro) & 41.25 & 64.52 \\
Jina-deepsearch & 36.25 & 65.67 \\
OpenAI-o3-deep-research & 35.00 & 61.11 \\
Kimi-deep-research & 35.00 & 62.94 \\
Doubao-deep-research & 28.75 & 71.30 \\
GPT-5.5 & 27.50 & 52.32 \\
Claude-opus-4-7 & 22.50 & 39.24 \\
Perplexity-deep-research & 22.50 & 55.65 \\
Gemini-3.1-pro-preview & 17.50 & 75.60 \\
Kimi-k2.5 & 13.75 & 77.62 \\
DeepSeek-V4-Pro & 10.00 & 76.12 \\
Qwen-deep-research & 10.00 & 83.37 \\
Grok-3-deepsearch & 7.50 & 84.70 \\
Tongyi-deepresearch-30b-a3b & 3.75 & 87.92 \\
\bottomrule
\end{tabular}
\end{table}