E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning Paper • 2609.14302 • Published 14 days ago • 3
CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System Paper • 2602.05004 • Published Feb 4
E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning Paper • 2609.14302 • Published 14 days ago • 3
Learning Sparse Decision Trees via Transformer Variational Auto-Encoders Paper • 2609.01430 • Published 26 days ago • 2
Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry Paper • 2608.30457 • Published 27 days ago • 7
Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry Paper • 2608.30457 • Published 27 days ago • 7
LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks Paper • 2608.23200 • Published Aug 24 • 7
LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks Paper • 2608.23200 • Published Aug 24 • 7
Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA Paper • 2607.26807 • Published Jul 29 • 1
WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts Paper • 2606.03220 • Published Jun 2 • 11
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO Paper • 2605.30789 • Published Jun 2 • 27
The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training Paper • 2603.10444 • Published Mar 11 • 13
ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection Paper • 2601.09195 • Published Jan 14 • 15
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature Paper • 2601.10108 • Published Jan 15 • 7
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature Paper • 2601.10108 • Published Jan 15 • 7
LEMAS: Large A 150K-Hour Large-scale Extensible Multilingual Audio Suite with Generative Speech Models Paper • 2601.04233 • Published Jan 4 • 2
RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies Paper • 2510.17950 • Published Oct 20, 2025 • 11