CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering Paper • 2604.03750 • Published Apr 4 • 1
VirtualCrime: Evaluating Criminal Potential of Large Language Models via Sandbox Simulation Paper • 2601.13981 • Published Apr 8
DeepfakeBench-MM: A Comprehensive Benchmark for Multimodal Deepfake Detection Paper • 2510.22622 • Published Oct 26, 2025
CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering Paper • 2604.03750 • Published Apr 4 • 1
β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation Paper • 2607.28582 • Published 3 days ago • 17
D^2-Monitor: Dynamic Safety Monitoring for Diffusion LLMs via Hesitation-Aware Routing Paper • 2605.25893 • Published May 25 • 39
Forecasting Scientific Progress with Artificial Intelligence Paper • 2605.22681 • Published May 21 • 45