StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field Paper • 2608.01954 • Published 2 days ago • 12
TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting Paper • 2607.28261 • Published 6 days ago • 116
AREX: Towards a Recursively Self-Improving Agent for Deep Research Paper • 2607.21461 • Published 13 days ago • 151
The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning Paper • 2606.29526 • Published Jun 28 • 170
Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players Paper • 2605.28816 • Published May 27 • 433
Learning POMDP World Models from Observations with Language-Model Priors Paper • 2605.13740 • Published May 13 • 7
SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise Paper • 2602.12783 • Published Feb 13 • 246
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence Paper • 2605.12882 • Published May 13 • 274
KernelBench-X: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels Paper • 2605.04956 • Published May 6 • 7
From Context to Skills: Can Language Models Learn from Context Skillfully? Paper • 2604.27660 • Published May 3 • 171
ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models Paper • 2604.08064 • Published Apr 9 • 8
SkillClaw: Let Skills Evolve Collectively with Agentic Evolver Paper • 2604.08377 • Published Apr 9 • 295
Adam's Law: Textual Frequency Law on Large Language Models Paper • 2604.02176 • Published Apr 2 • 510
AvatarPointillist: AutoRegressive 4D Gaussian Avatarization Paper • 2604.04787 • Published Apr 6 • 12
ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation Paper • 2604.03922 • Published Apr 5 • 53
TrajectoryMover: Generative Movement of Object Trajectories in Videos Paper • 2603.29092 • Published Mar 31 • 3