Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published Jul 21 • 11
Knowledge Extraction on Semi-Structured Content: Does It Remain Relevant for Question Answering in the Era of LLMs? Paper • 2509.25107 • Published Sep 29, 2025
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning Paper • 2510.01832 • Published Oct 2, 2025
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality Paper • 2508.00109 • Published Jul 31, 2025 • 4
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning Paper • 2403.11401 • Published Mar 18, 2024
Post-training an LLM for RAG? Train on Self-Generated Demonstrations Paper • 2502.10596 • Published Feb 14, 2025
Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness Paper • 2607.19322 • Published Jul 21 • 11
Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance Paper • 2511.13254 • Published Nov 17, 2025 • 140
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents Paper • 2602.06855 • Published Feb 6 • 83
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents Paper • 2602.06855 • Published Feb 6 • 83
AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents Paper • 2602.06855 • Published Feb 6 • 83
TV2TV: A Unified Framework for Interleaved Language and Video Generation Paper • 2512.05103 • Published Dec 4, 2025 • 20
Video-CoM: Interactive Video Reasoning via Chain of Manipulations Paper • 2511.23477 • Published Nov 28, 2025 • 2
What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity Paper • 2511.15593 • Published Nov 19, 2025 • 59
Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance Paper • 2511.13254 • Published Nov 17, 2025 • 140