Recursive Game Creator: An Agentic Product-Level Experience-Oriented Game Harness Paper • 2610.08621 • Published 3 days ago • 79
HyperBrowseComp: A Multilingual and Multimodal Stress Test for Web-Browsing Agents Paper • 2610.03574 • Published 7 days ago • 59
ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF Image-Text-to-Text • 177B • Updated 9 days ago • 3.41M • 721
An Empirical Study of Harness Design for Coding Agents Paper • 2609.20804 • Published 22 days ago • 93
Steering Geometry: Validating Human Value Geometry in LLM Steering Space Paper • 2609.06289 • Published Sep 5 • 31
CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation Paper • 2609.04083 • Published Sep 3 • 27
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published Aug 27 • 155
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published Aug 14 • 287
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design Paper • 2608.13560 • Published Aug 13 • 64
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 266
Vision-Language Grounding as Bidirectional Concept Correspondence Paper • 2608.07886 • Published Aug 8 • 7
On-Policy Delta Distillation for Multilingual Math Reasoning Paper • 2608.05802 • Published Aug 6 • 33
Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains Paper • 2608.05138 • Published Aug 5 • 32