SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published 2 days ago • 42
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 20 days ago • 260
TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity Paper • 2608.08119 • Published 13 days ago • 11
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published 22 days ago • 72
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization Paper • 2608.06301 • Published 15 days ago • 35
ChronoVision: Temporal Reasoning via Latent State Reconstruction Paper • 2608.05631 • Published 15 days ago • 40
When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation Paper • 2608.03632 • Published 17 days ago • 23
UniWorld-Design: From Pixel Generation to Layer-Native Design Paper • 2608.03971 • Published 16 days ago • 24