MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes Paper • 2609.10016 • Published 4 days ago • 19
Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training Paper • 2608.26730 • Published 17 days ago • 155
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? Paper • 2608.19799 • Published 24 days ago • 66
JonathanColetti/Qwen3.8-27B-Uncensored-GGUF Text Generation • 27B • Updated 15 days ago • 2.95M • 1.08k
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination Paper • 2608.14391 • Published about 1 month ago • 282
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published Aug 1 • 263
DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF Image-Text-to-Text • 27B • Updated 21 days ago • 1,000k • 2.34k
CAPEval: A Decoupled Caption Evaluation across Understanding and Generation Paper • 2608.02589 • Published Aug 3 • 25