CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows? Paper • 2605.16679 • Published May 15 • 55
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels Paper • 2510.06499 • Published Oct 7, 2025 • 33
Learning from Sparse Offline Datasets via Conservative Density Estimation Paper • 2401.08819 • Published Jan 16, 2024
Constrained Decision Transformer for Offline Safe Reinforcement Learning Paper • 2302.07351 • Published Feb 14, 2023
Bridging the Training-Inference Gap in LLMs by Leveraging Self-Generated Tokens Paper • 2410.14655 • Published Oct 18, 2024
Your Language Model May Think Too Rigidly: Achieving Reasoning Consistency with Symmetry-Enhanced Training Paper • 2502.17800 • Published Feb 25, 2025
Behavior Injection: Preparing Language Models for Reinforcement Learning Paper • 2505.18917 • Published May 25, 2025 • 1
LoCoBench: A Benchmark for Long-Context Large Language Models in Complex Software Engineering Paper • 2509.09614 • Published Sep 11, 2025 • 7
Behavior Injection: Preparing Language Models for Reinforcement Learning Paper • 2505.18917 • Published May 25, 2025 • 1