Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation Paper • 2609.00369 • Published 22 days ago • 21
SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation Paper • 2609.08108 • Published 14 days ago • 18
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers Paper • 2605.22668 • Published May 21 • 43
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers Paper • 2605.22668 • Published May 21 • 43
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation Paper • 2602.11451 • Published Feb 11 • 18
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs Paper • 2512.14944 • Published Mar 13 • 36