Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation Paper • 2609.00369 • Published 27 days ago • 21
SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation Paper • 2609.08108 • Published 19 days ago • 18
SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers Paper • 2605.22668 • Published May 21 • 43
PuzzleCraft Collection Qwen2.5-VL-3B & 7B models trained with PuzzleCraft • 9 items • Updated May 1 • 3
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains Paper • 2603.01301 • Published Mar 1 • 8
KeDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments Paper • 2504.15364 • Published Apr 21, 2025 • 4
LoopFormer Collection Models trained in the ICLR2026 paper: LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation • 17 items • Updated Feb 19 • 2