VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding Paper • 2412.03735 • Published Dec 4, 2024 • 1
VideoSAVi: Self-Aligned Video Language Models without Human Supervision Paper • 2412.00624 • Published Dec 1, 2024 • 2
CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation Paper • 2601.08010 • Published Jan 12
FrameOracle: Learning What to See and How Much to See in Videos Paper • 2510.03584 • Published Oct 4, 2025
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning Paper • 2511.18242 • Published Jun 30
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video Paper • 2508.03100 • Published Aug 5, 2025
OSCaR: Object State Captioning and State Change Representation Paper • 2402.17128 • Published Apr 2, 2024
ChartQA-X: Generating Explanations for Visual Chart Reasoning Paper • 2504.13275 • Published Apr 17, 2025
Video Generation Models: A Survey of Post-Training and Alignment Paper • 2610.00812 • Published 4 days ago • 37
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding Paper • 2412.03735 • Published Dec 4, 2024 • 1
VideoA11y: Method and Dataset for Accessible Video Description Paper • 2502.20480 • Published Feb 27, 2025 • 1
VideoSAVi: Self-Aligned Video Language Models without Human Supervision Paper • 2412.00624 • Published Dec 1, 2024 • 2