Uncertainty-Aware World Model for Aerial Image-Goal Navigation Paper • 2608.05597 • Published 5 days ago • 7
YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family Paper • 2608.07051 • Published 4 days ago • 11
World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation Paper • 2608.05369 • Published 6 days ago • 25
SKILL-KD: Contrastive Skill Distillation for LLM Agents Paper • 2607.28048 • Published 7 days ago • 11
OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents Paper • 2608.05013 • Published 7 days ago • 34
SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding Paper • 2608.05137 • Published 6 days ago • 24
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published 8 days ago • 164
InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis Paper • 2608.02437 • Published 8 days ago • 63
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 16 days ago • 103
QQWorld: Quantile-Quantile Matching for World Model Regularization Paper • 2607.28415 • Published 12 days ago • 30
SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift Paper • 2607.28996 • Published 11 days ago • 6
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents Paper • 2607.28227 • Published 12 days ago • 302
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing Paper • 2607.19064 • Published 21 days ago • 77
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models Paper • 2607.23373 • Published 17 days ago • 7
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model Paper • 2607.24904 • Published 15 days ago • 36
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey Paper • 2607.21655 • Published 20 days ago • 193
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning Paper • 2607.21653 • Published 20 days ago • 32
SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments Paper • 2607.20207 • Published 20 days ago • 4