Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers Paper • 2607.28611 • Published 10 days ago • 21
Coarse-to-Real: Generative Rendering for Populated Dynamic Scenes Paper • 2601.22301 • Published May 11
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing Paper • 2512.17909 • Published Dec 19, 2025 • 37
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders Paper • 2512.13690 • Published Dec 15, 2025 • 3
Rethinking Training Dynamics in Scale-wise Autoregressive Generation Paper • 2512.06421 • Published Dec 6, 2025 • 7
RELIC: Interactive Video World Model with Long-Horizon Memory Paper • 2512.04040 • Published Dec 3, 2025 • 24
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis Paper • 2402.16117 • Published Feb 25, 2024
AMOS: A Large-Scale Abdominal Multi-Organ Benchmark for Versatile Medical Image Segmentation Paper • 2206.08023 • Published Jun 16, 2022
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models Paper • 2509.25050 • Published Sep 29, 2025 • 5
AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition Paper • 2205.13535 • Published May 26, 2022
WOMD-Reasoning: A Large-Scale Dataset for Interaction Reasoning in Driving Paper • 2407.04281 • Published Jul 5, 2024
Large Language Models as Automated Aligners for benchmarking Vision-Language Models Paper • 2311.14580 • Published Nov 24, 2023
InstructDET: Diversifying Referring Object Detection with Generalized Instructions Paper • 2310.05136 • Published Oct 8, 2023
FlashVideo:Flowing Fidelity to Detail for Efficient High-Resolution Video Generation Paper • 2502.05179 • Published Feb 7, 2025 • 24
MetaBEV: Solving Sensor Failures for BEV Detection and Map Segmentation Paper • 2304.09801 • Published Apr 19, 2023
Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations Paper • 2202.07800 • Published Feb 16, 2022
Speed Co-Augmentation for Unsupervised Audio-Visual Pre-training Paper • 2309.13942 • Published Sep 25, 2023 • 1