World Observer: Joint Actor-Observer Generation for Persistent World Modeling Paper • 2610.02162 • Published 3 days ago • 72
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering Paper • 2609.38177 • Published 5 days ago • 59
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors Paper • 2604.02486 • Published Apr 2 • 10
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_spkEmbUncond_LATEST 1B • Updated May 24 • 4
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_spkEmbUncond_LATEST 1B • Updated May 24 • 4
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST 1B • Updated May 21 • 4
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST 1B • Updated May 21 • 4
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST Updated May 21 • 3