Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings Paper • 2609.25165 • Published 5 days ago • 47
Running on Zero Agents Featured 112 OvisOCR2 🔎 112 Stream structured Markdown from document images and PDFs.
Ovis: Structural Embedding Alignment for Multimodal Large Language Model Paper • 2405.20797 • Published May 31, 2024 • 34
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees Paper • 2406.07115 • Published Jun 11, 2024
Wings: Learning Multimodal LLMs without Text-only Forgetting Paper • 2406.03496 • Published Jun 5, 2024
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis Paper • 2410.08261 • Published Oct 10, 2024 • 52
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation Paper • 2412.18928 • Published Dec 25, 2024 • 1
PEMF-VVTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm Paper • 2412.03021 • Published Dec 4, 2024 • 1