OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Paper • 2608.03812 • Published 6 days ago • 26
RefCaptioner: Multi-Reference Image-Grounded Video Captioning Paper • 2607.28509 • Published 11 days ago • 30
Beacon: Knowing When and How to Perform Agentic Visual Reasoning Paper • 2607.28595 • Published 11 days ago • 55