#video-understanding
- VideoChat3: полностью открытая видео-MLLM для эффективного и универсального понимания видео MCG-NJU research
- Mage-VL: эффективная codec-native стриминговая мультимодальная базовая модель Microsoft research
- GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео? ByteDance Seed research