#vision-language
- MulTaBench: бенчмаркинг мультимодального табличного обучения с текстом и изображениями Technion research
- S²VOPD: самообучаемая визуальная on-policy дистилляция поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия UC San Diego research
- HumanCLAW: способны ли vision-language модели действовать через тело? Meta Research research
- DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp DeepSeek models-llm
- JoyAI-VL-Interaction: открытая VLM на 8B для взаимодействия в реальном времени с автономным управлением очередью речи JD.com research
- MemLens: бенчмарк мультимодальной долгосрочной памяти для моделей визуального языка NVIDIA research
- GitHub Copilot Vision стал общедоступен для всех тарифных планов GitHub tools
- PerceptionRubrics: атомарная рубричная оценка выявляет разрыв в 8% по восприятию между открытыми и закрытыми моделями research
- ABot-N1: базовая модель визуально-языковой навигации с архитектурой slow-fast Alibaba research
- Qwen выпускает Qwen3.8-27B и вариант FP8 как Apache-2.0 модель vision-language с открытыми весами Qwen models-llm
- Astra: VLM с RL-обучением запрашивает симулятор мира для пространственных рассуждений research
- Tencent выпустил обновление HY-Embodied-0.5-X для воплощённых агентов Tencent models-llm
- Visual Contrastive Self-Distillation University of Maryland research
- GST-Bench проверяет, развивают ли VLM глобальное пространственное восприятие по видео ByteDance Seed research