GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео?

ByteDance Seed

исследования официальный 1 ист. ~1 мин

Представляет бенчмарк для видео-вопросно-ответных задач, построенный на почти 6800 минутах синтетического видео, для проверки способности vision-language моделей интегрировать пространственные наблюдения по всему видео в целостное глобальное представление; протестировано 22 современные модели.

Почему это важно

Пятая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 42 голосами; лучшая модель в zero-shot режиме набирает лишь 42.68 против результата человека в 79.08 — существенный разрыв в способностях пространственного рассуждения по видео.

Важность: 2/5

Заметная статья HuggingFace Daily Paper (исследование) — пятая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 42 голосами; лучшая модель в zero-shot режиме набирает лишь 42.68 против результата человека в 79.08 — существенный разрыв в способностях пространственного рассуждения по видео.

Источники