Ежедневный дайджест

4 пункта · ~4 мин · Неделя 2026-W33

Стоит знать (3)

AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением

Tsinghua University
исследования официальный 1 ист. ~1 мин

Представляет RL-метод без критика для многошаговых агентных задач, который агрегирует разницу вероятностей учителя и ученика в пошаговые индикаторы и поддерживает байесовское состояние убеждений для распределения заслуги между отдельными решающими шагами, превращая разреженные награды за результат в детализированный сигнал.

Почему это важно
Самая популярная статья на HuggingFace Daily Papers за 2026-08-09 с 87 голосами; заявлен показатель успеха 89.1% на ALFWorld с Qwen2.5-7B, превосходящий существующие базовые методы.

OSReward: стандартизированная оценка кросс-платформенных reward-моделей для computer-use

NLP Group of The University of Hong Kong
исследования официальный 1 ист. ~1 мин

Предлагает бенчмарк для оценки траекторий агентов, использующих компьютер, с помощью vision-language моделей, обнаруживает, что даже современные модели демонстрируют систематическую склонность к снисходительности, ошибочно засчитывая провалы как успехи, и публикует датасет OS-Shepherd-100K, а также открытые reward-модели на 9B/35B, сопоставимые с коммерческими аналогами при меньшей стоимости.

Почему это важно
Вторая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 67 голосами; вскрывает конкретный изъян в оценке, влияющий на то, как в целом по индустрии оцениваются computer-use агенты.

WorldClaw: агентная генерация 3D-открытых миров в промышленном масштабе

Tencent Hunyuan
исследования официальный 1 ист. ~1 мин

Представляет агентный фреймворк типа coarse-to-fine, в котором планирующие агенты превращают текстовые промпты в структурированные спецификации, а затем строят крупные исследуемые 3D-сцены с целостным рельефом, переиспользуемыми ассетами и редактируемыми мешами на уровне отдельных объектов, дополнительно улучшаемые агентами на основе рендера.

Почему это важно
Четвёртая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 59 голосами, от лаборатории Hunyuan компании Tencent.
Справочно (1)

GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео?

ByteDance Seed
исследования официальный 1 ист. ~1 мин

Представляет бенчмарк для видео-вопросно-ответных задач, построенный на почти 6800 минутах синтетического видео, для проверки способности vision-language моделей интегрировать пространственные наблюдения по всему видео в целостное глобальное представление; протестировано 22 современные модели.

Почему это важно
Пятая по популярности статья на HuggingFace Daily Papers за 2026-08-09 с 42 голосами; лучшая модель в zero-shot режиме набирает лишь 42.68 против результата человека в 79.08 — существенный разрыв в способностях пространственного рассуждения по видео.