Ежедневный дайджест
4 пункта · ~4 мин · Неделя 2026-W33
Стоит знать (3)
AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением
Tsinghua UniversityПредставляет RL-метод без критика для многошаговых агентных задач, который агрегирует разницу вероятностей учителя и ученика в пошаговые индикаторы и поддерживает байесовское состояние убеждений для распределения заслуги между отдельными решающими шагами, превращая разреженные награды за результат в детализированный сигнал.
OSReward: стандартизированная оценка кросс-платформенных reward-моделей для computer-use
NLP Group of The University of Hong KongПредлагает бенчмарк для оценки траекторий агентов, использующих компьютер, с помощью vision-language моделей, обнаруживает, что даже современные модели демонстрируют систематическую склонность к снисходительности, ошибочно засчитывая провалы как успехи, и публикует датасет OS-Shepherd-100K, а также открытые reward-модели на 9B/35B, сопоставимые с коммерческими аналогами при меньшей стоимости.
WorldClaw: агентная генерация 3D-открытых миров в промышленном масштабе
Tencent HunyuanПредставляет агентный фреймворк типа coarse-to-fine, в котором планирующие агенты превращают текстовые промпты в структурированные спецификации, а затем строят крупные исследуемые 3D-сцены с целостным рельефом, переиспользуемыми ассетами и редактируемыми мешами на уровне отдельных объектов, дополнительно улучшаемые агентами на основе рендера.
Справочно (1)
GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео?
ByteDance SeedПредставляет бенчмарк для видео-вопросно-ответных задач, построенный на почти 6800 минутах синтетического видео, для проверки способности vision-language моделей интегрировать пространственные наблюдения по всему видео в целостное глобальное представление; протестировано 22 современные модели.