SWE-Bench ProMax: тестирование агентов на масштабном мультиязычном рефакторинге кода
Новый бенчмарк из 170 тщательно отобранных задач по рефакторингу кода на семи языках программирования, созданный для устранения проблем с качеством и тестовыми наборами, найденных в прежних вариантах SWE-Bench. Лучший из оценённых кодинг-агентов решает лишь 41,2% задач, что показывает, что текущие агенты всё ещё испытывают трудности с масштабным мультиязычным рефакторингом.
Почему это важно
Статья с наибольшим числом голосов в HuggingFace Daily Papers за 2026-08-11 (59 голосов); более сложный и чистый бенчмарк, чем существующие варианты SWE-Bench, для измерения реального прогресса кодинг-агентов.
Важность: 2/5
Статья дня с наивысшим рейтингом в HuggingFace Daily Papers, ниже порога в 100 голосов для повышения важности.
Источники
вторичный
HuggingFace Daily Papers, 2026-08-11