SWE-Bench ProMax: тестирование агентов на масштабном мультиязычном рефакторинге кода

исследования официальный 2 ист. ~1 мин

Новый бенчмарк из 170 тщательно отобранных задач по рефакторингу кода на семи языках программирования, созданный для устранения проблем с качеством и тестовыми наборами, найденных в прежних вариантах SWE-Bench. Лучший из оценённых кодинг-агентов решает лишь 41,2% задач, что показывает, что текущие агенты всё ещё испытывают трудности с масштабным мультиязычным рефакторингом.

Почему это важно

Статья с наибольшим числом голосов в HuggingFace Daily Papers за 2026-08-11 (59 голосов); более сложный и чистый бенчмарк, чем существующие варианты SWE-Bench, для измерения реального прогресса кодинг-агентов.

Важность: 2/5

Статья дня с наивысшим рейтингом в HuggingFace Daily Papers, ниже порога в 100 голосов для повышения важности.

Источники