SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке?

OpenMOSS

исследования офиц. + СМИ 2 ист. ~1 мин

Репозиторный бенчмарк из 119 задач в 98 GitHub-репозиториях по 20 научным доменам, охватывающий парадигмы issue-driven, expert-exploratory и engineering-integration. Лучший агент (Claude Code на Opus) набирает менее 50% pass@1; в работе каталогизированы четыре повторяющихся механизма отказа.

Почему это важно

HuggingFace Daily Papers: 52 upvotes. Расширяет линейку SWE-bench за пределы разработки ПО в научные вычисления — полезный сигнал о том, что топовые кодинг-агенты остаются хрупкими вне мейнстримных стеков.

Важность: 2/5

HF Daily Paper с 52 upvotes

Источники

официальный arXiv abstract page
официальный HF Daily Papers entry