#swe-bench
- Microsoft Build 2026: запуск семейства моделей MAI для GitHub Copilot без зависимости от OpenAI Microsoft models-llm
- Mistral выпустила Medium 3.5 — 128B dense, 256k контекста, открытые веса Mistral models-llm
- Mistral выпускает Medium 3.5 — открытый флагман и удалённые агенты для программирования в Vibe Mistral AI models-llm
- StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15 research
- Poolside открывает исходники Laguna XS.2 и M.1: первые open-weight агентские модели для кодинга от американского стартапа Poolside models-llm
- DeepReinforce выпускает Ornith-1.0: открытые модели для программирования, самостоятельно обучающие свои RL-каркасы DeepReinforce tools
- Dockerless: верификатор программ без окружения для агентов кодирования ByteDance research
- AutoSaddler: автоматическая оптимизация харнесса с устойчивыми обновлениями по трассам исполнения агента Microsoft research
- CompactionRL: обучение с подкреплением с компакцией контекста для long-horizon-агентов Zhipu AI / Tsinghua University research
- Cline открывает исходники оценок на основе Terminal-Bench для open-weight кодинг-агентов Cline tools
- EnvHarness: Awakening Static Worlds for Agent Learning Google research
- SWE-Together: многоходовой бенчмарк для оценки агентов программирования research
- SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке? OpenMOSS research
- SHERLOC: структурированная диагностическая локализация сокращает потребление токенов при ремонте кода на 36,7% research
- NVIDIA-labs OO Agents: нативные объектно-ориентированные агенты на Python NVIDIA research
- SWE-Bench ProMax: тестирование агентов на масштабном мультиязычном рефакторинге кода research
- Qwen Code v0.22.0 stable release Alibaba tools