#evals
- GigaChat 3.5 Ultra сдал экзамен программы профессиональной переподготовки по информационной безопасности с превышением порога на 14% Sber research
- LongHorizon-Harness: развитие агентов для долгих горизонтов в реальных задачах research
- Cline открывает исходники оценок на основе Terminal-Bench для open-weight кодинг-агентов Cline tools
- Demystifying Agent Skills: почему они работают — пока не перестают UC San Diego (Zhiyuan Jiang, Mengdi Wang, Yijiang Li et al.) research
- FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis University of Science and Technology of China research
- Anthropic выделяет $5 млн на исследования влияния AI на благополучие Anthropic research
- SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке? OpenMOSS research
- Sci-VBench: оценка генерации видео, насыщенного знаниями и рассуждениями, в научных областях research
- ASI-Bench: на заре искусственного суперинтеллекта 42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai) research