#benchmarks
- LLMRouter: единая инфраструктура для разработки, оценки и развёртывания LLM-роутеров University of Illinois at Urbana-Champaign research
- Long-Horizon-Terminal-Bench: тестирование пределов агентов на длинных терминальных задачах Tencent Hunyuan research
- Demystifying Agent Skills: почему они работают — пока не перестают UC San Diego (Zhiyuan Jiang, Mengdi Wang, Yijiang Li et al.) research
- EnvHarness: Awakening Static Worlds for Agent Learning Google research
- K12-KGraph: граф знаний, привязанный к учебной программе, для бенчмаркинга и обучения образовательных LLM research
- VibeWorlding: могут ли мультимодальные агенты создавать 3D-открытые миры от начала до конца? Tencent research
- HarnessEval-W: агентное превращение оценки визуальных миров NTU / MirroS-Lab consortium research
- SWE-bench Science: могут ли кодинг-агенты решать инженерные задачи в науке? OpenMOSS research
- IdeaGene-Bench: бенчмарк для рассуждений о научной родословной и генерации идей Shanghai Jiao Tong University research
- ASI-Bench: на заре искусственного суперинтеллекта 42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai) research
- MWS AI выпускает Cotype Pro 3 (27B) и Light 3 (9B) для корпоративных ИИ-агентов MWS AI models-llm