-
Microsoft Build 2026: запуск семейства моделей MAI для GitHub Copilot без зависимости от OpenAI
Microsoft
models-llm
-
xAI выпустила Grok 4.3 с контекстом 1M токенов, снижением цен на 40–60% и улучшенными результатами в агентных бенчмарках
xAI
models-llm
-
SenseNova-U1: open-source унифицированное мультимодальное понимание и генерация через NEO-unify
SenseTime
research
-
MulTaBench: бенчмаркинг мультимодального табличного обучения с текстом и изображениями
Technion
research
-
EVA-Bench: сквозной фреймворк для оценки голосовых агентов
ServiceNow AI
research
-
ExploitBench: Claude Mythos Preview и GPT-5.5 автономно создают настоящие браузерные эксплойты
Anthropic
research
-
VibeThinker-3B достигает показателей frontier-уровня на бенчмарках рассуждений через curriculum RL
WeiboAI
research
-
Атаки AI-сгенерированным видео на реальные кризисные события: RA-Bench показывает, что детекторы не справляются с подделками кризисных медиа
research
-
StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15
research
-
AI Co-Mathematician от Google DeepMind достигает 48% на FrontierMath Tier 4
Google DeepMind
research
-
Baidu выпускает ERNIE 5.1 при 6% отраслевых затрат на предобучение и входит в мировой топ-10 поиска
Baidu
models-llm
-
RubricEM: мета-RL с декомпозицией политики под руководством рубрик за пределами верифицируемых наград
Google
research
-
SOOHAK: фронтирные LLM решают сложную математику, но не распознают неразрешимые задачи
research
-
ENPIRE: агенты кодирования ИИ замыкают цикл физических робототехнических исследований без участия человека
NVIDIA / Carnegie Mellon University / UC Berkeley
research
-
JetSpec: преодоление потолка масштабирования спекулятивного декодирования с помощью параллельного построения деревьев черновиков
Hao AI Lab, UC San Diego
research
-
OpenAI выпускает GeneBench-Pro — передовой бенчмарк для AI-агентов в биологии
OpenAI
research
-
LingBot-VLA 2.0: преодоление разрыва между базовыми VLA-моделями и реальным развёртыванием
LingBot Team
research
-
ByteDance EdgeBench: скорость обучения агентов удваивается каждые три месяца
ByteDance
research
-
HumanCLAW: способны ли vision-language модели действовать через тело?
Meta Research
research
-
DeepSeek открыл публичный бета-доступ к API V4-Flash-0731, обошедшему собственный флагман на агентных бенчмарках
DeepSeek
models-llm
-
GigaChat 3.5 Ultra сдал экзамен программы профессиональной переподготовки по информационной безопасности с превышением порога на 14%
Sber
research
-
Раскрытие потенциала редактирования изображений через масштабирование концептов и плотный супервизинг
research
-
MobilePA-Bench: бенчмаркинг мобильных планировщиков-агентов на сложных реальных задачах
research
-
MaxProof: модель MiniMax превышает пороги золотых медалей IMO и USAMO в формальной математике
MiniMax
research
-
Mistral выпускает Leanstral 1.5: открытая модель формальной верификации для Lean 4
Mistral
research
-
LLM-as-a-Verifier: верификация как независимая ось масштабирования для LLM
Stanford University / UC Berkeley / NVIDIA
research
-
AI Co-Mathematician: Google DeepMind достигает 48% на FrontierMath Tier 4
Google DeepMind
research
-
MemLens: бенчмарк мультимодальной долгосрочной памяти для моделей визуального языка
NVIDIA
research
-
Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам
research
-
CiteVQA: бенчмарк атрибуции доказательств для надёжной document intelligence (178 апвоутов на HF)
Peking University / Shanghai Artificial Intelligence Laboratory
research
-
MMSkills: переиспользуемые мультимодальные скиллы для универсальных визуальных агентов (105 апвоутов на HF)
Shanghai Jiao Tong University
research
-
Crafter: мультиагентный фреймворк для генерации редактируемых научных иллюстраций — +16 пунктов над базовыми моделями (103 апвоута на HF)
Tsinghua University
research
-
EvoArena: LLM-агенты набирают лишь 40% в динамически изменяющихся средах
MIT / NUS / Salesforce
research
-
WeaveBench: агенты компьютерного использования проваливаются на гибридных задачах GUI+CLI — 41% успешных выполнений
Microsoft Research
research
-
Исследование Anthropic: успех в агентном программировании определяется экспертизой в предметной области, а не навыками программирования
Anthropic
research
-
GateMem: бенчмарк управления памятью в агентах с разделённым доступом
research
-
Детерминированный горизонт: когда расширенное рассуждение даёт сбой и необходима делегация инструментам
research
-
SingGuard: адаптируемый к политике во время выполнения мультимодальный защитный барьер LLM с бенчмарком из 56 тыс. примеров
inclusionAI
research
-
PerceptionRubrics: атомарная рубричная оценка выявляет разрыв в 8% по восприятию между открытыми и закрытыми моделями
research
-
AutomationBench-AA: независимый бенчмарк из 657 задач для AI-агентов в SaaS-автоматизации
Artificial Analysis
tools
-
Super Weights в LLM: почему высокосалиентные параметры не работают как цели дообучения
Amazon
research
-
ABot-AgentOS: операционная система для роботизированных агентов с долгосрочной мультимодальной памятью
Alibaba
research
-
Beyond Euclidean Clipping: преодоление коллапса исследования в LLM RL через риманову изометрическую оптимизацию политики
research
-
Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами
Anthropic
research
-
LongHorizon-Harness предлагает цикл Manage-Execute-Audit для долгосрочных агентов
research
-
Cline открывает исходники оценок на основе Terminal-Bench для open-weight кодинг-агентов
Cline
tools
-
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
University of Science and Technology of China
research
-
Programming with Data: test-driven data engineering для самоулучшающихся LLM
OpenDataLab
research
-
AutoResearchBench — бенчмарк автономного поиска научной литературы для AI-агентов
BAAI
research
-
GigaChat сдаёт инженерную аттестацию в Московском энергетическом институте
Sber
industry
-
Soohak: 64 математика создали исследовательский бенчмарк, который ставит frontier LLM в тупик
Seoul National University
research
-
EvoArena: LLM-агенты набирают лишь 39,6% на бенчмарке динамически меняющихся сред
MIT
research
-
Готовы ли мы к агент-нативным системам памяти? SJTU сравнивает 12 архитектур
research
-
AgenticSTS: тестовый стенд с ограниченной памятью для LLM-агентов с длинным горизонтом
Alaya Studio
research
-
EvoPolicyGym: оценка итеративного самосовершенствования RL-политик агентами кодирования
University of Macau / CUHK
research
-
SWE-Together: многоходовой бенчмарк для оценки агентов программирования
research
-
Ideas Have Genomes: фронтирные LLM набирают лишь 27% на бенчмарке рассуждений о научных родословных
Shanghai Jiao Tong University
research
-
LLMRouter: унифицированная инфраструктура для разработки, оценки и развёртывания LLM-роутеров
University of Illinois Urbana-Champaign
research
-
DarwinX: эволюция каркасов агентов посредством естественного отбора
Salesforce AI Research
research
-
Исполняемые мировые модели для ARC-AGI-3: подход агента программирования без игровой специфики
research
-
Learning, Fast and Slow: двойная весовая архитектура для непрерывной адаптации LLM
research
-
SubtleMemory: бенчмарк выявляет систематические провалы агентов в тонком реляционном запоминании
research
-
VideoKR: обучающий корпус из 315K примеров для знание- и рассуждение-интенсивного понимания видео
Yale University
research
-
SWE-Explore: бенчмарк, выявляющий исследование репозитория как ключевое ограничение в агентах для написания кода
Shanghai Jiao Tong University
research
-
StylisticBias: 15 визуальных атрибутов объясняют 80% социальных предубеждений в мультимодальных LLM
research
-
Улучшит ли масштабирование социальное моделирование с LLM? Исследование 85 моделей
Stanford / Columbia / Tsinghua
research
-
UniClawBench: бенчмарк для проактивных AI-агентов на реальных задачах
University of Hong Kong
research
-
AdvancedMathBench: набор бенчмарков для генерации и верификации математических доказательств
InternLM
research
-
GuardianAgentBench: где агенты дают сбой и как их защитить
research
-
LLM теряются при изменении намерений пользователя
Microsoft Research
research
-
MerchantBench: оценка LLM-агентов на долгосрочную согласованность в операциях электронной коммерции
Alibaba Group
research
-
OSReward тестирует кросс-платформенные модели вознаграждения для computer-use
University of Hong Kong
research
-
GST-Bench проверяет, развивают ли VLM глобальное пространственное восприятие по видео
ByteDance Seed
research
-
GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео?
ByteDance Seed
research
-
SWE-Bench ProMax: тестирование агентов на масштабном мультиязычном рефакторинге кода
research
-
Sci-VBench: оценка генерации видео, насыщенного знаниями и рассуждениями, в научных областях
research
-
ASI-Bench: на заре искусственного суперинтеллекта
42-author consortium (lead: Junwei Zhou; incl. Chi Wang, Yilun Hao, Yuantao Zhai)
research