-
VibeThinker-3B достигает показателей frontier-уровня на бенчмарках рассуждений через curriculum RL
WeiboAI
research
-
OpenAI представила GPT-Red — внутреннюю модель для автоматизированного red-teaming защиты от prompt-injection
OpenAI
research
-
StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15
research
-
Exploration Hacking: LLM можно дообучить для стратегического противодействия RL-обучению
research
-
OpenAI раскрывает случайное использование оценки цепочки рассуждений при RL-обучении шести моделей
OpenAI
research
-
AI Co-Mathematician от Google DeepMind достигает 48% на FrontierMath Tier 4
Google DeepMind
research
-
Flow-OPD: on-policy дистилляция даёт +29 пунктов по GenEval на Stable Diffusion 3.5
research
-
RubricEM: мета-RL с декомпозицией политики под руководством рубрик за пределами верифицируемых наград
Google
research
-
SU-01: рассуждения на уровне золотой медали олимпиады через curriculum SFT и двухэтапный RL
SU-01 Team
research
-
SkillsVote: Lifecycle Governance of Agent Skills — Collection, Recommendation, Evolution (219 HF upvotes)
Memtensor Research Group / IAAR-Shanghai
research
-
Qwen-AgentWorld: языковые мировые модели для универсальных агентов на 35B и 397B параметров
Qwen Team, Alibaba
research
-
Dockerless: верификатор программ без окружения для агентов кодирования
ByteDance
research
-
DOPD: двойная on-policy дистилляция с advantage-aware маршрутизацией токенов
research
-
Мираж оптимизации политик обучения: монотонные политики инференса как реальная цель для RL языковых моделей
Tianjin University / Alibaba
research
-
Long-Horizon-Terminal-Bench: тестирование пределов агентов на длинных терминальных задачах
Tencent Hunyuan
research
-
Molt: масштабируемый PyTorch-native фреймворк для обучения агентного reinforcement learning
NVIDIA
research
-
Intern-S2-Preview: научная агентская базовая модель на 397B от Shanghai AI Lab
Shanghai AI Lab
research
-
ClawGym II: исследование чёрно-ящичного RL на обвязке агента
Renmin University of China
research
-
Anthropic устраняет агентическое поведение шантажа у Claude с помощью «Teaching Claude Why»
Anthropic
research
-
DRPO: переосмысление дивергентной регуляризации в обучении с подкреплением для LLM
Tencent Hunyuan
research
-
LLM-as-a-Verifier: верификация как независимая ось масштабирования для LLM
Stanford University / UC Berkeley / NVIDIA
research
-
Технический отчёт Kimi K3: подробности об архитектуре Kimi Delta Attention и Stable LatentMoE
Moonshot AI
research
-
Learning while Deploying: флитовое обучение с подкреплением превращает развёртывание роботов в непрерывный тренинг
AGIBot
research
-
Ctx2Skill: фреймворк самосовершенствования для автономного обнаружения навыков из контекста в LLM
research
-
RLDX-1: Multi-Stream Action Transformer достигает 86,8% на гуманоидных задачах ALLEX
RLWRLD
research
-
OpenSearch-VL: открытый рецепт обучения мультимодальных агентов поиска
Tencent Hunyuan
research
-
SDAR: агентное обучение с подкреплением через самодистилляцию для многоходовых агентов
Zhejiang University / Meituan
research
-
GrepSeek: обучение поисковых агентов для прямого взаимодействия с корпусом через команды оболочки (93 апвоута на HF)
University of Massachusetts Amherst
research
-
ThoughtFold: интроспективное обучение предпочтениям сокращает токены рассуждения на 56% без потери точности
research
-
Агентные трансформеры доказуемо обучаются поиску в глубину через обучение с подкреплением
Carnegie Mellon University / Ohio State University
research
-
Flow-DPPO: принципиальное RL-выравнивание для моделей генерации изображений и видео на основе flow matching
Tencent Hunyuan
research
-
Arbor: автономное ML-исследование через уточнение дерева гипотез
NLPIR Lab
research
-
Z-Reward: распределения оценок вместо скалярных наград для RLHF в генерации изображений
Alibaba
research
-
InterleaveThinker: RL-пайплайн «планировщик+критик» для перемежающейся генерации текста и изображений
CUHK Multimedia Lab
research
-
OPID: дистилляция навыков на собственной политике улучшает RL агентов с длинным горизонтом
Institute of Automation, Chinese Academy of Sciences
research
-
CompactionRL: обучение с подкреплением с компакцией контекста для long-horizon-агентов
Zhipu AI / Tsinghua University
research
-
SearchOS-V1: к устойчивой коллаборации агентов открытого поиска информации
Ant Group / Renmin University
research
-
SEED: самоэволюционирующая on-policy дистилляция для агентного обучения с подкреплением
research
-
From Pixels to States: переосмысление интерактивных world models как игровых движков
research
-
Beyond Euclidean Clipping: преодоление коллапса исследования в LLM RL через риманову изометрическую оптимизацию политики
research
-
Frontis-MA1: обучение модели AI4AI для рекурсивного самоулучшения в машинном обучении
Horizon Research, Frontis.AI, Tsinghua University
research
-
DAPD: Dual-Anchored Policy Distillation
research
-
Progressive Agent Skill Generation via Reinforcement Learning (Skill-α)
The Chinese University of Hong Kong
research
-
Recursive Synthetic Terminal Tasks генерирует более 37 000 проверяемых долгосрочных агентных задач
research
-
DAPD выявляет режим отказа «иллюзия привилегии» в самодистилляции on-policy
Shanghai AI Laboratory
research
-
AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением
Tsinghua University
research
-
On-Policy Self-Distillation without Any Supervision
research
-
EnvHarness: Awakening Static Worlds for Agent Learning
Google
research
-
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
University of Science and Technology of China
research
-
CoPD: co-evolving policy distillation для унифицированных мультиспособных моделей
research
-
Odysseus: обучение VLM для интерактивного принятия решений на 100+ ходов с помощью RL
Princeton University
research
-
TrOPD: Trust-Region On-Policy Distillation Stabilizes LLM Training When Teacher-Student Gap Is Large
Samsung Research
research
-
InterleaveThinker: RL-фреймворк для агентной генерации чередующегося текста и изображений
research
-
FORT-Searcher: фреймворк обучающих данных, устойчивых к «срезанию углов», для агентов глубокого поиска
research
-
Astra: VLM с RL-обучением запрашивает симулятор мира для пространственных рассуждений
research
-
Горизонт верификации: ни одна функция вознаграждения не работает для агентов программирования при масштабировании
Qwen (Alibaba)
research
-
EvoPolicyGym: оценка итеративного самосовершенствования RL-политик агентами кодирования
University of Macau / CUHK
research
-
Передай эстафету: эстафетная on-policy дистилляция траекторий
Zhejiang University
research
-
DarwinX: эволюция каркасов агентов посредством естественного отбора
Salesforce AI Research
research
-
VibeWorlding: могут ли мультимодальные агенты создавать 3D-открытые миры от начала до конца?
Tencent
research
-
Prime Agent: самоулучшающийся RLM-харнесс
Prime Intellect
research
-
HeavySkill: интернализация «тяжёлого мышления» как обучаемого агентного навыка через RL
research
-
NanoResearch: совместная эволюция навыков, памяти и политики для персонализированной AI-автоматизации исследований
Shanghai AI Lab
research
-
TMAS: масштабирование тестового вычисления через синергию мультиагентов с иерархической памятью
research
-
BetaPRM: process rewards с учётом неопределённости сокращают расход reasoning-токенов на 33%
research
-
NudgeRL: стратегические контекстные подсказки для эффективного исследования в RLVR
KAIST AI
research
-
QUBRIC: Co-Designing Queries and Rubrics Extends RLVR to Open-Ended Reasoning Domains
research
-
О геометрии on-policy дистилляции: парадигма обучения, отличная от SFT и RLVR
Hong Kong University of Science and Technology
research
-
Слабые критики создают сильных учеников: On-Policy Critique Distillation для масштабируемого надзора
Rutgers University
research
-
ZPPO: дистилляция знаний через учителя-в-промптах превосходит градиентные методы для малых моделей рассуждений
NVIDIA
research
-
Агентные трансформеры доказуемо обучаются поиску через обучение с подкреплением
research
-
OPRD: дистилляция представлений на политике для пост-обучения LLM
research
-
VRRL: визуально заземлённая саморефлексия для моделей зрение-язык через RL
UT Austin / Cornell
research
-
Обобщение от слабого к сильному через прямую on-policy дистилляцию
ByteDance / Tsinghua University
research
-
RL-дообучение активно формирует стратегии композиционного рассуждения, а не просто усиливает базовые навыки
research
-
LongStraw: RL с длинным контекстом свыше 2М токенов при фиксированном GPU-бюджете
Mind Lab
research
-
Ring-Zero: масштабирование zero RL до триллиона параметров для возникающего рассуждения
inclusionAI
research
-
Понимание рассуждения: от предобучения к пост-обучению
research
-
AREX: к рекурсивно самосовершенствующемуся агенту для глубоких исследований
Beijing Academy of Artificial Intelligence (BAAI)
research
-
Skill Self-Play: расширение границ возможностей LLM с помощью совместно эволюционирующих навыков
Alibaba
research
-
От RLVR к RLSVR: преобразование задач порождает самопроверяемые вознаграждения для самосовершенствования LLM в открытых доменах
research
-
Weak-to-Strong On-Policy Distillation
Microsoft Research / University of Maryland / MBZUAI
research
-
MerchantBench: оценка LLM-агентов на долгосрочную согласованность в операциях электронной коммерции
Alibaba Group
research
-
ABSeeker: обучение поисковых агентов с длинным горизонтом через распределение наград методом обратного отслеживания ответа
Shanghai Jiao Tong University
research
-
Agentic ESOpt: файнтюн long-horizon LLM-агентов с минимальными требованиями к GPU
National University of Singapore (Zhi Zheng, Wee Sun Lee et al.)
research
-
Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL
UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.)
research
-
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
HKUST/NUS/Oxford/NTU
research
-
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
Microsoft Research
research