#post-training
- Z.ai выпускает GLM-5.3: фронтир в кодинге только за счёт post-training, эмерджентные кибервозможности Z.ai (Zhipu AI) models-llm
- Z.ai выпускает GLM-5.3 с frontier-кодингом и эмерджентной кибер-возможностью zhipu models-llm
- Intern-S2-Preview: научная агентская базовая модель на 397B от Shanghai AI Lab Shanghai AI Lab research
- Annotations as Rollouts: эффективный и масштабируемый reinforcement learning для видео-MLLM research
- On-policy само-дистилляция в диффузионных моделях ByteDance Seed research
- DRPO: переосмысление дивергентной регуляризации в обучении с подкреплением для LLM Tencent Hunyuan research
- SLAI T-Rex: полнопараметрическое пост-обучение семейства DeepSeek-V4 на Ascend SuperPOD SLAI research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- OPRD: дистилляция представлений на политике для пост-обучения LLM research
- Tencent Hunyuan публикует в открытый доступ UniRL: унифицированное RL-дообучение для LLM и диффузионных моделей Tencent / Hunyuan research
- Обобщение от слабого к сильному через прямую on-policy дистилляцию ByteDance / Tsinghua University research
- RL-дообучение активно формирует стратегии композиционного рассуждения, а не просто усиливает базовые навыки research
- Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.) research