Ежедневный дайджест

9 пунктов · ~9 мин · Неделя 2026-W33

Стоит знать (3)

DeepSeek V4 Pro вышел из превью как V4-Pro-0813 с крупным приростом в бенчмарках по коду

DeepSeek
модели/LLM офиц. + СМИ 3 ист. ~1 мин

DeepSeek тихо выпустила DeepSeek-V4-Pro-0813 как общедоступный релиз флагманской модели V4 Pro 12 августа 2026 года, завершив почти четырёхмесячное превью. Модель MoE на 1.6T параметров (49B активных) сохраняет контекст в 1M токенов и показывает значительный рост в бенчмарках агентного кодинга по сравнению с превью, включая SWE-bench Verified на уровне 80.6%, LiveCodeBench на уровне 93.5% и Terminal-Bench 2.1, выросший с 72.1 до 87.9.

Почему это важно
Это сигнализирует о том, что DeepSeek сокращает разрыв с топовыми закрытыми моделями в задачах агентного кодинга, сохраняя при этом агрессивные цены, что усиливает гонку по цене и возможностям между Китаем и США на передовых моделях.

On-Policy Self-Distillation without Any Supervision

исследования официальный 2 ист. ~1 мин

U-OPSD обучает языковую модель на консенсусных псевдо-решениях, построенных на основе её собственных генераций с мажоритарным голосованием, исправляя уверенные ошибки без эталонных меток, моделей-учителей или обратной связи от среды.

Почему это важно
187 голосов на HuggingFace Daily Papers; сообщается о приросте на 8.5–10.7% относительно базовых моделей на математических бенчмарках (AIME24/25, HMMT25, MATH500, AMC23), сопоставимо с методами self-improvement с учителем.

Macaron-V1: к открытому непрерывному обучению с самосовершенствованием и Mixture-of-LoRA

исследования официальный 2 ист. ~1 мин

Открытая система агентной модели для непрерывного обучения после развёртывания, сочетающая базу GLM-5.2 на 744B параметров с архитектурой Mixture-of-LoRA, которая комбинирует специализированные адаптеры для чата, агентных задач, кодинга и генеративного UI; меньший вариант на 50B на базе Qwen3.6 поддерживает локальное развёртывание.

Почему это важно
324 голоса на HuggingFace Daily Papers; представляет полноценный совместно спроектированный стек (платформа пост-тренинга MinT, RL для длинного контекста LongStraw, агентный RL MindForge), а не отдельную изолированную технику.
Справочно (6)

Кража трасс рассуждений из проприетарных LLM API

исследования официальный 2 ист. ~1 мин

Исследователи показывают, что зашифрованные блоки трасс рассуждений, возвращаемые крупными LLM API, взаимозаменяемы между сессиями, пользователями и даже разными моделями, что позволяет злоумышленникам внедрять их в более слабые модели, вынуждая раскрывать открытым текстом дословные рассуждения.

Почему это важно
Документированы четыре вектора атаки, затрагивающие Anthropic, OpenAI и Google, с извлечением 367 артефактов PII и 182 учётных данных из более чем 315 000 собранных блоков рассуждений; предложены криптографические и системные меры защиты.

Яндекс запускает функцию AI-компаньона Lumena в Яндекс Книгах

Yandex
инструменты офиц. + СМИ 2 ист. ~1 мин

Яндекс представил первую возможность Lumena, персонализированного AI-компаньона, запланированного для развёртывания во всех развлекательных сервисах компании, начав с функции «О персонажах» в Яндекс Книгах, которая позволяет читателям узнавать о персонажах и сюжете без спойлеров, исходя из их собственного прогресса чтения.

Почему это важно
Сигнализирует о курсе Яндекса на персонализированных AI-компаньонов, встроенных в потребительскую развлекательную экосистему компании (Книги, Кинопоиск, Музыка) — новую продуктовую поверхность за пределами основного ассистента Алиса.

AI-ассистент Яндекса помогает детским ревматологам дистанционно наблюдать пациентов с ювенильным артритом

Yandex
инструменты офиц. + СМИ 2 ист. ~1 мин

Яндекс, построенный на Yandex AI Studio и обученный на клинических рекомендациях Минздрава России и документации по лекарственным препаратам, развернул AI-ассистента внутри приложения дистанционного мониторинга, которым пользуются 32 детских ревматолога, наблюдающих около 1500 пациентов с ювенильным артритом по всей России.

Почему это важно
Конкретный кейс внедрения в здравоохранении для российской LLM-платформы: по сообщениям, доля обращений пациентов, которые врачи могут решить при первом контакте, выросла на 40%.

Claude Code v2.1.229 добавляет хуки для self-hosted раннеров и источники команд плагинов из marketplace

Anthropic
инструменты официальный 1 ист. ~1 мин

Вслед за укреплением синхронизации скиллов в v2.1.228, Anthropic выпустила Claude Code v2.1.229 12 августа, добавив поддержку хуков для self-hosted раннеров, источники команд 'command' в marketplace плагинов, позволяющие локальному инструменту поставлять и горячо перезагружать директории плагинов, группы сессий в боковой панели VSCode и SSE keepalive для потокового вещания через gateway.

Почему это важно
Приоритетный пункт для coding-агентов: продолжает укрепление безопасности синхронизации скиллов из предыдущего релиза, добавляя новую надёжность для CI-раннеров и функции для рабочего процесса в IDE для повседневных пользователей Claude Code.

Превью Zed editor 1.16.0 добавляет поддержку Gemini 3.6 Flash

Zed Industries
инструменты официальный 1 ист. ~1 мин

Превью-релиз Zed 1.16.0 (12 августа) добавляет Gemini 3.6 Flash в список моделей Google AI, наряду с улучшениями панели Git (сворачиваемые сгруппированные изменения, опциональные сообщения stash) и масштабируемым/прокручиваемым рендерингом диаграмм Mermaid.

Почему это важно
Добавляет недавно выпущенную модель Gemini в редактор Zed с поддержкой агентов, поддерживая актуальность его AI-ассистента для кодинга в соответствии с последней линейкой моделей.

OpenCode v1.18.17 и v1.18.18 привозят маршрутизацию провайдеров и исправления надёжности

SST
инструменты официальный 1 ист. ~1 мин

SST выпустила OpenCode v1.18.17 (12 августа) и v1.18.18 (13 августа), исправив системный промпт Kimi для провайдеров Moonshot/Kimi, уровень reasoning xhigh для моделей xAI, дефолты сэмплирования DeepSeek V4 Flash, качество компакции сессий для меньших моделей, а также включив PDF-вложения с поддержкой vision для моделей GitHub Copilot.

Почему это важно
Приоритетный пункт для coding-агентов: инкрементальные исправления надёжности и маршрутизации моделей для мультипровайдерного CLI/десктоп-приложения OpenCode.