Ежедневный дайджест
9 пунктов · ~9 мин · Неделя 2026-W33
Обязательно к прочтению (2)
Z.ai выпускает GLM-5.3: фронтир в кодинге только за счёт post-training, эмерджентные кибервозможности
Z.ai (Zhipu AI)14 августа 2026 года Z.ai выпустила GLM-5.3 — модель с фокусом на кодинг/агентов, использующую то же базовое ядро на 743B параметров, что и GLM-5.2, — весь прирост достигается за счёт массивно масштабированного post-training (в 10 раз больше сред для долгосрочных задач). Внутренный Z.ai Code Bench улучшился на 50% относительно GLM-5.2; Terminal-Bench 3.0 подскочил с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, а эмерджентные кибервозможности довели CyberGym до 84.5% и ExploitBench — с 24.4% до 54.4%. Модель текстовая с контекстом 1M токенов и сейчас доступна только подписчикам GLM Coding Plan; API и открытые веса раскатываются в течение ближайших ~двух недель.
Alaya-EVOKE: от линейно масштабируемого обучения к бесконечному миру
Интерактивная видео-world-модель, объединяющая индексируемый по камере банк внешнего состояния мира с разреженно-внимательным учителем, линейно масштабируемым по памяти и вычислениям, дистиллированная в трёхшагового студента через 30-секундную цель distribution-matching. Устанавливает SOTA на WBench и конкурентна на VBench-Long и VBench-2.0, генерируя каждый 1,5-секундный чанк за 2,11 с на одном H200 при 384x640.
Стоит знать (5)
Pika запускает Pika Audio: четыре фундаментальные звуковые модели фронтир-класса со стоимостью до 20 раз ниже
Pika14 августа 2026 года Pika выпустила Pika Audio — первое семейство фундаментальных звуковых моделей фронтир-класса, включающее Soundtrack (видео-в-аудио, $0,617/с), Music (песни до 6 минут по тексту/тексту песни/голосу/референсу), SFX (текст-в-звуковые эффекты, 44,1 кГц стерео, средняя задержка 0,847 с) и Speech (TTS 48 кГц с пресетами голосов или клонированием голоса, real-time factor 0,02). Pika позиционирует семейство как до 20 раз более дешёвое по сравнению со сопоставимыми аудио-моделями, с конкретными заявлениями: в 9 раз против ElevenLabs v3, в 4,5 раза против Cartesia/ElevenLabs Turbo и в 2 раза против Hunyuan Foley / Fish Audio.
Google разрешила пользователям отключать видимый водяной знак на изображениях, видео и музыке из Gemini
Google DeepMind14 августа 2026 года Google начала раскатывать переключатель «Настройки → Водяной знак медиа», который скрывает видимый водяной знак на изображениях (Nano Banana), видео (Omni) и музыке (Lyria), сгенерированных Gemini, как в приложении Gemini, так и в видеоредакторе Flow. Невидимые метки SynthID и C2PA Content Credentials остаются встроенными в каждый файл независимо от состояния переключателя, а Google выпускает новую open-source C++-библиотеку Credentio для локальной валидации C2PA.
DarwinX: эволюция агентских харнесов через естественный отбор
Salesforce AI ResearchРассматривает самоэволюцию агента как отбор по популяции харнесов (промптов, инструментов, скиллов, потока управления) при замороженных весах модели, используя цикл в стиле естественного отбора для эволюции харнеса, а не самой модели. Фреймирует возможности агента как функцию и весов, и харнеса, и демонстрирует эволюцию только харнеса как универсальный рычаг самосовершенствования, не зависящий от модели.
Spatial Memory Agent: процедурная память на основе опыта для пространственного интеллекта
Zhejiang UniversityФреймворк самоэволюции без обновления параметров для замороженных VLM-агентов в пространственном рассуждении: запрашивает замороженную VLM, получает reward от верификатора и дистиллирует проверенный пространственный опыт в переиспользуемые трансферабельные уроки, каждый с Transfer Reliability Score, откалиброванным по исходам последующих извлечений. На пяти пространственных бенчмарках и четырёх базовых VLM SMA достигает наилучшего макро-среднего в каждом блоке базовых моделей без экспертных пространственных инструментов на инференсе.
Claude Code v2.1.233 отключает инструменты Todo/Task на Opus 4.8 / Sonnet 5 / Fable 5 / Mythos 5 и закрывает утечку NTLM-учётных данных в Windows
Anthropic14 августа 2026 года Anthropic выпустила Claude Code v2.1.233. Релиз добавляет поддержку URL-merge request'ов GitLab для `--worktree` и представления `claude agents` (MR отображаются как `!N`), opt-in настройку apps-gateway `forward_user_identity` для атрибуции расходов по пользователям, opt-in лимиты памяти cgroup для Linux-Bash через `CLAUDE_CODE_TOOL_MEMORY_LIMIT` и переменную окружения `CLAUDE_CODE_WEBFETCH_CACHE_TTL_MS`. Также исправлены: зацикливание реконнекта MCP v2 `subscriptions/listen` на serverless-хостах, обход валидации Windows-путей `\??\` UNC, приводивший к утечке NTLM-учётных данных, регрессия idle-CPU 100% в Linux при включённой песочнице и пропадавшие хуки уведомлений для запросов разрешений в Claude Desktop и VS Code.
Справочно (2)
LLMRouter: унифицированная инфраструктура для разработки, оценки и развёртывания LLM-роутеров
University of Illinois Urbana-ChampaignУнифицированная модульная инфраструктура, формулирующая LLM-роутинг как пятикомпонентный последовательный процесс принятия решений (контекстные энкодеры, энкодеры моделей, скоринговые функции, правила решений, сигналы обучения), и поставляющая xRouteBench — автоматизированный бенчмарк, покрывающий generic, memory-augmented, vision, time-series и персонализированный роутинг. Среди 16+ репрезентативных роутеров обученные роутеры обходят сильнейший фиксированный бейзлайн на 14,6% относительно, а лёгкие роутеры побеждают в условиях жёстких ограничений по стоимости.
Как риторика может взломать оценки ИИ-ревьюеров? Разбор риторической чувствительности ИИ-систем научного рецензирования
Использует 4200 рукописей, полученных из 120 заявок ICLR 2026, чтобы проверить, как шесть риторических измерений (фрейминг доказательств, позиция новизны, фрейминг охвата и т.д.) сдвигают оценки пяти LLM-ревьюеров при стандартном и строгом протоколах. Фрейминг доказательств и позиция новизны дают наибольшие контрасты оценок; низкие оценки стремятся расти, высокие — снижаться, а строгое рецензирование снижает среднюю общую оценку на 1,36 балла без снижения риторической чувствительности.