AI Digest

Ежедневный обзор значимых релизов и событий в мире AI на русском, с акцентом на верифицируемость источников.

OpenAI представила Jalapeño — 700-ваттный inference-ASIC на архитектуре Broadcom, опережающий Nvidia Blackwell по показателю токенов на ватт

OpenAI
индустрия офиц. + СМИ 6 ист. ~1 мин

25 августа 2026 года OpenAI раскрыла Jalapeño — свой первый кастомный inference-оптимизированный ASIC, разработанный совместно с Broadcom и изготовленный TSMC по техпроцессу N3P (вычислительный кристалл) / N3E (I/O-чиплет), с памятью HBM4. На чип: 13,4 петаFLOPS в MXFP4, 216 ГБ HBM4 в шести стеках по 12 ярусов, пропускная способность памяти 15,4 ТБ/с, TDP 700 Вт. Стойка: 128 акселераторов, 1,7 эксаFLOPS 4-битных вычислений, 27,5 ТБ HBM4, ~2 ПБ/с пропускной способности памяти. На бенчмарке SemiAnalysis InferenceX показывает 1,5x-1,9x прироста пропускной способности и 1,7x-3,6x снижения задержки по сравнению с конкурирующими системами GB200/GB300, с преимуществом 2,1x-4,1x на сверхмалых задержках.

Почему это важно
Первый кастомный inference-кремний OpenAI и самая серьёзная публичная угроза CUDA-рову Nvidia; указывает на то, что экономика вертикальной интеграции теперь достижима для ведущих лабораторий.

Tencent выпускает мультимодальные модели эмбеддингов WeMM-Embedding (2B/4B/9B) — новый SOTA на MMEB-v2/v3

Tencent
модели/LLM офиц. + СМИ 7 ист. ~1 мин

Tencent опубликовала семейство WeMM-Embedding — универсальную мультимодальную модель эмбеддингов с размерами 2B/4B/9B параметров, дообученную из Qwen3.5-2B/4B/9B-Base — 25 августа 2026 года. Технический отчёт (arXiv:2608.24053) описывает двухэтапный пайплайн обучения (масштабное мультимодальное выравнивание, затем уточнение на курированных данных, тонкая релевантность-супервизия и кросс-размерный перенос знаний). Входы охватывают текст, изображения, видео, визуальные документы и чередующийся мультимодальный контент (без аудио). Выходы — L2-нормализованные эмбеддинги с поддержкой Matryoshka (2B → 2 048-мерные; 4B → 2 560-мерные; 9B → 4 096-мерные). WeMM-Embedding-9B устанавливает новый state-of-the-art на MMEB-v2 со средним баллом 80,6 (Image 81,9 / Video 74,3 / VisDoc 83,3) и лидирует на MMEB-v3 V3-All с 59,5 — опережая Qwen3-VL-Embedding-8B (53,5) и Tianmu-Emb-Uni-8B (53,3). Вариант 2B уже превосходит прежний 8B open-source baseline на MMEB-v2. Развёртывание поддерживается в vLLM 0.27.0 (pooling runner) и SGLang 0.5.9. В отчёте заявлено масштабное развёртывание в WeChat Channels, Official Accounts, Moments и e-commerce-сервисах, с 14 онлайн A/B-тестами и внутренним бенчмарком на 26 задач.

Почему это важно
Первый крупный open-weights релиз мультимодальных эмбеддингов от ведущей китайской лаборатории после Qwen3-VL-Embedding ранее в 2026 году, и первый, поставляющийся в трёх размерах (2B/4B/9B) с полными весами Apache-2.0 и подробным техническим отчётом. Закрепляет Tencent в открытой гонке мультимодальных эмбеддингов наряду с Qwen и Alibaba и сигнализирует, что продуктовая поверхность WeChat (поиск, рекомендации, e-commerce) теперь используется как реальный полигон для модели — доказательная база A/B-тестов и отличает релиз от чисто академических baseline'ов.

Сбер и Яндекс снижают цены на токены LLM — GigaChat минус 67%, YandexGPT Pro минус 33% (исследование Nodul)

Sber / Yandex
индустрия офиц. + СМИ 6 ист. ~1 мин

25 августа 2026 года исследование платформы Nodul, опубликованное через РБК, показало, что и Сбер, и Яндекс существенно снизили цены на токены LLM за период октябрь 2025 — август 2026: GigaChat Lite 0,20 → 0,065 руб/1к (-67,5%), GigaChat Pro 1,50 → 0,50 руб/1к (-66,7%), YandexGPT Pro 5.1 0,80 руб/1к (-33% против YandexGPT 5 Pro), YandexGPT Lite без изменений — 0,20 руб/1к. Яндекс оспаривает методологию Nodul (сравнение шло с моделями предыдущего поколения) и указывает на новую Alice AI LLM Flash как релевантную модель — около 0,425 руб за 5 000 токенов, падение >14x год к году. Сбер также оспаривает заглавные цифры. Зарубежные модели сопоставимого класса остаются до 10x дешевле: DeepSeek V4 Flash ~0,0375/0,112 руб, GPT-5.4 mini ~0,064/0,383 руб, Qwen 3.8 Max ~0,17/0,511 руб за 1к in/out. Яндекс отдельно сообщил, что коммерческое потребление токенов AI Studio в 1П 2026 достигло 597 млрд — 18x год к году.

Почему это важно
Самое резкое из публично раскрытых снижений цен от двух ведущих российских LLM-провайдеров за цикл. Гонка с китайскими моделями структурна: высокие российские цены отражают необходимость самостоятельно финансировать дата-центры в условиях ограничений на импорт GPU и работу с персональными данными, поэтому ценовая конкурентоспособность — реальный ров для любого российского enterprise-деплоя. Разворот Яндекса к более дешёвому флагману (Alice AI LLM Flash) вместо линейки YandexGPT — заметный шаг в нейминге/позиционировании.
Полный выпуск →

Alibaba выпускает видеомодель Wan 3.0 с 30-секундной генерацией за один проход и нативным аудио

Alibaba (Tongyi Lab)
видео офиц. + СМИ 8 ист. ~1 мин

Alibaba Cloud выпустила Wan 3.0 2026-08-24 в виде вызываемого API на Model Studio / Qwen Cloud и в песочнице create.wan.video. Модель генерирует до 30 секунд за один проход (вдвое больше 15-секундного потолка Wan 2.7), выдаёт нативное 1080p-видео со звуком, отрендеренным в том же проходе, и принимает текстовые, графические, видео-, аудио- и документные (PDF / слайд / веб-страница) входы. Для документных входов требуется режим 'thinking', который позволяет модели рассуждать о композиции до рендеринга. На запуске доступны три эндпоинта — T2V, I2V (с опциональным управлением конечным кадром) и reference-to-video — принимающие до 10 референсных изображений, 5 референсных видеоклипов (всего 15 с при 16 fps+) и 5 референсных аудиодорожек (всего 15 с). Цены: $0.05/$0.10/$0.20 за секунду при 480p/720p/1080p, тариф 'Prime' — $0.068/$0.14/$0.28. Публичная бета шла с 2026-08-06; понедельничный анонс совпал с закрытием доразмещения Alibaba на HK$80 млрд — крупнейшего в Гонконге с 2021 года.

Почему это важно
Wan 3.0 удваивает потолок длины видео за один проход, заданный предыдущим поколением Wan, и добавляет нативное аудио в том же проходе, выводя флагманскую видеомодель Alibaba в одну функциональную категорию с ByteDance Seedance 2.5 и Hailuo H3. Референсная композиция (изображения / видеоклипы / аудиоклипы / документы как входы первого класса) позиционирует её как единую мультимодальную модель, а не чистую text-to-video систему. Wan остаётся API-only — Wan 2.2 по-прежнему последний open-weights флагман, так что для open-source потребителей это пока не drop-in замена.

Apodex 1.1: масштабирование агентного интеллекта для сложных задач

Apodex
исследования офиц. + СМИ 2 ист. ~1 мин

Технический отчёт, определяющий «рабочую способность» — устойчивый верифицируемый прогресс в долгосрочных реальных задачах, затрагивающих файлы, источники и код. Масштабируется по двум осям: масштабирование среды (исполнительные верификаторы файлов/поиска/кода) и масштабирование агентной координации (декомпозиция, асинхронная делегация, перепланирование). Общий AgentOS-харнесс поддерживает состояние задачи и происхождение между инструментами и агентами; 35B-параметров Apodex 1.1 Mini сохраняет эту способность локально.

Почему это важно
Доклад HF Daily с 219 upvotes на 25 августа — №1 доклад HF Daily в тот день. Очерчивает видение «Heavy-Duty Solver» и показывает, что меньшая открытая модель конкурентоспособна с фронтирными системами на бенчмарках по финансам/исследованиям/математике/коду/поиску.

Claude Code v2.1.239 — крупный релиз с надбавкой за резидентность данных, межсессионными сообщениями в Windows, ListAgents

Anthropic
инструменты официальный 1 ист. ~1 мин

21 августа Anthropic выпустила Claude Code v2.1.239 (50+ изменений): оценки стоимости (/cost, status line, --max-budget-usd) теперь включают наценку 1.1x за инференс только в США для воркспейсов с резидентностью данных; новая команда /claude-api upgrade мигрирует Python-проекты с anthropic 0.x на 1.x; Alpine/musl-сборки теперь подгружают нативные аддоны для вставки изображений, буфера обмена и захвата аудио; межсессионные сообщения расширены на Windows (раньше только macOS/Linux); /goal check-ins теперь отступают (30 мин -> 1 ч -> 2 ч) вместо срабатывания каждые 30 мин; ListAgents / /list-agents показывает активных тиммейтов; keybindingFlavor 'readline' соответствует поведению word-key в Bash. Также исправлены: биллинг стриминга в Bedrock, задержка Edit/Write в JetBrains, обрезка MCP elicitation и фрагментация трейсов OpenTelemetry.

Почему это важно
Это крупнейший релиз Claude Code за рассматриваемый период и первый, выводящий ценообразование за резидентность данных прямо в CLI — значимое изменение для enterprise-пользователей на Bedrock/Vertex. Расширение межсессионных сообщений на Windows вместе с /goal-backoff в совокупности сигнализируют, что Anthropic инвестирует в долгоживущие мультиагентные воркфлоу Claude Code, а не в односессионные чаты.
Полный выпуск →

DeepSeek выпускает экспериментальную мультимодальную модель V4-Flash-Vision-Exp

DeepSeek
модели/LLM офиц. + СМИ 4 ист. ~1 мин

DeepSeek выложила V4-Flash-Vision-Exp на своей API-платформе как первый мультимодальный релиз: модель достигает уровня V4-Flash на текстовых задачах (агенты, рассуждения, world knowledge) и добавляет понимание изображений с тарификацией до 384 токенов за изображение. На бенчмарке DeepSeek для мультимодальных агентов vision-модель идёт вровень с Opus-4.8 и в день релиза получает бесплатный Files API для повторного использования изображений и поддержку DeepSeek Harness 0.1.1.

Почему это важно
DeepSeek выходит за пределы чистого текста в мультимодальную гонку по ценам уровня Flash; в день релиза попало в китайскую финансовую прессу (Caixin), которая подаёт это как начало мультимодальной конкуренции наряду с Moonshot и Qwen.

OpenAI Codex CLI v0.149.1 stable: добавлены классификация thread-source и image-budget compaction

OpenAI
инструменты официальный 2 ист. ~1 мин

OpenAI выпустила Codex CLI v0.149.1 как Latest stable 2026-08-24, вместе с альфа-тегами 0.149.0-alpha.7.2 / 0.149.0-alpha.4.3 (22–23 августа) и 0.150.0-alpha.7 (22 августа). v0.149.1 вводит глобальный флаг `codex exec --thread-source <SOURCE>`, который пробрасывается в новые и форкнутые треды и доступен как `threadSource` в TypeScript SDK; опциональную фичу `compaction_image_budget`, тарифицирующую сохраняемые изображения по существующим оценкам размера с атомарным обрезанием image-and-label; а также задаёт `thread_source=memory_consolidation` для отсоединённых memory-запросов.

Почему это важно
Первый stable-дропс Codex CLI за окно; добавляет метаданные-примитивы, на которые будет опираться остальной стек агента (compaction, observability, forks).

ForgeWM: Progressive Causal Training для Few-Step Action-Conditioned Video World Models

исследования офиц. + СМИ 2 ист. ~1 мин

Четырёхступенчатое прогрессивное обучение (domain adaptation → teacher-forced causal → causal consistency distillation → on-policy distribution matching) превращает двунаправленный видеогенератор в 1/2/4-шаговую каузальную world model. Продемонстрировано на Minecraft и FPS с геймпадом в режиме dual-path для интерактивного использования и реплея.

Почему это важно
HuggingFace Daily Papers: 95 upvotes. По словам авторов, первый фреймворк, поддерживающий low-latency каузальное игровое управление от диффузионного бэкбона при инференсе менее чем за 4 шага.
Полный выпуск →

τ₀-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

Shanghai Innovation Institute
исследования офиц. + СМИ 3 ист. ~1 мин

Hierarchical robot foundation model that treats high-level subtask generation as a compute-scalable inference problem solved via world-model-guided beam search with execution memory; trained on 40,115 hours of real-world multimodal data and shows large closed-loop gains on long-horizon manipulation under distribution shift.

Почему это важно
HF Daily Paper with 519 upvotes (highest of the day); large real-data hierarchical VLA with test-time compute scaling

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

Ant Research
исследования официальный 3 ист. ~1 мин

Reconstructs animatable 4D humans from an uncalibrated monocular video by generating reconstruction-grade, multi-view-consistent videos via a camera-controlled video diffusion model and lifting them to 4D Gaussian Splatting; introduces Reference Context Packing and Target Context Routing plus the MVGameHuman dataset.

Почему это важно
HF Daily Paper with 317 upvotes; accepted at SIGGRAPH Asia, first practical casual-video → 4DGS pipeline

EnvHarness: Awakening Static Worlds for Agent Learning

Google
исследования официальный 3 ист. ~1 мин

An 'ActionableEnv' wrapper plus 'EnvRigger' that programmatically reshape static LLM-agent benchmarks via Setup/Rule/Link plugins, targeting specific agent weaknesses without rebuilding verifiers; across five benchmarks in four domains, lifts SWE-bench Verified resolution from 52.13% to 54.79% and trims average steps per episode by 9.8%.

Почему это важно
HF Daily Paper with 248 upvotes; addresses the benchmark-saturation problem for LLM-agent RL
Полный выпуск →

OpenAI «временно замедляет» масштабирование frontier-моделей и описывает защиту от кибер-возможностей

OpenAI
индустрия офиц. + СМИ 5 ист. ~1 мин

19–20 августа 2026 года OpenAI опубликовала «Pacing model development in an era of cyber-critical capabilities» и сопутствующий пост, объявив о двухнедельной паузе в крупнейшем плановом frontier-запуске обучения с подкреплением, об усилении исследовательских сред за счёт более строгой сетевой изоляции и песочниц, а также о внедрении 30-минутного детектирующего монитора, потребляющего ~20% supervised inference-вычислений. Шаги связаны с внутренними находками red-team о критических кибер-возможностях у моделей линейки Astra / GPT-5.6 Sol.

Почему это важно
Первое конкретное публичное обязательство frontier-лаборатории замедлить крупный запуск обучения из-за кибер-возможностей; переводит дискуссию после Astra с «надо ли выпускать?» на «какая инфраструктура нужна для безопасного выпуска?» — задаёт прецедент, по которому будут оценивать другие лаборатории.

Z.ai выпускает GLM-5.3 с frontier-кодингом и эмерджентной кибер-возможностью

zhipu
модели/LLM офиц. + СМИ 6 ист. ~1 мин

Z.ai (Zhipu) выпустила GLM-5.3 с контекстом 1M токенов, обязательным reasoning (уровни усилия low/high/max) и существенным пост-тренировочным прогрессом поверх неизменной базы GLM-5.2. Z.ai сообщает о +50% на внутреннем Code Bench, SOTA среди open-source на Terminal Bench 3.0 и Agents' Last Exam (CLI), а также об эмерджентной кибербезопасностной возможности — 84.5% на CyberGym (с 77.2%) и 54.4% на ExploitBench (с 24.4%).

Почему это важно
GLM-5.3 показывает, что frontier-уровневую модель для кодинга/агентов можно получить одним лишь пост-тренингом на неизменной базе, закрывая большую часть разрыва с закрытыми frontier-моделями в агентном кодинге и открывая новый фронт эмерджентных кибер-возможностей, что побудило Z.ai выпускать веса поэтапно и проводить safety-оценки с партнёрами.

OpenAI предварительно анонсировала Private Safety Processing — abuse-монитор с совместимостью с Zero Data Retention для платного API-уровня

OpenAI
инструменты офиц. + СМИ 4 ист. ~1 мин

19 августа 2026 года OpenAI предварительно анонсировала Private Safety Processing (PSP) — систему мониторинга с длинным горизонтом, которая помечает misuse на нескольких диалогах без сохранения промптов или ответов клиента. PSP работает в защищённой одноразовой вычислительной среде, возвращает заголовок ответа `safety-identifier` на сработавших запросах и позиционируется как совместимый с ZDR способ выполнять обязательства по обнаружению abuse для платных API-клиентов.

Почему это важно
Даёт enterprise / регулируемым API-клиентам задокументированный путь сохранить гарантии zero-retention, одновременно выполняя планку OpenAI по abuse-мониторингу — закрывает давний privacy-пробел, из-за которого часть нагрузок уходила к Anthropic.
Полный выпуск →