Ежедневный дайджест
17 пунктов · ~17 мин · Неделя 2026-W34
Обязательно к прочтению (5)
Атаки AI-сгенерированным видео на реальные кризисные события: RA-Bench показывает, что детекторы не справляются с подделками кризисных медиа
Представляет RA-Bench — бенчмарк из 17 886 видео (1 830 настоящих якорей, 16 056 сгенерированных) по 10 категориям социального риска и показывает, что ни одно из трёх протестированных семейств детекторов надёжно не обобщается на реалистичные подделки кризисных событий, особенно те, которые обманывают людей и выдерживают компрессию соцсетей.
StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15
Agent-native среда выполнения, организующая исполнение вокруг устойчивых состояний, локального контекста фаз, проверяемых переходов, восстанавливаемых runbook'ов и версионированных практик. На Terminal-Bench 2.1 поднимает GPT-5.5 xhigh с 83,1% до 92,1%, выводит GPT-5.6 Sol xhigh на 95,3% сырой точности и адаптирует тот же harness к DeepSeek-V4 Flash менее чем за $38 с общими затратами на API $15 против $574,68 у GPT-референса.
S²VOPD: самообучаемая визуальная on-policy дистилляция поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия
UC San DiegoСоздаёт асимметрию учитель-ученик путём вычитания информации из ученика через визуальные аугментации, а не добавления привилегированной информации учителю. Дистилляция распределения учителя on-policy в распределение ученика на сильно аугментированном виде поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия, восстанавливая 96% прироста методов с привилегированной информацией без ground-truth, наград или более сильного учителя.
Как Claude ускоряет дизайн белков и аналитическую химию
AnthropicAnthropic сообщает, что Claude спроектировал белковые связующие против 14 из 15 мишеней с долей успеха 22–35% (против обычных 10–15%) и достиг 40% успеха на RBX1 (против 3,7% у участников конкурса); Opus 4.8 также создал перекрёстно-реактивные связующие TNFα для человека/обезьяны/мыши. В аналитической химии Claude Opus 5 обработал сырые файлы NMR и LC-MS за 23 и 19 минут, совпав с лабораторными результатами (96,4% против 96,33% чистоты, подсчёт атомов водорода с точностью до 0,08 1H). Дизайны были независимо произведены и протестированы Adaptyv Bio и Twist Bioscience с использованием до 12 500 часов NVIDIA H100 на Claude Science.
Cursor запускает Origin: хостинг репозиториев кода, PR с синхронизацией с GitHub и агенты в каждом репо
CursorCursor Origin выходит в раннюю бету на всех платных планах 17 августа. Он хостит код клиентов с репозиториями, pull-реквестами (двусторонняя синхронизация с GitHub), вкладкой Codebase и расширениями приложений (Vercel, Depot, Buildkite). Агенты работают внутри каждого репо как часть поверхности рабочих процессов, а не только в редакторе.
Стоит знать (2)
OpenAI Codex CLI 0.148.0 поставляет /export, exec fork, Bedrock как встроенный провайдер и асинхронные MCP-совместимые хуки
OpenAIРелиз 18 августа добавляет: экспорт разговоров из TUI в Markdown через /export; `codex exec fork` плюс архивирование/восстановление из TUI-выбора возобновления; черновик промпта во время инициализации TUI; оценку кредитов/стоимости треда в /status; Amazon Bedrock Runtime как встроенный провайдер; хуки могут выполняться асинхронно и вызывать MCP-инструменты. Исправления покрывают устаревшие инструкции после переключения модели, восстановление рабочей директории/политики одобрения в возобновлённой сессии, переподключение при сбоях провайдера, восстановление MCP после повторной OAuth-авторизации и fail-closed песочницу для отклонённых/нечитаемых путей.
Cline открывает исходники оценок на основе Terminal-Bench для open-weight кодинг-агентов
ClineБлог-пост 18 августа от Ara Khan подробно описывает, как Cline оценивает open-weight кодинг-агентов с помощью Terminal Bench, с практическими эвристиками для производительности модели, эффективности токенов, рассуждений, выбора провайдера и оптимизации оценок. Нацелено на воспроизводимость harness-уровневых измерений для сообщества open-weight моделей.
Справочно (10)
Stable Audio 3.0 получает DAW-плагин и мультитрековый веб-воркфлоу
Stability AIStability AI представила раннюю бету плагина Stable Audio, который генерирует аудио прямо внутри поддерживаемых DAW, синхронизируется с темпом проекта, поддерживает клипы до шести минут и сохраняет альтернативные дубли. Также обновила StableAudio.com итеративным промптингом, вариациями audio-to-audio, мультитрековым редактированием и микшированием, расширением треков, эффектами и экспортом стемов или полного микса.
Groq закрывает раунд Series A на $350 млн для строительства облака AI-инференса
GroqАнонс 17 августа формулирует раунд как «Building the World's Leading AI Inference Cloud». Ни ведущего инвестора, ни разбивки использования средств в блог-посте нет; полные условия и детали раунда не были перечислены в источнике, который я читал.
LightOn выпускает полное семейство LateOn + ColBERT-Zero вместе с Sentence Transformers v6
LightOnLightOn обновила всё семейство моделей late-interaction на Hugging Face — colbertv2.0, LateOn, mLateOn, LateOn-Code, LateOn-Code-edge, LateOn-regularized, LateOn-hpool-regularized, Agent-ModernColBERT, ColBERT-Zero, Reason-ModernColBERT — 17 августа 2026 года вместе с анонсом Sentence Transformers v6. ColBERT-Zero — первая модель ColBERT, контрастивно предобученная end-to-end в multi-vector постановке (55,43 nDCG@10 на BEIR).
IBM Research измеряет, сколько агентской памяти реально нужно каждому ярусу моделей
IBM ResearchIBM Research опубликовал второй пост ALTK-Evolve о калибровке дозы агентской памяти. Среди 8 frontier-моделей на AppWorld (585 задач, 9 приложений) DeepSeek-V3.2 получил +9,5 п.п. TGC с полным набором руководств, gpt-oss-120b показал наибольший прирост через компактное курируемое извлечение, а GLM-5 насытился — единая политика памяти не подходит для всех ярусов возможностей.
Sentence Transformers v6.0 добавляет нативный multi-vector / late-interaction API эмбеддингов
Hugging Face / UKPLabHugging Face анонсировала Sentence Transformers v6.0 с нативной поддержкой multi-vector / late-interaction через новый класс MultiVectorEncoder. Библиотека PyLate от LightOn поглощена в ядро, а ColBERT-Zero и семейство LateOn (LateOn, mLateOn, LateOn-Code, LateOn-regularized и др.) загружаются напрямую через sentence-transformers ≥6.0.
Dharma-AI поднимает утилизацию GPU-кластера с 53,6% до 87,0%, кодируя физические ограничения в планировщик
Dharma-AIDharma-AI опубликовала продолжение, показывающее, что их учитывающий ограничения GPU-аллокатор поднимает утилизацию с 53,6% до 87,0% на бенчмарке смешанных нагрузок обучения/инференса/квантизации, с приоритетно-взвешенной ценностью до +105% (в среднем +52%) по сравнению с FIFO. Кодирование физических ограничений (одна задача на GPU, непрерывные блоки для батчей, лимиты стоимости свопа для realtime) превзошло более сложный, но слепой к ограничениям планировщик.
Claude Code v2.1.235 добавляет опциональную проверку орфографии, исправляет фокус при восстановлении окна и встроенный grep
AnthropicРелиз 18 августа добавляет опциональную настройку проверки орфографии (aspell/hunspell/ispell), исправляет инвалидацию кэша всего промпта при отключении LSP в середине сессии, висячий отступ вложенных списков markdown на глубине 3+, сдвиги подсветки ввода промпта, поведение Shift+Tab в диалогах разрешений, рекламирование недоступных агентов по умолчанию в агентском инструменте и использование памяти/CPU в облачных сессиях вроде /ultrareview. Также усиливает SendMessage против слишком больших сообщений заранее и применяет проверку доступности enterprise-шлюза к claude rc.
llama.cpp выпускает pre-release v0.1.2 плюс ежедневные b10483–b10488 с исправлением производительности SYCL, обновлением OpenVINO и тюнингом CUDA для DGX Spark
llama.cpp (GGML)Работа 18 августа охватывает pre-release v0.1.2 (синхронизация ggml с 0.20.2, документация MCP stdio + CORS-дефолты, целочисленные оценки токенизатора, рефакторинг именования Built-In Tools), b10488 (OpenVINO 2026.3), b10486 (исправление порога тайлинга изображений LFM2), b10485 (синхронизация ggml) и b10483 (cmake alias-таргеты vendor::). 17 августа добавлены b10472 (переопределение пропуска CUDA UMA для HIP, #18159), b10470 (release.yml явно пушит тег), b10456 (SYCL q4_0→f32 с 20,21 до 158,19 GB/s на Arc 70) и b10455 (SYCL OPT_STEP_ADAMW/SGD).
LangChain выпускает langchain-core 1.5.6 и langchain-openai 1.5.2 с метаданными трассировки шлюза и сохранением границ рассуждений
LangChain17 августа: langchain-core 1.5.6 включает метаданные шлюза в трассировки. 18 августа: langchain-openai 1.5.2 (и 1.5.2a1) сохраняет границы элементов рассуждений. Ранее в месяце: langchain-openai 1.5.0 добавил поддержку openai 3.0 SDK, а langchain-anthropic 1.5.6 нормализовал блоки `tool_search_tool_result`.
Pydantic AI v2.32.0 раскрывает аннотации OpenRouter web-search и поставляет инструментарий v6
Pydantic AIРелиз 18 августа v2.32.0: предлагает известные имена моделей для неверных идентификаторов, поддерживает жизненный цикл attachment-search в xAI, раскрывает источники OpenRouter web-search в provider_details['annotations'] и добавляет инструментарий версии 6, отправляющий результаты инструментов под ролью 'tool'. Исправления: синхронные хуки выполняются в пуле потоков с принудительным timeout=, ответы только с пустыми текстовыми частями трактуются как отсутствие вывода, результаты инструментов сортируются раньше объявлений доступности, чтобы Bedrock принимал раскрытие нескольких инструментов, а нативные вызовы инструментов без блоков результатов отбрасываются. v2.31.1 (17 августа) отклоняет нативный структурированный вывод для Claude Sonnet 5 и Fable 5 на Bedrock и откатывается на thinking_level='LOW' для моделей Gemini, которые отвергают 'MINIMAL'.