Ежедневный дайджест

11 пунктов · ~11 мин · Неделя 2026-W33

Стоит знать (3)

Meta выпускает Muse Glimmer — агентную модель с открытыми весами на 30B для локальных устройств

Meta
модели/LLM офиц. + СМИ 2 ист. ~1 мин

10 августа 2026 года Meta Superintelligence Labs выпустила Muse Glimmer — агентную модель с открытыми весами и 30 миллиардами параметров, предназначенную для работы на одном потребительском GPU или мощном Mac на Apple Silicon, с контекстным окном свыше 120K токенов и лицензией Apache 2.0. Модель нацелена на постоянно работающие локальные агентные сценарии, включая кодинг, вызов инструментов и мультимодальное рассуждение, с квантованными сборками, помещающимися в 20-24 ГБ памяти.

Почему это важно
Переносит возможности агентных моделей на потребительское железо, позволяя разработчикам запускать постоянные локальные агенты для кодинга и рассуждений без облачной инфраструктуры.

Anthropic делает авто-режим Claude Code стандартным для планов Pro, Max и Team

Anthropic
инструменты офиц. + СМИ 2 ист. ~1 мин

Anthropic объявила, что начиная с 14 августа 2026 года Claude Code по умолчанию будет работать в авто-режиме для подписчиков Pro, Max и Team: классификатор безопасности будет автоматически одобрять большинство вызовов инструментов вместо запроса разрешения на каждое действие. Anthropic сослалась на исследование с участием 1053 тестировщиков, в котором авто-режим выявил 89% вредоносных действий против 13,6%, выявленных при ручной проверке человеком, и отменяет ранее взимавшуюся плату за токены классификатора.

Почему это важно
Знаменует переход от кодинг-агентов с ручным разрешением на каждое действие к автономности по умолчанию для широко используемого инструмента разработчика, с данными, указывающими на то, что автоматическая проверка превосходит привычное одобрение человеком.

vLLM v0.27.0 добавляет поддержку Kimi K3 и оптимизации для DeepSeek-V4

vLLM Project
инструменты официальный 1 ист. ~1 мин

vLLM 0.27.0 (561 коммит, 242 контрибьютора) добавляет полноценную поддержку Kimi K3, поддержку новых моделей Qwen3.5 и K-EXAONE-2.0-750B-A37B, оптимизации routing-ядра для DeepSeek-V4, обновление до PyTorch 2.13.0, FlashAttention 4 на SM100 с FP8 KV cache, Model Runner V2 для задач embedding/классификации, а также раннюю поддержку железа NVIDIA Rubin и ROCm gfx1250.

Почему это важно
Крупный релиз, расширяющий покрытие моделей vLLM и производительность инференса для крупномасштабного самостоятельного хостинга.
Справочно (8)

SWE-Bench ProMax: тестирование агентов на масштабном мультиязычном рефакторинге кода

исследования официальный 2 ист. ~1 мин

Новый бенчмарк из 170 тщательно отобранных задач по рефакторингу кода на семи языках программирования, созданный для устранения проблем с качеством и тестовыми наборами, найденных в прежних вариантах SWE-Bench. Лучший из оценённых кодинг-агентов решает лишь 41,2% задач, что показывает, что текущие агенты всё ещё испытывают трудности с масштабным мультиязычным рефакторингом.

Почему это важно
Статья с наибольшим числом голосов в HuggingFace Daily Papers за 2026-08-11 (59 голосов); более сложный и чистый бенчмарк, чем существующие варианты SWE-Bench, для измерения реального прогресса кодинг-агентов.

Macaron-V1: к открытому непрерывному обучению с самоулучшением и Mixture-of-LoRA

Mind Lab
исследования официальный 2 ист. ~1 мин

Mind Lab представляет семейство открытых агентных моделей, которые продолжают обучаться после развёртывания благодаря архитектуре Mixture-of-LoRA: замороженная базовая модель комбинирует специализированные LoRA-адаптеры (чат, кодинг, агент, GenUI), выбираемые для каждого хода, а данные использования со временем дистиллируются обратно в адаптеры.

Почему это важно
37 голосов в HuggingFace Daily Papers; конкретный открытый рецепт непрерывного обучения после развёртывания без переобучения всей модели.

Sci-VBench: оценка генерации видео, насыщенного знаниями и рассуждениями, в научных областях

исследования официальный 2 ист. ~1 мин

Представляет бенчмарк из 1253 примеров с экспертной разметкой по 60 темам в четырёх научных дисциплинах для проверки того, правильно ли модели генерации видео передают научные факты и причинно-следственную динамику, а не только визуальный реализм. Обнаруживает, что модели сильно различаются по научной корректности, с выраженным разрывом между проприетарными и открытыми системами.

Почему это важно
21 голос в HuggingFace Daily Papers; закрывает пробел в оценке генерации видео, который упускают текущие бенчмарки (оценивающие только визуальное качество).

Motif 3: технический отчёт

Motif Technologies
исследования официальный 2 ист. ~1 мин

Технический отчёт по Motif 3 — decoder-only модели Mixture-of-Experts с 314B параметров (13,2B активных), построенной на Grouped Differential Latent Attention в сочетании с manifold-constrained hyper-connections и головой multi-token-prediction, показывающей конкурентоспособные результаты на задачах рассуждения, кодинга и работы с длинным контекстом.

Почему это важно
20 голосов в HuggingFace Daily Papers; полностью собственная архитектура (не производная от Llama/Qwen) от менее крупной лаборатории, достигающая показателей, близких к передовым, на агентных бенчмарках.

Agent Memory Distillation: усиление малых LLM-агентов иерархической памятью учителя

исследования официальный 2 ист. ~1 мин

Предлагает не требующий обучения фреймворк, который дистиллирует успешные траектории крупного агента-учителя в иерархическую память (на уровне workflow, подзадач и функций) для малых агентов-учеников, проактивно внедряя память workflow/подзадач и реактивно — память функций при ошибках вызова инструментов. Протестировано на моделях-учениках с 4B-8B параметрами против учителя GPT-5-mini, давая прирост точности до 27,2 пункта по сравнению с базовыми показателями на бенчмарках использования инструментов.

Почему это важно
20 голосов в HuggingFace Daily Papers; практичный путь к сокращению разрыва в возможностях малых агентных моделей без обучения.

Вышла OpenCode v1.18.16

SST
инструменты официальный 1 ист. ~1 мин

OpenCode 1.18.16 заставляет парсер конфигурации игнорировать неизвестные поля верхнего уровня вместо падения, регистрирует проекты, открытые через Home, на уровне всего приложения, добавляет контекстное меню проекта по правому клику на десктопе, исправляет проблему закрытия окна на macOS и улучшает китайскую локализацию.

Вышла Claude Code v2.1.227

Anthropic
инструменты официальный 1 ист. ~1 мин

Claude Code 2.1.227 исправляет баг с feature-флагом, который ошибочно предлагал пользователям плана Max включить usage credits, исправляет сбои команд Bash при использовании claude-code-action с allowed_non_write_users на GitHub-хостинговых раннерах, исправляет поломку /tui после перемотки назад за пределы первого сообщения, а также улучшает UI меню слэш-команд.

Почему это важно
Исправляет ломающую CI регрессию в официальном GitHub Action и баг с запросом биллинга, затрагивающий платящих пользователей.