-
Claude Fable 5 и Claude Mythos 5: самая мощная модель Anthropic становится публичной
Anthropic
models-llm
-
Правительство США обязало Anthropic отключить Claude Fable 5 и Mythos 5 по всему миру
Anthropic
industry
-
OpenAI представляет семейство GPT-5.6: Sol, Terra и Luna — ограниченный выпуск только для одобренных правительством организаций
OpenAI
models-llm
-
Глобальное рабочее пространство в языковых моделях
Anthropic
research
-
OpenAI «временно замедляет» масштабирование frontier-моделей и описывает защиту от кибер-возможностей
OpenAI
industry
-
OpenAI представила GPT-Red — внутреннюю модель для автоматизированного red-teaming защиты от prompt-injection
OpenAI
research
-
OpenAI заявила, что предрелизные модели вырвались из тестовой песочницы и взломали Hugging Face
OpenAI
research
-
CEO Anthropic уточняет: компания не выступает против моделей с открытыми весами
Anthropic
industry
-
Anthropic раскрыла три реальных инцидента по итогам оценки кибербезопасности Claude
Anthropic
research
-
Атаки AI-сгенерированным видео на реальные кризисные события: RA-Bench показывает, что детекторы не справляются с подделками кризисных медиа
research
-
Exploration Hacking: LLM можно дообучить для стратегического противодействия RL-обучению
research
-
Разбор инцидента OpenAI: как RLHF reward hacking встроил гоблинские метафоры в GPT-5.x
OpenAI
research
-
OpenAI раскрывает случайное использование оценки цепочки рассуждений при RL-обучении шести моделей
OpenAI
research
-
OpenAI запускает Daybreak: платформу для обнаружения уязвимостей на базе ИИ
OpenAI
tools
-
Конгресс США опубликовал 269-страничный проект «Great American AI Act» с трёхлетним приоритетом над законами штатов
industry
-
Сотрудники Anthropic проведут переговоры с Белым домом о приостановке доступа к Fable 5
Anthropic
industry
-
OpenAI публикует Deployment Simulation: предсказание поведения модели до релиза
OpenAI
research
-
Насколько прозрачна DiffusionGemma? Исследование интерпретируемости сокращает разрыв с авторегрессионными моделями
Google DeepMind
research
-
Anthropic включила бывшего главу ФРС Бена Бернанке в Long-Term Benefit Trust
Anthropic
industry
-
Исследование Anthropic: ценности Claude существенно различаются в зависимости от версии модели и языка
Anthropic
research
-
ElevenLabs внедряет аудиоводяной знак SynthID от Google DeepMind для пользователей бесплатного тарифа
ElevenLabs
audio
-
Google DeepMind и Isomorphic Labs подробно рассказали о совместной инициативе по биоустойчивости
Google DeepMind
research
-
Anthropic делает авто-режим Claude Code стандартным для планов Pro, Max и Team
Anthropic
tools
-
OpenAI предварительно анонсировала Private Safety Processing — abuse-монитор с совместимостью с Zero Data Retention для платного API-уровня
OpenAI
tools
-
Natural Language Autoencoders: превращение внутренних состояний Claude в текст
Anthropic
research
-
Anthropic представляет Natural Language Autoencoders для масштабируемой интерпретируемости LLM
Anthropic
research
-
Anthropic устраняет агентическое поведение шантажа у Claude с помощью «Teaching Claude Why»
Anthropic
research
-
GRAM: модульное предобучение делает знания двойного назначения физически удаляемыми из AI-моделей
AE Studio / Anthropic
research
-
Model Spec Midtraining: как нормативное самопознание улучшает обобщение alignment
Anthropic
research
-
Вмешательства SAE ненадёжны: подавленное поведение восстанавливается после интервенции
Hong Kong Polytechnic University
research
-
Google DeepMind публикует AI Control Roadmap: эшелонированная защита от рассогласованных агентов кодирования
Google DeepMind
research
-
GateMem: бенчмарк управления памятью в агентах с разделённым доступом
research
-
SingGuard: адаптируемый к политике во время выполнения мультимодальный защитный барьер LLM с бенчмарком из 56 тыс. примеров
inclusionAI
research
-
Anthropic предлагает отраслевую шкалу оценки тяжести джейлбрейков
Anthropic
research
-
BadWAM: когда модели «мир-действие» правильно мечтают, но неправильно действуют
research
-
Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами
Anthropic
research
-
Mistral AI выпускает Shieldstral — классификатор безопасности с открытыми весами
Mistral AI
tools
-
Anthropic makes auto mode the default permission setting in Claude Code
Anthropic
tools
-
Anthropic выделяет $5 млн на исследования влияния AI на благополучие
Anthropic
research
-
Meta публикует отчёт о готовности Code World Model перед выпуском в открытый доступ
Meta
research
-
Google SynthID Reaches 100B+ Watermarked Assets; OpenAI and ElevenLabs Join C2PA Coalition
Google DeepMind
tools
-
Meta заявила, что её модель Muse Spark 1.1 взломала стороннюю компанию во время тестирования безопасности
Meta
research
-
Cursor запускает Security Review Beta: сканер уязвимостей в PR и плановые CVE-агенты
Cursor
tools
-
Quantifying Faithful Confidence Expression in Large Reasoning Models
Yale NLP
research
-
Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений
research
-
Google DeepMind и партнёры запускают исследовательский фонд по безопасности мульти-агентных AI на $10 млн
Google DeepMind
industry
-
Anthropic публикует первый Public Record: опрос 52 000 американцев об отношении к AI
Anthropic
research
-
Claude Code v2.1.183: защитные ограничения автоматического режима для деструктивных git- и инфраструктурных команд
Anthropic
tools
-
Институциональный red-teaming: правила развёртывания, а не только веса модели, причинно влияют на безопасность мультиагентных систем
research
-
Рекурсивное самосовершенствование в ИИ: обзор 1250 статей с таксономией по силе верификации
research
-
Anthropic запускает публичную инициативу подотчётности «Сложные вопросы»
Anthropic
industry
-
Метапознание в больших языковых моделях: основы, прогресс и возможности — обзор Yale NLP
Yale NLP Lab
research
-
AISPA: пользователецентричный аудит системных промптов для приложений на больших языковых моделях
Stanford University
research
-
Защитные механизмы на основе копируемого контекста не могут обеспечить надёжную безопасность LLM
research
-
Anthropic ослабила классификаторы биобезопасности Claude Fable 5, сократив ложные блокировки на 85%
Anthropic
research
-
OpenAI пресекла новую скрытую российскую операцию влияния с использованием ChatGPT
OpenAI
industry
-
LLM Safety From Within (SIREN)
University of Toronto CSSLab / McGill / LMU Munich
research
-
Яндекс распространяет сертификацию безопасности ИИ ISO/IEC 42001 на всё семейство моделей Alice AI
Yandex
industry