#audio
- MiniMax запускает H3 — омни-модальную модель, генерирующую 2K-видео с нативным стерео-звуком MiniMax video
- Alibaba выпускает видеомодель Wan 3.0 с 30-секундной генерацией за один проход и нативным аудио Alibaba (Tongyi Lab) video
- ElevenLabs Music v2: смена жанра по ходу трека, inpainting и коммерческий клиренс ElevenLabs audio
- ElevenLabs Music v2 API открывает смену жанров и инпейнтинг ElevenLabs audio
- ByteDance запускает Seed-Audio 1.0: унифицированная генерация речи, музыки и фоновых звуков ByteDance audio
- EchoWM: открытые и входимые omnimodal-модели мира JD.com research
- TLive-Omni: omnimodal-модель понимания для e-commerce-стриминга Tencent research
- Google распространяет аудио Veo 3.1 на все инструменты редактирования Flow, добавляет Insert и Remove Google DeepMind video
- Wan-Streamer v0.1: сквозная интерактивная фундаментальная модель реального времени с задержкой менее 550 мс Wan-AI research
- Suno запускает расширенное разделение на стемы с выделением отдельных инструментов Suno audio
- OpenAI добавила водяные знаки SynthID для аудио GPT-Live с API-верификацией OpenAI tools
- Stable Audio 3.0 получает DAW-плагин и мультитрековый веб-воркфлоу Stability AI audio