-
ByteDance представляет Seedance 2.5: нативная генерация 30-секундного 4K-видео с 50 мультимодальными входами
ByteDance
video
-
Google DeepMind инвестирует $75 млн в A24 и формирует первое AI-исследовательское партнёрство с киностудией
Google DeepMind
industry
-
Vidu S1: интерактивная генерация видео в реальном времени со скоростью 42 FPS на потребительских GPU
Shengshu Technology / Tsinghua University
research
-
MiniMax запускает H3 — омни-модальную модель, генерирующую 2K-видео с нативным стерео-звуком
MiniMax
video
-
Alaya-EVOKE: от линейно масштабируемого обучения к бесконечному миру
research
-
Атаки AI-сгенерированным видео на реальные кризисные события: RA-Bench показывает, что детекторы не справляются с подделками кризисных медиа
research
-
Alibaba выпускает видеомодель Wan 3.0 с 30-секундной генерацией за один проход и нативным аудио
Alibaba (Tongyi Lab)
video
-
UniVidX: единый диффузионный бэкбон для генерации RGB, карт внутренних признаков и RGBA-видео
research
-
MiniMax Hailuo 2.3 запущена с Media Agent и генерацией видео в пакетном режиме на 50% дешевле
MiniMax
video
-
Lance: 3B Unified Multimodal Model for Understanding, Generation, and Editing (314 HF upvotes)
ByteDance Research
research
-
xAI Grok Imagine Video 1.5: image-to-video с нативным звуком возглавляет Arena Leaderboard, API уже доступен
xAI
video
-
Google Veo 3.1 добавляет звук во все режимы редактирования Flow и новые инструменты Insert/Remove
Google DeepMind
video
-
Lionsgate берёт долю в Runway и планирует AI-сериалы короткого формата
Runway
industry
-
xAI выпускает Grok Imagine Video 1.5: первое место в Video Arena Leaderboard по цене $4.20/мин
xAI
video
-
Kling AI выпускает 3.0 Turbo и 3.0 Omni: быстрые превью и 4K-редактирование с консистентностью персонажей
Kuaishou
video
-
ByteDance Seedance 2.5 открывает корпоративное бета-тестирование: нативная генерация видео длиной 30 секунд
ByteDance
video
-
Vidu S1: модель интерактивной генерации видео в реальном времени
ShengShu Technology
research
-
Модели генерации видео как универсальные инструменты компьютерного зрения
Google DeepMind
research
-
DreamX-Phi 1.0 побеждает на WorldArena 2.0 Track 1 с action-conditioned видео world model для робототехнической манипуляции
Alibaba
research
-
Alaya-EVOKE: от линейно масштабируемого обучения к бесконечному миру
Zhejiang University
research
-
EchoWM: открытые и входимые omnimodal-модели мира
JD.com
research
-
LongLive-2.0: параллельная инфраструктура NVFP4 для генерации длинных видео (NVIDIA, 1220 апвоутов на HF)
NVIDIA
research
-
Мультиплеерные интерактивные мировые модели с репрезентационными автоэнкодерами
research
-
ABot-World-0: бесконечный интерактивный мир на одном настольном GPU
Alibaba AMAP CV Lab
research
-
Self Gradient Forcing: нативная экстраполяция длинного видео
research
-
Causal Forcing++: 2-шаговая дистилляция для генерации интерактивного видео в реальном времени
Tsinghua University
research
-
SANA-WM: мировое моделирование 720p длительностью в минуту на одном GPU
NVIDIA
research
-
Echo-Infinity: генерация бесконечного видео в реальном времени через обучаемый Memory Query
research
-
Flow-DPPO: принципиальное RL-выравнивание для моделей генерации изображений и видео на основе flow matching
Tencent Hunyuan
research
-
ElevenLabs запускает Avatars в ElevenCreative: AI-видео с говорящей головой на базе TTS
ElevenLabs
video
-
DreamX-World 1.0: интерактивная модель мира общего назначения с управлением камерой 6DoF
AMAP-ML (Alibaba Maps AI Lab)
research
-
Google выпускает Gemini Omni Flash для генерации видео через API
Google DeepMind
video
-
From Pixels to States: переосмысление интерактивных world models как игровых движков
research
-
TimeLens2: универсальное временное позиционирование в видео с мультимодальными LLM
MCG-NJU (Nanjing University)
research
-
PhiZero: модель мира, построенная вокруг физического языка
NLPR, Institute of Automation, Chinese Academy of Sciences
research
-
MiniMax H3: модель с открытыми весами выпущена на Hugging Face
MiniMax
video
-
JoyAI-Video-Edit: редактирование видео в реальном времени без ограничений на основе авторегрессионной диффузии
JD (Jingdong)
research
-
AnyFlow: видеодиффузия с произвольным числом шагов через on-policy дистилляцию flow map
MIT / NVIDIA
research
-
WorldDirector: управляемый симулятор мира с постоянной памятью динамических объектов
research
-
Илон Маск объявил о завершении разработки Grok Imagine
xAI
tools
-
ForgeWM: Progressive Causal Training для Few-Step Action-Conditioned Video World Models
research
-
ReWorld: интерактивная модель мира с долгосрочной памятью
TongyiLab (Alibaba)
research
-
InfinityEdit: бесконечный видеомонтаж с лёгким Edit-Ignition-адаптером
Alibaba (Tongyi)
research
-
Видеомодель Google Gemini «Omni» появляется в ранних демо накануне I/O 2026
Google DeepMind
video
-
Видеомодель Gemini Omni появляется накануне Google I/O 2026
Google DeepMind
video
-
ShengShu Technology запускает Vidu Claw: AI-платформу для сквозного производства рекламы
ShengShu Technology
video
-
VideoKR: обучающий корпус из 315K примеров для знание- и рассуждение-интенсивного понимания видео
Yale University
research
-
Echo-Memory: контролируемое исследование механизмов памяти в видеомоделях мира с условием на действие
Microsoft Research
research
-
SCAIL-2: сквозная анимация персонажей через инконтекстное кондиционирование
Tsinghua University
research
-
PhysisForcing: мировые модели с физическими ограничениями повышают успешность манипуляций роботов на 50%
Peking University / NVIDIA
research
-
Sci-VBench: оценка генерации видео, насыщенного знаниями и рассуждениями, в научных областях
research
-
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
Alibaba Group
research
-
ByteDance открыла публичный доступ к developer API Seedance 2.5
ByteDance
video