#diffusion
- Pixal3D: попиксельная генерация 3D из изображений принята на SIGGRAPH 2026 Tencent ARC Lab research
- Vidu S1: интерактивная генерация видео в реальном времени со скоростью 42 FPS на потребительских GPU Shengshu Technology / Tsinghua University research
- Alaya-EVOKE: от линейно масштабируемого обучения к бесконечному миру research
- UniVidX: единый диффузионный бэкбон для генерации RGB, карт внутренних признаков и RGBA-видео research
- Mean Mode Screaming: исправление патологии обучения открывает путь к 1000-слойным Diffusion Transformer research
- Flow-OPD: on-policy дистилляция даёт +29 пунктов по GenEval на Stable Diffusion 3.5 research
- Qwen-Image-2.0: унифицированная генерация и редактирование изображений в разрешении 2K, первое место на AI Arena Alibaba research
- Asymmetric Flow Models: SOTA FID 1,57 на ImageNet через ранг-асимметричную параметризацию скоростей Stanford University research
- Krea публикует открытые веса Krea 2 Raw и Turbo: 12B DiT-модель генерации изображений за 2 секунды Krea image
- Сбер открывает исходный код GFusion — первой российской диффузионной языковой модели Sber models-llm
- MrFlow: ускорение flow-matching моделей text-to-image в 10–25 раз без дообучения Beihang University research
- Vidu S1: модель интерактивной генерации видео в реальном времени ShengShu Technology research
- Раскрытие потенциала редактирования изображений через масштабирование концептов и плотный супервизинг research
- On-policy само-дистилляция в диффузионных моделях ByteDance Seed research
- Moebius: лёгкая модель инпейнтинга на 0,2 млрд параметров сравнялась с FLUX на 11,9 млрд Huazhong University of Science and Technology research
- Self Gradient Forcing: нативная экстраполяция длинного видео research
- Orthrus: 7,8-кратное ускорение инференса для Qwen3 за счёт совместного использования KV-кеша AR и диффузии research
- Causal Forcing++: 2-шаговая дистилляция для генерации интерактивного видео в реальном времени Tsinghua University research
- SANA-WM: мировое моделирование 720p длительностью в минуту на одном GPU NVIDIA research
- Flow-DPPO: принципиальное RL-выравнивание для моделей генерации изображений и видео на основе flow matching Tencent Hunyuan research
- Boogu-Image-0.1: сильный open source диффузионный трансформер на 10B для генерации и редактирования изображений по тексту Boogu Project research
- Mage-Flow: эффективная базовая модель нативного разрешения для генерации и редактирования изображений Microsoft Research research
- JoyAI-Video-Edit: редактирование видео в реальном времени без ограничений на основе авторегрессионной диффузии JD (Jingdong) research
- AnyFlow: видеодиффузия с произвольным числом шагов через on-policy дистилляцию flow map MIT / NVIDIA research
- ForgeWM: Progressive Causal Training для Few-Step Action-Conditioned Video World Models research
- Block3D: эффективная генерация text-to-3D через блочную диффузию research
- Cola DLM: непрерывная латентная диффузионная языковая модель с конкурентным масштабированием research
- SCAIL-2: сквозная анимация персонажей через инконтекстное кондиционирование Tsinghua University research
- Diffusion-Proof: формальное доказательство теорем с помощью диффузионных языковых моделей research
- DreamReasoner-8B: блоковый размерный curriculum для диффузионных reasoning-моделей research
- Tencent Hunyuan публикует в открытый доступ UniRL: унифицированное RL-дообучение для LLM и диффузионных моделей Tencent / Hunyuan research
- Mage-Flow: эффективная базовая модель нативного разрешения для генерации и редактирования изображений Microsoft research
- Свойства масштабирования текстового кондиционирования в визуальной генерации ByteDance Seed research