EchoWM: открытые и входимые omnimodal-модели мира
JD.com
Модель мира для входимых генеративных медиа, отвечающая на непрерывную навигацию и одновременно производящая 720p-видео с синхронизированным окружающим звуком, музыкой и речью. Взаимодействие организовано вокруг intent камеры: сцены от первого лица используют камеру для определения движения наблюдателя; сцены от третьего лица извлекают динамику камера-персонаж из данных. И дискретные команды, и непрерывные позы отображаются в общую относительную 6-DoF траекторию в метрической шкале с калибровкой движения на уровне датасета. Дополнительный движок данных и прогрессивная схема обучения плюс авторегрессионный пост-тренинг поддерживают совместное обучение аудио-визуальной генерации и управления траекторией. Авторы сообщают о сильном следовании траектории и визуальном качестве на публичных бенчмарках моделей мира как с взаимодействием от первого, так и от третьего лица.
Почему это важно
HF Daily 66 апвоутов 25 августа. Omnimodal (видео + аудио + речь) формулировка входимой модели под непрерывным 6-DoF-управлением — шаг за пределы прежних моделей мира, фокусировавшихся на одном типе движения камеры или только визуальном выходе; калибровка по гетерогенным источникам данных — практический рычаг.
Важность: 3/5
HF Daily 66 апвоутов