TLive-Omni: omnimodal-модель понимания для e-commerce-стриминга

Tencent

исследования офиц. + СМИ 2 ист. ~1 мин

Omnimodal-модель для live-коммерции, отображающая изображения, видео, аудио и текст в единое пространство представлений. Per-vGrid организует timestamped-токены, группирующие каждый видео-грид с его временно соответствующим аудио внутри явных граничных токенов для временного выравнивания. Трёхэтапный supervised-тренинг прогрессирует от omnimodal-восприятия к ответам по инструкциям. Этап Faithful-RFT reinforcement напрямую оценивает финальные ответы через верифицируемую по задаче обратную связь, а не через разведку rollout'ов в стиле reasoning. Сценутоориентированная таксономия атомарных возможностей и компактный движок производства данных превращают live-коммерческие потоки в тренировочные сигналы для ASR, анализа спикера, визуальной привязки товаров, OCR, временной привязки, dense-caption видео и omnimodal QA. Синхронизированный length-grouped sampler сокращает паддинг, сохраняя нагрузку по воркерам; стратегия динамического сэмплинга перегенерирует rollout-группы с near-zero дисперсией награды для поддержания значимых GRPO-преимуществ.

Почему это важно

HF Daily 55 апвоутов 25 августа. Затрагивает шумный, мультиисточниковый реальный домен, где факты о товарах разбросаны по речи, кадрам, изображениям товаров, наложенному тексту и запросам — полезный блюпринт для отраслевых omnimodal-моделей.

Важность: 3/5

HF Daily 55 апвоутов

Источники

официальный arXiv abstract