#vision-language-action
- TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM research
- τ₀-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation Shanghai Innovation Institute research
- Xiaomi-Robotics-1: масштабирование vision-language-action моделей на 100 000+ часов реальных траекторий Xiaomi Robotics research