По заявкам читателей. FLEX-$\pi$: A Multi-Stream World-Action Model… — gonzo-обзоры ML статей — TG.ME

По заявкам читателей.

FLEX-$\pi$: A Multi-Stream World-Action Model with Compute Flexibility
Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox
Статья: https://arxiv.org/abs/2608.10860
Проект: https://flex-pi.github.io/

# TL;DR

ЧТО сделали: Представили FLEX-$\pi$ — модель мира и действий (world-action model, WAM) на 6B параметров, которая одновременно предсказывает непрерывные действия робота, будущие RGB-кадры, 3D-карты точек (pointmaps) и семантические представления DINOv3. Ключевая находка: 3D-карты точек из Depth Anything 3 можно напрямую кодировать в латентное пространство замороженного RGB-видеоавтоэнкодера (Wan-2.2) вообще без специализированного 3D-предобучения. Благодаря дропауту визуальных потоков и межмодальному форсированию (cross-modality forcing) в бэкбоне Mixture-of-Transformers, один и тот же чекпоинт гибко переключается между быстрым инференсом только действий (~60 мс) и полноценной совместной генерацией мира и действий (~193 мс).

ПОЧЕМУ это важно: Обычные универсальные политики роботов вынуждены выбирать между быстрой реакцией VLA-моделей и богатой предиктивной регуляризацией WAM, предсказывающих только RGB. FLEX-$\pi$ устраняет этот компромисс, доказывая, что физический граундинг в 3D-геометрию и семантику можно добавить в генеративные политики без дополнительных датчиков глубины, без кастомных 3D-архитектур и без неизбежных задержек на инференсе. Модель показывает прирост успешности в 2–6 раз по сравнению с современными SOTA-бейзлайнами на субмиллиметровых и деформируемых задачах двуручной манипуляции.

Для практиков: Чтобы робот уверенно манипулировал предметами, ему нужно понимать глубину сцены, семантику объектов и предвидеть визуальные последствия своих действий. Современные модели обычно генерируют только будущие пиксели с камер — они передают цвет и текстуру, но плохо улавливают точную 3D-геометрию. FLEX-$\pi$ генерирует 3D-формы и высокоуровневые семантические признаки параллельно с траекториями робота. При этом не требуется дорогое железо: геометрия и семантика извлекаются из обычных RGB-камер готовыми моделями. Во время работы робот может динамически переключаться: генерировать полную симуляцию будущего для максимальной точности или предсказывать только действия на высокой частоте для управления в реальном времени.

Роботы тут: https://t.me/gonzo_ML_podcasts/4790
arXiv.org
Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility
World-action models (WAMs) predict the future to act better, but nearly all of them predict only RGB latents, trained purely for pixel reconstruction, with no explicit signal for the 3D geometry...
👍8🏆2❤1
August 14, 2026 2.5K 35