ByteDance показала Lucida: видео превращается в редактируемую 3D-сцену
Lucida это исследовательская система ByteDance Seed, Пекинского и Чжэцзянского университетов для переноса реального помещения в 3D.
На вход она получает видео или набор кадров, а на выходе собирает сцену из отдельных объектов, которые можно перемещать, редактировать и использовать в симуляции.
Главное здесь: Lucida не просто строит красивый 3D-тур по комнате. Она пытается восстановить структуру сцены и каждый предмет отдельно.
Пайплайн состоит из трёх этапов:
• Parse. Система выбирает ключевые кадры, распознаёт одни и те же объекты с разных ракурсов и собирает для каждого маски, 3D-боксы, частичное облако точек и текстовые подсказки.
• Generate. По этим данным создаётся полный 3D-объект, включая части, которые были закрыты другими предметами.
• Place. Модуль GizmoAct управляет трансформациями объекта в 3D-редакторе и в несколько шагов уточняет положение, масштаб и поворот, сверяя результат с исходными кадрами.
В результате кресло, шкаф, стол или лампа остаются отдельными редактируемыми mesh-объектами, а не запекаются в единую неподвижную модель помещения.
По официальным результатам Lucida улучшила сценовый F-Score с 0,794 у SAM 3D до 0,924 на тесте R2S-Scene.
Но это пока исследовательская работа, а не готовый сервис для обычного пользователя.
Стоимость: публичный доступ, API и цена пока не объявлены.
На странице проекта есть демо и статья, но нет открытого интерфейса или подтверждённого релиза кода.
На мой взгляд, самое интересное применение здесь не интерьерная визуализация сама по себе, а быстрые digital twins для робототехники, симуляторов, виртуального продакшена и подготовки сцен, где каждый объект должен оставаться управляемым.
Официальные источники:
https://lucida-r2s.github.io/
https://arxiv.org/abs/2608.30821
14
10
1
1September 1, 2026 2K 57
