VGGT: превращает набор фотографий в геометрию 3D-сцены Обычно… — Python Community — TG.ME

⚡️ VGGT: превращает набор фотографий в геометрию 3D-сцены

Обычно реконструкция сцены требует отдельной связки для оценки камер, глубины и отслеживания точек. VGGT получает изображения и предсказывает всё это одной feed-forward моделью.

На вход можно подать один кадр, несколько снимков или сотни ракурсов. На выходе модель строит:

- внутренние и внешние параметры камер
- карты глубины
- плотные карты 3D-точек
- траектории выбранных точек между кадрами

Результаты можно экспортировать в формат COLMAP, дополнительно обработать через bundle adjustment и использовать в пайплайнах NeRF или Gaussian Splatting через gsplat.

Запуск занимает несколько строк:


model = VGGT.from_pretrained("facebook/VGGT-1B").to(device)
images = load_and_preprocess_images(image_names).to(device)

with torch.no_grad():
predictions = model(images)


https://github.com/facebookresearch/vggt

@Python_Community_ru
July 22, 2026 602 9