Автоматическая нарезка видео перестала быть ручной работой… — MyKreaTool | Нейросети, ChatGPT и AI-инструменты — TG.ME

Автоматическая нарезка видео перестала быть ручной работой: разработчик под ником i_alakey выложил в открытый доступ код конвейера на ~7000 строк, который сам режет аниме-эпизоды на вертикальные Shorts — от исходного видео до готового ролика с субтитрами и отправкой в Telegram. Репозиторий называется shorts-factory, и это не игрушечный пример, а рабочая витрина большого приватного проекта с 249 тестами.

Как работает нейросеть для видео внутри конвейера

Идея простая: закинул эпизод целиком — на выходе несколько клипов формата 9:16, уже с динамическим кадрированием, пословными субтитрами, водяным знаком и обработанным звуком. Автор описывает путь так:

эпизод.mp4 → транскрипт → анализ сигналов (аудио, лица, склейки, темп, хуки) → отбор моментов через LLM → сборка сегментов → виртуальная камера 9:16 → слои оформления → чистка метаданных → публикация в Telegram

Всего тринадцать этапов, и каждый включается или выключается независимо — никаких флагов в командной строке, всё поведение канала описывается одним config.yaml. Это принципиально для тех, кто хочет автоматизацию монтажа под себя: файл конфигурации можно диффать, откатывать и подбирать параметры методом проб, не трогая код.

Почему автоматическая нарезка видео на шортсы не ломается на середине

Главная инженерная деталь — fail-soft архитектура. Если на девятом этапе из тринадцати что-то падает, весь прогон не летит в мусор: отсутствие библиотеки детекции лиц не роняет конвейер, недоступность внешнего сервиса субтитров мягко пропускается. Для конвейера, который может гонять исходники часами, это единственный вариант жить долго.

Отдельно решена проблема отладки: в debug-режиме, если моменты для нарезки ещё не просчитаны, а этапы постобработки уже включены, система берёт весь ролик целиком — чтобы можно было полировать субтитры или ватермарк, не прогоняя заново тяжёлые модели распознавания речи и LLM-отбор.

Виртуальная камера как замена оператору

Отдельный модуль отвечает за то, за что в обычном монтаже отвечает человек с камерой на плече. Центровой кроп кадра выбрасывает половину полезной картинки, а наивное слежение за лицом даёт дёрганую, неприятную для просмотра камеру. Решение — каскад из нескольких детекторов лиц (если один недоступен, включается следующий), выбор "героя" сцены по совокупности уверенности, крупности и положения в кадре, и физическая модель движения камеры с ограничением скорости и ускорения, которая не позволяет ей резко скакать между персонажами.

Что это значит для контент-мейкинга

Для тех, кто зарабатывает на коротких видео, это готовый скелет: нейросеть для видео берёт рутину нарезки на себя, а человек занимается только отбором исходников и донастройкой конфига. ИИ для видеомонтажа такого уровня раньше был доступен только внутри дорогих SaaS-сервисов — здесь же открытый код, который можно форкнуть и адаптировать под свою нишу, будь то геймплей, подкасты или образовательный контент. Порог входа — умение работать с Python и терпение на подбор параметров под конкретный тип видео.

— — —

❤️ — сильно / 🔥 — так себе

💬 А ты что думаешь? Пиши в комментариях

🎧 Некогда читать — послушай голосовую версию ниже
📎 Читать статью целиком
📢 Подписаться на @aigoby

#AIинструменты #нейросети #AIтулы #ИИ #AI
September 4, 2026 7