Как мы объединили фичи картиночной Алисы На связи команда… — Yandex for Developers — TG.ME

🔎 Как мы объединили фичи картиночной Алисы

На связи команда генеративных моделей в компьютерном зрении Поисковых сервисов и ИИ. Вместе с коллегами мы делаем мультимодального ассистента «Алиса AI». У модели Alice AI ART, которая отвечает за визуальную генерацию, есть два базовых сценария:

🔴 Text-to-Image (T2I) — генерация фото по текстовому описанию

🔴 Image-to-Image (I2I) — редактирование по картинке с инструкцией

Всё это время эти сценарии жили как два разных стека: свои базовые модели, данные, метрики и своя отдельная боль в разработке и поддержке. Поэтому мы решили объединить их в одну модель, которая одинаково хорошо умеет и в T2I, и в I2I.

🅰️ Как мы проводили обучение

➕ I2I-задача редактирования требует от модели понимания референса: входное изображение всегда содержит конкретный объект, который нужно сохранить, трансформировать или дополнить.

➕ T2I-задача сильно прокачивает релевантность. Промпты для генерации с нуля, как правило, детальнее editing-инструкций: они описывают всё, что должно быть на изображении.

Ключевая особенность обучения uni-модели — общий для обеих задач претрейн. T2I- и I2I-данные перемешаны, чтобы визуальный и текстовый прайоры были едиными.

🅰️ Как мы провели показательный эксперимент

Взяли набор концептов, которые отсутствовали в наших данных для редактирования, но которые ранее собирались для T2I. Затем смешали данные и провели совместное обучение, а после проверили, что станет с I2I.
Результат оказался такой, на какой мы и надеялись: концепты, выученные из T2I, становятся доступны в редактировании по инструкции. Специфические запросы начинают работать без необходимости повторять работу по сбору узких срезов данных.

📖 А в статье на Хабре мы рассказали:

🔴 На каких метриках мы измеряем качество моделей
🔴 Что изменилось в самой модели
🔴 Что планируем реализовать в будущем

Подписывайтесь:
💬 @Yandex4Developers
❤5🔥4🦄3👍1
August 20, 2026 2.9K 3 5