Даже без изменений в коде поведение такой Системы может меняться из-за:
1) поведения и апдейтов ИИ-моделей;
2) пользовательского поведения;
3) дрейфа общих данных.
– ИИ-продукт ≠ фича в коде — каждое новое поведение в Системе способно порождать неожиданные последствия.
– Первые версии должны быть максимально контролируемыми, почти ручными, это снижает риски и помогает накапливать правильные данные.
– Циклическая калибровка — ключевое в разработке ИИ-продукта. Постоянное измерение и тестирование поведения системы через оценки, метрики и обратную связь. Если нет стабильного потока оценок для аналитики, вы не знаете, как реально работает ваша ИИ-система.
Плохая калибровка ИИ = плохой ИИ-продукт.
Даже гениальная модель без калибровки рушит доверие. Нельзя двигаться дальше, пока система не заслужила доверие на текущем уровне.
– Ошибки на ранних этапах всегда стоят дешевле. Чем позже замечаете баг поведения, тем глубже и сильнее ломается доверие.
– Развитие ИИ-Системы — это рост её автономии: «подсказчик под присмотром» → «самостоятельный исполнитель» → «независимый ИИ-агент»
Слишком быстрый рост ИИ-автономии = потеря контроля. Пользователь сталкивается с ИИ-хаосом, команда — с кризисом доверия к ИИ. Оба ведут к упадку продукта.
Калибровка → Разработка → Калибровка
– Поэтому калибровка требует качественных данных. Недостаточно просто собрать логи — нужны продуманные сценарии, use cases, edge cases, стресс-тесты.
Лучший инструмент для калибровки – human-in-the-loop.
– Масштабирование ИИ-продукта – это наращивание данных и доверия к ним. Чем надёжнее данные, тем смелее можно расширять использование.
В масштабировании важна не скорость релизов, а качество обучения ИИ. Чем быстрее вы/ИИ учитесь на поведении системы, тем быстрее ИИ-продукт становится полезным.
– Разработчики должны мыслить циклами доверия, а не циклами релизов/сроков (впрочем, не только в работе с ИИ).
Ключевой вопрос для всех — «насколько этой Системе можно доверять?»
Потому что главная валюта в мире/ИИ/продуктах — доверие.