🧠 Один из самых частых вопросов про ИИ: а как проверить, что он действительно работает правильно?
Не насколько убедительно он отвечает. Не насколько красиво пишет. А как доказать, что система стабильно находит ошибки и сама не ошибается при их проверке?
И вот здесь начинается одна из самых интересных проблем современного ИИ.
Большие языковые модели по своей природе вероятностны. Один и тот же запрос может дать немного разные результаты. Поэтому идея "пусть один ИИ проверяет другой ИИ" выглядит логично - но фундаментально проблему не решает.
Получается вероятностная система, которую проверяет... другая вероятностная система.
Именно поэтому все больше внимания уделяется детерминированным проверкам - правилам, результат которых однозначен и воспроизводим.
Например:
- в одном разделе указано 120 пациентов, в другом - 125 → ошибка;
- доза в тексте 20 мг, а в таблице визитов 40 мг → ошибка;
- визит должен быть на День 14 ±2 дня, а указан День 20 → ошибка;
- сумма процентов не равна 100% → ошибка;
- обязательный раздел отсутствует → ошибка.
Здесь ИИ вообще не нужно "размышлять". Проверка может выполняться обычным кодом и при каждом запуске давать один и тот же результат.
Anthropic прямо рекомендует при оценке ИИ использовать детерминированные проверки там, где это возможно, модельные проверки - там, где без понимания смысла не обойтись, а результаты последних периодически сверять с экспертной оценкой.
OpenAI использует похожую логику: в системе оценки предусмотрены как обычные проверки совпадений и программные проверки, так и отдельные модели-оценщики.
Но полностью превратить контроль качества в набор правил невозможно.
Например:
Корректно ли выбрана конечная точка?
Соответствует ли статистический анализ цели исследования?
Достаточно ли убедительно обоснован размер выборки?
Не противоречат ли два раздела друг другу по смыслу, хотя формально цифры совпадают?
Здесь уже нужен анализ контекста.
Поэтому постепенно вырисовывается гораздо более интересная архитектура контроля:
1️⃣ Детерминированные проверки - всё, что можно проверить однозначно.
2️⃣ ИИ-проверки - смысл, логика, контекст, сложные противоречия.
3️⃣ Эксперт - спорные и критические случаи.
И самое любопытное: окончательной общепринятой методологии оценки ИИ сегодня всё ещё нет.
7 августа 2026 года NIST выпустил проект новой системы TEVV-Athlon для тестирования, оценки, верификации и валидации ИИ. Причём на публичное обсуждение вынесены даже сами определения этих понятий и вопрос о том, какие виды оценки ИИ существующая система пока не охватывает.
Регуляторы движутся в ту же сторону.
🇪🇺 EU AI Act для систем высокого риска требует проводить тестирование по заранее определённым метрикам и вероятностным порогам, соответствующим назначению системы.
💊 В январе 2026 года EMA и FDA совместно опубликовали 10 принципов надлежащей практики применения ИИ при разработке лекарственных препаратов. Среди ключевых требований - заранее определённый контекст применения, риск-ориентированная оценка производительности, документирование и контроль системы на протяжении всего жизненного цикла. При этом сами регуляторы прямо указывают, что стандарты и практики должны продолжать развиваться вместе с технологиями.
Получается довольно парадоксальная ситуация.
Мы уже умеем создавать ИИ, способный анализировать огромные клинические документы.
Но теперь одна из главных задач - научиться объективно доказывать, насколько хорошо он это делает.
И, возможно, следующая гонка в ИИ будет идти уже не только за тем, кто лучше генерирует.
А за тем, кто сможет доказать качество результата.
Именно на таком принципе мы развиваем контроль качества в ClinScriptum: там, где ошибку можно формализовать, её должен проверять не «ещё один ИИ», а воспроизводимое правило. А нейросеть подключается там, где действительно требуется понимание медицинского и клинического контекста.
🔗 Источники и регуляторные документы
🔗 NIST — TEVV-Athlon Framework for Evaluating AI Systems, август 2026
🔗 EU AI Act — требования к тестированию систем высокого риска
🔗 FDA — Guiding Principles of Good AI Practice in Drug Development, 2026
🔗 EMA — Artificial Intelligence in the medicines lifecycle
🔗 Anthropic — Demystifying evals for AI agents
🔗 OpenAI — Graders: подходы к автоматизированной оценке результатов ИИ
Clinscriptum.ru - АI-ассистент для клинической и регуляторной документации