Обзорчик вам а ленту:
У самой свежей ML-системы может внезапно оказаться ещё один потребитель GPU: мониторинг того, что она делает. OpenAI пишет, что для моделей уровня Sol и выше теперь отслеживает не только обучение и оценки, но и inference с инструментами, если модель может выполнять код или ходить в интернет.
Самая неприятная цифра здесь не про benchmark: компания оценивает накладные расходы такого мониторинга примерно в 20% inference compute. Причём это не фиксированный налог, а оценка, которая заметно меняется в зависимости от сценария обучения и проверки.
В ответ на инцидент с Hugging Face OpenAI даже приостанавливала на две недели reinforcement learning для последних моделей, а в исследовательских кластерах временно остановила inference с доступом к коду и интернету. То есть безопасность уже влияет не только на финальный deployment, но и на сам цикл разработки модели.
Для ML-инженера тут довольно практичный вывод: если модель умеет вызывать инструменты, выполнение запроса нельзя считать дешёвым проходом через сеть. В бюджет заранее попадают трассировка, проверки действий и отдельные ограничения для опасных capability. Иначе мониторинг появится поздно, когда его цена начнёт конкурировать с самой моделью.
Оговорка честная: пока это позиция и оценка самой OpenAI, а подробный технический отчёт компания обещает опубликовать позже. Но направление хорошо видно: у agentic inference теперь есть не только latency и цена токенов, но и цена наблюдаемости.
Основной источник: https://openai.com/index/pacing-model-development-cyber-capabilities