Когда reasoning-модель вроде o3 или Claude «думает» перед ответом, её внутренние рассуждения спрятаны от пользователя. OpenAI, Google, Anthropic вложили месяцы вычислений в эти reasoning-цепочки — стратегии декомпозиции, паттерны самопроверки, внутренние эвристики. Это и есть главная интеллектуальная собственность.
Но вот парадокс: сами API выдают достаточно метаданных, чтобы эти рассуждения реконструировать.
Что отдаёт API при обычном запросе? Четыре side-channel сигнала:
reasoning_tokens — точное число скрытых токенов рассуждений. Текста нет, но видно, сколько модель «думала»time.monotonic() в streaming-режиме — получаешь ещё один канал утечкиtotal_tokens и суммой видимых токенов — косвенно показывает объём скрытого reasoningЗачем это атакующему? Три вектора ущерба.
Первый — дистилляция. Восстановленные reasoning-траектории становятся готовыми обучающими данными. Берёшь дешёвую модель, скармливаешь ей чужие паттерны рассуждений — получаешь клон за копейки. По данным ещё одного препринта 2025 года, для экстракции проприетарного поведения агента хватает буквально нескольких API-взаимодействий.
Второй — усиление jailbreak'ов. Если ты знаешь, как модель рассуждает о safety (какие шаги проходит перед отказом, какие триггеры вызывают refusal), можно конструировать точечные обходы. В работе CoT Hijacking показано: средние слои трансформера кодируют силу safety-проверки, поздние — результат верификации. Зная структуру, атакующий целенаправленно «разбавляет» safety-сигнал.
Третий — утечка системной логики. OWASP уже классифицирует это как LLM07:2025. Скрытый CoT по сути — расширенный системный промпт: бизнес-логика обработки, правила отказа, стратегии решения.
<think> — красть нечего, зато удобно как эталон для верификации атак на закрытые модели. OpenAI o-серия полностью скрывает текст, но отдаёт метаданные. Claude с extended thinking — посередине: суммаризация reasoning выдаёт стилистические маркеры для реконструкции.Ни один крупный провайдер пока не отключает reasoning-метаданные — потому что клиентам они нужны для бюджетирования. Безопасность буквально проигрывает удобству.
Полный разбор таксономии атак, механики EchoCoT и практической методологии воспроизведения — в статье на форуме
https://codeby.net/threads/echocot-izvlecheniye-tsepochek-rassuzhdenii-llm-iz-black-box-reasoning-modelei-cherez-api.95271/



