Codeby: post #10390 — TG.ME

Скрытые мысли ИИ можно украсть через API — и провайдеры сами помогают

Когда reasoning-модель вроде o3 или Claude «думает» перед ответом, её внутренние рассуждения спрятаны от пользователя. OpenAI, Google, Anthropic вложили месяцы вычислений в эти reasoning-цепочки — стратегии декомпозиции, паттерны самопроверки, внутренние эвристики. Это и есть главная интеллектуальная собственность.

Но вот парадокс: сами API выдают достаточно метаданных, чтобы эти рассуждения реконструировать.

🔎Свежий препринт 2025 года описывает класс атак под названием EchoCoT — извлечение скрытого chain-of-thought из закрытых моделей. Не jailbreak, не обход safety-фильтров, а именно кража того, как модель рассуждает. И работает это пугающе просто.

Что отдаёт API при обычном запросе? Четыре side-channel сигнала:

⏺️Поле reasoning_tokens — точное число скрытых токенов рассуждений. Текста нет, но видно, сколько модель «думала»
⏺️TTFT (задержка до первого токена) — коррелирует с длиной скрытого CoT. Замеряешь через time.monotonic() в streaming-режиме — получаешь ещё один канал утечки
⏺️Streaming-паттерны — модель после длинного скрытого reasoning выдаёт ответ характерными «рывками», отличимыми от обычной генерации
⏺️Разница между total_tokens и суммой видимых токенов — косвенно показывает объём скрытого reasoning

Зачем это атакующему? Три вектора ущерба.

Первый — дистилляция. Восстановленные reasoning-траектории становятся готовыми обучающими данными. Берёшь дешёвую модель, скармливаешь ей чужие паттерны рассуждений — получаешь клон за копейки. По данным ещё одного препринта 2025 года, для экстракции проприетарного поведения агента хватает буквально нескольких API-взаимодействий.

Второй — усиление jailbreak'ов. Если ты знаешь, как модель рассуждает о safety (какие шаги проходит перед отказом, какие триггеры вызывают refusal), можно конструировать точечные обходы. В работе CoT Hijacking показано: средние слои трансформера кодируют силу safety-проверки, поздние — результат верификации. Зная структуру, атакующий целенаправленно «разбавляет» safety-сигнал.

Третий — утечка системной логики. OWASP уже классифицирует это как LLM07:2025. Скрытый CoT по сути — расширенный системный промпт: бизнес-логика обработки, правила отказа, стратегии решения.

🎇Интересная деталь — разные модели уязвимы по-разному. DeepSeek R1 вообще выкладывает CoT в открытом виде в тегах <think> — красть нечего, зато удобно как эталон для верификации атак на закрытые модели. OpenAI o-серия полностью скрывает текст, но отдаёт метаданные. Claude с extended thinking — посередине: суммаризация reasoning выдаёт стилистические маркеры для реконструкции.

Ни один крупный провайдер пока не отключает reasoning-метаданные — потому что клиентам они нужны для бюджетирования. Безопасность буквально проигрывает удобству.

Полный разбор таксономии атак, механики EchoCoT и практической методологии воспроизведения — в статье на форуме
⬇

https://codeby.net/threads/echocot-izvlecheniye-tsepochek-rassuzhdenii-llm-iz-black-box-reasoning-modelei-cherez-api.95271/
❤4👍4🔥4
August 25, 2026 2K 14