Скрытые мысли ИИ оказались не такими уж скрытыми
OpenAI, Anthropic и Google годами продавали нам красивую историю: модель думает, но её внутренний ризонинг зашифрован и никому не показывается. Мол, это для безопасности, чтобы никто не подсматривал за "сырыми мыслями" и не использовал их для джейлбрейков.
А теперь независимые исследователи взяли и просто прочитали эти мысли. Без джейлбрейка, без взлома, без танцев с бубном. Нашли архитектурную особенность в самом шифровании ризонинга — и декодировали скрытые рассуждения фронтирных моделей всех трёх грандов один в один.
То есть то, что считалось надёжно спрятанным слоем между "что модель думает" и "что она показывает пользователю" — на деле дырявое решето.
И вот тут вопрос интереснее, чем кажется на первый взгляд: если скрытый ризонинг можно читать так легко, то что вообще мешает читать его массово? И как компании будут реагировать — патчить архитектуру или делать вид, что ничего не произошло?
Пока ответа нет. Но осадочек остаётся: вся эта секретность вокруг "внутренних мыслей" ИИ держалась на уязвимости, а не на реальной защите 🤷♂️
August 15, 2026 19