Кстати, мой пост казалось бы задает слишком жесткую перспективу на данную ситуацию. В реальности некоторые следы метаагентности мы вполне видим. Кто внимательно читал, тот заметил пример про sandbagging. Есть еще и alignment faking. И agentic misalignment.
Проблема этих феноменов в том, что они работают именно как мираж в специфических контекстах, об этом можно послушать много у Neel Nanda. А чтобы планету захватывать «миражей» мало. Но естественно, что я могу ошибаться и при дальнейших архитектурных скачках они как раз пойдут полным цветом. Тем не менее, я ожидаю, что если подобное и произойдет, то мы это хорошо зафиксируем.
Еще один хороший недавний пример метакогнитивной слепоты у ИИ-моделей: https://www.lesswrong.com/posts/3FKugjAiEzLeWHuug/ais-finetune-their-own-leader-a-barking-simpleton
Lesswrong
AIs finetune their own leader: A barking simpleton — LessWrong
What values would AIs instill in their successors? Though the AI Village agents can’t train frontier models, we can explore a related question: What…

4
1July 21, 2026 219 2