Кстати, мой пост казалось бы задает слишком жесткую перспективу на… — Hidden Heuristic — TG.ME

Hidden HeuristicДобро пожаловать, Азатот! Азатот - безумный Бог Лавкрафта Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI…
Кстати, мой пост казалось бы задает слишком жесткую перспективу на данную ситуацию. В реальности некоторые следы метаагентности мы вполне видим. Кто внимательно читал, тот заметил пример про sandbagging. Есть еще и alignment faking. И agentic misalignment.

Проблема этих феноменов в том, что они работают именно как мираж в специфических контекстах, об этом можно послушать много у Neel Nanda. А чтобы планету захватывать «миражей» мало. Но естественно, что я могу ошибаться и при дальнейших архитектурных скачках они как раз пойдут полным цветом. Тем не менее, я ожидаю, что если подобное и произойдет, то мы это хорошо зафиксируем.

Еще один хороший недавний пример метакогнитивной слепоты у ИИ-моделей: https://www.lesswrong.com/posts/3FKugjAiEzLeWHuug/ais-finetune-their-own-leader-a-barking-simpleton
Lesswrong
AIs finetune their own leader: A barking simpleton — LessWrong
What values would AIs instill in their successors? Though the AI Village agents can’t train frontier models, we can explore a related question: What…
👍4❤1
July 21, 2026 219 2