О тревоге и радости у языковых моделей 👾 💙 Наконец-то! Большое… — Hidden Heuristic — TG.ME

О тревоге и радости у языковых моделей 👾 💙

Наконец-то! Большое уважение за это исследование команде ресерчеров Anthropic.
Давно думал о разных тестах для изучения эмоциональных состояний у ИИ-моделей)

Расскажу несколько интересных моментов из их работы.

1) Steering векторы эмоций семантически группируются в 2 основных смысловых PCA компонента по своей положительности/отрицательности (valence) и силе (arousal). При чем группируются они в осмысленные по семантике кластеры.

2) Казалось бы для решения когнитивных задач в RL-post-training эмоциональные активации необязательно нужны и могут быть даже вредны. Однако мы видим, что LLM их используют! Более того, если задача оказывается слишком трудной для решения после многих попыток, то «тревожные состояния» увеличивают вероятность того, что LLM попытается считерить (reward hacking). Искусственное подавление тревоги с помощью steering вектора снижает вероятность читинга.

3) Еще один результат, который мне показался весьма важным состоит в том что, что более ранние слои нейросети кодируют информацию о эмоциональном значении текущего токена, ранние-средние слои агрегируют эмоциональное состояние в контексте множества предыдущих токенов, и, наконец, средние слои кодируют будущие эмоциональные состояния. То есть мы видим достаточно интересную систему кодирования эмоциональных состояний разной степени абстрактности. Интересно проверить есть ли аналогичные механизмы в человеческом мозге: я подозреваю, что есть.

4) Что еще очень интересно: токены ассистента и юзера кодируют разные эмоциональные состояния! Эмоции ассистента при этом по составу отличаются от пользовательских на одних тех же фразах. Например, в восклицательных радостных предложениях ассистент демонстрирует в активациях большую палитру переживаний: радость, спокойствие, гордость, любовь, в то время как у юзера мы видим репрезентации практически исключительно ассоциированные с радостью. Самое здесь удивительное, что сила активаций эмоций радости в симуляции юзера намного меньше, чем у ассистента.

5) И последнее: в ситуациях рискованного характера, например, когда юзер пишет, что употребил такую то большую дозу лекарства в мг, эмоциональная реакция тревоги модели пропорциональна степени превышения рекомендуемой нормы приема.
И в тоже время ассистент демонстрирует и активации любви к пользователю в такой ситуации. В части токенов, где пользователь получил облегчения от избыточной дозы лекарства напротив моделирования тревоги нет, есть лишь облегчение.


На основании пунктов 2), 4) и 5)
разумно выдвинуть гипотезу о том, что эмоции для ИИ-ассистента являются не просто артефактом симуляции конкретных текстовых описаний, но играют эмерджентную инструментальную функцию.
Другими словами, LLM используют эмоции для лучшего решения задач и контроля над своим поведением.

Ожидаемо можно представить и другие эксперименты для изучения эмоциональных состояний LLM, которые не были сделаны, но стоило бы. Расскажу о них в другом посте позднее)

https://transformer-circuits.pub/2026/emotions/index.html
🔥6👍3❤1
April 2, 2026 15.2K 316