В далекие времена, когда про чатик GPT еще слыхом не слыхивали, в… — WTF_HR — TG.ME

В далекие времена, когда про чатик GPT еще слыхом не слыхивали, в наших широтах мирно сосуществовали Сири и Алиса. И если Сири начать жаловаться на жизнь, она пыталась жалеть и поддерживать, а Алиса запросто могла сказануть что-то типа “А никто не обещал, что будет легко”.

Еще до LLM компании делали ассистентов с разными персонами. И теперь эти персоны продолжают существовать, но уже на новом уровне. Теперь у нас есть не только тон разговора, и даже не только уровень сложности решаемых задач. У агентов на основе разных моделей есть почти человеческие черты - упорство или нерешительность, склонность к соблюдению правил или к импровизации, быстрота или задумчивость.

Сейчас у каждого уважающего себя чатика под капотом несколько моделей - посложнее для размышлений, попроще для разговоров. И это особенно заметно, если работать с разными моделями - а разные модели хороши для разного, и пользоваться несколькими - не роскошь, а средство достижения оптимального результата.

И тут, наверное, правильный момент, чтобы рассказать об ограничениях агентов. Знающие люди пишут, что пока агенты в реальной жизни - штука довольно ненадежная. На задачах из реального мира (а не из олимпиады или открытого бенчмарка, где есть правильный ответ и на него явным образом можно натренировать модель) они правильно выполняют задачи чуть более чем в половине случаев.

То есть на новой для себя задачке из реального мира у агента в среднем ничего не получится в половине случаев. Погодите хихикать - эта цифра довольно сильно варьируется в зависимости от собственно задачки (у некоторых моделей на некоторых типах задач она достигает более 80%), а с ростом производительности моделей и общие цифры будут расти. Мы это уже видели на чатиках, которые сначала глючили все время, а теперь - довольно редко, и с агентами будет то же самое.

Главная проблема агентов - не в качестве выполнения задач, а в том, что агент, в отличие от человека, совершенно не в состоянии оценить правильность выполнения незнакомой ранее задачи. И как подступиться к этой проблеме, пока не очень ясно.
Это значит, что для большинства профи, которые в состоянии грамотно поставить задачу, в которой нет однозначно правильного ответа, и оценить успешность ее выполнения, у нас хорошие новости - их работа в обозримом будущем будет в полной безопасности.

Но если вернуться к изначальной теме этого поста, то стоит добавить, что несмотря на всю антропоморфизацию, перед нами просто новый способ автоматизировать разные штуки. Только с новым уровнем адаптивности к пользователю - не на уровне двух конкурирующих SaaS-вендоров типа SAP и Workday, а на уровне “есть с десяток фундаментальных моделей, у каждой из них есть по нескольку версий, и почти на каждой из этих версий можно построить сотни видов агентов”. И довольно большая часть ИИ-грамотности - это понимать различия и использовать правильные штуки для правильных вещей. Авось и токены сэкономим.
June 10, 2026 4.8K 24