Самая умная модель больше не геймченджер
Начну с цифры, которая ломает норму.
Fable 5 – самая большая и дорогая модель Anthropic – вышла больше двух месяцев назад. Платежная платформа Ramp посмотрела расходы 70 000 компаний и насчитала, что на Fable 5 уходит 11% трат на ИИ-инструменты Anthropic. Кривая не растет, а обгоняет флагман его же младшая сестра – Opus 5, которая меньше и дешевле.
Рынок долгое время жил по правилу: корпоративный клиент берет верхнюю строчку каталога не глядя, просто потому что именно с топовой моделью больше шансов выполнить задачу. Сейчас это правило поменялось.
Почему?
Причина, которую называют в FT, простая: флагман дорогой, а модели попроще стали настолько хороши, что закрывают основную массу бизнес-задач. Ставить топовую модель на разбор тикетов – не премиальность, а перерасход. “Лучшее” и “нужное” оказались разными вещами.
Рынок это уже понял. Financial Times за девять дней выдала две статьи, которые складываются в интересную хронику.
15 августа: американские лаборатории, годами мерившиеся бенчмарками, начали меряться прайсом. Реальные цены, по которым платят клиенты, с середины июля упали почти на четверть. Через шесть дней OpenAI срезала цену флагманской GPT-5.6 Sol больше чем на 20%.
24 августа: те самые 11% расходов на Fable 5 и отличный комментарий Майлза Клементса из Accel, фонда, занесшего в Anthropic около $1 млрд. Человеку по должности положено продавать фронтир. Он говорит обратное: большинству фронтир незачем, а эпоха, когда брали только топ, устойчивой никогда и не была. Прорывы останутся нужны – под большие обещания и чтобы нанимать сильных исследователей, но все чаще будут витриной.
Витрина не бесполезна. Просто выручка считается не в ней. Особенно если впереди IPO с оценкой от двух триллионов.
А теперь то, ради чего я все это затеял.
История с Fable 5 – это про одну компанию, но разрыв схлопывается везде. По Stanford AI Index за год расстояние в рейтинге между лучшей закрытой и лучшей открытой моделью ужалось с 8% до 1,7%. Достаточно хороший средний слой теперь есть у всех – хоть свой, хоть открытый.
А раз линейка тянется от копеечных моделей до фронтирных и разница между ними стирается, то вопрос “чья модель умнее” перестает быть главным. Главным становится другой: кто решает, какая модель берет конкретную задачу и что происходит с результатом дальше.
Тут два слоя, и про оба я на канале пишу постоянно.
Харнесс – обвязка вокруг модели: инструменты, память, инструкции, проверка результата. Одна и та же модель в хорошей обвязке почти удваивает результат на CORE-Bench Hard: Claude Sonnet 4.5 - 44% против 62%, а Claude Opus 4.5 - 42% против 78% (и до 95% после ручной валидации). Модель та же, меняется только харнесс — CORE-Agent на Claude Code.
Оркестрация – роутер, который раздает задачи по моделям: простое уходит дешевой, сложное - мощной. В работе RouteLLM из Berkeley и Anyscale роутер вытянул 95% качества GPT-4 на MT-Bench, отправив к самой GPT-4 всего 13% запросов – остальное ушло дешевой модели. Оговорюсь честно: это лучший результат на одном бенчмарке, на других тестах разрыв меньше. Но порядок понятен, и так уже устроены Bedrock у Amazon, Cursor и Perplexity.
И тут же становится понятно, почему сравнивать модели по количеству параметров бессмысленно. Одна и та же модель на среднем и на максимальном усилии стоит и отвечает по-разному. Artificial Analysis сравнила Opus 5 на среднем усилии с китайской Kimi K3 на максимальном: результат и цена задачи получились примерно одинаковыми.
Считать надо не цену токена, а стоимость решенной задачи. А она теперь зависит не только от модели, но и от того, что собрано вокруг нее.
В размере моделей соревнуются все, но решающего отрыва он уже не дает: лидеры стоят в пределах нескольких пунктов AI-индекса, а Opus 5 и Fable 5 и вовсе разделяет один пункт. Отрыв теперь делает то, что вокруг модели: кто раздает задачи, что у модели под рукой, что она помнит и как проверяет результат. Зрелищности ноль – заголовки проще делать на бенчмарках, чем на цене решенной задачи. Но расходиться результаты в ближайшие пару лет будут именно здесь.
– Самое время подписаться!
29
13
4
1