Что там по новым моделям? Неделя обещает слухи о новых моделях — а… — сбежавшая нейросеть — TG.ME

Что там по новым моделям?

Неделя обещает слухи о новых моделях — а может, и релизы. Поехали:

Ox Alpha. Загадочная модель начала тестироваться 20 августа на OpenRouter и в OpenCode, поддерживает 1М токенов контекста, принимает на вход изображения и видео. Сообщество сразу же разогнало хайп вокруг модели – якобы в “любительских бенчмарках” она обходит Claude Fable.

Что это за модель? У каждой лаборатории свой „почерк“ — паттерны, переживающие смену версий; у Ox Alpha он указывает на Z.ai и линейку GLM: ранняя GLM-5.5 или быстрая GLM-5.3 Flash.

Но как GLM-5.3 Flash может быть лучше Claude Fable 5? Да никак. Сообщество тестирует красивым визуалом — от „SVG-пеликана на велосипеде“ до 3D-сцен в Three.js. Модели под такие промпты отлично оптимизируются. А "любительский бенчмарк" на 10 задачах DeepSWE (80% против 65% у Fable 5) — статистически ничто: в полном бенчмарке их 113.

Забавный факт: судя по всему, уже после запуска на OpenRouter и в OpenCode, разработчики обновили чекпоинт модели. Ее ответы стали заметно лучше, в результате в X сейчас всерьез обсуждают, что перед нами первая самообучающая модель. Было бы классно, но вероятность такого я оцениваю в 0,01%.

Бесплатный доступ до 27 августа; примерно тогда же Z.ai обещала открыть веса GLM-5.3, задержанные из-за кибер-способностей. Совпадение?

claude-marshmallow-eap и claude-melon-eap. Идентификаторы двух новых моделей Anthropic проскочили в API, и несколько тестеров уже делятся ощущениями: "лучше Opus 5, но хуже Fable 5".

Бенчмарк по ощущениям – это еще круче, чем 10 задач из DeepSWE. Я много работаю с Fable 5 и Opus 5, и могу сказать, что в большинстве повседневных задач разница между моделями настолько близки, что не заметишь разницу. Да и в бенчмарках зазор маленький. Opus 5 стараниями пары западных блогеров невзлюбило сообщество, так что “лучше Opus 5” – скорее укол в эту сторону.

По срокам Anthropic как раз пора выпускать что-то вроде Fable 5.1 – Mythos 5, на которой основывается текущая версия, появился еще полгода назад, так что модель пусть и мощная, но уже на излете жизненного срока. Более того, практически 100% известно, что внутри компании уже есть новая мощная модель – именно с ее помощью Левент Альпёге совершил последние математические открытия.

Но после скандалов с побегами агентов Anthropic может придержать самую сильную и выпустить сначала Sonnet 5.1 и Opus 5.1.

По срокам пока ничего не скажу, предыдущие случаи не показательны. Fruitcake “превратился” в Fable 5 через 2-3 дня, а вот Honeycomb стал Opus 5 только через 2 недели.

Grok 4.7. Я в последние два месяца внимательно слежу за нейронками SpaceXAI – после того, как компания приобрела Cursor и стала использовать их обучающие данные, Grok вплотную нагнал GPT и Fable. По словам Илона Маска, Grok 4.7 вырастет в размере – с 1,5T до 2,1T параметров. Но модель скорее ждем в начале сентября: SpaceXAI сейчас выпускает новые версии каждый месяц с небольшим, а Grok 4.6 был 12 августа.

OpenAI Astra. После взлома ИИ-агентом ресурса Hugging Face, компания приостанавливала обучение новых моделей, но недавно возобновила прогоны и тесты с более жестокими ограничениями безопасности.

Отвечать на новые модели Anthropic надо, но сейчас OpenAI под лупой: вчера генпрокурор Алабамы вручил ей повестку по делу о взломе — расследование ведут 15 штатов.

Google. Компания свернула разработку Gemini 3.5 Pro после провальных бенчмарков и сейчас тренирует Gemini 4. Вряд ли получится быстро, так что основная рабочая лошадка Google – недавно вышедшая Gemini 3.7 Flash.

Не люблю заканчивать посты без красивого вывода, но какой тут вывод – дайте мне скорее Claude Fable 5.1 и я пойду решать все научные задачи с ней!

Кстати, улучшить ответы ИИ можно не дожидаясь новых моделей. Достаточно избавиться от промптового долга – противоречащих и устаревших инструкций в промптах, скиллах и файлах с инструкциями. Бороться с промпт-долгом советуют в OpenAI и Anthropic, в лонгриде я подробно рассказал, как это делать:

Читать здесь.
3🔥24👍21❤16
August 25, 2026 4.2K 17