OpenAI пересадила GPT-5.6 Sol на нитро
Пока все спорят про качество моделей, OpenAI тихонько решила вопрос скорости. Ultrafast режим на чипах Cerebras — это 750 токенов в секунду. Для сравнения: обычный режим выдаёт в 14 раз меньше.
Что это значит на практике? Патч кода на 2000 токенов — который раньше вы ждали как автобус зимой — теперь прилетает за 2.7 секунды. Весь лимит вывода в 128 тысяч токенов теоретически можно выжрать меньше чем за 3 минуты.
Секрет — в архитектуре Wafer-Scale Engine от Cerebras. Это не GPU-кластер, а буквально один гигантский чип размера пластины. Никакой пересылки данных между картами — всё варится в одном месте.
Вопрос в том, готовы ли мы думать так быстро, как теперь может отвечать модель. Часто bottleneck — не скорость генерации, а скорость человека, который читает и решает, что делать с ответом дальше.
Скорость ради скорости — это красиво в бенчмарках. Но если вы гоняете агентов в цикле, где каждая итерация ждёт ответ модели — вот тут 14x это не понты, а реальные деньги и время.
August 14, 2026 15