Деталь, которая тут, пожалуй, главная. Проектировать чип помогали собственные модели компании. Они перебирали варианты реализации, сокращали циклы разработки и верификации, оптимизировали схемы. От первого дизайна прошло всего девять месяцев.
Чип под названием Jalapeño — первый заказной чип OpenAI, и заточен он под инференс: под ту работу, которая происходит каждый раз, когда вы что-то спрашиваете у нейросети.
На пике пропускной способности — в 1,5–1,9 раза больше работы на ватт, чем у систем конкурентов. Задержка от запроса до ответа ниже в 1,7–3,6 раза. А на самых интерактивных сценариях производительность выше в 2,1–4,1 раза.
Гоняли на трёх открытых моделях: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Сравнивали с коммерчески доступными ускорителями по открытому бенчмарку InferenceX от SemiAnalysis. Паспортное потребление чипа 700 Вт, но по факту под нагрузкой он держался на 550 Вт и ниже.
Зачем всё это? У инференса две очень разные фазы. Prefill — модель переваривает ваш промт, тут упор в чистые вычисления. Decode — она выдаёт ответ по токену, и здесь всё упирается уже в пропускную способность памяти. Обычно архитектуру затачивают под что-то одно, и вторая фаза страдает.
Jalapeño пытается вытянуть обе сразу. Состояние модели держится ближе к вычислительным блокам, а сетевая часть встроена прямо в архитектуру, чтобы данные поменьше мотались между чипами. Особенно это важно для агентов: они делают много шагов подряд, и микрозадержка на каждом складывается во вполне ощутимое ожидание.
Разворачивать Jalapeño в своей инфраструктуре OpenAI собирается к концу 2026 года. И это только первое поколение — второе и третье уже в разработке.
@droidergram








