【OpenAI Jalapeño:当推理芯片不再活在 Nvidia 的阴影下】
OpenAI 自研推理芯片 Jalapeño 的细节曝光撕掉了 GPGPU 统治推理市场的逻辑。这款芯片放弃了 Nvidia 引以为傲的统一 L2 缓存和复杂的 Warp 调度机制,转而采用计算核心与 HBM 内存一对一绑定的非统一内存访问架构,并引入了 CPU 式的乱序执行核。
通过 AI 代理驱动的编译器和 XLS 硬件描述语言,OpenAI 仅用 9 个月就完成了从设计到流片的过程,在单用户 Token 输出速度上达到了 Nvidia B300 的两到三倍,且能效比大幅提升。这标志着 AI 基础设施正从“通用优先”转向“推理第一性原理”。
Nvidia 的成功源于 CUDA 屏蔽了硬件复杂性,让开发者写程序更轻松,但这种通用性在推理场景下变成了沉重的延迟负担。
OpenAI 的思路很决绝:既然有了 AI 代理作为编译器,就不再需要照顾人类程序员的心智负担。硬件可以设计得极其“反人类”但对机器极度友好,通过放弃全局一致性来换取极致的访存延迟。
这不仅是芯片架构的胜利,更是软件定义硬件的范式转移——未来的算力竞争,可能不再是谁的峰值算力更高,而是谁能用 AI 搜索出最完美的指令排布,在电力供应的红线下榨出最后一滴 Token 性能。
September 1, 2026 424 2

