OpenAI 的 Jalapeño 芯片:专用加速器如何改变 LLM 推理的经济性

编辑者: Tatyana Hurynovich

OpenAI 推出了其首款专用芯片 Jalapeño,用于大型语言模型的推理任务。该加速器与 Broadcom 联合开发,专注于处理 GPT 和 Codex 等模型的请求,而非训练。在 2026 年八月的 Hot Chips 会议上发布时,附带的首批基准测试显示其在每瓦特令牌数和延迟降低方面具有显著优势。

关键技术方面在于针对 LLM 推理的典型模式进行了优化的架构:高吞吐量、低延迟以及高效的内存使用。与通用 GPU 不同,Jalapeño 专注于特定操作,如 Transformer 中的注意力机制和前馈网络。早期测试在 SemiAnalysis InferenceX 上显示,与 Nvidia Blackwell 相比,每瓦特工作量提升 1,5–1,9 倍,在某些场景下声称每瓦特令牌数提升高达 104 倍——这一数字需要独立验证。

测试方法包括与基于 Nvidia GB200/GB300 的系统进行比较,并根据芯片的标称功率(700 瓦,实际功耗高达 550 瓦)进行归一化。结果涵盖 OpenAI 内部模型以及外部模型 DeepSeek R1 和 Kimi K25。这增强了跨模型适用性的论点,但缺乏详细的消融实验和完整的数据集描述,使得可复现性存疑。

在 AI 芯片领域,Jalapeño 占据了专用推理 ASIC 的细分市场,类似于 Google 的 TPU 或 Amazon 的 Trainium/Inferentia。与 Meta 或 Microsoft 的方法不同,OpenAI 押注于与自身模型的紧密集成以及多代平台。这使其战略与 Google 相近,但通过在设计中使用 AI,将开发周期缩短至九个月。

对于行业而言,这意味着数据中心推理成本的潜在降低,这在扩展代理系统和 API 时尤为重要。更低的延迟(1,7–3,6 倍)使得在不牺牲性能与响应速度的情况下服务更多用户成为可能。

目前尚不清楚在 2027 年实际负载下这些指标能保持多久,届时竞争对手将推出新一代产品。独立测试和架构细节的披露将成为评估长期影响的关键。

Jalapeño 的开发凸显了推理效率不仅取决于模型大小,还取决于针对特定工作负载的硬件专业化。

5 查看

来源

  • OpenAI’s Jalapeño outpaces Blackwell

阅读更多关于此主题的文章:

你发现了错误或不准确的地方吗?我们会尽快考虑您的意见。