OpenAI 推出了其首款專用晶片 Jalapeño,用於大型語言模型的推論任務。這款加速器與 Broadcom 合作開發,專注於處理 GPT 和 Codex 等模型的請求,而非訓練。在 2026 年八月的 Hot Chips 會議上發布,伴隨首批基準測試,顯示在每瓦特 token 數和延遲降低方面具有顯著優勢。
關鍵的技術層面在於其架構,針對 LLM 推論的典型模式進行了最佳化:高吞吐量、低延遲以及高效的記憶體使用。與通用 GPU 不同,Jalapeño 專注於特定操作,例如 Transformer 中的注意力機制和前饋網路。SemiAnalysis InferenceX 的早期測試顯示,每瓦特工作量是 Nvidia Blackwell 的 1,5 到 1,9 倍,而在某些場景中,宣稱每瓦特 token 數可提升至 104 倍——這個數字需要獨立驗證。
測試方法包括與基於 Nvidia GB200/GB300 的系統進行比較,並根據晶片的標稱功率(700 瓦,實際功耗最高達 550 瓦)進行標準化。結果涵蓋 OpenAI 的內部模型以及外部模型,如 DeepSeek R1 和 Kimi K25。這強化了跨模型適用性的論點,但缺乏詳細的消融研究和完整的數據集描述,使得可重現性存疑。
在 AI 晶片領域,Jalapeño 佔據了專用推論 ASIC 的利基市場,類似於 Google 的 TPU 或 Amazon 的 Trainium/Inferentia。與 Meta 或 Microsoft 的做法不同,OpenAI 押注於與自家模型的緊密整合以及多代平台。這使其策略與 Google 相近,但透過在設計中使用 AI,將開發週期縮短至九個月。
對產業而言,這意味著資料中心推論成本可能降低,這在擴展代理系統和 API 時尤其重要。更低的延遲(1,7 到 3,6 倍)使得在不犧牲效能或回應速度的情況下服務更多用戶成為可能。
目前仍不清楚在 2027 年實際負載下這些數據的穩定性,屆時競爭對手將推出新一代產品。獨立測試和架構細節的揭露將是評估長期影響的關鍵。
Jalapeño 的開發凸顯了推論效率不再僅由模型大小決定,還取決於針對特定工作負載的硬體專業化。


