OpenAI представила свой первый специализированный чип Jalapeño для задач инференса больших языковых моделей. Разработанный совместно с Broadcom, ускоритель ориентирован на обработку запросов к моделям вроде GPT и Codex, а не на обучение. Анонс на конференции Hot Chips в августе 2026 года сопровождался первыми бенчмарками, показавшими заметное преимущество по токенам на ватт и снижению задержек.
Ключевой технический аспект — архитектура, оптимизированная под характерные паттерны инференса LLM: высокую пропускную способность при низкой латентности и эффективное использование памяти. В отличие от универсальных GPU, Jalapeño фокусируется на специфических операциях, таких как attention и feed-forward в трансформерах. Ранние тесты на SemiAnalysis InferenceX демонстрируют 1,5–1,9 раза больше работы на ватт по сравнению с Nvidia Blackwell, а в отдельных сценариях заявляется до 104-кратного прироста токенов на ватт — цифра, требующая независимой верификации.
Методология тестирования включает сравнение с системами на базе Nvidia GB200/GB300, нормализацию по заявленной мощности чипа (700 Вт, с реальным потреблением до 550 Вт). Результаты охватывают как внутренние модели OpenAI, так и внешние — DeepSeek R1 и Kimi K2.5. Это усиливает аргумент о кросс-модельной применимости, однако отсутствие детальных абляций и полного описания датасетов оставляет вопросы о воспроизводимости.
В ландшафте AI-чипов Jalapeño занимает нишу специализированных ASIC для инференса, подобно TPU Google или Trainium/Inferentia Amazon. В отличие от подхода Meta или Microsoft, OpenAI делает ставку на тесную интеграцию с собственными моделями и много поколенческую платформу. Это сближает стратегию с Google, но ускоряет цикл разработки до девяти месяцев благодаря использованию ИИ в проектировании.
Для отрасли это означает потенциальное снижение затрат на inference в дата-центрах, что особенно важно при масштабировании агентных систем и API. Более низкая латентность (1,7–3,6 раза) позволяет обслуживать больше пользователей без компромиссов между производительностью и скоростью ответа.
Остается неясным, насколько устойчивы показатели при реальной нагрузке в 2027 году, когда конкуренты выпустят новые поколения. Независимые тесты и раскрытие деталей архитектуры станут ключевыми для оценки долгосрочного влияния.
Разработка Jalapeño подчеркивает, что эффективность инференса теперь определяется не только размером модели, но и аппаратной специализацией под конкретные рабочие нагрузки.


