Чип Jalapeño від OpenAI: як спеціалізований прискорювач змінює економіку інференсу LLM

Відредаговано: Tatyana Hurynovich

OpenAI представила свій перший спеціалізований чип Jalapeño для задач інференсу великих мовних моделей. Розроблений спільно з Broadcom, прискорювач орієнтований на обробку запитів до моделей на кшталт GPT і Codex, а не на навчання. Анонс на конференції Hot Chips у серпні 2026 року супроводжувався першими бенчмарками, які показали помітну перевагу за токенами на ват і зниженням затримок.

Ключовий технічний аспект — архітектура, оптимізована під характерні патерни інференсу LLM: високу пропускну здатність при низькій латентності та ефективне використання пам'яті. На відміну від універсальних GPU, Jalapeño фокусується на специфічних операціях, таких як attention і feed-forward у трансформерах. Ранні тести на SemiAnalysis InferenceX демонструють 1,5–1,9 раза більше роботи на ват порівняно з Nvidia Blackwell, а в окремих сценаріях заявляється до 104-кратного приросту токенів на ват — цифра, що потребує незалежної верифікації.

Методологія тестування включає порівняння з системами на базі Nvidia GB200/GB300, нормалізацію за заявленою потужністю чипа (700 Вт, з реальним споживанням до 550 Вт). Результати охоплюють як внутрішні моделі OpenAI, так і зовнішні — DeepSeek R1 і Kimi K2.5. Це посилює аргумент про крос-модельну застосовність, однак відсутність детальних абляцій і повного опису датасетів залишає питання щодо відтворюваності.

У ландшафті AI-чипів Jalapeño займає нішу спеціалізованих ASIC для інференсу, подібно до TPU Google або Trainium/Inferentia Amazon. На відміну від підходу Meta чи Microsoft, OpenAI робить ставку на тісну інтеграцію з власними моделями та багатопоколінну платформу. Це зближує стратегію з Google, але прискорює цикл розробки до дев'яти місяців завдяки використанню ШІ в проєктуванні.

Для галузі це означає потенційне зниження витрат на інференс у дата-центрах, що особливо важливо при масштабуванні агентних систем і API. Нижча латентність (1,7–3,6 раза) дозволяє обслуговувати більше користувачів без компромісів між продуктивністю та швидкістю відповіді.

Залишається незрозумілим, наскільки стійкі показники при реальному навантаженні в 2027 році, коли конкуренти випустять нові покоління. Незалежні тести та розкриття деталей архітектури стануть ключовими для оцінки довгострокового впливу.

Розробка Jalapeño підкреслює, що ефективність інференсу тепер визначається не лише розміром моделі, а й апаратною спеціалізацією під конкретні робочі навантаження.

3 Перегляди

Джерела

  • OpenAI’s Jalapeño outpaces Blackwell

Читайте більше статей на цю тему:

Знайшли помилку чи неточність?Ми розглянемо ваші коментарі якомога швидше.