Chip Jalapeño của OpenAI: cách bộ tăng tốc chuyên dụng thay đổi kinh tế suy luận LLM

Chỉnh sửa bởi: Tatyana Hurynovich

OpenAI đã giới thiệu chip chuyên dụng đầu tiên của mình, Jalapeño, cho các tác vụ suy luận của các mô hình ngôn ngữ lớn. Được phát triển cùng với Broadcom, bộ tăng tốc này tập trung vào việc xử lý các yêu cầu đến các mô hình như GPT và Codex, chứ không phải huấn luyện. Thông báo tại hội nghị Hot Chips vào tháng Tám năm 2026 đi kèm với các điểm chuẩn đầu tiên, cho thấy lợi thế đáng kể về token trên mỗi watt và giảm độ trễ.

Khía cạnh kỹ thuật chính là kiến trúc được tối ưu hóa cho các mẫu suy luận LLM đặc trưng: thông lượng cao với độ trễ thấp và sử dụng bộ nhớ hiệu quả. Không giống như GPU đa năng, Jalapeño tập trung vào các hoạt động cụ thể như attention và feed-forward trong transformer. Các thử nghiệm ban đầu trên SemiAnalysis InferenceX cho thấy 1,5–1,9 lần khối lượng công việc trên mỗi watt so với Nvidia Blackwell, và trong một số kịch bản, tuyên bố tăng token trên mỗi watt lên đến 104 lần — một con số cần xác minh độc lập.

Phương pháp thử nghiệm bao gồm so sánh với các hệ thống dựa trên Nvidia GB200/GB300, chuẩn hóa theo công suất công bố của chip (700 W, với mức tiêu thụ thực tế lên đến 550 W). Kết quả bao gồm cả các mô hình nội bộ của OpenAI và các mô hình bên ngoài — DeepSeek R1 và Kimi K2.5. Điều này củng cố lập luận về khả năng áp dụng đa mô hình, nhưng việc thiếu các phân tích chi tiết và mô tả đầy đủ về bộ dữ liệu vẫn để lại câu hỏi về khả năng tái lập.

Trong bối cảnh chip AI, Jalapeño chiếm một vị trí thích hợp là ASIC chuyên dụng cho suy luận, tương tự như TPU của Google hoặc Trainium/Inferentia của Amazon. Khác với cách tiếp cận của Meta hay Microsoft, OpenAI đặt cược vào sự tích hợp chặt chẽ với các mô hình của riêng mình và một nền tảng đa thế hệ. Điều này đưa chiến lược đến gần Google hơn, nhưng tăng tốc chu kỳ phát triển lên chín tháng nhờ sử dụng AI trong thiết kế.

Đối với ngành, điều này có nghĩa là tiềm năng giảm chi phí suy luận trong các trung tâm dữ liệu, điều đặc biệt quan trọng khi mở rộng quy mô các hệ thống tác tử và API. Độ trễ thấp hơn (1,7–3,6 lần) cho phép phục vụ nhiều người dùng hơn mà không ảnh hưởng đến hiệu suất và tốc độ phản hồi.

Vẫn chưa rõ các chỉ số này bền vững đến mức nào dưới tải thực tế vào năm 2027, khi các đối thủ cạnh tranh phát hành các thế hệ mới. Các thử nghiệm độc lập và tiết lộ chi tiết kiến trúc sẽ là chìa khóa để đánh giá tác động lâu dài.

Việc phát triển Jalapeño nhấn mạnh rằng hiệu quả suy luận giờ đây không chỉ được xác định bởi kích thước mô hình mà còn bởi sự chuyên môn hóa phần cứng cho các khối lượng công việc cụ thể.

5 Lượt xem

Nguồn

  • OpenAI’s Jalapeño outpaces Blackwell

Đọc thêm bài viết về chủ đề này:

Bạn có phát hiện lỗi hoặc sai sót không?Chúng tôi sẽ xem xét ý kiến của bạn càng sớm càng tốt.