Jalapeño로 알려진 OpenAI의 첫 맞춤형 추론 칩이 테스트에서 Nvidia Corp.의 GB300 프로세서보다 뛰어난 성능을 보였다고, 칩 부문 책임자 Richard Ho가 Bloomberg 인터뷰에서 밝혔다.

Ho는 AI의 와트당 성능과 응답 속도를 측정한 테스트에서 이 칩이 더 뛰어난 성능을 보였다고 말했다.

“실험실에서 Jalapeño는 높은 처리량 영역과 낮은 지연 시간 영역 모두에서 성능을 보이고 있습니다. 높은 처리량 영역에서는 더 많은 고객에게 더 저렴하게 서비스를 제공할 수 있고, 낮은 지연 시간 영역에서는 이에 민감한 고객에게 응답 시간이 정말, 정말 빨라질 것입니다”라고 Bloomberg는 Ho의 말을 인용해 화요일 보도했다.

Jalapeño는 다양한 고객을 위한 맞춤형 칩을 제작하는 Broadcom Inc.와 협력해 개발됐다. 두 회사는 지난해 협력을 발표했으며, 6월에는 이 프로세서가 기록적인 시간 내에 개발됐다고 밝혔다.

이 칩은 학습된 AI 모델이 프롬프트에 응답하고 작업을 처리하는 AI 추론을 위해 설계됐다. Nvidia의 기술이 강점을 보이는 AI 모델 학습용으로는 설계되지 않았다고 Ho는 말했다.

Jalapeño는 최근 출하를 시작한 Nvidia의 최신 Vera Rubin 칩과는 비교 테스트를 진행하지 않았다.

Broadcom AI Semiconductor Revenue

Broadcom AI Semiconductor Revenue

  • Broadcom
Broadcom AI Semiconductor RevenueAs of 2026-01-01, Broadcom AI semiconductor revenue was $10.8 in the latest reported quarter.$15B$10B$5B$0BBroadcom, 2022-10-01T00:00:00.000Z: $0.6BBroadcom, 2023-01-01T00:00:00.000Z: $0.8BBroadcom, 2023-04-01T00:00:00.000Z: $1BBroadcom, 2023-07-01T00:00:00.000Z: $1.5BBroadcom, 2023-10-01T00:00:00.000Z: $2.3BBroadcom, 2024-01-01T00:00:00.000Z: $3.1BBroadcom, 2024-04-01T00:00:00.000Z: $3.1BBroadcom, 2024-07-01T00:00:00.000Z: $3.7BBroadcom, 2024-10-01T00:00:00.000Z: $4.1BBroadcom, 2025-01-01T00:00:00.000Z: $4.4BBroadcom, 2025-04-01T00:00:00.000Z: $5.2BBroadcom, 2025-07-01T00:00:00.000Z: $6.5BBroadcom, 2025-10-01T00:00:00.000Z: $8.4BBroadcom, 2026-01-01T00:00:00.000Z: $10.8BQ1 FY23Q2 FY23Q3 FY23Q4 FY23Q1 FY24Q2 FY24Q3 FY24Q4 FY24Q1 FY25Q2 FY25Q3 FY25Q4 FY25Q1 FY26Q2 FY26Broadcom: $10.8B on Q2 FY26
SOURCE: The Latent

테스트

OpenAI는 블로그 게시물에서 AI 요청을 시스템이 얼마나 빠르고 효율적으로 처리할 수 있는지 측정하는 SemiAnalysis의 공개 벤치마크인 InferenceX에서 Jalapeño를 테스트했다고 밝혔다. 테스트에는 높은 처리량과 낮은 지연 시간 워크로드가 모두 포함됐다.

DeepSeek R1 670B에서 Jalapeño는 Nvidia GB300 시스템 대비 킬로와트당 최고 혼합 토큰 처리량이 1.7배에 달했다. 엔드투엔드 지연 시간도 GB300 시스템의 5.99초보다 3.6배 낮은 1.65초였다.

OpenAI는 이번 테스트에서 가장 큰 공개 모델인 Kimi K2.5 1T를 기준으로 Jalapeño의 최고 와트당 성능이 1.5배 향상됐다고 밝혔다. 엔드투엔드 지연 시간은 3.4배 낮았다.

OpenAI는 GPT-OSS 120B에서 Jalapeño와 Nvidia의 GB200도 비교했다. 이 칩의 킬로와트당 최고 혼합 토큰 처리량은 85,448로, 44,960인 GB200보다 1.9배 높았다.