O primeiro chip de inferência personalizado da OpenAI, conhecido como Jalapeño, superou o processador GB300 da Nvidia Corp. nos testes, disse o chefe de chips Richard Ho em entrevista à Bloomberg.
Ho disse que o chip teve desempenho superior em testes que mediram o desempenho de IA por watt e a velocidade de resposta.
“No laboratório, o Jalapeño está demonstrando desempenho tanto no domínio de alto throughput — o que significa que será capaz de atender a muitos clientes por um custo menor — quanto no domínio de baixa latência — o que significa que, para os clientes que se importam com isso, o tempo de resposta será realmente muito, muito rápido”, citou a Bloomberg, reproduzindo Ho, em um relatório na terça-feira.
O Jalapeño foi desenvolvido em parceria com a Broadcom Inc., que fabrica chips personalizados para diversos clientes. As duas empresas anunciaram a colaboração no ano passado e disseram, em junho, que o processador foi desenvolvido em tempo recorde.
O chip foi desenvolvido para inferência de IA, que envolve modelos de IA treinados respondendo a prompts e executando tarefas. Ele não foi projetado para treinar modelos de IA, área em que a tecnologia da Nvidia se destaca, disse Ho.
O Jalapeño também não foi testado contra os chips Vera Rubin mais recentes da Nvidia, que começaram a ser enviados recentemente.
Testes
A OpenAI disse em uma publicação no blog que testou o Jalapeño no InferenceX, um benchmark público da SemiAnalysis que mede a rapidez e a eficiência com que um sistema pode atender a uma solicitação de IA. Os testes abrangeram cargas de trabalho de alto throughput e baixa latência.
No DeepSeek R1 670B, o Jalapeño entregou 1,7 vez o throughput máximo de tokens mistos por quilowatt do sistema Nvidia GB300. Sua latência de ponta a ponta também foi 3,6 vezes menor: 1,65 segundo, contra 5,99 segundos no sistema GB300.
O Kimi K2.5 1T, maior modelo público do teste, apresentou um ganho de 1,5 vez no desempenho máximo por watt com o Jalapeño, disse a OpenAI. A latência de ponta a ponta foi 3,4 vezes menor.
A OpenAI também comparou o Jalapeño com o GB200 da Nvidia no GPT-OSS 120B. O chip entregou throughput máximo de tokens mistos por quilowatt 1,9 vez maior: 85.448 contra 44.960.
