A inferência rápida pode se tornar um mercado de US$ 550 bilhões até 2030, segundo a Mizuho Securities, dando à fabricante de chips especializados Cerebras (CBRS) a chance de conquistar um dos maiores segmentos da computação de IA. O banco manteve sua recomendação de desempenho superior e o preço-alvo de US$ 300 em uma nota de 4 de outubro analisada pelo The Latent.
Vijay Rakesh, diretor-gerente da Mizuho, estima o mercado de inferência rápida em cerca de US$ 1 bilhão em 2025. Até 2030, ele espera que o segmento responda por cerca de 20% de todas as cargas de trabalho de IA. Os chips da Cerebras permitem um processamento mais rápido.
As estimativas de receita da Cerebras são de cerca de US$ 885 milhões neste ano, US$ 3 bilhões em 2027 e US$ 13,5 bilhões em 2029. A maior parte disso viria do "pipeline em expansão de contratos com clientes da empresa, ancorado por parcerias importantes com a OpenAI e a AWS, com potenciais novos clientes impulsionando ganhos adicionais até 2027/28E", diz a nota.
A US$ 300, a Cerebras seria negociada a cerca de 12 vezes a estimativa da Mizuho para as vendas de 2028. O preço-alvo está aproximadamente 80% acima do fechamento de sexta-feira, de US$ 166,43. Rakesh também apresentou um cenário otimista de US$ 465 e um cenário pessimista de US$ 165, escrevendo que a Cerebras "precisa executar continuamente seu roadmap para manter e ampliar sua vantagem tecnológica [em chips especializados]."
Compradores pagam mais por velocidade
Tokens de IA entregues em alta velocidade alcançam preços cerca de seis a 10 vezes maiores que os tokens padrão, escreveu Rakesh, "o que faz desse um segmento de maior receita e margem."
Considere o modo rápido da Anthropic para o Claude: ele opera cerca de 2,5 vezes mais rápido e custa seis vezes mais. Rakesh também citou o plano Pro de US$ 500 por mês da OpenAI, que inclui acesso ao nível Ultrafast lançado no evento DevDay da empresa na semana passada.
A Cerebras disse em agosto que fornece a infraestrutura do Ultrafast para o GPT-5.6 Sol da OpenAI. A empresa afirma que o modo rápido pode gerar até 750 tokens por segundo, ou até 14 vezes a velocidade do modo padrão da OpenAI. O modelo mais recente oferecido nesse nível é o GPT-6.1 Sol, atualmente o segundo melhor modelo da OpenAI no benchmark do The Latent.
Demanda inicial de empresas de trading e do Pentágono
Jane Street, Citadel, Jump e Hudson River Trading estão entre os formadores de mercado e as empresas de trading de alta frequência que, segundo a Mizuho, impulsionarão a demanda inicial. O banco também vê a inferência rápida ganhando espaço no monitoramento de cibersegurança e em sistemas de defesa que exigem inferência em tempo real, citando as empresas de tecnologia de defesa Anduril e Shield AI.
Um contrato já foi fechado: Cerebras e Ranovus receberam US$ 45 milhões da DARPA para construir uma plataforma de testes de IA para simulações de campo de batalha, com o objetivo de realizar inferências em menos de um segundo, segundo a nota.
Rakesh vê a Meta (META) como uma possível próxima cliente de inferência. Ele também afirma que a Amazon Web Services, ou AWS, planeja oferecer seus modelos Nova no Bedrock no primeiro trimestre de 2027 usando seus chips Trainium em conjunto com sistemas CS-3 da Cerebras.
Mais receita depende da OpenAI
A OpenAI sozinha deverá responder por mais de 80% da receita da Cerebras, segundo a estimativa da Mizuho. Isso ocorre após um ano em que a G42 e a Mohamed bin Zayed University of Artificial Intelligence, sediadas em Abu Dhabi, responderam por cerca de 86% da receita. O banco espera que a participação desses dois clientes caia para menos de 40% neste ano, ante o nível de 2025.
A Cerebras abriu o capital em maio a US$ 185 por ação. Na semana passada, a ação caiu abaixo do preço de seu IPO depois que a SemiAnalysis informou que o novo nível GPT-6.1 Sol Ultrafast da OpenAI opera em GPUs da Nvidia. Mais ações também ficaram disponíveis para venda com o fim das restrições de bloqueio do IPO.
O CEO da OpenAI, Sam Altman, escreveu no X que "a Cerebras é uma parceira próxima, e temos uma colaboração profunda para avançar as fronteiras da velocidade."
Segundo a Mizuho, a Cerebras planeja enviar o CS-4 no quarto trimestre, dobrando a velocidade de tokens da geração atual, e o CS-5 em 2027. A OpenAI também está desenvolvendo seu próprio hardware de inferência. A empresa disse em agosto que seu primeiro chip de inferência superou o GB300 da Nvidia em testes de laboratório.
