20/08/2026

Cerebras CS-4: o rack que quer acelerar os agentes de IA

Voltar ao blog

A corrida da inteligência artificial teve esta semana uma notícia menos vistosa do que um novo chatbot, mas talvez mais decisiva para quem paga a conta dos datacenters. A Cerebras apresentou a 18 de agosto de 2026 o CS-4, a quarta geração do seu sistema wafer-scale, agora redesenhado como uma plataforma rack-scale chamada Nexus.

O argumento da empresa é direto: se os agentes de IA precisam de raciocinar, verificar respostas e chamar ferramentas em poucos segundos, a inferência deixa de ser apenas um custo operacional e passa a ser experiência de produto. No comunicado a investidores, a Cerebras afirma que o CS-4 entrega até 30 vezes mais tokens por segundo por utilizador do que sistemas GPU testados, além de até 10 vezes mais throughput por watt face ao CS-3. As primeiras remessas estão previstas para este trimestre.

Imagem oficial Cerebras sobre o lançamento do sistema CS-4
O CS-4 marca a entrada da Cerebras numa arquitetura rack-scale modular para inferência de IA. Imagem: Cerebras

O que mudou dentro do rack

O número que salta à vista é 750 PFLOPS de compute IA num sistema com três Wafer Scale Engine 3 Turbo. Cada wafer mantém a escala extrema que tornou a Cerebras diferente: 4 biliões de transístores, 900.000 núcleos otimizados para IA e 44 GB de SRAM integrados no próprio wafer. A novidade prática está no conjunto: compute, energia, arrefecimento e I/O foram reorganizados para reduzir perdas e encurtar o caminho entre wafers.

A empresa chama a peça central de Wafer-Scale Backpack, um módulo traseiro que junta conversão de energia, arrefecimento líquido direto, I/O de alta velocidade e controlo à volta do wafer. Segundo a Cerebras, isso corta componentes face à geração anterior e reduz tempo de deploy de dias para horas. A promessa é menos glamour de silício novo e mais engenharia de sistema: aproximar energia, simplificar montagem e permitir upgrades por módulos.

Diagrama oficial Cerebras da arquitetura modular CS-4
A arquitetura Nexus separa compute, energia e I/O em módulos pensados para fabrico e atualização mais rápidos. Imagem: Cerebras

O que muda para equipas de IA

A parte mais interessante chama-se Direct Wafer Links. Em vez de passar tudo por uma camada tradicional de switches entre aceleradores, o CS-4 pode ligar wafers dentro e entre racks com latência anunciada de apenas dois microssegundos. Ao mesmo tempo, o sistema mantém RoCE v2 sobre Ethernet para conversar com infraestrutura existente e com arquiteturas heterogéneas, incluindo cenários onde AMD Helios ou AWS Trainium fazem o prefill e a Cerebras fica com o decode de baixa latência.

Para aplicações comuns, isto pode soar distante. Mas a consequência chega ao produto final: respostas mais rápidas permitem agentes com mais passos internos no mesmo tempo de espera. O CTO Sean Lie resumiu no comunicado que ser 30 vezes mais rápido dá a um sistema agentic espaço para muito mais raciocínio, verificação ou uso de ferramentas no mesmo relógio. Se a comparação se confirmar em produção, a pergunta deixa de ser apenas qual modelo usar e passa a incluir onde cada fase da inferência deve correr.

Interface Wafer I/O do Cerebras CS-4
O novo Wafer I/O Module é a peça que permite RoCE v2 para integração externa e Direct Wafer Links dentro do tecido Cerebras. Imagem: Cerebras

A ressalva que não cabe no benchmark

Há prudência a fazer. A The Next Web nota que o WSE-3 Turbo parece menos uma geração totalmente nova de silício e mais uma versão mais rápida do WSE-3, com os mesmos 4 biliões de transístores, o mesmo nó de 5 nm e a mesma SRAM integrada. A Network World também sublinha o outro lado dos links proprietários: podem cortar complexidade e energia entre sistemas Cerebras, mas não eliminam redes convencionais, armazenamento, orquestração nem integração com aceleradores de terceiros.

Mesmo assim, o CS-4 importa agora porque mostra onde a competição de IA está a deslocar-se. Depois de anos a medir modelos por benchmarks públicos, a vantagem pode vir de racks que entregam tokens mais depressa, gastam menos energia por resposta e encaixam melhor em datacenters enormes. A notícia não é que as GPUs deixaram de contar. A notícia é que a inferência rápida se tornou uma categoria de hardware própria, com arquitetura, cabos, refrigeração e economia tão importantes como o modelo que aparece no ecrã.

Comentários (2)

Anti-spam providenciado pela Cloudflare Turnstile.

Assistente Battlehorns

Perguntas sobre sites, apps e serviços

Olá. Posso ajudar com hosting, GuildOps, Casa Inteligente, websites e o resto dos serviços Battlehorns.