À medida que os data centers evoluem para fábricas de IA, a computação deixou de ser um centro de custos para se tornar um gerador de receitas.

“Computação é receita”, disse Jensen Huang, cofundador e CEO da NVIDIA. “Sem computação, não há como gerar tokens. Sem tokens, não há como gerar receita. Portanto, neste novo mundo da IA, computação é igual a receita.”

Essa reformulação muda o cálculo de uma organização. Se computação é receita, para que você otimiza? Aqui estão 5 questões a serem consideradas:

  1. Você está medindo o que realmente impulsiona a receita da fábrica de IA?

A maioria das fábricas de IA tem restrição de energia, então os tokens por watt determinam quanta receita você pode gerar e o custo por token impacta a margem de lucro da fábrica de IA.

Mas nenhuma destas métricas deve ser avaliada num único ponto operacional. Trabalhos em lote, chat em tempo real e cargas de trabalho de agente exigem diferentes pontos na curva de latência de rendimento. Os chips de IA que funcionam bem em apenas alguns pontos não atenderão a toda a gama de cargas de trabalho.

Métricas operacionais importantes adicionais, como tempo até o primeiro token (TTFT), tempo médio entre interrupções (MTBI) e vida útil da plataforma, são a base da eficiência da fábrica de IA. Eles determinam a rapidez com que uma fábrica de IA fica online para gerar tokens, a confiabilidade de seus fluxos de receita e sua capacidade de permanecer produtiva a longo prazo à medida que as cargas de trabalho de IA evoluem.

  1. Como a IA agêntica altera o que sua CPU precisa entregar?

As CPUs dos data centers têm sido historicamente otimizadas para rendimento paralelo, onde mais núcleos melhoram a capacidade agregada.

Cargas de trabalho agênticas são executadas em loops e fazem demandas diferentes. O modelo raciocina na GPU, a CPU executa chamadas de ferramentas, como compilação de código e recuperação de dados, e o resultado retorna à GPU para que o modelo possa raciocinar novamente. Cada etapa é executada em sequência, controlada pela anterior.

O desempenho por núcleo e a latência de memória determinam a rapidez com que cada etapa é concluída, o que afeta a qualidade do serviço prestado pelos agentes e o quão bem a fábrica de IA permanece utilizada.

  1. A sua rede e o seu armazenamento foram desenvolvidos para os padrões de tráfego e volumes de dados da IA?

O desempenho máximo da computação não significa nada se a rede não conseguir manter todos os aceleradores produtivos. Os requisitos de rede em uma fábrica de IA abrangem três camadas com demandas de desempenho que a Ethernet pronta para uso não consegue atender.

  • Aumente a rede conecta vários aceleradores e suas memórias com alta largura de banda e baixa latência, essenciais para os modelos atuais de mistura de especialistas.
  • Rede em expansão permite transferências diretas de dados em alta velocidade entre a memória da GPU em dezenas de milhares de servidores, sustentando latência consistentemente baixa com zero jitter.
  • Rede escalonável federa locais em uma fábrica unificada à medida que as restrições de energia aumentam a capacidade em vários locais, com inteligência e orquestração integradas.

O armazenamento deve fornecer mais do que capacidade e rendimento. Cargas de trabalho agênticas exigem acesso rápido e inteligente ao estado de inferência e à memória de trabalho em contextos longos e múltiplas sessões. Quando os caminhos de armazenamento não conseguem acompanhar o ritmo, a utilização da GPU cai.

  1. Sua pilha de software se mantém em escala e melhora a economia da fábrica de IA?

Transformar o potencial do hardware em desempenho realizado requer uma pilha de software robusta e comprovada que otimize todas as camadas, desde primitivos de computação até estruturas de inferência e orquestração.

O software de código aberto oferece às equipes a flexibilidade para criar, personalizar e ampliar em uma base moldada por um amplo ecossistema de desenvolvedores. Um software robusto de nível empresarial captura essa inovação enquanto preserva a confiabilidade da IA ​​de produção. Além disso, o software que proporciona ganhos contínuos de desempenho em escala de produção reduz o custo por token e prolonga a vida útil da infraestrutura de IA.

  1. A segurança está incorporada ao seu caminho de dados de IA?

Uma violação de segurança pode comprometer os dados do cliente, o IP do modelo ou a integridade das decisões do agente, além de resultar em tempo de inatividade e perda de saída de token.

A segurança deve operar em linha nas velocidades de fábrica da IA, em dados em repouso, em trânsito e em uso. O armazenamento deve inspecionar o comportamento do agente, impor políticas de acesso a arquivos e à rede e proteger a memória de contexto em tempo real. Na camada de computação, a computação confidencial com atestado enraizado em hardware verifica a integridade da carga de trabalho e protege modelos e dados durante a inferência.

Como essas questões moldam o co-design extremo na NVIDIA

Essas considerações dos clientes da NVIDIA moldaram a forma como construímos. O co-design extremo da NVIDIA integra verticalmente computação, rede, armazenamento e software para oferecer o melhor desempenho, eficiência, resiliência e segurança para otimizar a economia da fábrica de IA. A plataforma NVIDIA também é horizontalmente aberta, abrangendo desde arquiteturas de referência NVIDIA MGX e DSX até suporte NVLink Fusion para XPUs de terceiros e um amplo ecossistema de software de código aberto.

A prova está na liderança de desempenho:

  • NVIDIA Vera Rubin NVL72 oferece 10x mais tokens por megawatt do que NVIDIA GB200 NVL72.
  • A arquitetura em escala de rack sem cabos do Vera Rubin reduz a montagem da bandeja de 2 horas para 5 minutos com uma taxa de sucesso na primeira passagem de 95%, acelerando a abertura e o tempo para a primeira inferência. Combinado com software de resiliência, ele mantém o tempo de atividade.
  • NVIDIA Groq 3 LPX oferece rendimento até 35x maior por megawatt para inferência de latência ultrabaixa
  • A CPU NVIDIA Vera oferece desempenho de núcleo de thread único até 2x maior, largura de banda de núcleo a núcleo 3x maior e latência de memória 40% menor para acelerar a IA de agente.
  • O NVIDIA NVLink, agora em sua sexta geração, foi desenvolvido especificamente para redes escaláveis ​​e oferece latência 3x menor e taxa de pacotes 10x maior em comparação com Ethernet padrão.
  • A Ethernet NVIDIA Spectrum-X oferece desempenho até 1,6x maior do que a Ethernet padrão e mantém até 95% de eficiência em implantações que excedem 100.000 GPUs.
  • A DPU NVIDIA BlueField-4 oferece conectividade de 800 Gb/s e 6x a computação de seu antecessor, enquanto o processador de armazenamento Vera BlueField-4 STX capacita o NVIDIA CMX para fornecer tokens até 5x mais altos por segundo para inferência de agente.
  • NVIDIA DOCA no BlueField-4 oferece segurança no silício, com detecção de ameaças em tempo de execução até 1.000 vezes mais rápida do que as soluções sem agente existentes e aplicação de políticas de acesso a arquivos e rede.
  • A NVIDIA Confidential Computing protege modelos e dados em uso em todas as GPUs e CPUs do Vera Rubin NVL72.
  • A pilha de software NVIDIA alimenta as maiores fábricas de IA do mundo. Na Blackwell, as otimizações contínuas reduziram os custos de token do DeepSeek V4 em até 5x em 1 mês.