À medida que os data centers evoluem para fábricas de IA, a computação deixou de ser um centro de custos para se tornar um gerador de receitas.
“Computação é receita”, disse Jensen Huang, cofundador e CEO da NVIDIA. “Sem computação, não há como gerar tokens. Sem tokens, não há como gerar receita. Portanto, neste novo mundo da IA, computação é igual a receita.”
Essa reformulação muda o cálculo de uma organização. Se computação é receita, para que você otimiza? Aqui estão 5 questões a serem consideradas:
- Você está medindo o que realmente impulsiona a receita da fábrica de IA?
A maioria das fábricas de IA tem restrição de energia, então os tokens por watt determinam quanta receita você pode gerar e o custo por token impacta a margem de lucro da fábrica de IA.
Mas nenhuma destas métricas deve ser avaliada num único ponto operacional. Trabalhos em lote, chat em tempo real e cargas de trabalho de agente exigem diferentes pontos na curva de latência de rendimento. Os chips de IA que funcionam bem em apenas alguns pontos não atenderão a toda a gama de cargas de trabalho.
Métricas operacionais importantes adicionais, como tempo até o primeiro token (TTFT), tempo médio entre interrupções (MTBI) e vida útil da plataforma, são a base da eficiência da fábrica de IA. Eles determinam a rapidez com que uma fábrica de IA fica online para gerar tokens, a confiabilidade de seus fluxos de receita e sua capacidade de permanecer produtiva a longo prazo à medida que as cargas de trabalho de IA evoluem.
- Como a IA agêntica altera o que sua CPU precisa entregar?
As CPUs dos data centers têm sido historicamente otimizadas para rendimento paralelo, onde mais núcleos melhoram a capacidade agregada.
Cargas de trabalho agênticas são executadas em loops e fazem demandas diferentes. O modelo raciocina na GPU, a CPU executa chamadas de ferramentas, como compilação de código e recuperação de dados, e o resultado retorna à GPU para que o modelo possa raciocinar novamente. Cada etapa é executada em sequência, controlada pela anterior.
O desempenho por núcleo e a latência de memória determinam a rapidez com que cada etapa é concluída, o que afeta a qualidade do serviço prestado pelos agentes e o quão bem a fábrica de IA permanece utilizada.
- A sua rede e o seu armazenamento foram desenvolvidos para os padrões de tráfego e volumes de dados da IA?
O desempenho máximo da computação não significa nada se a rede não conseguir manter todos os aceleradores produtivos. Os requisitos de rede em uma fábrica de IA abrangem três camadas com demandas de desempenho que a Ethernet pronta para uso não consegue atender.
- Aumente a rede conecta vários aceleradores e suas memórias com alta largura de banda e baixa latência, essenciais para os modelos atuais de mistura de especialistas.
- Rede em expansão permite transferências diretas de dados em alta velocidade entre a memória da GPU em dezenas de milhares de servidores, sustentando latência consistentemente baixa com zero jitter.
- Rede escalonável federa locais em uma fábrica unificada à medida que as restrições de energia aumentam a capacidade em vários locais, com inteligência e orquestração integradas.
O armazenamento deve fornecer mais do que capacidade e rendimento. Cargas de trabalho agênticas exigem acesso rápido e inteligente ao estado de inferência e à memória de trabalho em contextos longos e múltiplas sessões. Quando os caminhos de armazenamento não conseguem acompanhar o ritmo, a utilização da GPU cai.
- Sua pilha de software se mantém em escala e melhora a economia da fábrica de IA?
Transformar o potencial do hardware em desempenho realizado requer uma pilha de software robusta e comprovada que otimize todas as camadas, desde primitivos de computação até estruturas de inferência e orquestração.
O software de código aberto oferece às equipes a flexibilidade para criar, personalizar e ampliar em uma base moldada por um amplo ecossistema de desenvolvedores. Um software robusto de nível empresarial captura essa inovação enquanto preserva a confiabilidade da IA de produção. Além disso, o software que proporciona ganhos contínuos de desempenho em escala de produção reduz o custo por token e prolonga a vida útil da infraestrutura de IA.
- A segurança está incorporada ao seu caminho de dados de IA?
Uma violação de segurança pode comprometer os dados do cliente, o IP do modelo ou a integridade das decisões do agente, além de resultar em tempo de inatividade e perda de saída de token.
A segurança deve operar em linha nas velocidades de fábrica da IA, em dados em repouso, em trânsito e em uso. O armazenamento deve inspecionar o comportamento do agente, impor políticas de acesso a arquivos e à rede e proteger a memória de contexto em tempo real. Na camada de computação, a computação confidencial com atestado enraizado em hardware verifica a integridade da carga de trabalho e protege modelos e dados durante a inferência.
Como essas questões moldam o co-design extremo na NVIDIA
Essas considerações dos clientes da NVIDIA moldaram a forma como construímos. O co-design extremo da NVIDIA integra verticalmente computação, rede, armazenamento e software para oferecer o melhor desempenho, eficiência, resiliência e segurança para otimizar a economia da fábrica de IA. A plataforma NVIDIA também é horizontalmente aberta, abrangendo desde arquiteturas de referência NVIDIA MGX e DSX até suporte NVLink Fusion para XPUs de terceiros e um amplo ecossistema de software de código aberto.
A prova está na liderança de desempenho:
- NVIDIA Vera Rubin NVL72 oferece 10x mais tokens por megawatt do que NVIDIA GB200 NVL72.
- A arquitetura em escala de rack sem cabos do Vera Rubin reduz a montagem da bandeja de 2 horas para 5 minutos com uma taxa de sucesso na primeira passagem de 95%, acelerando a abertura e o tempo para a primeira inferência. Combinado com software de resiliência, ele mantém o tempo de atividade.
- NVIDIA Groq 3 LPX oferece rendimento até 35x maior por megawatt para inferência de latência ultrabaixa
- A CPU NVIDIA Vera oferece desempenho de núcleo de thread único até 2x maior, largura de banda de núcleo a núcleo 3x maior e latência de memória 40% menor para acelerar a IA de agente.
- O NVIDIA NVLink, agora em sua sexta geração, foi desenvolvido especificamente para redes escaláveis e oferece latência 3x menor e taxa de pacotes 10x maior em comparação com Ethernet padrão.
- A Ethernet NVIDIA Spectrum-X oferece desempenho até 1,6x maior do que a Ethernet padrão e mantém até 95% de eficiência em implantações que excedem 100.000 GPUs.
- A DPU NVIDIA BlueField-4 oferece conectividade de 800 Gb/s e 6x a computação de seu antecessor, enquanto o processador de armazenamento Vera BlueField-4 STX capacita o NVIDIA CMX para fornecer tokens até 5x mais altos por segundo para inferência de agente.
- NVIDIA DOCA no BlueField-4 oferece segurança no silício, com detecção de ameaças em tempo de execução até 1.000 vezes mais rápida do que as soluções sem agente existentes e aplicação de políticas de acesso a arquivos e rede.
- A NVIDIA Confidential Computing protege modelos e dados em uso em todas as GPUs e CPUs do Vera Rubin NVL72.
- A pilha de software NVIDIA alimenta as maiores fábricas de IA do mundo. Na Blackwell, as otimizações contínuas reduziram os custos de token do DeepSeek V4 em até 5x em 1 mês.
