Há uma guerra silenciosa acontecendo sob o boom da IA, e a maioria das pessoas não está prestando atenção à frente direita. Embora as manchetes se concentrem em qual modelo está ganhando, qual startup está arrecadando dinheiro ou qual chatbot está conquistando usuários, uma corrida paralela está ocorrendo em data centers e salas de reuniões corporativas em todo o mundo. A corrida é pela infraestrutura de IA: clusters de GPU, contratos de energia, sistemas de resfriamento, estrutura de rede, ferramentas de orquestração e serviços de inferência que fazem a IA moderna realmente funcionar. As empresas que lutam nessa corrida são chamadas de neonuvens.

Compreender a importância das neonuvens é importante pela mesma razão que era importante compreender a computação em nuvem em 2008. As empresas que primeiro viram a mudança para a nuvem e se posicionaram corretamente em torno dela acabaram por controlar uma enorme camada da indústria tecnológica. A mesma dinâmica está ocorrendo na infraestrutura de IA neste momento. Mas o mercado da neocloud é mais complicado do que parece. Nem todas essas empresas fazem a mesma coisa. Agrupá-los como se fossem apenas empresas de aluguel de GPU é totalmente errado. A maneira mais útil de compreender o espaço é reconhecer que as neonuvens estão evoluindo para quatro categorias distintas, cada uma com um foco diferente, um cliente diferente e uma função diferente na pilha de IA.

O que realmente é uma neocloud

Antes de entrar nas categorias, é útil estabelecer o que o termo significa. Uma neocloud é um provedor de infraestrutura em nuvem projetado especificamente para cargas de trabalho de IA. Isso parece simples, mas cobre muito terreno. Hyperscalers de uso geral, como AWS, Azure e Google Cloud, foram projetados para oferecer suporte a uma ampla variedade de cargas de trabalho em vários setores. Eles construíram uma arquitetura baseada em flexibilidade, amplitude de serviços e amplo apelo empresarial. Neoclouds adotou uma abordagem diferente. Eles foram construídos em torno de um objetivo: tornar a computação de IA o mais rápida, densa e escalável possível.

Isso significa projetar instalações em torno de alta densidade de potência, integrar interconexões rápidas entre GPUs, investir em resfriamento líquido e resfriamento com reconhecimento de energia e construir orquestração em torno de ferramentas como Kubernetes e Slurm, criadas especificamente para treinamento de IA distribuída. Isso também significa competir agressivamente pelo acesso aos aceleradores Nvidia mais recentes, porque na infraestrutura de IA, o acesso à GPU é muitas vezes a vantagem competitiva mais importante que uma empresa pode ter.

O resultado é um mercado fragmentado, mas profundamente competitivo. Algumas neonuvens estão focadas na capacidade física. Alguns estão focados em tornar a computação GPU acessível aos desenvolvedores. Alguns estão construindo infraestruturas de nível empresarial que podem competir diretamente com hiperscaladores em domínios específicos de IA. E alguns estão focados em uma das apostas de longo prazo mais importantes da IA: a inferência. Vamos dar uma olhada mais de perto nas quatro categorias de neonuvens.

Infraestrutura de IA full stack

A primeira e mais proeminente categoria são os provedores de infraestrutura de IA full-stack. Essas empresas estão tentando se tornar a AWS da era da IA, mas são construídas desde o início em torno de GPUs, em vez de computação de uso geral. Seu objetivo é possuir o máximo possível da experiência de infraestrutura de IA: clusters brutos de GPU, rede, armazenamento, orquestração, Kubernetes gerenciados, agendamento Slurm, clusters privados, suporte empresarial, cargas de trabalho de treinamento e serviços de inferência.

As empresas neste espaço incluem CoreWeave, Nebius, Lambda, Crusoe, Nscale e Fluidstack. CoreWeave emergiu como o exemplo mais claro desta categoria. Ela construiu sua identidade em torno de enormes clusters de GPU otimizados para treinamento de IA em grande escala, combinados com orquestração nativa do Kubernetes e contratos empresariais no valor de bilhões. A Nebius seguiu um caminho diferente, combinando profundo conhecimento de engenharia com uma estratégia soberana e orientada para a Europa, ao mesmo tempo que se expandia fortemente para data centers nos EUA. Lambda começou como uma nuvem de GPU amigável para desenvolvedores e pesquisadores para aprendizado de máquina, mas se tornou deliberadamente sofisticada, adicionando superclusters e serviços de cluster privados.

Nuvens de GPU de desenvolvedor e de autoatendimento

A segunda categoria são nuvens de GPU de desenvolvedor e de autoatendimento. Estas plataformas não estão competindo por contratos empresariais de bilhões de dólares. Eles estão competindo por desenvolvedores, startups, pesquisadores e equipes menores que precisam de acesso rápido à GPU, sem negociar acordos de longo prazo. A experiência do produto aqui é de autoatendimento: escolha uma GPU, crie uma instância, implante um modelo, execute um notebook, teste uma carga de trabalho ou inicie um pequeno cluster.

As marcas que cabem aqui incluem Vultr, Runpod, Civo, Lambda e Together AI. Vultr traz a computação de GPU para uma plataforma de nuvem mais ampla, com presença global e implantação de autoatendimento. Runpod conquistou seguidores leais de desenvolvedores, mantendo a experiência simples e rápida. O Civo é direcionado a desenvolvedores que preferem um ambiente que prioriza o Kubernetes. Lambda ainda oferece fortes instâncias de GPU de autoatendimento e clusters de 1 clique junto com suas ofertas empresariais. Together AI vai além do aluguel bruto de GPU para combinar inferência, ajuste fino, hospedagem de modelos e clusters dedicados em uma plataforma acessível ao desenvolvedor.

Esta categoria é importante porque nem toda equipe de IA precisa de milhares de GPUs e de um gerente de contas dedicado. Muito trabalho importante acontece na bancada de pesquisa, no estágio de protótipo de inicialização e no nível de desenvolvedor individual. Essas nuvens atendem a esse mercado e muitas vezes se transformam em contas maiores à medida que as equipes crescem.

Nuvens de IA que priorizam a inferência

A terceira categoria, cada vez mais importante, são as nuvens de IA que priorizam a inferência. O treinamento recebe manchetes dramáticas, mas a inferência é onde os produtos de IA realmente residem. Cada resposta do chatbot, conclusão do assistente de codificação, interação do agente de voz e solicitação de geração de imagem é uma inferência. E, diferentemente do treinamento, que ocorre em rajadas, a inferência ocorre o dia todo, todos os dias, para todos os usuários.

As empresas a serem observadas incluem Together AI, Groq, CoreWeave Inference, Nebius Token Factory, Crusoe Managed Inference e Nscale Serverless Inference. A Together AI construiu uma das plataformas de inferência mais claras do mercado, especialmente para modelos de código aberto e de peso aberto, ao mesmo tempo que oferece suporte para ajuste fino e clusters de GPU dedicados. Groq se destaca porque sua identidade está ligada à inferência ultrarrápida executada em sua própria arquitetura de unidade de processamento de linguagem (LPU), que inverte o paradigma tradicional da GPU. CoreWeave Inference estende a história da infraestrutura do CoreWeave para atendimento de modelo dedicado e sem servidor. Nebius Token Factory e Crusoe Managed Inference representam como os players full-stack estão adicionando camadas de inferência para monetizar sua capacidade de GPU de maneira diferente. Nscale Serverless Inference é a mudança da Nscale para um modelo sob demanda que atende sem gerenciamento de infraestrutura.

O que torna esta categoria tão convincente é a direcção económica. À medida que a IA passa de um punhado de grandes laboratórios de fronteira para milhões de aplicações de produção, a procura por infra-estruturas de inferência provavelmente diminuirá a procura de formação. As empresas que controlam a capacidade de inferência podem acabar controlando o fluxo de receitas mais durável a longo prazo.

Data centers e players com grande capacidade

A quarta categoria é a mais fisicamente fundamentada. Estas são as empresas que estão construindo e controlando o patrimônio da IA. Isso vai além das nuvens GPU no sentido tradicional. Estas empresas estão a adquirir terrenos, a assegurar contratos de energia, a conceber centros de dados, a desenvolver campi, a implementar racks de alta densidade e a competir para controlar capacidades que genuinamente não podem ser replicadas rapidamente.

As marcas que se enquadram aqui incluem Fluidstack, Applied Digital, Core Scientific, Voltage Park, Crusoe e Nscale. Algumas dessas empresas também oferecem serviços em nuvem, mas sua vantagem estratégica está fundamentalmente no comando da infraestrutura física. A Fluidstack é especializada em fornecer capacidade de cluster de GPU personalizada em grande escala e soluções personalizadas de data center para empresas e laboratórios de IA. A Applied Digital fornece infraestrutura de hospedagem para IA e computação de alto desempenho em escala. A Core Scientific fez a transição de data centers de mineração de criptografia para infraestrutura de IA. O Voltage Park está focado na capacidade de GPU em grande escala para IA e organizações de pesquisa.

Crusoe e Nscale aparecem nesta categoria e em outras, o que vai ao cerne de um dos pontos mais importantes do mercado de neocloud em geral. Estas categorias não são caixas limpas. As empresas situam-se rotineiramente em múltiplas categorias e a pressão competitiva está a empurrar a maioria delas para expandir o seu âmbito. Crusoe é um provedor de nuvem e desenvolvedor de data center. Nscale é uma plataforma em nuvem e um importante construtor de infraestrutura. As empresas que acabarão por vencer poderão ser aquelas que conseguirem abranger as quatro categorias de forma mais eficaz.

Por que o enquadramento da categoria é importante

Compreender essas categorias não é apenas um exercício acadêmico. Tem consequências reais na forma como as empresas tomam decisões de compra, na forma como os investidores avaliam o espaço e na forma como os líderes tecnológicos pensam sobre a estratégia de infraestrutura de IA.

Uma empresa focada na capacidade física está jogando um jogo fundamentalmente diferente de uma empresa que vende APIs de inferência gerenciada. Podem aparecer nos mesmos artigos sobre tecnologia e competir pelas mesmas manchetes, mas a sua economia, as relações com os clientes e a diferenciação a longo prazo parecem muito diferentes. Do ponto de vista do comprador corporativo, é importante entender qual camada você está realmente comprando antes de assinar um contrato. Algumas neoclouds estão construindo relacionamentos de plataforma de longo prazo. Outros estão oferecendo capacidade para preencher uma lacuna imediata. A categoria determina qual é qual.

O mercado da neocloud é jovem, em rápida evolução e genuinamente complicado. Novos participantes, fusões e aquisições e expansão de plataformas estão remodelando o cenário em tempo real. Mas a lógica subjacente permanece constante. A infraestrutura de IA está se tornando uma camada crítica da pilha de tecnologia, e quem controla essa camada terá enorme influência sobre como a IA é construída, implantada e monetizada.

As empresas deste mercado não são todas iguais. Prestar atenção ao que eles realmente fazem, e não apenas ao que eles se autodenominam, é como você separa aqueles que moldarão o futuro da IA ​​daqueles que foram simplesmente os primeiros a enviar um comunicado à imprensa.