Musk aposta no poder de computação de IA em escala ultralarga, xAI planeja implantar mais de 1,2 milhão de GPUs NVIDIA

📅 2026-09-25

Resumo:

XAI, empresa de inteligência artificial de Elon Musk, está expandindo ainda mais a escala de seu data center e planeja implantar mais de 1,2 milhão de GPUs Nvidia AI nos próximos anos. À medida que o data center Colossus continua a se expandir, a xAI espera treinar e executar o modelo Grok de próxima geração por meio de infraestrutura de computação em larga escala e lançar uma competição mais intensa de infraestrutura de IA com concorrentes como a OpenAI.

O maior projeto atual de infraestrutura de IA da xAI é o data center Colossus localizado em Memphis, Tennessee, EUA. A construção do projeto começa em 2024, e a primeira fase, Colossus 1, já está operacional. Musk já havia chamado a Colossus de “superfábrica de poder computacional” da xAI, cujo objetivo principal é implantar centralmente um grande número de GPUs o mais rápido possível.

A Colossus inicialmente usava GPUs NVIDIA H100. A escala anunciada anteriormente da primeira fase é de cerca de 200.000 H100s. Com a expansão subsequente, o data center começou a adicionar GPUs mais avançadas da série Blackwell. As informações mais recentes mostram que, além do H100 original, o Colossus 1 também implanta cerca de 30.000 Nvidia GB200s, então o número atual de GPUs no Colossus 1 atingiu cerca de 230.000.

A segunda fase do xAI, Colossus 2, é ainda maior. O projeto também está localizado em Memphis e planeja implantar mais de 500.000 GPUs NVIDIA. De acordo com os planos atuais, o Colossus 2 se tornará um dos maiores projetos de data center de IA do mundo e seu poder computacional excederá em muito o dos supercomputadores tradicionais.

Se todos os projetos de construção do Colossus 1, Colossus 2 e subsequentes forem incluídos, o número de GPUs NVIDIA que xAI planeja usar no futuro chegará a aproximadamente 1,2 milhão ou mais. Este número não significa que todas essas GPUs foram instaladas, mas corresponde à escala geral dos futuros planos de expansão do data center da xAI.

A expansão radical do número de GPUs da xAI está diretamente relacionada ao rápido crescimento na demanda por poder de computação para treinamento de modelos de IA. A escala de parâmetros, os dados de treinamento e o processo de aprendizagem por reforço de modelos de linguagem em grande escala exigem cada vez mais recursos computacionais, e o poder computacional necessário para treinamento e inferência de modelos está evoluindo da escala dos data centers tradicionais para a escala dos clusters de supercomputação.

Nesse caso, ter um grande número de GPUs tornou-se uma base importante para as empresas de IA expandirem as capacidades de seus modelos. Musk enfatizou repetidamente que a xAI precisa expandir suas capacidades computacionais o mais rápido possível e reduzir sua dependência de plataformas de computação em nuvem de terceiros, construindo seus próprios clusters de supercomputação.

A velocidade de construção do Colossus também é uma característica importante da estratégia de infraestrutura xAI. O data center de primeiro estágio foi reformado com base em uma instalação industrial abandonada e a xAI o expandiu para um centro de treinamento de IA em grande escala com centenas de milhares de GPUs em um curto período de tempo por meio de um grande número de equipamentos pré-fabricados, construção paralela e rápida implantação de GPUs.

xAI também continua a expandir a construção de data centers e as capacidades de fornecimento de energia da Colossus. Devido ao consumo extremamente alto de energia das modernas GPUs de IA, a expansão dos data centers não envolve apenas aumentar o número de servidores. Eles também devem construir uma grande quantidade de infraestrutura de energia, refrigeração, rede e armazenamento ao mesmo tempo.

xAI já enfrentou problemas de fornecimento de energia antes. O consumo de energia do Colossus 1 atinge centenas de megawatts e, à medida que o número de GPUs aumenta ainda mais, os seus requisitos de energia também aumentam significativamente. A fim de apoiar a expansão subsequente, a xAI tem procurado novas fontes de energia e construído a correspondente infra-estrutura de geração e distribuição de energia.

À medida que as GPUs NVIDIA Blackwell e subsequentes da série Rubin entram gradualmente no mercado, o data center da xAI continuará passando por atualizações de hardware. Em comparação com o H100, a nova geração de GPU pode fornecer maior desempenho de computação de IA, mas o consumo de energia de uma única GPU também está aumentando. Portanto, os futuros grandes centros de dados de IA devem resolver os problemas de densidade computacional e fornecimento de energia ao mesmo tempo.

Musk também afirmou anteriormente que a xAI planeja aumentar significativamente a capacidade geral de energia do data center por volta de 2027 e expandir o poder de computação várias vezes em relação à escala anterior. Planos relevantes mostram que a escala de energia total dos futuros data centers da xAI pode atingir vários gigawatts ou até 10 gigawatts.

Uma infraestrutura tão grande significa que a xAI está tentando construir uma "superfábrica" ​​de IA semelhante à das grandes empresas de computação em nuvem. Servidores GPU, equipamentos de rede, sistemas de armazenamento, instalações de energia e sistemas de refrigeração líquida serão combinados em um enorme cluster de computação para treinamento e execução de modelos de IA como o Grok.

Essa estratégia também torna a competição entre xAI e OpenAI cada vez mais direta. A OpenAI também construiu data centers de IA em grande escala nos últimos anos e estabeleceu uma parceria de infraestrutura em grande escala com a NVIDIA. A NVIDIA anunciou planos para fornecer à OpenAI pelo menos 10 GW de sistemas de IA, correspondendo a milhões de GPUs, e planeja investir gradualmente até US$ 100 bilhões em OpenAI com implantação de infraestrutura.

O plano da OpenAI significa que a indústria de IA está entrando em uma nova fase com “data centers de nível gigawatt” como unidade competitiva básica. No passado, a concorrência entre empresas de IA concentrava-se mais em algoritmos de modelos, talentos e dados, mas agora a própria infraestrutura computacional tornou-se um fator importante na determinação da velocidade e escala do treinamento de modelos.

xAI opta por construir seu próprio data center Colossus em grande escala, o que permite à empresa controlar mais diretamente a implantação de GPU, estrutura de rede, software de data center e infraestrutura de treinamento. Para empresas que precisam treinar continuamente modelos em grande escala, essa abordagem pode reduzir a dependência de plataformas externas de nuvem, ao mesmo tempo que permite que as equipes de engenharia otimizem hardware e software para seus próprios modelos.

No entanto, a escala de 1,2 milhão de GPUs ainda é uma meta futura, e não o número que a xAI implantou atualmente. A velocidade de construção do data center, fornecimento de GPU, fornecimento de energia, instalações de resfriamento, equipamentos de rede e investimento de capital afetarão a velocidade final de implantação. Portanto, o número real de GPUs em execução e o tempo de conclusão ainda podem variar.

Independentemente de os números finais atingirem a escala atualmente planejada, o Colossus que está sendo construído pela xAI mostrou que a competição de infraestrutura de IA está entrando em uma nova etapa. À medida que OpenAI, Google, Meta, Microsoft e outras empresas de IA constroem data centers de nível gigawatt, a competição entre modelos de IA no futuro evoluirá em grande parte para uma competição entre escala de data center, fornecimento de energia e capacidades avançadas de aquisição de GPU.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários