Os processadores gráficos Blackwell GB300 e GB200 da NVIDIA continuam a demonstrar desempenho líder em diversas cargas de trabalho de inteligência artificial por meio de otimização técnica contínua. À medida que a nova geração de plataformas de IA continua a ser implantada em todo o mundo, o mundo exterior pode ter especulado que a NVIDIA mudará seu foco para a arquitetura Rubin. No entanto, acontece que a série Blackwell, que foi colocada em prática em inúmeros data centers, como a arquitetura Hopper do ano, ainda está liberando um potencial incrível por meio de atualizações contínuas de software. Entre eles, o GB300 continua a estabelecer novos máximos de desempenho em tarefas de computação de inteligência artificial.

De acordo com dados oficiais divulgados pela NVIDIA, a otimização contínua da plataforma Blackwell melhorou muito o desempenho geral e a relação de eficiência energética. Em apenas 3 meses, a NVIDIA aumentou o rendimento por megawatt em até 4x na mesma configuração GB200 NVL72 executando DeepSeek R1 0528 – cargas de trabalho de 1K/1K. Durante esse período, a empresa adicionou 38 otimizações importantes à plataforma Blackwell, executando mais de 250.000 configurações de simulação e consumindo um total de 1,4 milhão de horas de teste de GPU. Vale ressaltar que mais de 90% dos resultados de otimização podem ser aplicados a outros modelos de inteligência artificial, o que demonstra plenamente o compromisso da NVIDIA em manter investimentos profundos nas plataformas de IA existentes à medida que novas plataformas se tornam gradualmente mais populares.

Por outro lado, a plataforma GB300 "Blackwell Ultra" da NVIDIA continua a dominar o campo do treinamento em inteligência artificial. Ao usar 256 GPUs para executar o modelo DeepSeek-V3 671B, seu núcleo Megatron Core estabeleceu um recorde surpreendente de 1.648 Terops por GPU, alcançando um salto de desempenho de 3x em comparação com GB200 606 Terops. Usar GB300 NVL72 para pré-treinar o DeepSeek-V3 671B pode atingir uma eficiência operacional recorde mundial de 1648 Terops por GPU, permitindo que a mesma tarefa de treinamento atinja um determinado desempenho com apenas uma fração da escala de hardware. Ao mesmo tempo, o desempenho do mesmo sistema GB300 NVL72 também aumentou até 1,5 vezes nos últimos 6 meses após otimização contínua.
Além disso, a NVIDIA também lançou uma cooperação profunda com PyTorch e a comunidade de código aberto JAX para promover a implementação completa de vários resultados de otimização em sua matriz de produtos de inteligência artificial. Ao executar o modelo DeepSeek-V3 671B usando a pilha de treinamento nativa do PyTorch, TorchTitan, o rack Blackwell Ultra alcançou uma melhoria de desempenho de até 6x sem qualquer otimização inicial. A estrutura JAX alcançou um crescimento ainda mais significativo. Sua velocidade disparou para 1.025 Terops por GPU, e o rendimento de uma única GPU pode chegar a 4.082 Tokens por segundo. Em comparação com a linha de base de janeiro deste ano, alcançou um salto de desempenho de 10 vezes.





Além disso, a NVIDIA também alcançou desempenho de escalonamento de classe mundial de 256 a 1.024 GPUs em todas as estruturas convencionais para pré-treinamento. Ao atingir a escala de 1.024 GPUs, o Megatron Core pode manter uma eficiência de expansão de até 98,5%, enquanto a eficiência de expansão do TorchTitan e da estrutura JAX também mantém um nível de 97%. O componente principal que suporta esse excelente desempenho de expansão é o chip de rede escalável NVIDIA 800Gb/s integrado dentro de cada rack NVL72. Desde o treinamento de modelos até a implantação de inferências, a NVIDIA está constantemente estabelecendo novos padrões no campo da inteligência artificial. Com a plataforma Rubin já no mercado e trazendo maiores ganhos de desempenho, outros concorrentes enfrentam, sem dúvida, uma pressão considerável para alcançá-la.