Resumo:
De acordo com o analista da cadeia de suprimentos Ming-Chi Kuo, o projeto do acelerador de IA “Rubin CPX” da NVIDIA, anteriormente arquivado, foi reiniciado e a arquitetura de memória foi redesenhada. Este produto foi originalmente planejado para ser equipado com memória de vídeo GDDR7 de 128 GB, mas agora está equipado com memória de alta largura de banda HBM4 de 168 GB.

A Nvidia anunciou no final do ano passado que planejava desenvolver um acelerador dedicado baseado na família de GPUs Rubin, principalmente para cargas de trabalho de inteligência artificial de agentes em grande escala. Depois que o projeto foi anunciado, foi relatado que ele foi temporariamente arquivado, mas a Nvidia parece ter concluído o replanejamento. O Rubin CPX será implantado em racks independentes, cada rack pode ser configurado com 64 a 256 GPUs CPX independentes.
Diferentemente das GPUs Rubin convencionais responsáveis por tarefas de decodificação, as GPUs CPX são usadas principalmente para o estágio de "pré-preenchimento" no processo de inferência de grandes modelos de linguagem e são responsáveis pelo processamento do contexto de entrada e do cache KV. A NVIDIA está tentando separar as tarefas de pré-preenchimento e decodificação, com a GPU CPX cuidando do trabalho de pré-preenchimento e, em seguida, a GPU Rubin regular cuidando da decodificação, melhorando assim a eficiência geral de inferência.
Uma bandeja de rack equipada com 8 GPUs CPX pode lidar com até 1,34 TB de dados de pré-preenchimento de contexto longo e cache KV relacionado, todos contando com memória HBM4. O HBM4 pode fornecer maior largura de banda de memória, ajudando a acelerar o processamento de dados de contexto longos. Como o design anterior não exigia HBM4 integrado, a Nvidia também deve redesenhar o pacote do chip e espera-se que use a tecnologia de pacote avançado CoWoS-S ou CoWoS-L da TSMC.
Em termos de desempenho computacional, o Rubin CPX adota um design de chip monolítico e pode fornecer 30 gigaflops de desempenho computacional NVFP4, ou 30 PFLOPS. O chip também integra 4 mecanismos de codificação de vídeo NVENC e 4 mecanismos de decodificação de vídeo NVDEC, permitindo concluir cargas de trabalho relacionadas a multimídia mais eficientes sem depender de processadores externos.
À medida que a escala de parâmetros de grandes modelos de linguagem se aproxima do nível de trilhões, espera-se que a transferência de tarefas de pré-preenchimento e tarefas de decodificação para diferentes racks aumente significativamente a velocidade de geração e entrega de tokens. A Nvidia também recomenda manter uma proporção de 1:1 de GPUs CPX para GPUs Rubin regulares no rack de decodificação.
Comentários