Resumo:
Afetada pelo fornecimento contínuo e restrito de DRAM, a indústria de IA está mudando de “capacidade de computação limitada” para “memória limitada”. Segundo relatos, o Google começou a desmontar servidores desativados, reciclar os módulos de memória DDR4 que ainda podem ser usados e reutilizá-los em alguns servidores de IA recém-construídos, estabelecendo gradualmente uma cadeia de fornecimento de reciclagem de memória interna.

Nikhil Cherian, diretor sênior de infraestrutura da cadeia de suprimentos do Google, revelou recentemente em um fórum de cúpula que a memória de alto desempenho atualmente representa cerca de 75% do custo da lista de materiais de um servidor de IA. Para superar o gargalo de memória, o Google está promovendo soluções em nível de software e hardware, incluindo o desmantelamento de servidores desativados e a reciclagem de componentes utilizáveis.
O Google até projetou adaptadores de hardware especialmente para permitir que gerações anteriores de soluções de memória, como DDR4, sejam conectadas a servidores de IA de nova geração. Cherian também admitiu que o Google repatriará especificamente alguns servidores aposentados apenas para remover os módulos de memória DDR4.
Ao mesmo tempo, o Google também continua a otimizar a biblioteca de funções subjacente, a arquitetura do modelo e a tecnologia de compactação de cache KV para reduzir a capacidade de memória necessária por unidade de capacidade de computação.
O Google lançou duas versões do TPU ASIC este ano, das quais o TPU8t é usado principalmente para treinamento de modelos de IA, enquanto o TPU8i é otimizado para tarefas de inferência. Para eliminar gargalos de desempenho, o TPU8i adota um design de memória multicamadas altamente personalizado.
Cada chip TPU 8i está equipado com 288 GB de memória HBM3e, que pode fornecer largura de banda de memória ultra-alta de 8,6 TB por segundo. O chip também integra 384 MB de SRAM no chip para armazenar um cache de valor-chave ativo para evitar acesso frequente à memória externa do sistema.
Na parte do host do servidor, o servidor TPU 8i cancela completamente o processador principal x86 tradicional e usa o processador Axion personalizado do Google baseado na arquitetura Arm. O processador Axion depende da arquitetura de memória DDR5 de alta velocidade e é o principal responsável por tarefas em nível de host, como pré-processamento de dados.
No entanto, com base na última declaração de Cherian, o Google parece ter usado memória DDR4 mais antiga em alguns novos servidores de IA para substituir os módulos DDR5 que originalmente deveriam estar equipados. A gama específica de servidores e o número de módulos DDR4 envolvidos ainda não foram divulgados.
Comentários