A competição global de poder de computação de IA atingiu um grande ponto de viragem tecnológica! Recentemente, o Google anunciou a nova tecnologia de compressão de memória AI "TurboQuant", que atraiu grande atenção na indústria. Esta tecnologia afirma ser capaz de reduzir os requisitos de espaço do "cache de valor-chave" (KV Cache) que consome mais recursos no estágio de inferência de IA generativa para 1/6 do original sem sacrificar a precisão do modelo e aumentar a velocidade de cálculo em 8 vezes.

Esta tecnologia inovadora também suscitou preocupações em todo o mercado de que a procura de memória cairá de um precipício. As ações dos EUA relacionadas ao armazenamento, como Micron, Sandisk e Western Digital, despencaram.

O que exatamente é o TurboQuant?

Durante o processo de inferência LLM (Large Language Model), para processar textos longos, o sistema deve armazenar informações de conversas anteriores no KV Cache, que é como um "notebook portátil" de IA. À medida que a duração da conversa aumenta, as informações que precisam ser armazenadas neste notebook sobrecarregarão rapidamente a memória de alta largura de banda (HBM) da GPU AI, tornando-se o maior gargalo na operação da IA.

A principal vantagem da tecnologia TurboQuant do Google é resolver o “ruído de memória” (Overhead) produzido pela tecnologia tradicional de compressão de memória. A tecnologia consiste em duas partes principais:

PolarQuant (quantificação de coordenadas polares): Os vetores tradicionais são marcados com coordenadas XYZ e a operação é complicada. Em vez disso, o Google usa a lógica de "coordenadas polares" para simplificar orientações complexas em "raio" e "ângulo". Isto é como simplificar a informação que originalmente deveria ser rotulada como “caminhar 3 quilômetros para o leste e 4 quilômetros para o norte” para “caminhar 5 quilômetros em um ângulo de 37 graus”. Esta transformação das estruturas geométricas reduz bastante a carga de processamento de dados.


QJL (Quantized Johnson-Lindenstrauss): Este é um mecanismo de correção matemática de 1 bit extremamente simplificado. Apenas 1 bit adicional é usado para corrigir com precisão o erro residual no processo de compactação, de modo que mesmo que o modelo seja compactado para apenas 3 bits, ele ainda pode atingir "perda zero de precisão" em muitos testes de benchmark, como o LongBench.


△No modelo Llama-3.1-8B-Instruct, o TurboQuant demonstrou forte desempenho de compactação de cache KV no teste de benchmark LongBench, superando vários métodos de compactação (a largura de bits é indicada entre parênteses).

O Google optou por abrir totalmente o código-fonte desse conjunto de tecnologias que se tornaram o núcleo da competitividade. Ele não apenas otimiza a eficiência de recuperação de modelos grandes como o Gemini, mas também reduz a dependência da memória para outros modelos grandes e abre caminho para acelerar o desenvolvimento da IA ​​final.

De acordo com medições reais, no acelerador NVIDIA H100, o desempenho do TurboQuant é melhorado em até 8 vezes em comparação com a solução não compactada, e o modelo pode ser montado diretamente, sem retreinamento. Pode ser chamada de “arma mágica” para reduzir custos e aumentar a eficiência na implantação de IA.


△No acelerador NVIDIA H100, o TurboQuant mostra melhorias significativas de desempenho na computação de valores lógicos de atenção no cache de valor-chave, superando a linha de base JAX altamente otimizada em vários níveis de largura de bits.


△TurboQuant demonstra forte desempenho de recuperação, alcançando a melhor recuperação 1@k no conjunto de dados GloVe (d=200) em relação a várias linhas de base de quantização de última geração.

O CEO da Cloudflare, Matthew Prince, e outros chamaram o TurboQuant de "momento DeepSeek" do Google e acreditam que se espera que ele, como o DeepSeek, reduza significativamente os custos operacionais de IA por meio de ganhos de eficiência extremamente altos, permanecendo competitivo em termos de resultados.

Os requisitos de memória diminuirão ou criarão requisitos maiores?

Em relação à tecnologia TurboQuant, que suscitou preocupações sobre um declínio acentuado na procura de memória em todo o mercado, especialistas da indústria e instituições de investigação também deram opiniões completamente diferentes:

O analista do Wells Fargo, Andrew Rocha, observou:"Quando a janela de contexto (janela de contexto) está ficando cada vez maior, o crescimento explosivo do KV Cache era originalmente uma garantia para aumentar a demanda de memória. Mas o TurboQuant está atacando diretamente essa curva de custo. Uma vez amplamente adotados, os requisitos de especificação para capacidade de memória em data centers serão marcados por grandes questões."

No entanto, o conhecido banco de investimento Morgan Stanley e a organização de pesquisa Lynx Equity Strategies deram opiniões completamente diferentes.

O Morgan Stanley acredita que o mercado pode ter ignorado a lei económica de que “melhorias de eficiência impulsionam o crescimento agregado”.Quando o custo de memória necessário para a computação de IA for reduzido para 1/6 do original, isso causará uma explosão massiva na demanda por aplicativos de IA que anteriormente não conseguiam ficar online porque a memória era muito cara (como tradução de textos longos, geração de código complexo) e, em vez disso, preencherá ou até mesmo excederá a lacuna de memória compactada.

Este é o paradoxo de Jevon, que consiste em que quando o progresso tecnológico melhora a eficiência da utilização dos recursos (reduzindo a quantidade necessária para qualquer utilização), mas a redução dos custos leva a um aumento na procura, a velocidade do consumo de recursos aumenta em vez de diminuir.

O analista do Morgan Stanley Joseph Moore e sua equipe observaram em uma nota ao investidor divulgada na quinta-feira: “Há relatos de que o TurboQuant do Google reduzirá o uso de memória para 1/6 do original, mas isso ignora que eles estão se referindo apenas ao KV Cache, não ao uso geral da memória.

“É importante notar que ambos os modelos Gemini 3 e 2.5 Pro do Google têm janelas de contexto de 1 milhão de tokens, mas o Google revelou que testou janelas de contexto de até 10 milhões de tokens usando Gemini 1.5 Pro e obteve resultados muito bons, mas devido ao alto custo de inferência, eles acabaram não lançando o modelo”, disse Moore. “Como resultado, esperamos que, à medida que este tipo de inovação e outras tecnologias surjam, os custos diminuam e esta tecnologia seja usada para servir produtos mais inteligentes e com uso intensivo de computação”.

O Morgan Stanley destacou ainda que o TurboQuant otimiza principalmente o cache na “fase de inferência”, e não os pesos do modelo na “fase de treinamento”. Portanto, o impacto na lógica de aquisição de HBM (memória de alta largura de banda) que suporta o treinamento básico de IA é relativamente limitado.

Em contraste, o TurboQuant é mais significativo para a implantação de inteligência artificial em dispositivos terminais, como telefones celulares e laptops. Como os dispositivos móveis têm memória limitada, este tipo de tecnologia de compressão eficiente permite que modelos de IA mais poderosos sejam executados em telefones celulares, o que por sua vez estimulará uma atualização abrangente das especificações de memória em vários dispositivos terminais.

De acordo com a Lynx Equity Strategies,Embora os fornecedores de IA precisem de inovação para resolver os gargalos na inferência que surgem à medida que o comprimento do contexto do token aumenta, isso não reduzirá a demanda por memória e flash nos próximos três a cinco anos devido a restrições de oferta.