O CEO da Qualcomm sugere que modelos de linguagem em larga escala capazes de executar 100 bilhões de parâmetros podem estar disponíveis até 2028

📅 2026-10-11

Resumo:

Algumas empresas líderes de inteligência artificial estão a promover a indústria dos telemóveis para desenvolver dispositivos que possam executar continuamente modelos de linguagem de grandes dimensões com 100 mil milhões de parâmetros, com o prazo previsto a apontar para 2028. No entanto, esta ideia enfrenta dois desafios práticos: primeiro, a execução de um modelo tão grande requer uma grande quantidade de memória e, segundo, os centros de dados de inteligência artificial estão a competir pela capacidade de produção de memória global, resultando numa oferta limitada de memória para o consumidor e em aumentos contínuos de preços.

O CEO da Qualcomm, Amon, disse em entrevista à Fireside Alpha que algumas empresas na vanguarda da indústria de inteligência artificial estão explorando telefones celulares que podem executar continuamente centenas de bilhões de modelos de parâmetros. Ele não revelou os nomes específicos dessas empresas, mas declarações relevantes mostram que as expectativas das empresas de inteligência artificial em relação aos dispositivos móveis estão mudando: no futuro, os telefones celulares podem não ser mais apenas terminais que ocasionalmente chamam serviços de IA em nuvem, mas dispositivos de computação pessoal que podem executar continuamente grandes modelos localmente e lidar ativamente com tarefas.

No entanto, a declaração de Amon foi mais sobre a descrição das metas propostas pelos clientes do setor, em vez do roteiro de produtos anunciado oficialmente pela Qualcomm. Actualmente, a Qualcomm ainda não forneceu uma solução de hardware completa que possa atingir este objectivo em 2028, nem prometeu que lançará um telemóvel comercial com capacidades correspondentes até então.

Do ponto de vista técnico, o modelo de 100 bilhões de parâmetros tem requisitos muito mais elevados para hardware de telefonia móvel do que os modelos de IA atualmente comuns em dispositivos. Os parâmetros de um modelo de linguagem grande determinam o grande número de valores que o modelo precisa salvar e chamar, e esses dados geralmente precisam ser armazenados na memória para que o processador possa acessá-los rapidamente durante a inferência.

Tome como exemplo um modelo com 100 bilhões de parâmetros. Se a quantização de 4 bits for usada, cada parâmetro teoricamente requer apenas 4 bits de armazenamento, portanto, apenas os próprios parâmetros do modelo requerem cerca de 50 GB de memória. Na operação real, o espaço também deve ser reservado para o sistema operacional, outros aplicativos, cache de contexto e dados temporários durante a inferência. Portanto, 50 GB não é a capacidade total de memória exigida por um telefone celular para executar o modelo sem problemas.

Se o modelo for quantizado ainda mais para 2 bits, cada parâmetro exigirá apenas 2 bits, e o requisito teórico de armazenamento para os parâmetros do modelo poderá ser reduzido para aproximadamente 25 GB. No entanto, esta solução ainda exige que os telefones celulares tenham uma capacidade de memória muito superior à dos produtos convencionais atuais, e a quantização de precisão extremamente baixa pode danificar significativamente a qualidade de saída do modelo, especialmente em tarefas de inferência complexas.

Deve-se observar que o número de parâmetros não determina diretamente todas as capacidades do modelo. Os dados de treinamento, arquitetura, métodos de treinamento e técnicas de inferência de diferentes modelos afetarão o desempenho final. É inteiramente possível que um modelo pequeno e otimizado supere um modelo maior em uma tarefa específica. Portanto, mesmo que o telefone celular não possa executar diretamente o modelo de 100 bilhões de parâmetros por enquanto, isso não significa que não possa fornecer uma experiência de uso real próxima à de um modelo grande.

Atualmente, ainda existe uma lacuna clara entre a configuração de memória dos smartphones e a capacidade exigida por centenas de bilhões de modelos de parâmetros. No passado, alguns telefones Android carro-chefe já forneciam 24 GB de memória LPDDR5X. No entanto, com a oferta limitada de memória e o aumento dos preços, os fabricantes de telemóveis começaram a reavaliar o valor comercial das versões com muita memória. Para os consumidores comuns, aumentar a capacidade de memória significa custos de hardware mais elevados, e é difícil para os fabricantes de telemóveis determinar se os utilizadores estão dispostos a pagar mais para executar modelos de IA locais maiores.

Isso cria uma contradição: as empresas de inteligência artificial esperam que os telefones celulares tenham capacidades de computação local cada vez mais poderosas, mas a memória necessária para atingir esse objetivo está se tornando mais cara e difícil de obter.

A oferta global de memória é escassa, o que está intimamente relacionado à rápida expansão dos data centers de inteligência artificial. As grandes empresas de tecnologia continuam a investir em servidores de IA, que requerem grandes quantidades de DRAM, memória de alta largura de banda e dispositivos de armazenamento de alta velocidade. Os fabricantes de memória também estão prestando cada vez mais atenção aos produtos relacionados à inteligência artificial com forte demanda e lucros maiores ao organizar a produção. A memória tradicional necessária para equipamentos eletrônicos de consumo está, portanto, sob pressão de fornecimento.

Embora a DRAM de baixo consumo usada em smartphones e a memória de alta largura de banda usada em aceleradores de IA sejam diferentes na estrutura do produto e nos requisitos de fabricação, elas ainda são afetadas por mudanças na alocação da capacidade de produção e na oferta e demanda do mercado em toda a indústria de semicondutores. Quanto mais forte for a procura de memória por parte da infraestrutura de IA, mais difícil será para os fabricantes de eletrónica de consumo manterem as condições anteriores em termos de preço e oferta.

Essa pressão se refletiu nos custos de fabricação de celulares. Uma análise publicada anteriormente pela empresa de pesquisa de mercado Counterpoint Research mostrou que, no segundo trimestre de 2026, os preços das memórias para smartphones aumentaram mais de 80% em relação ao trimestre anterior. Entre os telemóveis com preços diferentes, o aumento dos custos de memória tem um impacto significativo nos custos globais dos materiais.

A Counterpoint apontou que o custo da lista de materiais de telefones celulares de médio porte aumentou aproximadamente 52% ano a ano, e a memória representou aproximadamente 40% do custo geral da lista de materiais. Os telefones celulares de última geração também foram afetados, e a DRAM ultrapassou até os chips de nível de sistema para se tornar o componente individual mais caro em alguns telefones celulares emblemáticos.

Isso significa que os fabricantes de telefones celulares não só precisam considerar se têm a capacidade de configurar 50 GB ou mais de memória para modelos de 100 bilhões de parâmetros, mas também devem responder a uma pergunta mais realista: os consumidores estão dispostos a pagar por essas memórias?

Se for apenas para rodar modelos grandes, a memória do celular precisa ser aumentada dos atuais 12 GB ou 16 GB para 64 GB ou até mais, e o custo de toda a máquina pode aumentar significativamente. Aliado a processadores mais potentes, embalagens avançadas e design térmico, o preço do produto final pode ficar ainda mais distante da faixa aceitável para o consumidor comum.

A Qualcomm e a Apple estão tentando aliviar esse problema em termos de arquitetura de chips e tecnologia de empacotamento. Relatórios relacionados mencionaram que o Apple A20 Pro e a nova geração da plataforma Snapdragon da Qualcomm estão explorando designs de chips e métodos de organização de memória que são mais propícios à operação de modelos grandes, na esperança de melhorar a eficiência do acesso a dados e reduzir a sobrecarga de transmissão de dados entre o processador e a memória.

No entanto, melhorar o encapsulamento e a eficiência do acesso aos dados não significa que os requisitos de memória física desaparecerão automaticamente. Mesmo que o processador possa utilizar a memória de forma mais eficiente, o próprio modelo de 100 bilhões de parâmetros ainda precisa salvar muitos dados de parâmetros. Para tornar modelos desta escala verdadeiramente adaptáveis ​​aos telemóveis, a indústria poderá precisar de fazer mais avanços na compressão de modelos, na arquitectura de inferência e no acesso ao armazenamento.

Uma solução possível é uma tecnologia de quantificação mais radical. Ao reduzir o número de bits usados ​​por parâmetro, o modelo pode rodar em um espaço de memória menor. No entanto, a quantificação não ocorre sem custos. Para tarefas que exigem raciocínio lógico complexo, uma precisão numérica muito baixa pode levar a uma degradação significativa no desempenho do modelo. Portanto, como encontrar um equilíbrio entre o uso da memória e a qualidade do modelo se tornará uma importante direção de pesquisa para a IA final.

Outra solução é o modelo especialista híbrido, que é a arquitetura MoE. Ao contrário das arquiteturas intensivas tradicionais que exigem a chamada de todo o modelo para cada inferência, o modelo MoE seleciona parte da rede de especialistas para participar de cálculos baseados em tarefas específicas. Com um design adequado, apenas um pequeno conjunto de parâmetros no modelo precisa ser ativado cada vez que um token é processado.

Se a tecnologia de descarregamento especializado for adotada, o sistema poderá reter os especialistas atualmente necessários na DRAM e armazenar os especialistas desnecessários temporariamente na memória flash. Quando outros especialistas são necessários para o processo de inferência, os dados relevantes são lidos da memória flash para a memória.

Essa abordagem pode reduzir a quantidade de dados que o modelo deve residir na DRAM ao mesmo tempo, mas às custas de maior acesso ao armazenamento e sobrecarga de transferência de dados. As características de velocidade de acesso e latência da memória flash UFS usada em telefones celulares são significativamente diferentes da DRAM. Se o modelo lê frequentemente parâmetros da memória flash, a velocidade de inferência pode ser afetada.

A Apple também estudou anteriormente a solução de usar o armazenamento integrado do dispositivo para executar grandes modelos de linguagem. Espera-se que este tipo de tecnologia reduza a dependência da capacidade DRAM, mas se consegue atingir uma latência suficientemente baixa, um elevado rendimento e um consumo de energia aceitável nos telemóveis ainda requer uma verificação mais aprofundada.

Além disso, o funcionamento contínuo de modelos grandes também causará problemas de dissipação de calor e de vida útil da bateria. O espaço interno dos telefones celulares é limitado e eles não podem ser equipados com sistemas de refrigeração de grande escala, como computadores desktop ou servidores. Se o processador realizar inferência de IA de alta intensidade por um longo período, a temperatura do chip poderá continuar a aumentar, acionando posteriormente o mecanismo de redução de frequência, resultando em degradação do desempenho.

Esse problema é particularmente grave para agentes que precisam operar 24 horas por dia. Os chatbots tradicionais geralmente iniciam o processamento de tarefas depois que o usuário faz uma solicitação, mas a nova geração de agentes de IA pode precisar monitorar continuamente as informações, analisar o contexto e executar operações proativamente no momento apropriado. Se o telefone precisar rodar modelos grandes 24 horas por dia, não apenas a memória precisará estar disponível o tempo todo, mas o consumo de energia do processador e o consumo da bateria também deverão ser rigorosamente controlados.

Portanto, mesmo que um futuro telefone celular consiga carregar com sucesso um modelo de 100 bilhões de parâmetros, isso não significa que ele poderá continuar a funcionar na velocidade ideal. Se o modelo pode realmente residir na memória, quantas palavras ele pode processar por segundo, quanto calor gera durante a operação e quanto impacto tem na vida útil da bateria são indicadores importantes para medir o valor de uso real.

Em comparação com conectar diretamente um modelo de 100 bilhões de parâmetros a um telefone celular, uma solução mais realista pode ser executar um modelo de tamanho médio destilado e otimizado.

A destilação de modelo geralmente aproveita os recursos de um modelo grande para treinar um modelo menor, de modo que este último possa reter o desempenho do modelo grande em uma tarefa específica, tanto quanto possível, enquanto a escala de parâmetros é significativamente reduzida. A Wccftech acredita que um modelo de 20 a 30 bilhões de parâmetros devidamente destilado pode se aproximar do desempenho de um modelo de 100 bilhões de parâmetros em determinadas tarefas e, portanto, é mais adequado para se tornar a principal força da IA ​​local em futuros smartphones.

A vantagem desta solução é que ela não precisa depender de uma capacidade de memória extremamente grande e tem a oportunidade de fornecer capacidades de raciocínio bastante poderosas. Para os fabricantes de telefones celulares, em vez de simplesmente buscar quantos parâmetros podem ser acomodados, é melhor obter uma melhor experiência real com recursos de hardware limitados por meio de arquitetura de modelo, quantificação, destilação e otimização de inferência.

É claro que o desempenho de diferentes modelos varia muito, e um modelo de 20 a 30 bilhões de parâmetros não pode substituir o modelo de 100 bilhões de parâmetros em todas as tarefas. Capacidades como raciocínio complexo, experiência e processamento de contexto longo ainda dependem do treinamento e do projeto de arquitetura de modelos específicos. Mas, do ponto de vista da produtização, ser capaz de concluir a maioria das tarefas diárias com consumo e custo de energia razoáveis ​​pode ser mais valioso do que buscar uma escala pura de parâmetros.

A declaração do CEO da Qualcomm também reflete que a indústria de smartphones está em busca de novas direções de crescimento. À medida que os benefícios marginais das atualizações de hardware tradicionais diminuem gradualmente, os fabricantes de telemóveis esperam utilizar agentes de IA para redefinir a forma como os dispositivos são utilizados.

Os futuros smartphones podem não ser mais apenas dispositivos que esperam que os usuários abram aplicativos e digitem comandos, mas sim assistentes pessoais que podem compreender continuamente as necessidades, organizar tarefas e chamar diferentes serviços no âmbito da autorização do usuário. Esses sistemas exigem capacidades de raciocínio local mais fortes, bem como gerenciamento de memória mais eficiente, computação de baixo consumo de energia e mecanismos de segurança.

No entanto, ainda existe uma distância entre os objetivos da indústria e o produto final. Amon não anunciou o nome da empresa parceira específica, nem forneceu um roteiro completo de hardware ou cronograma de produção em massa. 2028 é mais adequado para ser entendido como o prazo que algumas empresas de IA esperam atingir essa capacidade, em vez da data de lançamento do produto que a Qualcomm confirmou.

A julgar pelas condições técnicas atuais, não é completamente impossível para os telefones celulares executarem centenas de bilhões de modelos de parâmetros em 2028, mas o método de implementação pode ser diferente do que as pessoas imaginam ao "carregar todos os modelos completos na memória do telefone móvel". Quantização mais agressiva, arquitetura MoE, descarregamento especializado, design de memória dedicada e destilação de modelo podem fazer parte do alcance do objetivo.

Ao mesmo tempo, a oferta global de memória e as tendências de preços afetarão diretamente a viabilidade comercial dessa direção. Se o fornecimento de DRAM de consumo for reduzido por data centers de IA por um longo período, mesmo que seja tecnicamente possível fabricar telefones celulares com 64 GB ou mais de memória, os fabricantes podem não estar dispostos a lançar tais produtos em grande escala.

Portanto, a visão da Qualcomm de um telefone móvel com 100 bilhões de parâmetros realmente precisa ser resolvida não apenas em termos de desempenho do chip, mas também no equilíbrio abrangente entre tamanho do modelo, capacidade de memória, custo de fabricação, dissipação de calor, vida útil da bateria e demanda do consumidor. Para os usuários comuns, o mais notável no futuro pode não ser se o telefone celular pode executar um modelo com 100 bilhões de parâmetros, mas se ele pode fornecer serviços locais de IA confiáveis, rápidos e verdadeiramente úteis, sem aumentar significativamente o preço ou sacrificar seriamente a vida útil da bateria.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários