Desenvolvedor transforma iPhone 17 Pro Max na segunda GPU do MacBook Pro

📅 2026-10-03

Resumo:

Um experimento realizado por um desenvolvedor mostra que conectar o iPhone 17 Pro Max a um MacBook Pro equipado com um chip M4 Pro por meio de software personalizado pode melhorar significativamente a eficiência operacional do modelo local de grande idioma. Ao executar o modelo Qwen3.8-27B, o desempenho de pré-preenchimento do sistema é melhorado em até 44%.

O pano de fundo deste experimento é que modelos de linguagem grandes têm requisitos extremamente altos de memória de vídeo e capacidade de memória do sistema. Embora o MacBook Pro equipado com o chip M4 Pro tenha 24 GB de memória unificada, ele ainda é limitado pela capacidade de memória e pelo tamanho da janela de contexto ao executar um modelo grande com 27 bilhões de níveis de parâmetros. Os desenvolvedores, portanto, tentaram usar o iPhone 17 Pro Max como um nó de computação adicional para executar modelos em conjunto com o MacBook Pro por meio da interface USB-C.

De acordo com o plano anunciado pelo desenvolvedor, o MacBook Pro é responsável por processar as tarefas de computação da camada 1 à camada 40 em cada lote de 256 tokens e transmitir os dados de ativação intermediária para o iPhone em tempo real. Posteriormente, o iPhone 17 Pro Max usa a GPU no chip A19 Pro para continuar realizando operações da camada 41 à camada 64, enquanto o Mac começa a processar o próximo lote de dados simultaneamente. Por meio dessa divisão de trabalho em pipeline, dois dispositivos podem participar do processo de inferência do modelo ao mesmo tempo.

Resultados experimentais mostram que, em comparação com a execução do modelo apenas no MacBook Pro, a velocidade de pré-preenchimento melhorou significativamente após o lançamento do iPhone. Na janela de contexto de 8K, a velocidade de processamento aumenta de 132 Tokens por segundo para 177 Tokens, um aumento de 35%; na janela de contexto de 16K, o desempenho aumenta de 109 Tokens por segundo para 157 Tokens, um aumento de 44%; no cenário de janela de contexto de 32K, a velocidade de processamento aumenta de 101 Tokens por segundo para 130 Tokens, um aumento de aproximadamente 29%.

Além da computação colaborativa da GPU, o mecanismo de rede neural do chip A19 Pro também participa de algumas tarefas. Os desenvolvedores afirmaram que cada contexto histórico de 16K será convertido em um modelo de rede neural dedicado para processamento. Na escala de contexto de 140.000 tokens, o tempo de gravação de um único token é reduzido de 279 milissegundos quando se depende apenas da GPU para 176 milissegundos, melhorando ainda mais a eficiência operacional em cenários de contexto longo.

No entanto, esta solução tem limitações. Os desenvolvedores apontaram que o iPhone ajuda principalmente a melhorar o desempenho do estágio de pré-preenchimento, enquanto em tarefas de geração de texto abaixo de 64K, a maior parte do trabalho real de raciocínio ainda é feita principalmente pelo Mac. Além disso, esta solução requer suporte de software especialmente desenvolvido e atualmente não é adequada para implantação direta por usuários comuns.

No entanto, este experimento demonstra o potencial dos dispositivos Apple voltados para o consumidor na computação local de IA. À medida que o desempenho dos chips móveis continua a melhorar, um sistema de computação colaborativa mais flexível poderá ser formado entre smartphones, tablets e computadores pessoais no futuro, reduzindo assim a dependência de uma configuração de hardware de dispositivo único para executar grandes modelos de inteligência artificial.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários