Resumo:
A NVIDIA lançou recentemente oficialmente a versão beta do Personal AI Router (PAIR) durante a IFA 2026. Este é um software de código aberto gratuito. Não é um roteador de hardware de rede no sentido tradicional, mas um “roteador virtual” para inferência local de IA. Ele pode descobrir automaticamente computadores compatíveis na mesma LAN, organizar o poder de computação ocioso de vários dispositivos e fornecer recursos de inferência mais suficientes para agentes de IA e tarefas locais de grandes modelos.
Uma demonstração de agente com cinco filhos anunciada pela NVIDIA também reflete o efeito dessa abordagem. Usando Hermes Desktop e Ollama, um cluster PAIR composto por três dispositivos levou 8 minutos e 48 segundos para concluir a tarefa, enquanto um único notebook RTX Spark levou 18 minutos. A NVIDIA acredita que isso mostra que a utilização do poder de computação ocioso de vários dispositivos na rede doméstica pode melhorar significativamente o rendimento da IA multitarefa local.
Um julgamento importante por trás do PAIR é que os usuários domésticos muitas vezes já possuem vários computadores com determinadas capacidades de computação, mas esses dispositivos ficam ociosos na maior parte do tempo. Dados citados pela Nvidia apontam que mais da metade das residências nos Estados Unidos possuem dois ou mais computadores, portanto, um grande número de GPUs e outros recursos computacionais não são totalmente utilizados durante uma parte considerável do dia. Para famílias com computadores para jogos, laptops e outros dispositivos de alto desempenho, o PAIR tenta transformar esses dispositivos originalmente independentes em um conjunto de recursos computacionais que podem servir em conjunto à IA local.
A equipe técnica da NVIDIA estima até que, em um caso extremo, pode haver aproximadamente 165 TFLOPS de capacidade de computação ociosa em uma residência. A pessoa responsável descreveu esse poder de computação local que não foi totalmente utilizado como “recursos de token gratuitos ociosos em casa”. No entanto, a NVIDIA espera que os usuários típicos verdadeiramente adequados para PAIR não precisem ter um tamanho de dispositivo tão exagerado. Uma configuração mais realista pode ser um notebook MacBook ou Windows, além de um PC para jogos.
Além do PAIR, a NVIDIA também anunciou desta vez para simplificar ainda mais a experiência de implantação de agentes locais de IA. Três softwares de agentes de IA, incluindo Perplexity Portable Computer, Hermes Agent e OpenClaw, fornecerão métodos de configuração local mais simples para GPUs NVIDIA. No passado, os usuários muitas vezes precisavam selecionar modelos, encontrar servidores de inferência compatíveis, ajustar parâmetros de quantização e concluir diversas configurações. A nova solução espera compactar esse processo em poucos cliques.
Entre eles, o Perplexity Portable Computer já foi capaz de rodar em GPUs NVIDIA RTX equipadas com pelo menos 24 GB de memória de vídeo e DGX Spark em sistemas Linux, e a versão para Windows também está em andamento. Ele permite que os usuários mantenham mais fluxos de trabalho no local e optem por usar modelos de nuvem quando pesquisas adicionais ou recursos de inferência mais fortes forem necessários; o sistema obterá o consentimento do usuário antes de entregar o conteúdo à nuvem.
O Agente Hermes, desenvolvido pela Nous Research, é um agente de IA de uso geral. A configuração local da versão Windows suportará a implantação do modelo com um clique. O software pode identificar automaticamente a GPU NVIDIA, selecionar o modelo e a configuração apropriados de acordo com o hardware e executá-lo por meio do llama.cpp otimizado para NVIDIA integrado. O suporte ao Linux será lançado posteriormente. Após a execução, Hermes pode chamar ferramentas, manter o contexto entre as tarefas, lembrar informações de diferentes sessões e acumular habilidades reutilizáveis com o uso.
O OpenClaw também obtém uma solução de implantação simplificada para Windows. A Nvidia disse que o OpenClaw se tornou um projeto importante no ecossistema de agentes abertos de IA, e a escala do projeto no GitHub ultrapassou 380.000 estrelas. O novo aplicativo do Windows reduzirá o limite para configuração do modelo local, tornando mais fácil para usuários com pelo menos 24 GB de memória de vídeo GPU NVIDIA RTX iniciarem assistentes de IA locais.
Para melhorar ainda mais a velocidade de resposta do agente local de IA, a NVIDIA também anunciou simultaneamente a otimização de inferência para llama.cpp e vLLM. Com base na nova otimização do kernel, decodificação especulativa mais avançada e processamento de pré-preenchimento mais rápido, o rendimento do llama.cpp na GeForce RTX 5090 pode ser aumentado em até 1,9 vezes; O desempenho do vLLM pode ser melhorado em até 1,2 vezes no RTX PRO 6000 Blackwell Workstation Edition e em até 1,4 vezes em um cluster composto por dois DGX Sparks. Essas otimizações já estão disponíveis por meio dos back-ends de inferência correspondentes e também no LM Studio e Ollama.
A Nvidia também revelou desta vez que novos pequenos computadores com IA com Windows equipados com a plataforma RTX Spark deverão ser lançados em outubro. À medida que esses hardwares locais orientados para IA, software de inferência e ferramentas de agentes de IA amadurecem gradualmente, a NVIDIA está claramente promovendo uma maneira diferente de usar a IA tradicional na nuvem: os usuários não precisam enviar todas as tarefas para data centers remotos, mas podem usar GPUs e outros dispositivos diretamente em casa para construir seu próprio ambiente de computação de IA local.
PAIR ainda está em fase Beta e o projeto foi lançado como código aberto. Os desenvolvedores podem visualizar o código-fonte, enviar problemas e participar de melhorias. A NVIDIA espera que através do PAIR, a IA local passe gradualmente de "um único computador de alto desempenho executando um modelo" para "vários dispositivos domésticos compartilhando a carga de trabalho da IA", e isso também pode se tornar um novo modelo de computação após a popularização dos agentes locais de IA.
Comentários