Resumo:
Você acredita que a produção do primeiro chip da OpenAI realmente derrotou toda a série NVIDIA? ! Agora mesmo, o primeiro chip desenvolvido pela OpenAI, Jalapeño, entregou o primeiro lote de resultados medidos - desempenho de inferência de IA, superando completamente NVIDIA GB200 e GB300.


Decole diretamente na velocidade medida!
O Jalapeño pode cuspir 1.459 tokens em um segundo, enquanto a Nvidia GB200 só pode cuspir 535 tokens, o que é menos da metade.
Leva apenas 1,65 segundos para "Pepper" completar uma tarefa, mas leva quase 6 segundos para GB300, uma diferença total de 3,6 vezes.
O mais cruel é que mesmo que o GB300 seja forçado à sua velocidade de decodificação mais rápida, o rendimento do Jalapeño ainda é 104,3 vezes maior que ele.
O consumo nominal de energia do Jalapeño é de apenas 700W, enquanto o do GB300 é de 1400W, o que é exatamente a metade.
O famoso analista de semicondutores Dylan Patel até disse duramente: "Não foi apenas a Blackwell que foi derrubada, até o chip Rubin da Nvidia foi superado"!

Por um tempo, todo o círculo de IA explodiu. Os internautas ficaram maravilhados com o fato de o OpenAI ser tão louco que a Nvidia também foi derrotada.
A declaração do Ultraman foi dominadora, mas contida: "Fizemos um chip, é ridiculamente rápido"!


01
Uma "pimenta" derrubou o carro-chefe da Nvidia
Isso não é a OpenAI falando sobre si mesma.
SemiAnalysis foi ao laboratório para medições reais, e a conclusão que eles escreveram é——
O Jalapeño derrotou todos os chips da Nvidia, AMD e Google que eles testaram antes.
Qual é a diferença? O mais recente Vera Rubin da Nvidia consome eletricidade suficiente para alimentar quase três Jalapeños.

Durante o teste, a OpenAI selecionou três modelos públicos para execução: GPT-OSS 120B e um modelo 670B e 1T.
Esta rodada de testes abrange arquiteturas MoE de parâmetros médios a trilhões. Os resultados gerais são os seguintes:
A carga de trabalho de IA por watt aumentou de 1,5 a 1,9 vezes
Latência ponta a ponta reduzida de 1,7 a 3,6 vezes
Melhoria de desempenho de 2,1 a 4,1x em cargas de trabalho altamente interativas

Os 1.459 Token/s mencionados anteriormente foram medidos no GPT-OSS 120B.
Convertido para o intervalo de palavras, há apenas 0,69 milissegundos entre os dois Tokens.
Uma pessoa normalmente lê cerca de cinco ou seis palavras em um segundo, mas cospe 1.459 palavras em um segundo. Os olhos não conseguem acompanhar e a tela não consegue lê-los.

Verde é Jalapeño, azul é o mais forte disponível. Os três modelos são 2,7 vezes, 4,1 vezes e 3,8 vezes mais rápidos, respectivamente.
O intervalo de quatro segundos entre 1,65 segundos e 5,99 segundos pode ser tolerado no chat, mas é outra questão quando é usado em um agente, porque uma tarefa requer dezenas de etapas consecutivas, então a diferença precisa ser multiplicada.
Então foi dito que toda a rede girava 104,3 vezes.
O que isso significa exatamente é que levar o GB300 à sua velocidade de decodificação mais rápida, que é de 169 tokens por segundo, nesse ponto, a taxa de transferência do Jalapeño é 104,3 vezes maior que a dele.
Essa tendência é verdadeira para os três modelos, com o GPT-OSS atingindo 53,7 vezes e o modelo 1T atingindo 56,1 vezes.


Para o mesmo modelo, à medida que a velocidade de produção de palavras exigida aumenta, a margem inicial aumenta de 1,7 vezes para 104,3 vezes
Em outras palavras, o local onde o oponente atinge o limite e começa a ofegar é exatamente onde ele ainda navega com calma.
Se os valores de pico forem calculados com base em seus respectivos melhores pontos de trabalho, a diferença será muito mais suave, 1,9 vezes, 1,7 vezes e 1,5 vezes para os três modelos respectivamente.

O que realmente cria distância é a cena de alta interação

O eixo horizontal da imagem esquerda é a velocidade de saída da palavra e o eixo horizontal da imagem direita é o atraso da solicitação completa. O Jalapeño verde pressiona o GB200 azul em toda a curva
A semiAnalysis leva em consideração a fonte de alimentação, a dissipação de calor e a rede e depois os espalha para cada chip.
Como resultado, Jalapeño tem 1,125 quilowatts por unidade, GB200 tem 1,87 quilowatts e Vera Rubin tem 3,3 quilowatts.
Ao executar o GPT-OSS nesse calibre, o Jalapeño emite cerca de 53 milhões de tokens por megawatt por segundo, e o GB200 NVL72 emite apenas cerca de 10 milhões.

O roxo é Jalapeño, o eixo horizontal é a velocidade de interação e o eixo vertical é o número de tokens emitidos por megawatt por segundo
Em termos de custo, o custo total de propriedade por hora de chip é de US$ 1,56 para o Jalapeño, o que é quase o mesmo que US$ 1,55 para o H100, enquanto o Vera Rubin custa US$ 3,61.

Verde é Vera Rubin, roxo é Jalapeño. Depois de 200 fichas por segundo, o roxo percorreu todo o caminho até um lugar que estava fora do alcance do verde
O mais terrível é que esses resultados não mostram toda a força do Jalapeño.
Ele nem sequer permite decodificação especulativa e previsão de token, nem realiza implantação separada de pré-preenchimento e decodificação. No entanto, todos os outros chips da imagem estão executando sua própria configuração ideal e nenhuma das otimizações que deveriam ser habilitadas é deixada de fora.
SemiAnalysis estima que a decodificação especulativa por si só pode reduzir o custo por Token em mais de 2/3.

Um Jalapeño também pode executar o "Doom Slayer"
02
Em nove meses, o GPT‑Astra trabalhou até a sala de gravação
Para tal, foram necessários apenas nove meses desde o design até a saída da OpenAI. Em comparação, um prazo comum na indústria é de 18 a 36 meses.
Todos que já fizeram ASIC sabem que o trabalho mais árduo neste ciclo é a verificação. A simulação tem que ser repetida várias vezes e, se você mudar de lugar, terá que começar tudo de novo.
A razão pela qual a OpenAI pode "trapacear" é porque ela convida seu modelo mais poderoso para a sala de gravação——
O modelo que ajudou a desenvolver o Jalapeño se chama GPT-Astra, que é o GPT-6 que tem sido comentado pelo mundo exterior!


Durante todo o processo, o GPT-Astra basicamente se tornou o suporte mais forte da equipe.
Ele ajuda a explorar soluções de implementação, comprime todo o círculo de "projeto-medição-verificação" até a morte e também micro-manipula circuitos aritméticos.
Até que ponto o microgerenciamento é feito? Os números obtidos pela SemiAnalysis são que o design assistido por IA reduz a área da unidade SIMD em 8% e a área do motor de matriz em 10%.
Ao mesmo tempo, esses módulos são melhores que a primeira versão em termos de temporização e consumo de energia.

A matriz de computação está no centro, com três HBM4s de cada lado, e o topo é o chip de E/S
A matriz de cálculo principal tem cerca de 840 milímetros quadrados e o limite da máscara da máquina de litografia EUV é de 858 milímetros quadrados. Este pedaço de silício está a apenas 18 milímetros quadrados do teto físico.
Pode-se dizer que a área onde a máquina de fotolitografia pode ser utilizada para desenho está basicamente ocupada, não sobrando nada.

A linha rosa é Jalapeño, e as três colunas mais à direita são largura de banda HBM por watt, FLOPs por watt e relação potência/largura de banda de computação
Em termos de largura de banda HBM por watt, Jalapeño tem 22, o segundo colocado Rubin tem 11,1 e GB300 tem apenas 5,71. É exatamente o dobro do segundo colocado.
O FLOPs por watt é 19,1 e o Rubin é 19,4. Os dois estão quase empatados, mas o Rubin queima mais de 1.800 watts, enquanto o Jalapeño queima apenas 700 watts.
Isso está sendo executado apenas com etapas A0. O B0 já está na fábrica e seu desempenho por watt é cerca de 25% maior que o A0.
Desta forma, contando com a poderosa combinação de Codex e GPT-Astra, a OpenAI transformou três modelos de código aberto que não foram originalmente planejados em um estado de alto desempenho em apenas dois meses.
O que é ainda mais assustador é que nos módulos de MoE e de “atenção” que exigem mais desempenho, o código digitado pela IA é executado de 1,5 a 1,8 vezes mais rápido do que os principais especialistas humanos.
A IA projeta o chip, o chip executa a IA e a IA volta para otimizar a IA no chip.
Este volante, OpenAI, já está girando.


Fosso CUDA, morto?
O fosso mais profundo da NVIDIA sempre foi o CUDA.
A pilha de software acumulada nas últimas duas décadas cultivou a memória muscular de engenheiros em todo o mundo. Cada vez que o hardware é alterado, eles têm que desmontá-lo e começar tudo de novo.
SemiAnalysis fez um julgamento muito pesado no artigo, dizendo que o fosso do CUDA pode estar morto.

O motivo é a velocidade.
Eles também adicionaram uma comparação mais comovente: Rubin, da Nvidia, concluiu a fita CoWoS um mês antes de Jalapeño.
Mas até agora, os únicos resultados do Rubin que o mundo exterior pode ver são os dados das amostras de engenharia do CoreWeave. A Nvidia não coloca terceiros no laboratório para testes aleatórios como o OpenAI.
Portanto, o problema está na velocidade com que o software é iniciado. Não há nada de errado com o próprio hardware da NVIDIA.
Começar do zero dá até uma vantagem à OpenAI. Não precisa carregar bagagem histórica, e a arquitetura pode ser desenhada integralmente em uma folha de papel em branco.
A última frase do SemiAnalysis é muito gráfica——
Dizem que modelos OpenAI como GPT-5.6 Sol rodando em GPUs NVIDIA foram usados para projetar um chip que realmente ameaça o fosso CUDA. As próprias GPUs da NVIDIA estão gerando seus próprios “sucessores” em tempo real.

03
10 gigawatts, isso é apenas o começo
Jalapeño é apenas a primeira tacada na frente.
Em outubro do ano passado, a OpenAI e a Broadcom deram um grande passo e assinaram um grande pedido de cooperação para um acelerador personalizado de 10 GW.

O CEO da Ultraman e da Broadcom, Chen Fuyang, exibiu o wafer Jalapeño, com a placa de identificação dizendo "Processador de Inteligência Jalapeño"
O nível de 10 GW é quase equivalente a dez usinas nucleares operando em plena capacidade.

O gabinete principal da CPU à esquerda, o gabinete ASIC à direita, 128 chips em um gabinete, o total dos dois gabinetes é de cerca de 160 quilowatts
A propósito, a bandeja que contém a CPU se chama Katsu, o chip se chama Vindaloo Indian curry e o switch se chama grão de bico Chana. Da comida japonesa à comida indiana picante, essas pessoas realmente querem que você se lembre desse sistema.
E Jalapeño é apenas a primeira geração no roteiro, afirmou claramente a OpenAI no relatório——
A Gen2 já está em profundo desenvolvimento e a Gen3 também está tomando forma.
A produção em massa não aumentará gradualmente até 2027, e o próximo marco será de 100 megawatts.

No entanto, hoje mesmo foi revelado que o gerente do data center da OpenAI, Chris Malone, se foi!
Malone é o chefe do Stargate.
Agora, o IPO está cada vez mais próximo. Neste momento, a perda do principal comandante da infraestrutura computacional faz com que as pessoas se perguntem sobre a tendência subjacente à OpenAI.

É claro que um Jalapeño não é suficiente para derrubar a Nvidia.
Mas o verdadeiro sinal de perigo é que a OpenAI transformou modelos, chips e software em um volante acelerado.
O Jalapeño de hoje é apenas a primeira geração, seguida pela Gen2, Gen3 e um cenário de potência computacional de 10 GW. Mesmo que os principais executivos saiam, isso não poderá impedir que este caminho continue a avançar.
A Nvidia ainda está no trono.
Só que desta vez o substituto não se alinhou do lado de fora da porta, ele já havia corrido para a sala de informática.
Os rivais da Nvidia finalmente começaram a construir sua própria Nvidia.
Comentários