OpenAI lançou seus principais modelos de inferência o3 e o3-mini, que se tornaram seu trabalho final em 2024 e criaram um pequeno boom. Como sempre, o Twitter (x.com) ainda é o principal fórum de discussão externa. Mas há uma coisa que você ainda não percebeu. A voz do “próprio pessoal” da OpenAI aumentou significativamente desta vez – quase todos os funcionários da OpenAI com contas x estão postando para apoiar a principal plataforma de atualização de modelo da empresa.
Quanto mais os internautas navegavam pelos tweets, mais descobriam que o mundo estava cheio de engenheiros e pesquisadores da OpenAI. E desta vez não se limita mais a alguns nomes conhecidos, sai toda a equipe.
Esta situação é familiar? Os funcionários da OpenAI no Twitter se parecem com você no círculo de amigos que trabalham duro para “fazer negócios” para seu empregador?
1
Todos os membros da OpenAI criam em conjunto o evento o3:
A equipe de liderança assume a liderança em relações públicas
Escusado será dizer que o líder, Ultraman, não pôde deixar de sugerir o novo produto com “ohohoh” antes de seu lançamento e convidou todos a solicitar permissão de teste o3;
Enfatizando que o desempenho da programação do o3-mini superou o o1 com um custo significativamente reduzido, Online agradeceu aos membros da equipe pelo trabalho árduo e chamou todos que trabalham juntos de “uma das maiores alegrias da vida”;
Depois, há os vários tweets O3 de um clique e três links de colegas, que são muito animados.
Greg Brockman, cofundador e presidente da OpenAI, que acabou de terminar as “férias mais longas de sua vida” no mês passado, tem cooperado estreitamente com cada movimento da empresa e trabalhado duro na publicidade desde seu retorno.
Após o lançamento do o3, ele elogiou: O novo modelo alcançou um salto qualitativo no teste mais desafiador e atingiu diretamente um novo patamar.
O diretor de produtos, Kevin Weil, e o vice-presidente de pesquisa, Mark Chen, retuitaram o avanço do teste ARC-AGI e os tweets da equipe o3-mini, respectivamente.
Dane Stuckey, o novo diretor de segurança da informação da OpenAI, também chegou ao “um, dois, três, ligação” e lamentou que este fosse “que dia emocionante”.
Curiosamente, Stuckey registrou uma conta no Twitter há cerca de quatro anos, e foi somente em outubro deste ano que ele deixou a PalantirTech e anunciou oficialmente que se juntaria à OpenAI que começou a postar oficialmente. E ele mudou seu perfil discreto no passado e tornou-se extremamente ativo.
A equipe criativa se une para estrear
Nesta transmissão ao vivo, o jovem pesquisador chinês Hongyu Ren, como representante da equipe, apresentou em detalhes o modelo leve o3mini.
Posteriormente, ele postou no Twitter focando no excelente desempenho do o3mini, incluindo sua eficiência, custo-benefício e tempo de inferência flexível e ajustável. Vários membros principais que participaram do desenvolvimento do o3-mini também foram especialmente mencionados para homenageá-los.
Vários criadores principais também postaram respostas, dizendo que o3-mini é "um monstrinho inteligente", "extremamente rápido" e tem "desempenho incrível em matemática e codificação", e seu orgulho é evidente em suas palavras.
Na verdade, esses pesquisadores já obtiveram conquistas consideráveis na indústria. Olhando para seus antecedentes, você descobrirá que muitos deles são contribuidores importantes para o1 e o1-mini. No entanto, esta onda de anúncios oficiais de facto tornou mais pessoas conscientes deles. A julgar pela capacidade de criação de estrelas da OpenAI, vários novos KOLs na grande indústria de modelos podem estar chegando.
Colegas de todos os grupos se reuniram para elogiar uns aos outros
Desta vez, há tantos membros do "Grupo de Louvor OpenAI": contanto que você clique na conta x de um funcionário, provavelmente será capaz de seguir vários encaminhamentos de "matryoshka" e clicar nos tweets de vários outros colegas elogiando o3.
Isso nos fez pensar se o Ultraman havia estabelecido algumas metas e incluído o aumento da exposição do O3 nos KPIs dos funcionários.
Sébastien Bubeck, um conhecido magnata da informática que trabalhou na Microsoft Research por dez anos e atuou como vice-presidente de IA e um cientista notável, ingressou na OpenAI em outubro deste ano. Ele admitiu no tweet fixado que o3 e o3-mini são seus modelos favoritos até agora. As diversas avaliações do o3 são simplesmente incríveis, principalmente a pontuação de 25% no teste de matemática de ponta.
Aidan Clark, pesquisador que liderou o pré-treinamento do GPT-4o e o desenvolvimento do o1, postou cinco mensagens consecutivas, elogiando "Hongyu é tão incrível" e dizendo que o3-mini é o primeiro modelo que lhe permite realmente fazer perguntas difíceis.
Anshita Saini, membro da equipe técnica que foca no crescimento do GPT, disse que o3 é muito diferente. O conceito de toda a série o3 a fará parar e pensar sobre “como seria um mundo onde AGI fosse produzido”.
Pesquisadores analisam online
Além do apoio direto acima, alguns pesquisadores da OpenAI assumiram o papel de responder dúvidas e tentar esclarecer algumas questões compartilhando suas opiniões.
Embora o lançamento do o3 e do o3-mini tenha trazido entusiasmo à comunidade, também causou alguma polêmica e dúvidas. Algumas pessoas aplaudiram que o AGI está próximo e até foi realizado por causa dos resultados dos testes do ARC-AGI; outros desprezaram e expressaram preocupação com os altos requisitos de poder de computação e custos operacionais da o3, reclamando que este é apenas mais um produto "imagem".
A este respeito, o pesquisador de raciocínio multimodal da OpenAI, NoamBrown, escreveu: A reação do mundo exterior ao teste ARC-AGI é um tanto excessiva. Romper o benchmark ARC-AGI não significa que o modelo atingiu o nível AGI. Ele também mencionou um fenômeno comum no campo da IA: as pessoas muitas vezes pensam que um determinado teste de benchmark requer "superinteligência" para ser concluído, mas quando um modelo realmente supera esse benchmark, as pessoas ficarão desapontadas porque não atinge o nível esperado de "superinteligência".
A implicação: por favor, trate-o racionalmente e não o elogie.
O diretor de engenharia da OpenAIAPI, Sherwin Wu, concorda fortemente com isso. Sherwin lembra à comunidade: em comparação com o teste ARC-AGI, os avanços do o3 em programação e matemática são mais dignos de atenção - o nível de programação do o3 se superou e o3 pode responder corretamente a um quarto das questões matemáticas de ponta, mas não consegue resolver nenhuma delas.
Além disso, os pesquisadores da empresa Brandon McKinzie e Rhythm Garg responderam a perguntas sobre se o modelo o3 usa conjuntos de dados específicos, otimiza em áreas específicas ou ajusta artificialmente os formatos de prompt para melhorar os resultados da avaliação:
O conjunto de treinamento público arc-agi usado na avaliação é apenas uma pequena parte dos maiores dados de treinamento o3 e não pode determinar o desempenho do modelo; o3 é um modelo geral sem qualquer ajuste específico de campo; a alta pontuação ARC-AGI não depende de dicas de ajuste, mas é um reflexo natural da versatilidade do modelo e dos resultados de treinamento.
Em relação ao alto preço do o3, o pesquisador Nat McAleese explicou o seguinte: Embora o o3 seja o modelo mais caro no atual estágio de testes, ele abriu uma nova era de “computação para desempenho”. Ao aumentar a quantidade de cálculos na fase de testes, o3 melhorou o desempenho do modelo a um “nível incrível”.
Nat acredita que embora seja realmente caro no momento, à medida que a tecnologia avança, o preço dos tokens diminuirá gradualmente. Mais importante ainda, a equipe encontrou uma maneira de converter cálculos com eficiência em melhorias de desempenho, o que indica que as capacidades dos modelos de IA serão bastante melhoradas no futuro.
Finalmente, há a questão da velocidade de treinamento do modelo OpenAI. Jason Wei, que é muito influente na comunidade chinesa, disse: A atualização de o1 para o3 levou apenas três meses, provando que o novo paradigma de aprendizagem por reforço baseado na cadeia de pensamento é muito mais rápido do que o método tradicional de pré-treinamento que só pode lançar um novo modelo a cada 1-2 anos.
Até Tadao Nagasaki, presidente do OpenAI Japan Office, também apoiou: "Não lançamos o o1 em setembro? Agora iniciamos a avaliação inicial do o3!"
1
Que mensagem os negócios coletivos devem transmitir?
Desta vez, os funcionários da OpenAI endossaram coletivamente o lançamento do o3, principalmente por causa de sua alta confiança no produto. Através da interpretação de diferentes ângulos, eles esperam que o mundo exterior possa ter uma compreensão mais abrangente das conquistas revolucionárias da o3 em matemática, programação e raciocínio. A OpenAI pretende mostrar ao mundo exterior que ainda é líder em tecnologia de IA e ainda está presente em um mercado repleto de concorrentes.
Além disso, neste momento crítico em que a OpenAI enfrenta dúvidas externas e uma pressão competitiva intensificada, juntamente com a perda frequente de funcionários essenciais e o impacto do escândalo do "denunciante", as operações de todos os funcionários também dão uma sugestão de "trabalhar em conjunto para se manterem aquecidos". Eles tentaram usar este comunicado para enviar vários sinais à comunidade:
1. Novos avanços na lei de expansão
Vários pesquisadores da OpenAI apontaram que o3 e o3-mini verificaram que o aumento dos recursos computacionais, do volume de dados e dos parâmetros do modelo pode realmente trazer melhorias significativas de desempenho e romperam a limitação de "benefícios decrescentes" da lei de expansão tradicional, provando que o modelo ainda tem um enorme espaço para melhorias no futuro.
2. A inovação tecnológica não “bate na parede”
Ao encaminhar dados de teste e interpretações detalhadas, os funcionários enfatizaram que o conceito e o desempenho da série o3 romperam a imaginação de muitas pessoas sobre os limites dos modelos de IA. Não só alcançou avanços no desempenho que superaram as expectativas, mas também demonstrou uma aplicabilidade mais ampla. Comparado com os rumores sobre o “nascimento difícil” do GPT-5, a OpenAI quer provar que está abrindo outro caminho inovador.
3. A velocidade do treinamento não diminuiu
Diante de dúvidas externas sobre a velocidade de iteração dos modelos OpenAI, especialmente no contexto de uma competição global cada vez mais acirrada em IA, a rápida atualização de o1 para o3 tornou-se uma resposta clara. Isso mostra que a OpenAI tem a capacidade de romper o tradicional ciclo de desenvolvimento de pré-treinamento de 1 a 2 anos, lançar modelos de alta qualidade em uma velocidade mais rápida e estabilizar a confiança do mercado.
Olhando para trás, desde o lançamento da versão oficial do o1 até o anúncio oficial do o3, esses 12 dias de transmissão técnica ao vivo foram mais como um grande show OpenAI. Nesta época do ano passado, o evento “OpenAIisnothingwithoutitspeople” que chocou toda a rede tinha acabado de chegar ao fim. Um ano depois, não se pode dizer que o OpenAI seja ruim, mas não é mais o auge da glória que já foi durante o GPT. Depois de passar por vários altos e baixos, talvez todos os funcionários queiram trabalhar duro para tornar o OpenAI excelente novamente no final do ano.