Resumo:
No início de maio deste ano, um vídeo de cinco segundos de X se tornou viral. Esta é uma transmissão da Liga Coreana de Beisebol Profissional, os Hanwha Eagles jogam contra os Doosan Bears. A câmera focalizou uma mulher na arquibancada vestindo uma blusa branca e jeans com as pernas cruzadas. A certa altura, ela pareceu suspirar e desviou o olhar, parecendo insatisfeita com o jogo.

A legenda do vídeo é "Mulheres Coreanas Comuns". Até a publicação deste artigo, o vídeo foi reproduzido 15,25 milhões de vezes|Fonte do vídeo: X @kangminlee
Mas logo um grupo de fãs veteranos percebeu que algo estava errado. O placar dizia que o batedor era Cho Inseong, mas Cho Inseong se aposentou em 2017 e agora é treinador da Doosan.
Além disso, o slogan de torcida nas arquibancadas tem uma palavra a mais do que o slogan oficial dos Doosan Bears, que parece ser uma tradução direta e literal da IA. Quanto a esta transmissão, os comentários foram feitos com um sotaque americano padrão, o que também era muito suspeito.
Essa mulher não existe, ela foi gerada pela IA. Mas o vídeo não desapareceu depois de exposto. Em vez disso, tornou-se um modelo. Todos colocaram seus rostos na mesma tela de transmissão, criando uma imagem sua capturada pela câmera do estádio, que rapidamente se tornou popular nas redes sociais.

"Eu mesmo capturado pela câmera do estádio" rapidamente se tornou um modelo popular|Fonte da foto: RADII
Cada vez que os recursos de imagem de IA são aprimorados, quase sempre haverá um sucesso popular. Por exemplo, em março de 2025, o GPT-4o foi capaz de fazer desenhos e a tela foi preenchida com fotos redesenhadas no estilo das animações Ghibli; no final de agosto, foi lançada a Nano Banana do Google. A maneira preferida de jogar era transformar selfies em figuras que eram colocadas na mesa do computador. Os usuários geraram mais de 200 milhões de fotos em duas semanas.
Os itens populares são alterados a cada vez, e a maioria deles é baseada na jogabilidade "coloque-se dentro". Mas desta vez na quadra foi exposta uma sequência que antes não era tão óbvia: primeiro, uma beldade inexistente enganou dezenas de milhões de pessoas, e depois desenvolveu um template que todos podem jogar.
A beleza não é um papel coadjuvante que aparece acidentalmente na cena, ela é mais como um valor padrão
.Esse padrão antecede a IA em meio século. Em 1973, nos primórdios da digitalização de imagens, um grupo de engenheiros quis testar uma nova tecnologia de imagem e também escolheu uma bela mulher.
01
A primeira-dama da Internet
Lena Soderberg começou sua carreira como modelo impressa em Chicago, Illinois. Ela já havia se mudado da Suécia para os Estados Unidos como au pair. Em 1972, ela posou para a página central da edição de novembro da revista Playboy. Essa edição da Playboy vendeu mais de 7,16 milhões de cópias, tornando-se a edição mais vendida da revista.
A maioria das pessoas que estudaram processamento digital de imagens já a viu: usando um chapéu de abas largas, ombros nus e olhando de soslaio para a câmera. Ao longo das décadas, inúmeros algoritmos de compressão e processamento de imagens foram testados nesta face.

Lena Soderberg é a primeira-dama do ciberespaço | Fonte da imagem: SIPI IMAGE DATABASE
Em 1973, pesquisadores do Instituto de Processamento e Imagem de Sinais da Universidade do Sul da Califórnia estavam lutando para encontrar uma nova imagem para um trabalho de pesquisa. Eles esgotaram seu estoque habitual de imagens de teste. Naquele momento, um colega teria entrado com a edição de novembro de 1972 da Playboy. Vendo a situação difícil dos pesquisadores, ele rasgou uma tira de 5,12 polegadas da parte superior da inserção central e colocou-a no scanner.
Desde então,
esta imagem tem sido amplamente utilizada na comunidade de processamento de imagens e até se tornou a imagem de teste padrão do setor
.Em 1996, David Munson, editor-chefe do IEEE Transactions on Image Processing, escreveu um pequeno artigo explicando como essa imagem digitalizada aleatoriamente se tornou um padrão da indústria. Ele deu duas razões. O primeiro é técnico. Esta imagem possui todos os detalhes, áreas planas, sombras e texturas, por isso é adequada para testar algoritmos. O segundo artigo está mais de acordo com a natureza humana:
Esta é a foto de uma mulher atraente. Não é surpreendente que um círculo de pesquisa dominado por homens se sinta atraído por ela
.Dada a origem desta imagem, a sua utilização gerou controvérsia. Em 1991, a Playboy descobriu a imagem na capa de uma revista acadêmica, enviou uma carta reivindicando direitos autorais e acabou deixando-a de lado, permitindo que continuasse a ser usada em pesquisas. O vice-presidente de novas mídias da empresa disse que, como se tornou um fenômeno, é melhor aproveitar.
Há também algumas vozes diferentes dentro da comunidade de pesquisa em processamento de imagens. Eles observaram que os engenheiros não deveriam usar material de qualquer publicação que pudesse ser visto como humilhante para as mulheres.
Até a própria Lena afirmou no documentário "Losing Lena" que espera parar de usar esta imagem.

No documentário, a própria Lena mostra a famosa foto sua tirada há mais de 50 anos | Fonte da imagem: IMDB
Como resultado, a partir de 1º de abril de 2024, a IEEE Computer Society não aceitará mais artigos que utilizem esta imagem.
Cinquenta e um anos se passaram desde aquela verificação
.02
Rosto médio
Agora, as questões do teste no círculo técnico foram alteradas há muito tempo.
A IA não consegue beber um copo cheio de vinho tinto. O nível do líquido no copo pára sempre no meio. Quando a IA desenha um relógio, os ponteiros sempre param às 10h10. O motivo é o mesmo: a maioria das fotos de vinho tinto na Internet não são de copos cheios, e a convenção em anúncios de relógios é exibi-los às 10h10. O modelo irá replicar a distribuição dos dados de treinamento e não poderá se livrar da inércia dos dados.

A explicação mais popular para o motivo pelo qual os anúncios de relógio sempre param às 10h10 é que parece um "sorriso alegre", mas antes da década de 1950, era mais comum parar às 8h20 | Fonte da imagem: Reddit
Vinho tinto e relógios são evidências de que “os modelos não são bons o suficiente”. Mas quando se trata de mulheres bonitas a situação é diferente. A inércia “dela” está alinhada com a estética das pessoas.
Em 1990, as psicólogas Judith Langlois e Lori Roggman conduziram um experimento: calcularam matematicamente a média de um lote de rostos para sintetizar um novo rosto e depois pediram às pessoas que o avaliassem. Como resultado, a face sintética é mais atraente do que quase todas as faces reais envolvidas na síntese, e quanto mais faces envolvidas na média, melhor será a aparência da face sintética. Este efeito é válido tanto para rostos masculinos como femininos e para diferentes grupos étnicos.
O título do artigo é chamado simplesmente de
"Rostos atraentes são apenas medianos"
.Observações semelhantes ocorreram anteriormente. Em 1877, alguém escreveu a Darwin e disse-lhe que, ao sobrepor dois retratos de uma senhora usando um estereoscópio, o rosto resultante seria cada vez mais bonito.
A essência do modelo generativo é, na verdade, aprender uma distribuição de dados e, em seguida, amostrar próximo ao centro da distribuição. Em outras palavras, o modelo está programado para desenhar rostos comuns, e os rostos comuns são o que os humanos consideram bonitos.
A psicologia humana combinada com os princípios da máquina tornou-se a base técnica para a beleza como valor padrão da IA
.Um estudo de 2023 da Universidade Nacional Australiana levou esta colisão ao extremo. Os psicólogos descobriram que os rostos brancos gerados pela IA foram julgados como “reais” pelos participantes experimentais com mais frequência do que os rostos brancos reais. Os pesquisadores chamam isso de "hiper-realismo da IA", explicando que os dados de treinamento são principalmente de pessoas brancas, e os rostos gerados pelo modelo estão mais próximos da média desse grupo, e serão percebidos como mais típicos e mais parecidos com pessoas reais.
Depois que o experimento de Langlois foi publicado, ele recebeu uma crítica: o rosto sintético parece bom apenas porque as manchas e manchas na pele são facilmente apagadas durante a média. Essa crítica era metodológica em 1990.
Mas hoje parece uma profecia.
A característica mais típica das belezas da IA é a pele excessivamente lisa. Mais de três décadas depois, as organizações de verificação de factos estão a ensinar as pessoas a identificar imagens de IA, e uma das falhas listadas é a pele excessivamente lisa. Esse artefato estatístico apontado pelos críticos há mais de três décadas caracteriza as belezas da IA de 2025.
03
Ovo de gesso
Lena foi selecionada em um laboratório. O valor padrão de hoje é aumentado a partir dos dados.
No final de 2022, a função "Magic Avatar" do aplicativo de edição de fotos Lensa de repente se tornou popular: carregue algumas selfies e a IA gerará uma centena de retratos de estilos diferentes para você. Melissa Heikkilä, repórter de IA do MIT Technology Review, também o usou para gerar 100 avatares dela mesma, 16 dos quais estavam em topless e 14 com roupas mínimas e poses sensuais. E todos os seus colegas do sexo masculino têm astronautas, exploradores e inventores. Nenhum deles deu nenhuma dica ao modelo durante esse processo.

Imagem gerada por Melissa via Lensa|Fonte da imagem: MIT TECHNOLOGE REVIEW
Melissa explicou em seu artigo que a modelo por trás disso foi treinada com fotos capturadas da Internet, e
a Internet já está cheia de fotos de mulheres seminuas. Isso faz com que o modelo gere "mulheres seminuas" como valor padrão
.Então, a inércia comportamental do usuário continuará a impulsionar essa tendência. Cada geração, salvamento e encaminhamento é um voto. Um estudo de 2025 contou mudanças de conteúdo na comunidade de imagens de IA Civitai: a proporção de imagens NSFW (voltadas para adultos) aumentou de 41% em janeiro de 2023 para 80% em dezembro de 2024.
Finalmente, o fabricante escreverá esses votos no modelo. Para permitir que o modelo de imagem gere imagens mais agradáveis, os fabricantes treinarão um “pontuador”, que é tecnicamente chamado de modelo de recompensa ou pontuador estético. Seu trabalho é aprender quais imagens as pessoas consideram bonitas e, em seguida, usar esse padrão para treinar o modelo: ir mais na direção com pontuação alta e ir menos na direção com pontuação baixa.
Um dos marcadores mais comumente usados é chamado PickScore. Seus dados de treinamento vêm de uma aplicação web: o usuário escreve uma palavra de prompt, o sistema fornece duas imagens e o usuário escolhe a que mais gosta.
Esses dados serão revisados e os usuários que geram conteúdo NSFW serão eliminados, mas ainda há muitas palavras de prompt NSFW misturadas. Um artigo de 2024 que estuda modelos de recompensa descobriu que usar PickScore para ajustar o modelo,
mesmo que as palavras de prompt não tenham nada a ver com sexo, o modelo desenhará mais imagens NSFW
.Uma imagem então aparece: o revisor de conteúdo na recepção está interceptando, mas o apontador na retaguarda está recuando. As demos oficiais da fabricante nunca apresentam belezas NSFW, e a política de geração é muito rígida. Mas, como todos sabemos, os grandes modelos atuais não são totalmente controláveis. Ele foi treinado pelo gosto do usuário, e o gosto do usuário foi muito longe na inércia.
Na década de 1930, o etólogo holandês Niko Tinbergen observou uma espécie de gaivota. Esta ave põe ovos pequenos, azul-claros com manchas cinzentas. Mas quando ele colocava enormes ovos de gesso azuis brilhantes com pontos pretos ao lado do ninho, os pássaros abandonavam seus próprios ovos e subiam nos ovos de gesso para chocá-los. Ele chamou essas imitações exageradas, que são mais atraentes do que as reais, de "estimulação supernormal".

Niko Tinbergen pinta ovos durante uma expedição ao ar livre | academia
O rosto humano também tem uma estimulação extraordinária e leva o conceito de que “a média é o mais bonito” um passo adiante. Em 1994, David Perrett e outros publicaram um estudo na Nature: um grupo dos rostos mais bonitos foi sintetizado para ser mais simpático do que o rosto médio de todas as pessoas; e se a diferença entre ela e a face média fosse ampliada em 50%, a pontuação seria ainda maior. Os sujeitos japoneses e os brancos escolheram a mesma direção.
Entre as principais empresas de IA, pelo menos uma transformou diretamente essa psicologia em um recurso de produto. A geração de imagens de Grok possui quatro modos, um dos quais é chamado Spicy. Quando ativada, a filtragem de conteúdo será flexibilizada, permitindo a geração de conteúdos sugestivos e nudez parcial, e está aberta apenas para usuários pagantes.
Em janeiro de 2026, os usuários descobriram que podiam enviar fotos de qualquer pessoa para "despir digitalmente" Grok. As vítimas incluíam crianças e muitos governos intervieram para exercer pressão. X respondeu limitando a geração geral de imagens a um recurso pago.
O porta-voz do primeiro-ministro britânico comentou: Esta é apenas uma função de geração de imagens ilegais, transformadas num serviço pago.
A IA se transforma no grupo de pessoas que clicam em "Curtir" com mais frequência
. Em 1973, esse grupo era um laboratório predominantemente masculino. Hoje, são os usuários que mais clicam, mais encaminham e mais salvam. A preferência das pessoas pela beleza tem uma base biológica. Bebês de dois a três meses olharão por mais tempo para rostos considerados atraentes pelos adultos.Lena, a primeira-dama da Internet, foi um acidente. O padrão atual é que o modelo cresça a partir do centro dos dados. Os cliques do usuário levaram-no cada vez mais longe e, finalmente, alguém colocou um preço nisso.
As características estatísticas do modelo de geração de IA, as preferências estéticas humanas para o "rosto médio", bem como os cliques dos usuários e os incentivos comerciais formam um ciclo de feedback. Eles são independentes um do outro, mas juntos apontam na mesma direção, tornando-se hoje nossa opção padrão de consumo de conteúdo.
Comentários