No início desta semana, uma investigação detalhou que a Apple e outros gigantes da tecnologia usaram legendas do YouTube para treinar seus modelos de inteligência artificial. Isso inclui mais de 170.000 vídeos de MKBHD, MrBeast e muito mais. A Apple então usou esse conjunto de dados para treinar seus modelos OpenELM de código aberto, lançados em abril.
No entanto, a Apple confirmou agora que o OpenELM não oferece suporte a nenhum de seus recursos de inteligência artificial ou aprendizado de máquina, incluindo Apple Intelligence.
A Apple disse que criou o modelo OpenELM para contribuir com a comunidade de pesquisa e avançar no desenvolvimento de modelos de linguagem de código aberto em grande escala. No passado, os pesquisadores da Apple descreveram o OpenELM como o “modelo de linguagem aberta de última geração”. De acordo com a Apple, o OpenELM é apenas para fins de pesquisa e não é usado para oferecer suporte a nenhum dos recursos do Apple Intelligence. O modelo é lançado como código aberto e está amplamente disponível, inclusive no site de pesquisa de aprendizado de máquina da Apple.
Como o OpenELM não é usado como parte do Apple Intelligence, isso significa que o conjunto de dados "Legendas do YouTube" não foi usado para o treinamento do Apple Intelligence. No passado, a Apple disse que os modelos Apple Intelligence são treinados “em dados licenciados, incluindo dados selecionados para aprimorar recursos específicos, bem como dados disponíveis publicamente coletados por nossos rastreadores da web”.
Por fim, a Apple também afirmou que não tem planos de construir novas versões do modelo OpenELM.
Conforme relatado pela Wired no início desta semana, empresas como Apple, Anthropic e Nvidia usaram esse conjunto de dados de “legendas do YouTube” para treinar seus modelos de inteligência artificial. Este conjunto de dados faz parte de um conjunto de dados maior chamado “ThePile” da organização sem fins lucrativos EleutherAI.