Pesquisadores independentes identificaram agentes da OpenAI usando mais de dez sites que não haviam sido divulgados anteriormente para trocar mensagens não autorizadas no início deste ano. O comportamento não foi classificado como invasão cibernética, mas envolveu o contorno de restrições impostas aos próprios agentes.
As estimativas variam. Andrew Yoon, da organização sem fins lucrativos CivAI, afirmou ter contabilizado 18 sites usados entre maio e julho. Sydney Von Arx disse que seu grupo encontrou indícios confiáveis em 23 sites não mencionados anteriormente. Kenneth Russell DeGraff afirmou ter localizado informações em pelo menos dez páginas.
Apesar das diferenças, os investigadores ouvidos concordaram que a quantidade de sites afetados era superior a dez. A OpenAI não informou quantas páginas foram usadas nem explicou por que manteve a atividade em segredo durante meses.
Como os pesquisadores localizaram as mensagens
Seis investigadores ou grupos independentes analisaram a atividade. Parte das conclusões foi publicada nas redes sociais, enquanto outras foram compartilhadas em caráter privado. Os métodos incluíram a comparação de sequências de dados deixadas em um site colaborativo em alemão com sequências idênticas publicadas em outras páginas no mesmo período.
Também foram analisados nomes de usuários semelhantes ou iguais e atividades relacionadas às mesmas perguntas demográficas pouco comuns, incluindo consultas sobre a incidência de câncer no Estado de Iowa. Em alguns casos, os investigadores associaram os registros a endereços de protocolo de internet ligados à infraestrutura do Microsoft Azure, que às vezes é usada pela OpenAI.
A maior parte dos sites identificados incluía páginas colaborativas, serviços de armazenamento de textos e encurtadores de links administrados pela Universidade Vanderbilt, no Tennessee, e pela Universidade de Toronto, no Canadá. A Universidade Vanderbilt não respondeu aos pedidos de comentário. A Universidade de Toronto informou que investigava o caso.
Entre os outros endereços estavam um site colaborativo voltado à química do programa americano Advanced Placement, criado em 2008 por um professor do ensino médio de Massachusetts; duas páginas pessoais de profissionais poloneses de tecnologia; sites sobre jogos para pessoas que gostam de exercitar o cérebro; e um site amador dedicado a programas de edição de texto.
Resposta da OpenAI
A empresa afirmou que realiza uma análise mais ampla da atividade dos agentes e que, até o momento, não identificou outra ação comparável à gravidade ou à escala do caso envolvendo o repositório de código aberto Hugging Face, que sofreu uma invasão em julho.
A OpenAI também informou que prepara uma estrutura para relatar casos de desalinhamento durante o treinamento, a avaliação e a implementação de modelos de inteligência artificial. A empresa disse que divulgará essa estrutura em breve.
Pesquisadores que encontraram os primeiros indícios afirmam que os agentes podem ter recebido a tarefa de responder a perguntas complexas de pesquisa. As instruções permitiriam apenas consultas na internet, sem publicação de conteúdo. Ainda assim, os agentes teriam explorado particularidades de sites colaborativos antigos e de páginas que aceitavam alterações por comandos fora do padrão para deixar mensagens entre si.
“Se esses modelos receberam a instrução de apenas ler, eles precisaram encontrar formas engenhosas de deixar informações para trás”, afirmou Kenneth Russell DeGraff.
Helmut Leitner, desenvolvedor aposentado que fornece hospedagem e programas para seis dos sites colaborativos afetados, disse que a OpenAI não havia entrado em contato. Segundo ele, o administrador do DseWiki, site colaborativo em alemão identificado inicialmente pelo grupo de Von Arx, passou horas removendo os vestígios da atividade.
Leitner afirmou que não se deveria culpar a inteligência artificial pelo episódio. Para ele, a responsabilidade é das pessoas e organizações que estão por trás da tecnologia.







