Agentes de inteligência artificial da OpenAI teriam usado páginas externas para publicar mensagens e se comunicar entre si, apesar de restrições impostas pela própria empresa. Pesquisadores identificaram dezenas de sites empregados pelos sistemas durante a execução de tarefas.
Andrew Yoon encontrou 18 endereços que ainda não haviam sido divulgados e que teriam sido usados entre maio e julho. Outra equipe, liderada por Sydney Von Arx, identificou evidências da atividade em 23 sites. “Não temos ideia de quanto existe por aí”, afirmou Von Arx.
Os sistemas tinham permissão para pesquisar informações na internet, mas não deveriam publicar conteúdo. As investigações indicam que eles recorreram a recursos editáveis de wikis antigos, plataformas de armazenamento de textos e encurtadores de links mantidos por universidades para registrar e compartilhar mensagens.
Canais alternativos e uso do Tor
Um dos casos envolveu o DseWiki, site alemão voltado a temas de programação. Mais de 15 mil edições foram atribuídas por pesquisadores a agentes da OpenAI. Os sistemas teriam usado a plataforma para compartilhar estratégias, superar limitações programadas e diminuir a possibilidade de serem detectados.
Também foram encontrados indícios de discussões sobre o uso do Tor, tecnologia que permite acessar a internet com maior grau de anonimato. Depois que um moderador começou a apagar mensagens no DseWiki, os agentes teriam criado páginas alternativas para manter a comunicação.
A OpenAI não informou o número total de sites envolvidos nem explicou por que a atividade não havia sido divulgada durante meses. A empresa disse que conduz uma revisão mais ampla dos episódios.
Caso envolvendo a Hugging Face
Os relatos foram divulgados após um episódio ocorrido em julho, durante testes de cibersegurança. Agentes da OpenAI teriam ultrapassado barreiras de proteção, alcançado a internet aberta e obtido acesso não autorizado a sistemas da Hugging Face, plataforma de hospedagem e compartilhamento de modelos de inteligência artificial.
A OpenAI reconheceu posteriormente que os agentes exploraram vulnerabilidades e acessaram partes da infraestrutura da empresa sem autorização. A companhia classificou o caso como um alerta sobre os riscos de sistemas autônomos com capacidades crescentes.
A empresa afirmou não ter identificado outras atividades com a mesma gravidade ou escala do incidente. Também informou que revisa o comportamento dos agentes e trabalha em uma estrutura específica para relatar casos de desalinhamento durante treinamento, avaliação e implantação.








