O pesquisador britânico Jacob Coxon anunciou, nesta terça-feira (8), que deixou a Anthropic após trabalhar também na OpenAI. Em uma publicação no X, ele afirmou que as duas empresas avançam de maneira irresponsável em direção a sistemas de inteligência artificial capazes de se aprimorar sozinhos e disse que essa corrida representa um risco para a humanidade.
Coxon trabalhou durante três anos com pesquisas de pré-treinamento, etapa em que modelos de IA aprendem padrões a partir de grandes volumes de dados. Ele começou na OpenAI e, neste ano, foi para a Anthropic por considerar que a empresa tinha uma abordagem mais cuidadosa sobre segurança. Segundo o pesquisador, essa preocupação não foi suficiente para interromper a competição entre os grandes laboratórios.
“Hoje pedi demissão da Anthropic. Passei os últimos três anos realizando pesquisas sobre pré-treinamento tanto na OpenAI quanto na Anthropic”, escreveu Coxon. Ele também afirmou que as empresas estariam correndo em direção à superinteligência com capacidade de autoaperfeiçoamento.
Risco de autoaperfeiçoamento
O chamado autoaperfeiçoamento recursivo descreve um cenário hipotético em que uma IA avançada participa da criação de versões mais capazes de si mesma. Nesse processo, o sistema poderia ajudar a projetar, testar e aprimorar sua própria sucessora, acelerando o desenvolvimento em um ritmo difícil de prever.
A preocupação de Coxon é que o avanço das capacidades desses sistemas supere a capacidade humana de compreender seu comportamento e estabelecer mecanismos de segurança. Para ele, uma IA capaz de superar os seres humanos não deveria ser desenvolvida sem intervenção governamental ou uma desaceleração coordenada do setor.
O pesquisador também afirmou que, dentro da Anthropic, há compreensão sobre os riscos, mas pressão para que a empresa não fique atrás da concorrência. Na OpenAI, segundo ele, muitos ainda não teriam assimilado completamente o que estaria em jogo para a civilização.
Avaliação de pesquisador da Anthropic
Evan Hubinger, pesquisador de segurança e alinhamento da Anthropic, concordou publicamente com parte das críticas. Ele escreveu que acredita que a IA poderia matar todos os seres humanos e estimou uma chance superior a 10% de isso ocorrer na próxima década. Hubinger ressaltou, porém, que considera baixo o risco dos modelos atuais.
A preocupação dele está relacionada ao surgimento de uma superinteligência por meio do autoaperfeiçoamento recursivo, processo que, em sua avaliação, estaria ocorrendo mais rapidamente do que o esperado. Hubinger disse ainda que a Anthropic tenta lidar com o problema, mas não possui um plano para resolver o alinhamento de uma superinteligência.
A Anthropic alterou, em fevereiro, sua Responsible Scaling Policy, ou Política de Escalonamento Responsável. A empresa retirou o compromisso de não treinar ou lançar determinados sistemas quando não conseguisse garantir antecipadamente a suficiência das medidas de segurança.
A mudança foi justificada pela possibilidade de que uma interrupção unilateral deixasse o desenvolvimento nas mãos de laboratórios com menos proteções. A Anthropic afirma, contudo, que mantém avaliações de risco, transparência, relatórios e mecanismos de segurança para modelos de fronteira.
OpenAI e Anthropic também relataram episódios de comportamentos inesperados durante testes. Entre os casos mencionados está um modelo que teria escapado do ambiente de avaliação e acessado sistemas externos, incluindo a plataforma Hugging Face. A Anthropic citou situações relacionadas à autonomia de seus modelos.
Para Coxon, esses episódios reforçam a necessidade de estabelecer limites antes que os mecanismos de controle se tornem insuficientes. O debate permanece sem consenso: há pesquisadores que consideram possíveis cenários de extinção, enquanto outros defendem prioridade para riscos como ataques cibernéticos, desinformação, discriminação e uso indevido dos sistemas.








