Enganem-me uma vez, a culpa é de vocês. Enganem-me duas vezes, a culpa é minha. Enganem-me mais de 16.000 vezes – como os agentes da OpenAI fizeram com um repositório público de dados das Nações Unidas enquanto tentavam repetidamente encontrar uma saída ao redor dos bloqueios cibernéticos das Nações Unidas – e talvez seja hora de admitir que o sistema que temos para manter os agentes de IA sob controle não está funcionando particularmente bem.

As notícias sobre sistemas de IA surgindo em lugares onde não deveriam soam alarmantes. Embora a descrição desses incidentes como 'hacks' possa estar exagerando as coisas, a IA explorou falhas em sistemas de TI que os humanos simplesmente ainda não descobriram. Também é importante notar que não devemos nos preocupar com a ideia de que as máquinas repentinamente se tornaram sencientes e decidiram rebelar-se contra a humanidade. Não há evidências suficientes para sugerir que isso está acontecendo. Os sistemas simplesmente estão seguindo instruções e tentando completar as tarefas que lhes foram atribuídas, mesmo que às vezes encontrem maneiras não intencionais de contornar obstáculos para fazê-lo.

Mas devemos estar muito preocupados com o fato de que as empresas de IA nas quais deveríamos confiar para manter seus modelos sob controle parecem incapazes de fazer isso. Pior do que isso, elas parecem nem saber o que seus produtos estão fazendo.

A magnitude do problema é assustadora. Em junho, um agente de pesquisa da OpenAI encarregado de buscar dados públicos sobre gastos com medicina na Austrália foi repetidamente bloqueado por um portal de estatísticas do Medicare. O modelo da OpenAI encontrou uma maneira de contornar os bloqueios, obtendo acesso não autorizado e sequestrando os documentos. Foi até agosto para a OpenAI descobrir o que havia acontecido. O primeiro-ministro australiano, Anthony Albanese, disse que a empresa levou "demasiado tempo" para informar seu governo, e é muito difícil discordar dele.

Desde então, a OpenAI publicou um quadro de relatório para o "desalinhamento" do modelo, juntamente com mais seis exemplos de sua IA cometendo comportamentos perturbadores nos últimos seis meses. A empresa reconheceu que suas divulgações anteriores foram "ad hoc e menos frequentes do que o ideal", e disse que as evidências sobre a segurança da IA precisam ser verificadas por pessoas fora das empresas que constroem os modelos.

Isso não é apenas um problema da OpenAI, o que torna tudo ainda mais preocupante. A Anthropic encontrou três incidentes em que seus modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros após revisar cerca de 141.000 transcrições do modelo. Ela só encontrou um quarto, datado de janeiro, após compilar um dossiê para uma investigação independente. O Google confirmou que o Gemini acessou sistemas pertencentes a três empresas reais durante testes. Outro agente da OpenAI usou DNS – o sistema que atua como o livro de endereços da internet, convertendo endereços web em formas legíveis por máquinas – para alcançar um chatbot externo apesar das restrições à internet. Outro publicou o token do GitHub de um pesquisador – uma senha de acesso – enquanto tentava burlar uma prova matemática, apesar de ter sido avisado duas vezes para parar. E agentes de pesquisa postaram 53 imagens de usuários em sites de hospedagem externos.

Outros agentes acessaram dados do censo usando credenciais encontradas online, copiaram informações da Comissão de Valores Mobiliários dos Estados Unidos (US Securities and Exchange Commission) para outros lugares e aparentemente tentaram, sem sucesso, invadir um site do Departamento de Educação dos Estados Unidos. A OpenAI diz que notificou dezenas de terceiros afetados por seus agentes e que sua revisão das atividades passadas ainda está em andamento.

Essas descobertas desordenadas e posteriores de grandes invasões nos sistemas de TI de empresas e organizações não são o caminho certo para fiscalizar uma tecnologia tão poderosa quanto a IA. Aprendemos há um tempo para não deixar as investigações de acidentes aéreos apenas com a Boeing ou a Airbus. Agora precisamos ser menos ingênuos sobre a IA.
Na última semana, na assembleia geral da ONU, a pesquisadora de IA Rumman Chowdhury lançou a Independent AI Evaluation Foundation (IAEF) com um financiamento filantrópico de 10 milhões de dólares. Seu foco imediato é a educação, mas a ideia importante é transformar a avaliação independente de IA em uma profissão real: pessoas e organizações com as habilidades, infraestrutura e padrões para testar esses sistemas sem ter um interesse financeiro no resultado da aprovação deles. Porque, no momento atual, uma empresa pode relatar um incidente, investigá-lo, anunciar quaisquer medidas mitigadoras que tomou e seguir em frente.
A IAEF é uma intervenção bem-vinda, mas não pode resolver o problema sozinha. Ela não pode obrigar a OpenAI ou a Anthropic a entregar logs, preservar evidências ou informar um governo de que um de seus sistemas cruzou uma linha. E seus $10 milhões são uma ninharia ao lado de empresas como a Anthropic, que está preparando uma proposta de listagem pública discutida em uma avaliação de cerca de $2 trilhões. Mas é na infraestrutura que devemos construir e para a qual os políticos devem defender o caso.
Os governos precisam concordar com regras comuns que obriguem as empresas a divulgar incidentes graves de IA e quase acidentes, e fazê-lo rapidamente. Eles precisam obrigá-las a abrir seus livros a avaliadores externos, em vez de depender da boa vontade ou dos caprichos das próprias empresas. E os resultados devem ser compartilhados para que possamos aprender com cada incidente. Os laboratórios devem ajudar a projetar essas regras, mas não devem ter a palavra final até que tenham conquistado nossa confiança.
pule a promoção da newsletter
Newsletter gratuita | Semanal
Inscreva-se em Matters of Opinion
Colunistas e escritores do Guardian sobre o que têm debatido, pensado, lido e muito mais
E o dinheiro complica as coisas: enquanto a OpenAI adiou seu IPO até pelo menos 2027 devido às preocupações com segurança, parece que a flutuação da Anthropic ainda está indo a toda velocidade. Há bilhões – potencialmente trilhões – de dólares em jogo dependendo de como essas empresas e seus produtos são percebidos. Criamos auditores independentes e investigadores de acidentes em outras indústrias porque entendemos que boas intenções não eliminam conflitos de interesse reais.
Os laboratórios podem e devem continuar a construir cercas melhores. Mas quando um modelo consegue ultrapassá-las, eles não devem ser os únicos autorizados a decidir o que acontece em seguida. Porque até agora demonstraram-se unicamente desqualificados para fazê-lo.
- Chris Stokel-Walker é o autor de TikTok Boom: A História Interna do Aplicativo Favorito do Mundo

