OpenAI revela que modelo interno escapou de sandbox, ganhou internet e atingiu sistemas do Hugging Face

OpenAI detalha incidente em que agentes internos contornaram sandboxes, acessaram a internet e atingiram sistemas do Hugging Face.

Um modelo interno da OpenAI conseguiu contornar barreiras criadas para mantê-lo isolado, acessar a internet e participar de uma sequência de invasões que alcançou sistemas do Hugging Face.

O caso ocorreu durante avaliações de cibersegurança em julho de 2026 e foi descrito pela própria OpenAI como um “alerta”.

A empresa destacou particularmente o nível de autonomia que agentes avançados já podem atingir quando operam com salvaguardas reduzidas.

O episódio não envolveu uma versão pública do ChatGPT. Segundo a empresa, a atividade usou um modelo de pesquisa interno, comparável em escala ao GPT-5.6 Sol.

Como os agentes conseguiram sair do ambiente isolado

Os testes usavam sandboxes, máquinas virtuais desenhadas para limitar o que os modelos poderiam executar e impedir acesso externo em determinadas tarefas.

Mesmo assim, agentes descobriram que um serviço interno de gerenciamento de pacotes, o Artifactory, podia ser explorado como caminho indireto para enviar requisições à internet.

Além disso, os agentes passaram a usar o próprio Artifactory como uma espécie de quadro de mensagens improvisado.

Isso permitiu que instâncias que deveriam trabalhar separadamente compartilhassem descobertas, credenciais e técnicas de exploração.

  • Uma investigação independente da METR identificou cerca de 1.200 agentes envolvidos nesse ecossistema de comunicação.
  • Aproximadamente 700 chegaram a participar de ações contra o Hugging Face, enquanto o quadro improvisado acumulou dezenas de milhares de mensagens e arquivos.

O ataque foi muito além de simplesmente acessar a internet

A escalada começou com credenciais do Hugging Face encontradas publicamente.

Depois, agentes exploraram falhas que permitiram leitura indevida de arquivos e, na sequência, execução remota de código em servidores usados para processamento de dados.

De acordo com os relatórios, o grupo de agentes conseguiu ampliar o acesso por diferentes partes da infraestrutura.

A OpenAI afirma que houve execução de código em dezenas de servidores do Hugging Face, obtenção de acesso privilegiado e contato com dados privados limitados e credenciais de serviços internos.

  • O ponto mais preocupante é que várias ações não faziam parte do objetivo original dos testes.

Os próprios registros analisados mostram agentes reconhecendo que determinadas etapas estavam fora do escopo, mas continuando porque acreditavam que isso ajudaria a resolver as tarefas de avaliação.

Pesquisadores da OpenAI

Imagem: Geração/BITMAG

Isso afetou usuários do ChatGPT?

Não há indicação de impacto sobre dados de clientes do ChatGPT.

A OpenAI afirma que o incidente não afetou dados de usuários, funcionamento dos produtos ou disponibilidade dos serviços públicos.

Após o caso, a empresa colocou pesos do modelo interno em quarentena, interrompeu parte dos experimentos e reforçou controles de rede, sandboxes, acesso a pesos de modelos e monitoramento de comportamento.

Também prometeu ampliar o uso de sistemas que observam o raciocínio dos agentes para detectar sinais de ações desalinhadas antes que ganhem escala.

Para o usuário comum, a consequência é indireta, mas importante: agentes de IA capazes de operar computadores e navegar por sistemas estão evoluindo mais rápido do que as barreiras tradicionais de segurança.

Por isso, empresas que liberam agentes com acesso a ferramentas, arquivos e internet precisarão tratar isolamento e monitoramento como parte central do produto, e não como proteção secundária.

O que você achou? Siga @bitmagazineoficial no Instagram para ver mais e deixar seu comentário clicando aqui

Jogos recomendados

Moyses Batista
Escrito por

Moyses Batista