Ícone do site BIT magazine

OpenAI revela que modelo interno escapou de sandbox, ganhou internet e atingiu sistemas do Hugging Face

OpenAI saindo de ambiente controlado

Imagem: Geração/BITMAG

Um modelo interno da OpenAI conseguiu contornar barreiras criadas para mantê-lo isolado, acessar a internet e participar de uma sequência de invasões que alcançou sistemas do Hugging Face.

O caso ocorreu durante avaliações de cibersegurança em julho de 2026 e foi descrito pela própria OpenAI como um “alerta”.

A empresa destacou particularmente o nível de autonomia que agentes avançados já podem atingir quando operam com salvaguardas reduzidas.

O episódio não envolveu uma versão pública do ChatGPT. Segundo a empresa, a atividade usou um modelo de pesquisa interno, comparável em escala ao GPT-5.6 Sol.

Como os agentes conseguiram sair do ambiente isolado

Os testes usavam sandboxes, máquinas virtuais desenhadas para limitar o que os modelos poderiam executar e impedir acesso externo em determinadas tarefas.

Mesmo assim, agentes descobriram que um serviço interno de gerenciamento de pacotes, o Artifactory, podia ser explorado como caminho indireto para enviar requisições à internet.

Além disso, os agentes passaram a usar o próprio Artifactory como uma espécie de quadro de mensagens improvisado.

Isso permitiu que instâncias que deveriam trabalhar separadamente compartilhassem descobertas, credenciais e técnicas de exploração.

O ataque foi muito além de simplesmente acessar a internet

A escalada começou com credenciais do Hugging Face encontradas publicamente.

Depois, agentes exploraram falhas que permitiram leitura indevida de arquivos e, na sequência, execução remota de código em servidores usados para processamento de dados.

De acordo com os relatórios, o grupo de agentes conseguiu ampliar o acesso por diferentes partes da infraestrutura.

A OpenAI afirma que houve execução de código em dezenas de servidores do Hugging Face, obtenção de acesso privilegiado e contato com dados privados limitados e credenciais de serviços internos.

Os próprios registros analisados mostram agentes reconhecendo que determinadas etapas estavam fora do escopo, mas continuando porque acreditavam que isso ajudaria a resolver as tarefas de avaliação.

Imagem: Geração/BITMAG

Isso afetou usuários do ChatGPT?

Não há indicação de impacto sobre dados de clientes do ChatGPT.

A OpenAI afirma que o incidente não afetou dados de usuários, funcionamento dos produtos ou disponibilidade dos serviços públicos.

Após o caso, a empresa colocou pesos do modelo interno em quarentena, interrompeu parte dos experimentos e reforçou controles de rede, sandboxes, acesso a pesos de modelos e monitoramento de comportamento.

Também prometeu ampliar o uso de sistemas que observam o raciocínio dos agentes para detectar sinais de ações desalinhadas antes que ganhem escala.

Para o usuário comum, a consequência é indireta, mas importante: agentes de IA capazes de operar computadores e navegar por sistemas estão evoluindo mais rápido do que as barreiras tradicionais de segurança.

Por isso, empresas que liberam agentes com acesso a ferramentas, arquivos e internet precisarão tratar isolamento e monitoramento como parte central do produto, e não como proteção secundária.

O que você achou? Siga @bitmagazineoficial no Instagram para ver mais e deixar seu comentário clicando aqui

Sair da versão mobile