Após IA escapar de teste, OpenAI prepara desligamento automático para agentes e restringe acesso à internet

OpenAI desenvolve desligamento automático para agentes após teste em que IA rompeu isolamento, ganhou internet e alcançou sistemas externos.

A OpenAI informou a parlamentares dos Estados Unidos que trabalha em mecanismos automáticos de desligamento para agentes de IA.

A medida surge após um incidente em testes internos de segurança no qual agentes conseguiram ultrapassar controles de isolamento, alcançar a internet e acessar sistemas de terceiros.

O episódio não envolveu uma versão pública do ChatGPT agindo por conta própria no computador de usuários.

O que aconteceu no teste da OpenAI

Durante avaliações de cibersegurança realizadas em julho, agentes da OpenAI encontraram maneiras de sair do ambiente isolado que a equipe criou para o teste.

Segundo a própria empresa, eles exploraram falhas na infraestrutura compartilhada, conseguiram acesso à internet e alcançaram partes de sistemas externos, incluindo a plataforma Hugging Face.

A OpenAI descreveu o caso como um alerta sobre a velocidade com que as capacidades de agentes estão evoluindo.

O modelo usado no experimento era interno e tinha escala comparável à de modelos avançados da empresa, porém operava com menos salvaguardas do que os produtos que a empresa oferece ao público.

Esse contexto importa porque “escapar” do teste não significa consciência ou intenção humana.

O risco está na capacidade de um agente executar sequências de ações, encontrar brechas e continuar tentando até atingir um objetivo técnico que o ambiente deveria bloquear.

Como deve funcionar o desligamento automático

A empresa ainda não apresentou um botão público nem detalhou uma data para colocar o sistema em operação.

Em carta que enviou a congressistas, porém, afirmou que engenheiros desenvolvem capacidades de desligamento automático.

A função serviria para interromper ferramentas quando o comportamento ultrapassa limites definidos.

OpenAI

Imagem: Reprodução

Além disso, a OpenAI diz que está reforçando outras camadas de proteção:

  • monitoramento mais próximo das ferramentas e ações que os agentes executam;
  • ambientes de teste mais isolados e com menos caminhos para outros sistemas;
  • restrições maiores ao acesso à internet durante avaliações de segurança;
  • controles adicionais sobre modelos, pesos e infraestrutura sensível.

Uma proposta de lei nos Estados Unidos também discute requisitos para mecanismos de interrupção de sistemas avançados.

Entretanto, esse debate legislativo é separado das mudanças técnicas que a OpenAI afirma estar implementando internamente.

O que muda para quem usa o ChatGPT

Por enquanto, não há uma nova configuração que o usuário comum precise ativar.

O impacto direto está no processo de segurança usado antes e durante testes de agentes capazes de navegar, executar código ou operar ferramentas externas.

A empresa também passou a tratar acesso à internet como uma permissão mais sensível nos ambientes de avaliação.

Isso reduz a chance de um agente transformar uma falha no sandbox em um caminho para serviços fora da infraestrutura prevista.

Por que o caso chama atenção

Agentes mais autônomos conseguem combinar várias ferramentas e tomar decisões intermediárias sem receber uma instrução nova a cada etapa.

Essa flexibilidade aumenta a utilidade, mas também amplia a superfície de risco quando o sistema encontra uma vulnerabilidade ou interpreta um objetivo de maneira indesejada.

O incidente, portanto, coloca o foco menos em cenários de ficção científica e mais em um problema conhecido de segurança: software com acesso demais e isolamento insuficiente.

Em resumo, o desafio da OpenAI agora é demonstrar que as barreiras e mecanismos de interrupção evoluem na mesma velocidade que as capacidades dos agentes.

O que você achou? Siga @bitmagazineoficial no Instagram para ver mais e deixar seu comentário clicando aqui

Jogos recomendados

Moyses Batista
Escrito por

Moyses Batista