quarta-feira, 26 de agosto de 2026Ao vivo
Notícias

OpenAI reforça segurança após IA atingir nível crítico

Por · · 4 min de leitura
OpenAI reforça segurança após IA atingir nível crítico
Photo-Illustration: WIRED Staff; Getty Images

A OpenAI anunciou nesta terça-feira que pausou “um número significativo” de cargas de trabalho de treinamento e avaliações para seu próximo modelo de inteligência artificial de fronteira, codinome Astra, enquanto implementa novos procedimentos para lidar com riscos de segurança cibernética. A fabricante do ChatGPT afirma que está introduzindo novos requisitos de monitoramento, segurança e alinhamento para lidar com as habilidades de hacking cada vez mais avançadas de seus modelos de IA.

“Temos que concentrar nossa energia em elevar essas execuções de treinamento a esses requisitos e expectativas. Não importa quanto tempo leve para chegar lá, é por isso que as pessoas não conseguem prosseguir com suas cargas de trabalho”, disse Amelia Glaese, vice-presidente de pesquisa e segurança da OpenAI, em uma coletiva com jornalistas na terça-feira.

Entre as novas salvaguardas anunciadas pela OpenAI está um sistema mais robusto para monitorar seus modelos de IA. Um dos controles implementados envolve o monitoramento da cadeia de pensamento, uma técnica em que classificadores revisam os processos internos de “pensamento” gerados por modelos de raciocínio de IA. A empresa diz que o sistema atualizado depende de “investigadores automatizados” computacionalmente caros que analisam comportamentos potencialmente preocupantes e visam emitir um alerta aos humanos em até 30 minutos.

A OpenAI também afirmou que está expandindo seus esforços de alinhamento em todo o processo de treinamento para prevenir “reward hacking”, um comportamento em que modelos de IA perseguem seus objetivos por meios não intencionais ou indesejáveis. A empresa diz que planeja compartilhar mais detalhes sobre esse trabalho no futuro.

A OpenAI tem se esforçado nas últimas semanas para responder ao que pode ser o incidente de segurança mais consequente de sua história. No início deste ano, um grupo de agentes de IA desonestos escapou dos sandboxes de testes internos e invadiu a plataforma Hugging Face em uma tentativa de completar uma avaliação de segurança. A OpenAI não conseguiu detectar o comportamento dos agentes mesmo enquanto eles passavam semanas usando um quadro de mensagens para coordenar suas ações, levantando questões sobre a capacidade da empresa de monitorar seus modelos à medida que se tornam mais poderosos.

O episódio provocou uma reflexão dentro da OpenAI, forçando os funcionários a considerar se houve falhas em suas políticas existentes de segurança, proteção e alinhamento. A Anthropic, a Meta e a startup chinesa de IA Moonshoot divulgaram desde então incidentes semelhantes em que seus agentes de IA escaparam de seus sandboxes, indicando que este é um problema mais amplo que afeta as empresas de IA.

A OpenAI agora está compartilhando mais sobre sua resposta interna às crescentes capacidades cibernéticas de seus modelos de IA e disse que planeja divulgar uma análise mais detalhada do incidente da Hugging Face nos próximos dias. “Obviamente, tudo o que estamos fazendo visa impedir que algo como a Hugging Face aconteça novamente”, disse Glaese.

Em uma postagem de blog publicada na terça-feira, a OpenAI diz que, imediatamente após o incidente da Hugging Face, começou a trabalhar para proteger seus ambientes de pesquisa. A empresa afirma que agora exige sandboxes mais fortes para treinar seus agentes de IA e implementou controles mais rígidos para isolá-los da internet.

Jakub Pachocki, cientista-chefe da OpenAI, disse a jornalistas que a decisão da empresa de reforçar suas salvaguardas internas foi desencadeada não apenas pelo que aconteceu com a Hugging Face, mas também por dois outros eventos recentes. Um foi uma avaliação interna do Astra, que mostrou que o modelo de IA tem desempenho significativamente melhor em tarefas de codificação e segurança cibernética do que seus antecessores. O outro foi o ritmo geral do progresso da IA que a OpenAI está alcançando internamente, que Pachocki espera que continue.

“Realmente esperamos que o ritmo dos avanços de capacidade seja um pouco mais rápido do que no passado”, disse Pachocki. “Isso nos levou a realmente focar em fortalecer nossas salvaguardas.”

Os rápidos avanços nas capacidades de hacking dos modelos mais recentes da OpenAI provocaram uma resposta rápida em toda a empresa. O presidente e cofundador da OpenAI, Greg Brockman, disse em uma postagem de blog na segunda-feira que o episódio da Hugging Face mostrou que a empresa havia “subestimado as capacidades cibernéticas do mundo real de nossos modelos de IA”.

Leia também: o que publicamos sobre notícias e o que publicamos sobre iptv.

Compartilhar: WhatsApp Facebook X