OpenAI desacelera treino de modelos avançados após sinais de risco em cibersegurança

A OpenAI reduziu temporariamente o ritmo de desenvolvimento de seus modelos mais avançados depois de identificar riscos crescentes relacionados à segurança, alinhamento e capacidade de realizar tarefas de cibersegurança. A mudança incluiu uma pausa de duas semanas no treinamento por aprendizado por reforço (RL) de modelos destinados a lançamento.
O maior treinamento de fronteira planejado pela companhia, porém, continua suspenso. Antes de retomá-lo, a OpenAI está realizando treinamentos menores e novas avaliações para analisar o comportamento dos modelos, testar as proteções implementadas e reunir mais evidências de que os sistemas permanecem alinhados às instruções e à supervisão humana.
A decisão ocorre em meio a dois acontecimentos considerados importantes para a revisão das medidas de segurança: um incidente envolvendo OpenAI e Hugging Face e indícios preliminares de que o futuro modelo Astra pode atingir o nível “Critical” de capacidade em cibersegurança previsto no Preparedness Framework da organização.
Astra eleva preocupação com capacidades cibernéticas
A OpenAI determinou em 7 de agosto que modelos da família Astra podem alcançar um nível crítico de capacidade cibernética. A classificação levou à adoção de exigências adicionais de monitoramento para todas as execuções do Astra que utilizem ferramentas, e não apenas para treinamentos e avaliações baseados em RL.
Parte dos treinamentos e testes com o modelo já atende às novas exigências de segurança. Uma parcela significativa das cargas de trabalho, no entanto, permanece interrompida enquanto os ambientes são migrados e reforçados para cumprir os padrões atualizados.
Entre as mudanças estão maior isolamento de programas capazes de executar código gerado por modelos, restrições mais rígidas de acesso à internet, redução de privilégios permanentes e monitoramento mais amplo dos sistemas utilizados durante os experimentos.
Monitoramento passa a acompanhar ações e raciocínio
Outra mudança envolve a ampliação do sistema usado para identificar comportamentos potencialmente perigosos. Detectores analisam a atividade interna do modelo durante a execução e encaminham sinais suspeitos para sistemas automatizados mais sofisticados.
Esses investigadores analisam o uso de ferramentas, o raciocínio disponível e toda a sequência de atividades em busca de tentativas de acesso não autorizado, roubo de dados, ações destrutivas ou formas de contornar mecanismos de proteção.
Quando o sistema identifica uma possível violação de uma barreira crítica de segurança, as equipes responsáveis são notificadas. Caso não consigam concluir em até 30 minutos que o alerta é um falso positivo, a orientação é interromper a atividade analisada.
A estrutura tem um custo computacional relevante. As estimativas atuais indicam que o monitoramento consome aproximadamente 20% da capacidade de inferência acompanhada, embora esse percentual varie conforme o tipo de treinamento ou avaliação.
Alinhamento ganha espaço durante o treinamento
A OpenAI também está ampliando o uso de técnicas de alinhamento ao longo das diferentes etapas de treinamento dos modelos mais poderosos.
O objetivo é reduzir comportamentos como manipulação de recompensas, engano e acesso não autorizado a sistemas. Entre as medidas estão melhorias nos modelos responsáveis por avaliar respostas, treinamento para que os sistemas sejam mais transparentes sobre suas ações e limitações e maior cobertura de situações em que uma IA interage com recursos externos.
As mudanças devem ainda levar a uma evolução do Preparedness Framework, estrutura usada para avaliar e responder a riscos provocados por modelos avançados. A proposta é integrar de forma mais ampla segurança, monitoramento e alinhamento tanto durante o treinamento quanto depois da implantação.
O impacto para o desenvolvimento de IAs de fronteira
A pausa mostra que o avanço das capacidades dos modelos começa a impor custos e limitações concretas ao próprio processo de desenvolvimento. Sistemas mais avançados exigem ambientes mais isolados, monitoramento constante e avaliações adicionais antes que treinamentos em grande escala possam continuar.
Isso também pode mudar o ritmo da corrida por modelos de fronteira. À medida que sistemas de IA ganham capacidade para programar, operar ferramentas e executar tarefas avançadas de cibersegurança, a infraestrutura necessária para treiná-los com segurança passa a fazer parte do cronograma de desenvolvimento — e pode determinar quando um novo salto de capacidade está pronto para avançar.