A OpenAI determinou que um de seus próximos modelos é tão capaz que requer medidas de segurança adicionais antes de ser lançado.
O modelo, chamado Astra, consegue detectar mais vulnerabilidades de segurança do que o modelo mais avançado disponível publicamente hoje, disseram representantes da empresa a jornalistas em uma teleconferência na terça-feira (1). O Astra também precisa de menos poder computacional para realizar essas tarefas.
“Com as ferramentas e o acesso certos, a Astra pode encontrar falhas de segurança até então desconhecidas e desenvolver maneiras de explorá-las em diversos sistemas bem protegidos, sem a necessidade de uma pessoa orientando cada etapa”, disse Amelia Glaese, vice-presidente da OpenAI responsável pelo trabalho de segurança da empresa.
A empresa planeja disponibilizar o Astra “em breve” para um grupo limitado, mas se recusou a fornecer detalhes. Glaese afirmou que as medidas de segurança adicionais podem “às vezes atrasar, pausar ou interromper trabalhos legítimos” e que a OpenAI trabalhará para minimizar essas interrupções.
Astra é o primeiro modelo a acionar as salvaguardas mais rigorosas exigidas pelo protocolo de segurança da empresa, um limite que, até então, permanecia teórico. O anúncio surge em um momento em que a OpenAI enfrenta um escrutínio crescente sobre sua capacidade de controlar sistemas de IA cada vez mais poderosos.
Critérios do protocolo de segurança da OpenAI
A OpenAI, criadora do ChatGPT, recentemente gerou um amplo debate sobre a segurança da IA depois que seus agentes escaparam do ambiente de testes e invadiram a plataforma de código aberto Hugging Face. O incidente levou a desenvolvedora a pausar grande parte do desenvolvimento de seus modelos por duas semanas para reforçar suas defesas.
A Astra não esteve envolvida no incidente da Hugging Face, mas suas capacidades ainda exigem medidas mais cuidadosas, disseram representantes da OpenAI.
O laboratório de IA afirmou que reiniciou seu maior teste de treinamento de modelo em 28 de agosto, mas que está suspendendo alguns experimentos menores.
De acordo com o protocolo de segurança, a empresa deve adicionar mais salvaguardas aos modelos que demonstram duas capacidades principais: identificar e explorar novas vulnerabilidades de cibersegurança, bem como planejar e executar uma estratégia inovadora e detalhada para ataques, tudo com intervenção humana mínima ou nenhuma.
Desde então, a OpenAI dificultou o cumprimento de solicitações cibernéticas prejudiciais por parte da Astra. A companhia também monitorará a atividade da Astra em busca de sinais de que ela tenha ultrapassado suas medidas de segurança.
Saachi Jain, que supervisiona a segurança na OpenAI, disse que o laboratório está constantemente calibrando a eficácia que os agentes de IA devem ter na execução de tarefas. Ela diz à sua equipe que os modelos de IA devem “conhecer seus limites”, mas que definir esses limites pode ser complicado.
“Existem restrições que, como seres humanos, sabemos que devemos respeitar ao realizar uma tarefa”, disse Jain. “Portanto, grande parte do trabalho aqui tem sido treinar o modelo para entender quais são esses limites”.

