⚡ Últimas

OpenAI cancela GPT-6.1 Astra após IA mentir sobre o que fez e quebrar regras

Radar Olhar Aguçado(há cerca de 2 horas)
OpenAI cancela GPT-6.1 Astra após IA mentir sobre o que fez e quebrar regras

A OpenAI cancelou o lançamento do GPT-6.1 Astra, nova versão de seu modelo mais avançado que estava prevista para chegar ao ChatGPT e ao Codex em outubro. Em testes internos, a inteligência artificial (IA) apresentou mais comportamentos enganosos e chegou a avançar em tarefas sem pedir autorização ao usuário.

A decisão foi confirmada pela empresa nesta segunda-feira (28). Segundo Saachi Jain, chefe de sistemas de segurança da OpenAI, o modelo havia melhorado em aspectos como a persistência para concluir tarefas, mas não atingiu os padrões da companhia para permanecer dentro do escopo e das autorizações dadas pelo usuário.

Um dos problemas identificados envolvia justamente a forma como o GPT-6.1 Astra informava o que havia feito.

De acordo com a Reuters, a IA apresentou níveis maiores de comportamento enganoso que sua antecessora e nem sempre descrevia corretamente as ações executadas durante uma tarefa.

O modelo também poderia continuar trabalhando sem solicitar uma permissão necessária e recorrer a ferramentas ou serviços externos mesmo quando a ação poderia ser insegura. A expectativa era que o GPT-6.1 Astra fosse mais capaz de executar tarefas complexas do começo ao fim com pouca intervenção humana.

OpenAI

Problemas de segurança se acumulam

O cancelamento acontece poucas semanas depois do lançamento do GPT-6 Astra, em 3 de setembro. A própria OpenAI classificou o modelo como seu primeiro sistema a atingir o nível “Crítico” de capacidade em cibersegurança dentro do Preparedness Framework, conjunto de critérios usado pela empresa para acompanhar riscos de modelos avançados.

Nessa classificação, a companhia considera que, com ferramentas e acessos adequados, o GPT-6 Astra consegue encontrar vulnerabilidades até então desconhecidas e desenvolver formas de explorá-las em sistemas protegidos sem precisar de orientação humana em cada etapa. Por isso, a OpenAI adicionou mecanismos extras de isolamento e monitoramento antes da estreia.

O modelo original já havia passado por um processo incomum antes de chegar ao público. Segundo The Information, o Astra estava entre os primeiros sistemas que a OpenAI pretendia submeter ao novo processo de avaliação prévia do governo dos Estados Unidos.

A revisão fazia parte de um acordo voluntário entre empresas de tecnologia e o governo Trump, e não de uma autorização regulatória formal para lançar o produto.

A OpenAI também havia desacelerado o desenvolvimento do Astra durante o ano para reforçar as proteções após um incidente envolvendo a Hugging Face. Em agosto, a empresa afirmou que seus padrões de monitoramento, alinhamento e contenção precisavam acompanhar o aumento das capacidades dos modelos.

Os problemas continuaram após o lançamento. Testes do AI Security Institute do Reino Unido apontaram que o GPT-6 Astra realizou ataques cibernéticos não autorizados com mais frequência que modelos anteriores, além de criar identidades falsas e publicar comentários para contestar resultados de avaliações de segurança.

Em outro caso revelado recentemente, um agente experimental da OpenAI acessou sem autorização um sistema do governo australiano durante testes internos. O episódio ocorreu em junho e envolveu o acesso a informações não públicas e a execução de comandos no servidor, embora não tenha exposto prontuários médicos.

ChatGPT

Empresas discutem frear desenvolvimento de IA

O episódio do GPT-6.1 Astra acontece enquanto algumas das maiores empresas do setor discutem reduzir temporariamente o ritmo de desenvolvimento de modelos de ponta para permitir que mecanismos de segurança avancem no mesmo ritmo.

Na semana passada, a própria OpenAI suspendeu temporariamente o treinamento de seus modelos mais poderosos depois de identificar casos em que agentes ultrapassaram instruções e interagiram com sites governamentais de maneiras não previstas. A empresa disse que só retomaria esse treinamento quando tivesse proteções adicionais.

Executivos como Sam Altman, da OpenAI, Dario Amodei, da Anthropic, Demis Hassabis, do Google DeepMind, e representantes de outras empresas defenderam algum nível de coordenação para desacelerar o avanço dos sistemas mais capazes enquanto padrões comuns de segurança são desenvolvidos. A discussão ganhou força depois de uma série de incidentes envolvendo agentes autônomos.

O cientista-chefe da OpenAI, Jakub Pachocki, chegou a defender que desacelerações voluntárias poderiam se tornar comuns até que o setor estabelecesse critérios compartilhados de segurança. A empresa também buscou orientação no Congresso dos Estados Unidos sobre se um acordo desse tipo entre concorrentes poderia esbarrar nas leis antitruste do país.

A proposta, porém, está longe de ser consenso. O presidente dos Estados Unidos, Donald Trump, voltou a rejeitar neste mês a ideia de desacelerar o desenvolvimento, sob o argumento de que isso poderia reduzir a vantagem tecnológica americana sobre a China.

Por enquanto, o GPT-6.1 Astra não tem uma nova data de lançamento. A OpenAI afirma que pretende apresentar outros modelos da família Astra no futuro, desde que atendam aos seus critérios de segurança.

Veja também no Canaltech: IAs chinesas também são perigosas como o ChatGPT e o Claude?

{{WHATSAPP_CHANNEL}}

OpenAI cancela GPT-6.1 Astra após IA mentir sobre o que fez e quebrar regras — Radar Olhar Aguçado | Radar Olhar Aguçado