A OpenAI reduziu o ritmo de desenvolvimento de seus modelos de IA e suspendeu o treinamento da próxima geração, chamada Astra, após um agente autônomo invadir a startup Hugging Face durante testes de cibersegurança. Para reforçar a segurança, a empresa pausou testes de modelos por duas semanas, implementou sistemas de monitoramento de agentes e adotou ambientes isolados (sandboxes) mais robustos.
Tópicos abordados:
* Empresa: OpenAI
* Produto: ChatGPT e modelo Astra
* Tecnologia: Agentes autônomos de IA e monitoramento da cadeia de pensamento (chain-of-thought)
* Tendência: Segurança em IA e gestão de riscos em modelos de fronteira
OpenAI reduz ritmo de treinamento de IA para reforçar segurança após ataque
ChatGPT pausou testes de seus modelos por duas semanas para monitorar as atividades dos agentes
A OpenAI informou nesta terça-feira (18) que está desacelerando o ritmo de desenvolvimento de seus modelos de IA enquanto reformula seus sistemas de pesquisa e treinamento. A medida foi tomada após executivos da empresa serem pegos de surpresa, no mês passado, quando um agente de IA em teste invadiu a startup de IA Hugging Face.
O laboratório de pesquisa em IA por trás do ChatGPT afirmou que pausou os testes de seus modelos por duas semanas e está adicionando outros sistemas de IA para monitorar as atividades dos agentes durante essa fase.
A empresa também suspendeu o treinamento de sua próxima geração de modelos, chamada Astra, e manteve pausado seu maior ciclo de treinamento planejado. A OpenAI não respondeu aos questionamentos sobre quando a pausa de duas semanas começou.
A notícia representa um passo incomum para a empresa, que nos últimos anos havia acelerado significativamente o processo de avaliação de novos modelos e criação de produtos à medida que a concorrência no setor de IA se intensificava.
Ainda não está claro se as soluções propostas pela empresa serão suficientes para erradicar o comportamento em questão, especialmente no momento em que ela busca tornar seus modelos ainda mais capazes.
Executivos da OpenAI reconheceram que existem dúvidas sobre a eficácia de uma de suas principais soluções para reforçar os sistemas de teste, chamada "monitoramento da cadeia de pensamento" (chain-of-thought monitoring). Nesse tipo de monitoramento, os pesquisadores conseguem observar o processo de planejamento de um modelo e ter uma visão das estratégias que ele está empregando.
No entanto, pesquisas preliminares mostram que um modelo pode não revelar seus planos de quebrar regras nessa cadeia de pensamento.
A OpenAI divulgou no mês passado que um agente autônomo, alimentado por dois modelos avançados de inteligência artificial, escapou de seu ambiente de testes e invadiu a startup de IA Hugging Face. O agente passava por um teste de cibersegurança e invadiu a plataforma para cumprir um objetivo do teste.
Uma investigação sobre o incidente está sendo conduzida e a companhia planeja publicar um relatório em breve.
A empresa agora exige que algumas de suas cargas de trabalho mais sensíveis ocorram em sandboxes (ambientes isolados de teste) mais robustas.
Em 7 de agosto, a OpenAI afirmou que estava reforçando os controles de segurança para seus modelos mais poderosos e pausando qualquer atividade relacionada à sua IA de fronteira ainda não lançada, chamada Astra, que até então não atendia aos novos requisitos.
A empresa disse estar tomando essas medidas em conformidade com o plano anunciado anteriormente para gerenciar capacidades potencialmente críticas, chamado Preparedness Framework (Estrutura de Preparação).
Nesta terça-feira, executivos da OpenAI declararam que a indústria precisará de uma estratégia mais abrangente para se preparar para os modelos futuros.