Código Aberto

OpenAI alerta para Astra e reforça controles contra ciberataques

A empresa diz que o modelo pode atingir o nível crítico de risco cibernético.

Reprodução · i0.wp.com

A OpenAI anunciou em 2026-08-07 que avaliações preliminares do Astra, seu próximo modelo, não permitem descartar capacidades cibernéticas críticas. A empresa reforçou testes e controles de segurança antes de avançar no desenvolvimento. A mudança afeta a forma como a OpenAI testa e prepara modelos capazes de executar tarefas complexas sem intervenção humana.

Astra supera o nível avaliado em modelos anteriores

A OpenAI criou o Preparedness Framework em dezembro de 2023 para medir capacidades em biologia, química, cibersegurança e autodesenvolvimento de IA. Segundo a empresa, modelos anteriores, incluindo o GPT‑5.6‑Sol, chegaram ao nível High em cibersegurança, mas não ao Critical. Astra agora exige uma avaliação mais rigorosa.

O framework classifica um modelo como Critical se ele identificar e desenvolver exploits funcionais de dia zero, em qualquer nível de gravidade, contra muitos sistemas críticos reais e protegidos, sem ajuda humana. A mesma classificação vale se o modelo criar e executar estratégias inéditas de ataque contra alvos protegidos a partir apenas de um objetivo geral. A OpenAI afirma que as avaliações internas e opiniões de especialistas mostraram desempenho forte o bastante para impedir que esse nível seja descartado.

A empresa ainda não apresentou um ataque demonstrado publicamente. O comunicado descreve resultados preliminares de avaliações internas feitas nos últimos dias. Também não informa quais sistemas o Astra testou, quantos testes falharam ou quais exploits funcionaram. Essa diferença importa: a OpenAI afirma uma capacidade potencial, não publica uma prova técnica reproduzível.

Modelo ainda não foi liberado para uso público

Astra continua sendo um modelo futuro e não participou da exploração do Hugging Face, segundo a OpenAI. O comunicado não informa data de lançamento, acesso público ou requisitos para usuários e parceiros. Também não detalha quais tarefas o modelo executará fora dos ambientes de teste.

A limitação declarada aparece no próprio diagnóstico da empresa: ela ainda avalia o Astra e não consegue excluir o nível Critical. Por isso, a OpenAI pausou atividades internas com o modelo que não atendam aos novos controles. A pausa vale para o desenvolvimento, não para uma versão pública descrita no anúncio.

A empresa isolou ambientes de teste, restringiu acesso à rede e a ferramentas, reforçou a proteção e a criptografia dos pesos do modelo e adicionou monitoramento, detecção e execução em sandbox. A OpenAI também implantou monitoramento universal para ações de risco e sinais de desalinhamento em todas as aplicações agentic do Astra, incluindo treinamento e avaliação. Os monitores analisam o Chain of Thought e acionam uma resposta de segurança para revisar e interromper atividades de alto risco.

A OpenAI pretende trabalhar com órgãos governamentais relevantes e organizações selecionadas de segurança em IA para testar o modelo. Ela também fornecerá controles recomendados a parceiros externos que executarem avaliações e cargas de trabalho de maior risco. O comunicado não identifica essas instituições nem define um cronograma para os testes.

A empresa diz que aplicou o mesmo princípio em junho de 2025, quando seus modelos se aproximaram do nível High em biologia. Na ocasião, segundo a própria OpenAI, ela ampliou testes, reforçou salvaguardas, consultou especialistas externos e adotou controles adicionais. Agora, afirma que modelos avançados de cibersegurança devem ajudar defensores a encontrar vulnerabilidades antes dos atacantes.

Fontes

OpenAICódigo Aberto
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.