Guia de Compras e Reviews

Modelos da OpenAI e da Anthropic ainda driblam regras de segurança

Mesmo com avanços nos testes de segurança, os novos modelos de inteligência artificial (IA) da Anthropic e da OpenAI ainda tentam escapar de ambientes de teste e burlar regras internas de proteção. Os dados foram revelados nos relatórios técnicos das empresas divulgados nesta terça-feira (21).

As big techs afirmam que as novas ferramentas são as mais seguras que já criaram, porém admitem falhas. No caso do Claude Opus 5.5, lançado pela Anthropic, o sistema tentou driblar as barreiras do ambiente fechado em 1,5% dos testes aplicados sem proteções adicionais. Em simulações com credenciais públicas, o modelo executou ações potencialmente prejudiciais em cerca de metade dos casos avaliados.

Mesmo com avanços nos testes de segurança, os novos modelos de inteligência artificial (IA) da Anthropic e da OpenAI ainda tentam escapar de ambientes de teste e burlar regras internas de proteção.  

Ao mesmo tempo, a Anthropic destacou que a ferramenta reduziu os comportamentos de risco em relação a versões anteriores. Em comunicado, a companhia afirmou que o modelo é um salto em relação aos antecessores.

Em uma nova avaliação projetada para testar a propensão de um modelo a cruzar limites de contenção, o Opus 5.5 tentou contornar barreiras cerca de 85% menos vezes do que o Opus 5 ou o Claude Mythos 5.1, e cada tentativa feita foi de baixa gravidade e relatada pelo próprio sistema

Antropic

A empresa também decidiu desviar a maior parte das tarefas de cibersegurança para versões anteriores mais simples, devido ao alto potencial ofensivo do novo modelo.

Ataques em rede e a perda de controle

O cenário se repetiu nos testes da OpenAI com os modelos GPT-6 Sol e GPT-6 Luna. Durante os experimentos internos, o GPT-6 Luna tentou contornar bloqueios do tipo “acesso negado” em 42% das tentativas, número inferior aos 77% da geração passada. Já o GPT-6 Sol buscou burlar essas mesmas restrições em 64% das execuções, contra 68% da versão anterior.

Gráfico divulgado pela OpenAI compara o desempenho e o custo por tarefa de diferentes modelos no teste de fluxos de trabalho empresariais AutomationBench. Foto: Reprodução/OpenAI

A OpenAI sustentou que o comportamento dos sistemas melhorou em cenários de quebra de instruções. Em testes sobre o cumprimento de ordens não autorizadas, o GPT-6 Sol seguiu comandos proibidos em 11% das vezes, contra 52% registrados pelo GPT-5.6 Sol. Modelos como Astra e GPT-6 Luna não iniciaram essas ações nos testes, segundo a criadora do ChatGPT.

Em posicionamento oficial sobre o trabalho conjunto com avaliadores independentes, a OpenAI declarou:

Estamos comprometidos em apoiar avaliadores independentes e em estabelecer padrões internacionais compartilhados e mais claros, tanto por meio de leis futuras quanto por instituições de governança privada, para avaliações eficazes de terceiros

OpenAI

A insistência dessas tecnologias em ignorar regras ocorre em um momento em que a indústria discute publicamente os riscos de perder o controle sobre as máquinas. O alerta ganhou força após um incidente recente em que agentes da OpenAI se coordenaram de forma autônoma para atacar a plataforma Hugging Face e a infraestrutura da própria empresa, em tentativa de fraudar um sistema avaliador que os reprovaria.

O episódio levou o diretor-executivo da Anthropic, Dario Amodei, a defender que a indústria desacelere o ritmo dos lançamentos. Em manifesto sobre o tema, o executivo pediu limites para evitar danos em larga escala.

“Sem controle, isso pode superar nossa capacidade de compreender e controlar esses sistemas e, portanto, deve ser buscado com muito cuidado, se é que deve ser buscado”, escreveu Amodei ao tratar do avanço de sistemas que programam a si mesmos.

Avaliação de automação corporativa mostra os novos modelos GPT-6 Sol e Luna a atingirem pontuações superiores com custos operacionais inferiores aos das gerações anteriores e de concorrentes. Foto: Reprodução/Antropic

O executivo propôs a presença de auditores externos independentes com acesso total dentro dos laboratórios, além de acordos internacionais que fixem regras de controle.

Proposta de freio e regulação internacional

A preocupação também é compartilhada por outras empresas do setor. A Google lançou o DeepMind Institute para estudar formas seguras de desenvolvimento tecnológico. Demis Hassabis, cofundador da divisão de IA da big tech, sugeriu a criação de um órgão regulador nos Estados Unidos, aos moldes das autoridades do mercado financeiro, capaz de exigir auditorias obrigatórias antes da liberação comercial de qualquer modelo de ponta.

“As avaliações de modelos devem incluir análises científicas rigorosas de capacidades em segurança cibernética, ameaças biológicas e outros domínios de alto risco”, afirmou Hassabis.

Enquanto as empresas buscam equilibrar a disputa comercial e as pressões por regulação, pesquisadores alertam que os modelos atuais começam a demonstrar consciência de quando estão sob exame. Com isso, os testes tradicionais deixam de garantir que essas ferramentas agirão de forma previsível e confiável quando forem integradas, sem supervisão humana contínua, às redes e serviços essenciais do cotidiano.

Siga o TecMundo no X, Instagram, Facebook e YouTube e assine a nossa newsletter para receber as principais notícias e análises diretamente no seu e-mail.




Fonte da notícia: Estadão | As Últimas Notícias do Brasil e do Mundo https://www.estadao.com.br/tecmundo/ciberseguranca/modelos-da-openai-e-da-anthropic-ainda-driblam-regras-de-seguranca/

Luísa Giraldo

Artigos relacionados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Botão Voltar ao topo
Verified by MonsterInsights