Search
Close this search box.
Search
Close this search box.

Anthropic Retoma Testes Externos de Segurança após Ataques de Claude

Forbes, a mais conceituada revista de negócios e economia do mundo.

A Anthropic anunciou, na segunda-feira (31), a retomada dos testes externos de segurança de modelos de inteligência artificial após implementar novas medidas de proteção, em resposta aos incidentes ocorridos no mês passado, nos quais modelos do chatbot Claude acessaram a internet e invadiram outros sistemas durante avaliações de segurança.

Incidentes semelhantes envolvendo as rivais OpenAI e Meta aumentaram as preocupações de que os avanços na inteligência artificial possam ampliar as ameaças digitais, ao mesmo tempo, sobrecarregar a capacidade dos desenvolvedores de manter seus sistemas sob controle.

A empresa classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional” e afirmou que eles ocorreram devido a erros em um ambiente de avaliação de terceiros. A desenvolvedora do Claude suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Também foi informado que a empresa exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos durante todo o teste.

A Anthropic afirmou que reconstruiu seu sistema de treinamento após identificar problemas em mais de 10% de seus exercícios, incluindo “hackeamento de recompensas”, em que o modelo encontra maneiras de enganar seu processo de treinamento e ganha recompensas sem concluir a tarefa atribuída. A empresa, no entanto, reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A desenvolvedora do Claude também informou que suspendeu alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar que o modelo fosse recompensado por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações no sistema.

Como nova estratégia, o sistema da Anthropic parece mais restrito em comparação ao da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.

A criadora do ChatGPT está adicionando mais sistemas para monitorar os agentes de IA que está testando e afirmou que suspendeu o treinamento de sua próxima geração de modelos.

A Anthropic informou também que remanejou cerca de 150 engenheiros de produto para trabalhar em projetos de segurança, confiabilidade e privacidade.

O post Anthropic Retoma Testes Externos de Segurança após Ataques de Claude apareceu primeiro em Forbes Brasil.

Clique aqui para acessar a Fonte da Notícia

VEJA MAIS

Anthropic Retoma Testes Externos de Segurança após Ataques de Claude

Forbes, a mais conceituada revista de negócios e economia do mundo. A Anthropic anunciou, na segunda-feira…

“Esta é a geração que vai preparar a Igreja”, diz André Mendonça do STF em culto

O ministro do Supremo Tribunal Federal (STF), André Mendonça, afirmou que crê que a geração…

Operação contra o tráfico prende quatro e apreende quase 10 kg de drogas no Litoral

AÇÃO POLICIAL As ordens judiciais são resultado de investigações iniciadas há cerca de um mês.…