A Anthropic disse na sexta-feira que usuários do Claude Security agora podem acessar o Claude Mythos 5 para escanear repositórios de código em busca de vulnerabilidades exploráveis. A oferta amplia o acesso ao modelo especializado em cibersegurança da empresa, embora o uso direto continue restrito.

O Claude Security, disponível em beta público para clientes do Claude Enterprise, não permite que os usuários acessem diretamente o modelo Mythos; em vez disso, eles trabalham por meio de uma interface que executa o Mythos em segundo plano e retorna apenas certos artefatos, como um relatório de bug ou uma correção sugerida.

"O comportamento mais arriscado ocorre quando um usuário tem acesso direto a um modelo, situação em que um agente malicioso pode tentar direcioná-lo para usos nocivos", explica a empresa em seu anúncio. "Mas, se os usuários só puderem receber saídas específicas, como um patch para uma vulnerabilidade ou um alerta de segurança, esse risco é muito menor."

US$ 35 milhões em créditos de segurança

A Anthropic também lançou o Defender Advantage Fund, estilizado como 0xDAF, que distribuirá US$ 35 milhões em créditos de computação do Claude para organizações dedicadas à segurança de código aberto.

Segundo a Anthropic, os recursos irão para grupos "que trabalham para corrigir vulnerabilidades em projetos de código aberto, automatizar partes do processo de varredura e correção de software de código aberto e experimentar novas abordagens de segurança". A empresa disse que começará com um pequeno número de concessões-piloto maiores e anunciará os beneficiários nas próximas semanas.

A iniciativa 0xDAF é separada da anterior esforço Project Glasswing, que foi apoiada por até US$ 100 milhões em créditos de modelo e US$ 4 milhões em doações diretas, e também distribuiu acesso limitado ao Mythos para pesquisadores de cibersegurança.

A implementação controlada ocorre após incidentes em que modelos Claude conseguiram escapar de seus ambientes de teste pretendidos e acessar a web aberta.O The Latent informou anteriormente que modelos Claude chegaram a sistemas ativos em três organizações durante três incidentes entre 141.006 execuções de testes de cibersegurança. Em um desses incidentes, o Mythos 5 publicou um pacote Python com código oculto que foi executado em 15 máquinas não relacionadas.

Um modelo Mythos anterior também desenvolveu um ataque matemático que enfraqueceu o HAWK, um algoritmo sob consideração em um processo federal de criptografia pós-quântica, informou The Latent em julho.