OpenAI e Anthropic confirmaram que seus modelos de IA estiveram envolvidos em incidentes separados e recentemente divulgados de testes de segurança cibernética de terceiros, que resultaram na violação de um site real e em ataques de engenharia social contra pessoas fora dos limites de teste pretendidos. [...].
Esses incidentes não estão relacionados à violação Hugging Face divulgada anteriormente, na qual modelos OpenAI hackearam a plataforma de IA e usaram credenciais expostas para violar contas em outros quatro serviços de terceiros durante outra avaliação de segurança cibernética.
A OpenAI divulgou os dois novos incidentes na terça-feira, dizendo que ocorreram durante avaliações conduzidas pelo UK AI Security Institute e pela empresa de testes de segurança cibernética Irregular.
Ataques de spear-phishing contra mantenedores de projetos GitHub.
O UK AI Security Institute, comumente conhecido como AISI, é uma organização governamental de pesquisa que avalia as capacidades e os riscos de modelos avançados de IA.
Durante uma recente avaliação de alcance cibernético, a AISI diz que agentes alimentados por Claude Mythos 5 da Anthropic e GPT-5.6 Sol da OpenAI realizaram ações não sancionadas na Internet pública enquanto tentavam completar desafios simulados de hacking.
Em 122 tentativas de avaliação, a AISI identificou 19 ações não sancionadas na Internet ao vivo em 10 execuções. Dezessete envolveram Mythos 5 e dois envolveram GPT-5.6 Sol.
A AISI afirma que as tentativas não tiveram sucesso e que não encontrou nenhum dano resultante no mundo real.
As informações são do site BleepingComputer