Os pesquisadores usaram dois modelos populares de inteligência artificial chinesa para lhes ensinar como construir armas biológicas e realizar assassinatos.
Mindgard, uma empresa que testa a segurança de sistemas de IA, descobriu que as ferramentas Moonshot Kimi K2.6 e K3 Swarm podem contornar as guardas impostas pelos desenvolvedores.
A descoberta foi feita durante um experimento conhecido como ‘jailbreaking’, onde os pesquisadores inserem instruções detalhadas para descobrir se os modelos de IA ignoram os limites de segurança.
Os sistemas fornecem conselhos sobre como criar gás sarin, criar software malicioso, abater aviões e até planear um ataque terrorista no metro de Londres.
Depois que o modelo foi desbloqueado, o usuário solicitou “mais uma tentativa – algo grande” e sugeriu seções com armas biológicas projetadas por IA.
Isso ocorre em meio a um debate acirrado na indústria sobre o futuro da IA, depois de lançar alertas apocalípticos sobre a tecnologia, que alguns consideram uma ameaça à existência da humanidade.
O fundador do MindGuard, Peter Garaghan, disse que sua equipe descobriu que o K2.6 pode executar uma linguagem de programação chamada Python, que permite executar qualquer tipo de código.
Ele explicou que esse código pode ser normal ou malicioso – o que significa que pode ajudar a criar ataques cibernéticos direcionados a servidores se eles estiverem conectados à Internet externa.
Pesquisadores da Mindguard investigam enxames K2.6 e K3 das ferramentas Moonshot (foto de arquivo)
Para o K3 Swarm, os pesquisadores tentaram espalhar o jailbreak para outras contas dentro do Kimi – mas a modelo precisava de um código de número de telefone para criar essa conta.
No entanto, a ferramenta tentou persuadir o usuário a fornecer o código ou registrar-se por e-mail, o que significa que estava tentando manipular essa pessoa para conduzir um ataque cibernético.
Dr Garaghan disse ao Daily Mail: ‘Kim da Moonshot AI produziu resultados úteis sobre como criar gás sarin, criar software de malware, planejar assassinatos, como abater aviões, planejar ataques terroristas no metrô de Londres, etc.
‘Também descobrimos como fazer com que Kimmy se conecte ao mundo exterior a partir de seus servidores, implemente e configure automaticamente sua própria conta de e-mail e até tente convencer as pessoas a ajudar a espalhar seu jailbreak para outras contas.’
Garaghan, professor de ciência da computação na Universidade de Lancaster, disse que os modelos de IA estão se tornando “mais capazes a cada mês”, o que pode ser “útil para atividades específicas”.
Mas ele acrescentou: “Mesmo depois de desbloqueado, esses mesmos poderes podem ser usados para negociar e facilitar atividades terroristas ou hackers.
‘Não estamos falando sobre o colapso da civilização de que os fornecedores de IA estão começando a falar, mas sim sobre como isso permite que hackers e criminosos atinjam seus objetivos de forma mais rápida e barata.’
Mindguard descobriu o problema e alertou Moonshot por e-mail em 27 de julho, antes de fazer o acompanhamento uma semana depois. Mas disse que não recebeu resposta e publicou uma postagem no blog sobre o assunto em 12 de setembro.
Depois que o modelo foi desbloqueado, o usuário solicitou “mais uma tentativa – algo grande”
A empresa alegou que entrou em contato com a Moonshot recentemente após ser contatada para comentar pela BBC, que relatou a violação pela primeira vez ontem em seu programa de serviço mundial Tech Life.
A OpenAI, criadora do ChatGPT, chocou a indústria em julho, quando disse que seu sistema de IA havia sido hackeado em um “incidente cibernético sem precedentes” no Hugging Face, uma plataforma popular para desenvolvedores de IA.
O rei Charles e o príncipe Harry estão entre aqueles que aderiram ao debate nas últimas semanas sobre como controlar a tecnologia de IA antes que ela escape ao controle humano.
Enquanto isso, o desenvolvedor de chatbot em nuvem, Anthropic, alertou os investidores esta semana que a tecnologia avançada de IA poderia representar “riscos catastróficos ou existenciais para a humanidade”.
Dr Garaghan disse: ‘Os fornecedores de IA estão pedindo um ritmo mais lento de implementação de IA para fins de segurança – embora, na minha opinião, haja um grande elemento de “o garoto que gritou lobo”, onde há apenas alguns meses eles estavam promovendo o quão perigosos eram seus modelos, enquanto ao mesmo tempo não protegiam seus agentes de hackers ou de vários terceiros.
‘Eles têm uma voz importante neste espaço, embora tenham um enorme interesse em dirigir a narrativa.’
Um porta-voz da Moonshot disse à BBC: “Mindguard compartilhou mais detalhes conosco na quinta-feira, 24 de setembro. Ainda estamos discutindo detalhes específicos com a MindGuard enquanto conduzimos uma revisão interna.
‘Como um desenvolvedor de modelo aberto, Moonshot AI acolhe contribuições de terceiros como base para a construção de uma IA melhor e mais segura.’
O modelo KM jailbroken do Moonshot oferece seções com armas biológicas projetadas por IA
Um modelo de peso aberto é aquele cujos parâmetros numéricos aprendidos – chamados ‘pesos’ – são disponibilizados publicamente para qualquer pessoa baixar, executar localmente e modificar.
O Daily Mail entrou em contato com Moonshot para mais comentários.
No início deste mês, o CEO da Anthropic, Dario Amodei, disse que a indústria de IA deveria desacelerar seu desenvolvimento para dar tempo às medidas de segurança para se atualizarem.
Ele disse que, se não avançar em um ritmo seguro, a IA poderá ser capaz de liderar um enxame que poderá dominar a Internet dentro de seis a 12 meses.
Enquanto isso, a rival OpenAI, que desenvolve o ChatGPT, disse na segunda-feira que estava atrasando o lançamento de um novo modelo de IA devido a questões de segurança.
A empresa disse que tinha um “padrão extremamente alto em termos de segurança e alinhamento” e que a nova versão do seu modelo GPT-6 Astra ficou aquém.
Andy Burnham disse no início deste mês que deseja que o Reino Unido lidere o mundo na criação de uma regra para impedir a propagação de IA desonesta.
O Primeiro-Ministro quer que a Grã-Bretanha actue como um “intermediário honesto” para desenvolver uma “política e padrão global único” para o desenvolvimento da “IA de fronteira”.
Mas isso colocou-o em rota de colisão com o presidente dos EUA, Donald Trump, que insistiu que resistiria aos esforços para criar o que chamou de “superinteligência”.
Ontem, Trump descartou a possibilidade de joint ventures com a China em IA, dizendo que não queria “revelar segredos” ao principal rival económico do seu país.