Início Ciência e tecnologia Esta IA alimentada por luz pode detectar deepfakes com quase 98% de...

Esta IA alimentada por luz pode detectar deepfakes com quase 98% de precisão

18
0

Pesquisadores da Universidade da Califórnia, Los Angeles (UCLA) criaram um novo processador óptico-neural que usa luz para ajudar a identificar vídeos deepfake com rapidez e precisão. Ao contrário dos sistemas tradicionais, que normalmente examinam vídeos um após o outro usando hardware digital, a tecnologia UCLA pode analisar 15 ou mais fluxos de vídeo ao mesmo tempo.

A principal diferença é que parte do processo de detecção ocorre através da propagação física da luz. Isso permite que vários vídeos sejam avaliados simultaneamente durante uma única passagem óptica, em vez de exigir que cada um seja movido separadamente através de um pipeline de processamento digital tradicional.

A tecnologia está detalhada no estudo”Arquitetura óptico-neural escalonável e com baixo consumo de energia para detecção de vídeo deepfake multiplexado.”, publicado em e luz. Os pesquisadores projetaram o sistema Optical AI para servir como uma primeira camada de defesa de alto rendimento e resistente a ataques para a triagem de grandes quantidades de vídeos manipulados e gerados por IA.

O crescente desafio da detecção de deepfakes

As rápidas melhorias na IA genérica tornaram o vídeo sintético cada vez mais realista, aumentando a necessidade de sistemas de detecção que sejam precisos e capazes de funcionar em escala.

Muitos detectores avançados de deepfake dependem fortemente de cálculos digitais. Uma única análise pode exigir centenas de bilhões de operações de ponto flutuante, e os vídeos geralmente são processados ​​sequencialmente. À medida que mais material deve ser examinado, tanto o tempo de processamento quanto os requisitos de energia podem aumentar proporcionalmente.

Os sistemas de detecção digital enfrentam outro problema. Os invasores podem alterar deliberadamente vídeos falsos de maneiras sutis para confundir os detectores e fazer com que as imagens manipuladas pareçam autênticas.

O professor Aydogan Ozcan e sua equipe da UCLA desenvolveram um sistema óptico-digital híbrido destinado a enfrentar ambos os desafios.

Um codificador digital leve primeiro coleta informações compactas sobre cada vídeo, incluindo recursos espaciais, espectrais e temporais. Essa informação é convertida em um padrão de fase e exibida em um modulador de luz espacial programável.

A frente de onda óptica resultante viaja então através de um decodificador óptico passivo baseado em espaço livre. Por outro lado, detectores ópticos acoplados geram diretamente uma pontuação de autenticidade para cada vídeo.

Na verdade, o sistema substitui uma rede de decodificação digital computacionalmente exigente por um processo físico que pode lidar com múltiplos fluxos em paralelo.

Cerca de 98% de precisão em 15 vídeos de uma vez

Em experimentos utilizando luz visível, o processador examinou 15 vídeos Celeb-DF simultaneamente durante cada passagem óptica.

Isto alcançou uma precisão média de detecção de 97,79%, sensibilidade de 99,86% e especificidade de 95,72%. A sensibilidade mede o sucesso do sistema na identificação de vídeos manipulados, tornando a alta sensibilidade especialmente importante para ferramentas de triagem projetadas para impedir a propagação de conteúdo falso.

A sensibilidade de 99,86% traduziu-se numa taxa média de falsos negativos de ~0,14%. Em outras palavras, apenas uma pequena parcela dos vídeos manipulados foi falsamente classificada como autêntica.

Os pesquisadores levaram o sistema ainda mais longe, aumentando sua capacidade para 18 vídeos em uma única passagem óptica. Mesmo nesse nível, a precisão média do reconhecimento permaneceu em 96,13%.

Mais camadas ópticas aumentam o desempenho

A equipe descobriu que o processador poderia se tornar mais eficiente aumentando a profundidade física de seu decodificador óptico passivo sem aumentar significativamente o uso de energia ou a latência de inferência.

Quando os pesquisadores adicionaram duas camadas convolucionais passivas otimizadas ao testar manipulações deepfake mais difíceis, a precisão da detecção melhorou em aproximadamente 6,8%.

Essas camadas difrativas somente de fase podem ser fabricadas como estruturas/superfícies ópticas passivas e estáveis. Eles realizam cálculos adicionais por meio de difração de luz, o que significa que não requerem energia elétrica adicional quando o sistema está fazendo inferências.

Esta abordagem pode permitir um processamento mais sofisticado sem os mesmos custos de energia que normalmente ocorrem com grandes redes neurais digitais.

Testando o sistema em relação ao vídeo Google VEO-3

Os pesquisadores não limitaram seus experimentos aos deepfakes tradicionais de troca de rosto. Eles também desafiaram o processador com um vídeo produzido usando o modelo VEO-3 do Google.

Os sistemas generativos de IA mais recentes podem criar imagens que não possuem muitos dos artefatos óbvios associados à tecnologia deepfake anterior, tornando-os alvos mais difíceis para detectores treinados principalmente em formas mais antigas de manipulação.

Com apenas um ajuste mínimo, o processador óptico alcançou 94,80% de precisão e 97,61% de sensibilidade em vídeos VEO-3 inéditos durante os experimentos.

Os resultados sugerem que a abordagem poderia potencialmente se adaptar à medida que a tecnologia genérica de IA continua a se desenvolver.

Um detector deepfake projetado para dificultar o engano

O sistema óptico também mostra resistência a ataques adversários de caixa preta e fornece proteção integrada contra ataques de caixa branca.

Parte dessa segurança vem da maneira como o detector faz fisicamente seus cálculos. Como parte do processo de estimativa ocorre por meio de difração, os parâmetros críticos do modelo óptico são efetivamente incorporados ao hardware.

Pode ser difícil para um invasor medir, reproduzir ou fazer engenharia reversa desses parâmetros. Isso torna bastante difícil reconstruir o detector e projetar transformações adversárias cuidadosamente adaptadas.

O processador também continuou a funcionar de forma confiável quando os vídeos foram afetados por ruído de imagem, desfoque, compactação JPEG e desalinhamento experimental. Segundo os pesquisadores, esses resultados mostram como a computação óptica poderia fornecer uma base mais segura e confiável para alguns sistemas de inteligência artificial.

A primeira linha de defesa contra deepfakes

Em vez de substituir completamente detectores digitais sofisticados, o processador UCLA foi projetado para servir como um primeiro estágio altamente sensível de um sistema de detecção maior.

Grandes quantidades de vídeo podem inicialmente passar por processadores ópticos paralelos. Os materiais identificados como suspeitos podem ser enviados para modelos digitais mais exigentes computacionalmente para uma avaliação final mais detalhada.

Tal sistema poderia combinar os pontos fortes de ambas as abordagens. O processamento óptico pode fornecer operação paralela, baixos requisitos de energia do decodificador, alta sensibilidade, resistência a ataques adversários e capacidade de adaptação a novos geradores de vídeo de IA, enquanto os sistemas digitais tradicionais podem fornecer análises mais profundas quando necessário.

Os pesquisadores dizem que essa combinação pode eventualmente ser útil para moderação de conteúdo em larga escala, autenticação de mídia, vigilância e outras aplicações de IA críticas para a segurança.

Os autores deste trabalho são Parnian Gapandar Kashani e Dr. Shiqi Chen, que contribuíram igualmente, e o Professor Aydogan Ozcan. Os pesquisadores são afiliados ao Departamento de Engenharia Elétrica e de Computação da UCLA, ao Departamento de Bioengenharia da UCLA e ao California Nanosystems Institute.

Source link

DEIXE UMA RESPOSTA

Por favor digite seu comentário!
Por favor, digite seu nome aqui