La capacité de l’intelligence artificielle (IA) à générer du contenu synthétique continue de croître. Des images et vidéos au texte et à la voix, les créations générées par l’IA sont de plus en plus difficiles à distinguer de la réalité.
En particulier, les discours générés par l’IA ont suscité d’importantes inquiétudes en raison de leur potentiel d’utilisation à des fins de désinformation, de fraude et à d’autres fins malveillantes.
Nous explorons ici s’il est possible de détecter les voix générées par l’IA et comment les défis associés à cette technologie émergente sont résolus.
L’essor de la parole générée par l’IA
La synthèse vocale a connu des progrès remarquables grâce aux réseaux neuronaux profonds et à d’autres progrès de l’apprentissage automatique. Des outils tels que FakeYou et PlayHT ont facilité la création de voix synthétiques réalistes, les rendant accessibles à un large éventail d’utilisateurs.
Ces systèmes peuvent générer des voix à partir de texte (TTS, text-to-speech) ou transformer la voix d’une personne en celle d’une autre (conversion vocale), en conservant les nuances émotionnelles et les schémas respiratoires du discours d’origine.
Cependant, cette technologie a également été utilisée pour créer des « deepfakes » audio, où les voix de personnalités publiques sont falsifiées pour diffuser des informations erronées ou commettre des escroqueries.
Un cas récent concernait un canular qui semblait provenir du président américain Joe Biden, décourageant les électeurs démocrates lors des primaires du New Hampshire. Cet incident souligne le besoin urgent de disposer d’outils fiables pour détecter l’audio généré par l’IA.
Défis liés à la détection de l’audio généré par l’IA
La détection des voix générées par l’IA est intrinsèquement plus compliquée que la détection de fausses images ou vidéos. L’audio est un support unidimensionnel et éphémère, ce qui rend difficile l’examen et l’analyse des signaux de génération d’IA.
Selon Manjeet Rege, directeur du Centre d’intelligence artificielle appliquée à l’Université de St. Thomas, l’audio manque de contexte visuel et d’indices pouvant aider à identifier les contrefaçons.
Les méthodes de détection actuelles s’appuient largement sur l’apprentissage automatique, dans lequel les modèles sont formés avec de vastes ensembles de données de voix réelles et synthétiques. Autrement dit, utiliser l’IA pour détecter le contenu généré par d’autres IA.
Ces modèles recherchent des modèles et des fonctionnalités permettant de distinguer l’audio généré par l’IA de l’audio réel. Cependant, ces systèmes se heurtent à plusieurs obstacles :
- Variabilité audio : l’audio peut facilement se dégrader en raison de la compression, des bruits de fond et d’autres facteurs, ce qui rend une détection précise difficile.
- Mise à jour constante : avec de nouveaux modèles de génération de voix IA publiés chaque semaine, les systèmes de détection doivent être continuellement mis à jour pour identifier les différences subtiles entre les voix réelles et générées.
- Limitations linguistiques : la plupart des modèles actuels se concentrent sur l’anglais, ce qui signifie qu’ils peuvent ne pas être efficaces pour détecter l’audio généré en espagnol ou dans d’autres langues.
Existe-t-il quelque chose d’efficace pour détecter les deepfakes vocaux ?
Diverses institutions et entreprises développent des outils pour détecter les voix générées par l’IA, mais avec des résultats mitigés. Une expérience menée par NPR (radio publique américaine) a testé 3 outils de détection de deepfake : Pindrop Security, AI or Not et AI Voice Detector.
Los resultados variaron significativamente, con algunas herramientas fallando al identificar clips generados por IA o etiquetando erróneamente voces reales como falsas.
Investigadores de la Universidad de Granada (UGR) han desarrollado un sistema pionero para discernir si un audio es real o generado por IA, integrando modelos específicos para voces de personalidades frecuentes en desinformación.
Cet outil, intégré à la Chaire RTVE-UGR, se veut une solution avancée pour vérifier l’actualité et lutter contre la désinformation.
Une autre étude menée à l’Université de Buffalo a testé 14 outils de détection de deepfake audio et a révélé qu’aucun n’était totalement fiable. Les outils testés comprenaient DeepFake-o-meter et AI or Not, avec des résultats variant considérablement en fonction de l’audio et des conditions de test.
Recommandations et approches combinées
Étant donné que les outils actuels ne sont pas totalement fiables, les experts recommandent une approche combinée pour détecter les deepfakes audio. Cela inclut l’utilisation de plusieurs méthodes de détection et de techniques supplémentaires.
Par exemple, dans la mesure du possible, vérifiez l’audio doit être effectué. Cela implique de confirmer l’authenticité de l’audio en le vérifiant à partir de sources indépendantes et fiables.
Une autre stratégie consiste à prêter attention aux détails subtils, tels que l’écoute des irrégularités respiratoires, des pauses et des intonations qui pourraient indiquer une manipulation de l’IA.
D’autres stratégies font appel à la psychologie, comme remettre en question l’urgence d’une demande. Par exemple, les audios demandant de toute urgence des informations personnelles ou financières doivent toujours être traités avec suspicion, car ce sentiment d’urgence sert à empêcher les victimes de vérifier les informations.
De grandes plateformes comme Meta et TikTok développent des technologies pour marquer le contenu généré par l’IA, qui pourrait également inclure de l’audio à l’avenir.
L’avenir de la détection vocale créé par l’IA
Alors que la technologie de génération vocale par l’IA continue d’évoluer, il est essentiel que les outils de détection suivent le rythme. La collaboration entre les développeurs de technologies de synthèse vocale et les experts en détection peut accroître la précision et l’efficacité de ces outils.
De plus, la mise en œuvre de politiques et de réglementations exigeant l’identification du contenu généré par l’IA peut contribuer à atténuer l’impact de la désinformation et d’autres utilisations malveillantes.
En résumé, même si la détection vocale générée par l’IA présente de nombreux défis, les progrès continus dans la recherche et le développement d’outils ciblés promettent d’améliorer notre capacité à identifier et à atténuer les risques associés.
Il est essentiel que la société reste vigilante et adopte des approches combinées pour se protéger contre les menaces émergentes posées par cette technologie en évolution rapide.
This post is also available in: