Avec l’annonce récente de

X-Portrait 2 permet aux créateurs d’animer des portraits à partir d’une seule image fixe et d’une vidéo de référence, qui peuvent avoir de multiples applications dans les domaines du divertissement, des médias sociaux, du cinéma et des jeux vidéo.

Nous explorerons ensuite en profondeur le fonctionnement, les caractéristiques et les éventuelles implications éthiques de cette technologie d’intelligence artificielle.

Qu’est-ce que X-Portrait 2 ?

X-Portrait 2 est une technologie qui utilise des modèles génératifs avancés pour animer des images statiques de visages, reproduisant des gestes, des mouvements et des expressions faciales à partir d’une vidéo de référence.

Contrairement à d’autres outils de génération vidéo, X-Portrait 2 a été développé spécifiquement pour capturer des détails très fins, atteignant un niveau d’expressivité et de précision qui n’était auparavant possible qu’avec des techniques complexes de capture de mouvement.

Des sourires subtils aux expressions complexes telles que gonfler les joues, tirer la langue ou froncer les sourcils, cette technologie peut transférer chaque détail expressif, en conservant la fidélité des traits du visage d’origine dans l’image statique.

L’outil est particulièrement utile pour les animateurs et les créateurs de contenu car il offre une alternative plus accessible à l’animation traditionnelle ou à la capture de mouvement, réduisant considérablement le temps et les ressources nécessaires pour créer des scènes réalistes.

Comment fonctionne X-Portrait 2 ?

X-Portrait 2 utilise une combinaison d’intelligence artificielle et de modèles de diffusion latente, qui générent des animations à partir d’une image fixe (appelée « portrait de référence ») et d’une vidéo fournissant des expressions faciales et des mouvements (appelée « vidéo de conduite »).

Ces modèles de diffusion latente fonctionnent en décomposant le processus de génération d’images en plusieurs étapes, permettant un contrôle granulaire de l’identité et des expressions du visage.

Pour garantir que chaque expression faciale est transférée avec précision et que l’identité du visage d’origine n’est pas altérée, X-Portrait 2 utilise des modules avancés d’attention au mouvement, notamment ControlNet, un système qui garantit que le transfert de gestes est cohérent et réaliste.

ControlNet, en particulier, est capable de cartographier les repères faciaux de la vidéo de conduite au portrait de référence, ce qui est crucial pour obtenir une animation naturelle et fluide.

Concurrents dans le domaine de l’animation de portraits

X-Portrait 2 fait face à une concurrence croissante de la part des outils qui appliquent l’intelligence artificielle à l’animation de visages et à la manipulation d’images et de vidéos. Les concurrents notables dans cet espace incluent :

Acte 1 sur la piste

L’une des alternatives les plus avancées, Runway Act-One utilise des modèles d’apprentissage en profondeur pour l’animation d’images et la génération de vidéos à partir d’instructions textuelles.

Bien que Runway se soit initialement concentré sur le montage vidéo pour les créateurs de contenu, la plateforme a également introduit des outils d’animation faciale qui vous permettent de générer des mouvements et des expressions à partir d’un visage statique.

Cependant, contrairement à X-Portrait 2, Act-One a une orientation plus générale vers la création vidéo et le montage numérique, tandis que X-Portrait 2 se spécialise dans la fidélité des expressions et les détails subtils du visage.

DeepFaceLab

Cet outil open source est largement utilisé pour créer des deepfakes et est devenu populaire dans la recherche universitaire et parmi les passionnés de traitement d’images.

Bien que DeepFaceLab permette une manipulation avancée des visages dans la vidéo, il lui manque la précision des détails d’expression que X-Portrait 2 peut offrir.

Refaire le visage

Orienté vers le consommateur, Reface permet aux utilisateurs de changer de visage dans de courtes vidéos et GIF de manière rapide et amusante.

Bien qu’il s’agisse d’une option amusante pour l’utilisateur moyen, elle ne dispose pas des capacités techniques et détaillées qu’offre X-Portrait 2, notamment en ce qui concerne la qualité de transfert d’expressions faciales spécifiques et complexes.

Comment tester X-Portrait 2 ?

X-Portrait 2 n’est pas encore largement accessible au grand public, mais ceux qui souhaitent expérimenter cette technologie devraient avoir accès à certaines ressources.

Actuellement, le modèle nécessite du matériel puissant (comme des GPU haut de gamme), en raison de la complexité des calculs nécessaires au transfert des mouvements et des expressions.

Selon la documentation, le code source de X-Portrait 2 est disponible sur GitHub, ce qui permet aux développeurs et aux universitaires de tester et d’expérimenter l’outil de manière contrôlée et non commerciale.

Pour de meilleurs résultats, les utilisateurs ont besoin d’images de haute qualité et de vidéos de référence qui capturent clairement les expressions faciales qu’ils souhaitent transférer. Vous pouvez voir quelques exemples sur leur page de présentation.

ByteDance a indiqué qu’il travaillerait sur les futures versions qui optimiseraient le modèle pour réduire les besoins en matériel, le rendant ainsi plus facile d’accès pour un public plus large.

La technologie d’animation de portraits est-elle dangereuse ?

Le développement de technologies telles que X-Portrait 2 suscite diverses inquiétudes quant à son éventuelle utilisation abusive, notamment dans un contexte où les deepfakes ont déjà suscité la controverse.

En facilitant la création d’animations faciales réalistes, il existe un risque que cette technologie soit utilisée à des fins trompeuses, voire criminelles, comme la création de fausses vidéos de personnalités publiques ou la diffusion de contenus manipulés sans consentement.

Pour atténuer ces risques, il est essentiel que ByteDance et d’autres développeurs de technologies similaires établissent des politiques et des contrôles éthiques. Par exemple :

  • Limiter l’utilisation de ces outils aux applications contrôlées et interdire leur distribution massive jusqu’à ce que des méthodes de vérification robustes puissent être mises en œuvre.

– Inclure des marqueurs visuels ou de métadonnées dans les vidéos générées qui nous permettent d’identifier que le contenu a été généré par l’IA, ce qui contribuerait à empêcher que les vidéos ne soient utilisées à des fins malveillantes.

Et bien sûr, travaillez avec les régulateurs pour créer des lois qui protègent contre l’utilisation abusive des technologies d’animation de portraits et de deepfake.

Dans plusieurs pays, des lois contre la création de deepfakes non autorisés ont déjà commencé à être mises en œuvre, créant un précédent important pour l’utilisation éthique de X-Portrait 2 et de technologies similaires.

This post is also available in: Español Русский Italiano English