HunyuanVideo-I2V

HunyuanVideo-I2V

Tencent Hunyuan Team · Vidéo

HunyuanVideo-I2V est le modèle image-vers-vidéo open source de Tencent, et il prend une image fixe plus une instruction textuelle pour en faire un court clip animé. Il s'appuie sur le système précédent HunyuanVideo de texte-vers-vidéo, mais change le point de départ : au lieu d'une description écrite, il utilise une vraie image, si bien que la première image correspond toujours à ce que vous avez envoyé. Le modèle est distribué avec des poids ouverts sur Hugging Face, accompagnés du code d'inférence et des scripts d'entraînement LoRA. Autrement dit, vous l'exécutez vous-même au lieu de payer à chaque clip.

Aperçu de l'interface de HunyuanVideo-I2V

À propos de HunyuanVideo-I2V

Qu'est-ce que HunyuanVideo-I2V

HunyuanVideo-I2V est un modèle IA image-vers-vidéo publié par l'équipe Hunyuan de Tencent en mars 2025. Contrairement à un service hébergé, c'est une famille de modèles que vous téléchargez : définitions PyTorch, poids pré-entraînés et code d'échantillonnage, le tout sous la Tencent Hunyuan Community License. L'attrait, c'est le contrôle. La chaîne vous appartient, vous décidez de ce qui tourne sur votre matériel, et personne ne facture vos générations.

Il résout un problème précis. Les modèles texte-vers-vidéo s'écartent souvent de ce que vous avez imaginé, parce que les mots décrivent mal une scène. Partir d'une image lève cette ambiguïté. La sortie conserve le sujet, l'éclairage et la composition de votre image de référence, et ajoute du mouvement par-dessus. Cela compte quand vous animez une photo de produit, un portrait ou une illustration conceptuelle.

Le hic, c'est le matériel. C'est un modèle de 13 milliards de paramètres, et la chaîne 720p réclame beaucoup de VRAM. Les retours de la communauté situent le plancher pratique entre 45 et 60 GB, et les recommandations de Tencent pointent vers des cartes de 80 GB pour les exécutions les plus fluides. Les poids quantifiés abaissent ce seuil, mais pas jusqu'à un ordinateur portable. Un PC gamer ? Ça ne suffira pas. Sans GPU de datacenter, mieux vaut louer du calcul cloud qu'acheter une carte.

Pour commencer

  1. Clonez le dépôt GitHub officiel et préparez un environnement Python, puis installez les dépendances listées dans requirements.txt.
  2. Téléchargez les poids depuis Hugging Face (tencent/HunyuanVideo-I2V) dans le dossier ckpts, ou récupérez-les avec l'outil huggingface-cli.
  3. Lancez le script d'inférence avec votre image de référence, une instruction textuelle décrivant le mouvement voulu et vos réglages de résolution.
  4. Attendez la fin de la passe d'échantillonnage, puis vérifiez la vidéo obtenue. Si le mouvement ne correspond pas, ajustez l'instruction ou la graine.
  5. Si vous voulez un effet ou un style récurrent, vous pouvez affiner un LoRA sur vos propres clips.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de HunyuanVideo-I2V.

Offre gratuiteOui
Offres payantes$0 (open weights, self-hosted)
PlateformeLinux (local GPU deployment), cloud GPU
DéveloppeurTencent Hunyuan Team
CatégorieVidéo
Date de lancementMar 2025
Dernière mise à jourMar 2025
Visites du site649.3M
Classement mondial du site50
Disponibilité de l’APIN/A

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Chercheurs en IA et ingénieurs ML
  • Animateurs indépendants et motion designers
  • Développeurs qui créent des fonctions vidéo

Tâches

  • Animer une image fixe
  • Créer des effets vidéo personnalisés
  • Recherche et comparaison

Cas d'usage

  • Transformer la maquette fixe d'un client en vidéo de présentation
  • Prévisualiser une courte scène
  • Monter un outil vidéo auto-hébergé

Fonctionnalités clés

Génération image-vers-vidéo

La tâche centrale est simple. Vous donnez une image de référence et une instruction, et il renvoie un clip 720p allant jusqu'à 129 images, soit environ cinq secondes à 24 fps. Le modèle utilise l'image comme ancre, donc l'image d'ouverture correspond à ce que vous avez fourni au lieu de réinterpréter votre description écrite depuis zéro.

Cohérence de la première image

Les premiers modèles vidéo ouverts avaient la fâcheuse habitude de déformer le sujet dès que le mouvement démarrait. Tencent a corrigé en mars 2025 un bug qui provoquait des changements d'identité, et les poids mis à jour tiennent bien mieux la première image. Pour tout ce qui implique un visage reconnaissable ou un objet de marque, cette cohérence est l'essentiel. Ça marche. Et c'est la raison pour laquelle beaucoup de gens ont basculé.

Entraînement LoRA pour effets personnalisés

La publication inclut des scripts d'entraînement LoRA, qui vous laissent affiner un petit adaptateur sur vos propres images. Vous pouvez enseigner au modèle un mouvement ou un style visuel précis et le réutiliser, sans réentraîner le modèle complet de 13 milliards. C'est la fonction qui transforme un modèle généraliste en outil taillé pour votre travail.

Compréhension multimodale via encodeur MLLM

HunyuanVideo-I2V utilise un modèle de langage multimodal décodeur seul comme encodeur de texte, au lieu du duo habituel CLIP et T5. En clair, il lit votre image et votre instruction ensemble et raisonne sur les deux à la fois, ce qui l'aide à suivre des consignes détaillées sur ce qui doit bouger et comment.

Inférence parallèle multi-GPU

Tencent a livré du code d'inférence parallèle reposant sur xDiT, si bien que vous pouvez répartir une seule génération sur plusieurs GPU. Cela ne fait pas tenir le modèle sur du matériel plus faible, mais cela raccourcit le temps réel quand vous avez déjà une machine multi-GPU et une série de clips à rendre. Des rendus lents sur une seule carte ? Associez deux ou quatre cartes et l'attente fond vite.

Avantages et inconvénients

Avantages

  • Poids et code entièrement ouverts, donc vous pouvez exécuter, inspecter et modifier le modèle sans payer à la génération.
  • Forte cohérence de la première image après le correctif de mars 2025, ce qui compte pour les visages et les objets de marque.
  • Les scripts d'entraînement LoRA sont inclus, ce qui vous laisse créer vos propres effets au lieu de vous contenter de ceux d'origine.
  • Sortie 720p jusqu'à 129 images, assez pour quelques secondes exploitables.
  • Le code d'inférence parallèle raccourcit les temps de rendu sur les machines à plusieurs GPU.

Inconvénients

  • C'est un modèle de 13 milliards, et le plancher pratique de VRAM tourne autour de 45 à 60 GB, donc les cartes grand public souffrent même avec la quantification.
  • Aucune API hébergée officielle n'est liée à ce dépôt, ce qui veut dire que vous gérez la pile de service, la montée en charge et la disponibilité.
  • Les clips plafonnent à environ cinq secondes, donc les séquences plus longues demandent un montage et une préparation soignée des instructions.
  • L'installation suppose que vous êtes à l'aise avec les environnements Python, les poids de modèles et la ligne de commande, ce qui exclut les utilisateurs non techniques.

Questions fréquentes

Il génère une vidéo à partir d'une image fixe, en gardant l'image d'entrée comme ancre visuelle. Les usages typiques : animer une illustration conceptuelle, ajouter du mouvement à des photos de produits et produire de courts clips pour la recherche ou la prévisualisation.

Contenus associés

Découvrez des outils, des compétences et des articles liés à HunyuanVideo-I2V.

Alternatives à HunyuanVideo-I2V

Vadu AI

Vadu AI

Vadu AI · Image · Vidéo

Vadu AI est un générateur de vidéo par IA basé sur le web qui transforme des invites écrites ou des images fixes en clips courts, et il crée aussi des images de son propre chef. Vous tapez ce que vous voulez, choisissez un modèle et un style, et la plateforme produit le résultat en quelques minutes. Une offre gratuite couvre les tests légers, tandis que les formules payantes vont de 9 à 77,40 dollars par mois selon le nombre de crédits que vous consommez.

Gratuit / $9 - $77.40/moVoir les détails
Mykaraoke Video

Mykaraoke Video

MyKaraoke Video · Vidéo

Mykaraoke Video est un créateur de vidéos karaoké et de vidéos avec paroles qui fonctionne en ligne et transforme n'importe quelle chanson en une vidéo finie, paroles synchronisées, directement dans votre navigateur. Il s'occupe de la partie fastidieuse à votre place. L'IA extrait les voix du mixage et cale les paroles sur le rythme, puis vous personnalisez l'arrière-plan, les polices et les couleurs avant d'exporter en MP4 1080p. Si vous créez des vidéos avec paroles pour les réseaux sociaux, des soirées ou la promotion musicale, vous évitez complètement les installations logicielles et le travail de synchronisation manuelle. Vous voulez un générateur de vidéos karaoké qui ne vous mange pas toute la soirée ? C'est la promesse.

Gratuit / $0 - $6/moVoir les détails
Finalframe

Finalframe

Finalframe · Vidéo

Finalframe est un ensemble d'outils gratuits qui tournent dans le navigateur et servent à sortir des trames précises d'un clip vidéo. Sa fonction la plus connue, l'Extracteur de Dernière Trame, permet d'extraire la dernière trame de n'importe quelle vidéo pour l'utiliser comme image de départ dans des outils vidéo IA comme Luma Dream Machine, Runway ou Kling. Vous voulez prolonger un clip ? Cette dernière trame est votre point de départ. L'outil tourne dans votre propre navigateur, ne demande aucun compte et ne coûte rien. Une application séparée de génération vidéo par IA, payante et de la même équipe, est hors ligne le temps d'être reconstruite.

Gratuit / $0Voir les détails