HunyuanVideo-I2V

HunyuanVideo-I2V

Tencent Hunyuan Team · Vídeo

HunyuanVideo-I2V es el modelo de imagen a vídeo de código abierto de Tencent, y toma una imagen fija más un texto de instrucción para convertirlos en un clip animado corto. Parte del sistema anterior HunyuanVideo de texto a vídeo, pero cambia el punto de partida: en lugar de una descripción escrita, usa una imagen real, así que el primer fotograma siempre coincide con lo que subes. El modelo se distribuye con pesos abiertos en Hugging Face, junto con el código de inferencia y los scripts de entrenamiento LoRA. Eso significa que lo ejecutas tú mismo en lugar de pagar por cada clip.

Vista previa de la interfaz de HunyuanVideo-I2V

Acerca de HunyuanVideo-I2V

Qué es HunyuanVideo-I2V

HunyuanVideo-I2V es un modelo de IA de imagen a vídeo que el equipo Hunyuan de Tencent lanzó en marzo de 2025. A diferencia de un servicio alojado, es una familia de modelos que descargas: definiciones de PyTorch, pesos preentrenados y código de muestreo, todo bajo la Tencent Hunyuan Community License. El atractivo está en el control. Tú eres dueño del flujo de trabajo, tú decides qué corre en tu hardware y nadie te cobra por generación.

Resuelve un problema concreto. Los modelos de texto a vídeo suelen alejarse de lo que imaginabas, porque las palabras son una forma imprecisa de describir una escena. Partir de una imagen elimina esa ambigüedad. La salida conserva el sujeto, la iluminación y la composición de tu fotograma de referencia, y encima añade movimiento. Eso importa cuando animas la foto de un producto, un retrato o arte conceptual.

El problema es el hardware. Es un modelo de 13 000 millones de parámetros, y la ruta de 720p exige mucha VRAM. Los reportes de la comunidad sitúan el mínimo práctico entre 45 y 60 GB, y la propia guía de Tencent apunta a tarjetas de 80 GB para las ejecuciones más fluidas. Los pesos cuantizados bajan ese listón, pero no hasta el terreno de un portátil. ¿Tienes un PC gamer? No te va a alcanzar. Si no dispones de una GPU de centro de datos, te conviene más alquilar cómputo en la nube que comprar una tarjeta.

Cómo empezar

  1. Clona el repositorio oficial de GitHub y prepara un entorno de Python, luego instala las dependencias que aparecen en requirements.txt.
  2. Descarga los pesos del modelo desde Hugging Face (tencent/HunyuanVideo-I2V) a la carpeta ckpts, o tráelos con la herramienta huggingface-cli.
  3. Ejecuta el script de inferencia con tu imagen de referencia, un texto de instrucción que describa el movimiento que quieres y tus ajustes de resolución.
  4. Espera a que termine la pasada de muestreo y revisa el vídeo resultante. Si el movimiento no es el que tenías en mente, ajusta la instrucción o la semilla.
  5. Si quieres un efecto o un estilo recurrente, puedes afinar un LoRA con tus propios clips.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de HunyuanVideo-I2V.

Plan gratuitoSí
Planes de pago$0 (open weights, self-hosted)
PlataformaLinux (local GPU deployment), cloud GPU
DesarrolladorTencent Hunyuan Team
CategoríaVídeo
Fecha de lanzamientoMar 2025
Última actualizaciónMar 2025
Visitas al sitio web649.3M
Ranking global del sitio50
Disponibilidad de la APIN/A

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Investigadores de IA e ingenieros de ML
  • Animadores independientes y diseñadores de movimiento
  • Desarrolladores que crean funciones de vídeo

Tareas

  • Animar una imagen fija
  • Crear efectos de vídeo personalizados
  • Investigación y evaluación comparativa

Casos de uso

  • Convertir el boceto fijo de un cliente en un vídeo de presentación
  • Previsualizar una escena corta
  • Crear una herramienta de vídeo autoalojada

Funciones clave

Generación de imagen a vídeo

La tarea central es simple. Le das una imagen de referencia y una instrucción, y devuelve un clip de 720p de hasta 129 fotogramas, unos cinco segundos a 24 fps. El modelo usa la imagen como ancla, así que el fotograma inicial coincide con lo que entregaste en lugar de reinterpretar tu descripción escrita desde cero.

Consistencia del primer fotograma

Los primeros modelos de vídeo abiertos tenían la mala costumbre de deformar al sujeto en cuanto empezaba el movimiento. Tencent corrigió en marzo de 2025 un error que provocaba cambios de identidad, y los pesos actualizados mantienen el primer fotograma con mucha más fidelidad. Para cualquier cosa con una cara reconocible o un objeto de marca, esa consistencia lo es todo. Funciona. Y es la razón por la que mucha gente se pasó a este modelo.

Entrenamiento LoRA para efectos personalizados

El lanzamiento incluye scripts de entrenamiento LoRA, que te dejan afinar un adaptador pequeño con tu propio material. Puedes enseñarle al modelo un movimiento o un estilo visual concreto y reutilizarlo, sin reentrenar el modelo completo de 13 000 millones. Es la función que convierte un modelo de propósito general en algo hecho a medida para tu trabajo.

Comprensión multimodal con codificador MLLM

HunyuanVideo-I2V usa un modelo de lenguaje multimodal solo decodificador como codificador de texto, en lugar de la combinación habitual de CLIP y T5. Dicho en simple: lee tu imagen y tu instrucción juntas y razona sobre ambas a la vez, lo que le ayuda a seguir instrucciones detalladas sobre qué debe moverse y cómo.

Inferencia paralela en varias GPU

Tencent incluyó código de inferencia paralela respaldado por xDiT, así que puedes repartir una sola generación entre varias GPU. No hace que el modelo quepa en hardware más débil, pero sí acorta el tiempo real cuando ya tienes una máquina con varias GPU y un lote de clips que renderizar. ¿Renderizados lentos en una sola tarjeta? Junta dos o cuatro y la espera se reduce rápido.

Ventajas y desventajas

Ventajas

  • Pesos y código totalmente abiertos, así que puedes ejecutar, inspeccionar y modificar el modelo sin pagar por generación.
  • Fuerte consistencia del primer fotograma tras la corrección de marzo de 2025, algo clave con caras y objetos de marca.
  • Los scripts de entrenamiento LoRA vienen incluidos, lo que te deja crear efectos propios en lugar de conformarte con los de serie.
  • Admite salida de 720p de hasta 129 fotogramas, suficiente para unos segundos de material utilizables.
  • El código de inferencia paralela acorta los tiempos de render en máquinas con varias GPU.

Desventajas

  • Es un modelo de 13 000 millones, y el mínimo práctico de VRAM ronda los 45 a 60 GB, así que las tarjetas de consumo sufren incluso con cuantización.
  • No hay una API alojada oficial ligada a este repositorio, lo que significa que tú gestionas la infraestructura de servicio, el escalado y la disponibilidad.
  • Los clips llegan como máximo a unos cinco segundos, así que las secuencias más largas necesitan empalmes y una planificación cuidadosa de las instrucciones.
  • La instalación da por hecho que te manejas con entornos de Python, pesos de modelos y la línea de comandos, lo que deja fuera a los usuarios no técnicos.

Preguntas frecuentes

Genera vídeo a partir de una imagen fija, manteniendo el fotograma de entrada como ancla visual. Sus usos típicos son animar arte conceptual, añadir movimiento a fotos de productos y producir clips cortos para investigación o previsualización.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con HunyuanVideo-I2V.

Alternativas a HunyuanVideo-I2V

Vadu AI

Vadu AI

Vadu AI · Imagen · Vídeo

Vadu AI es un generador de video con IA basado en web que convierte indicaciones escritas o imágenes fijas en clips cortos, y también crea imágenes por su cuenta. Escribes lo que quieres, eliges un modelo y un estilo, y la plataforma genera el resultado en minutos. Un plan gratuito cubre pruebas ligeras, mientras que los niveles de pago van de 9 a 77,40 dólares al mes según cuántos créditos gastes.

Gratis / $9 - $77.40/moVer detalles
Mykaraoke Video

Mykaraoke Video

MyKaraoke Video · Vídeo

Mykaraoke Video es un creador de videos karaoke y de videos con letras que funciona online y convierte cualquier canción en un video terminado y con las letras sincronizadas directamente en el navegador. Se encarga de la parte lenta por ti. La IA separa las voces de la mezcla y ajusta la letra al ritmo, y luego personalizas el fondo, las fuentes y los colores antes de exportar en MP4 a 1080p. Si haces videos con letras para redes sociales, noches de fiesta o promoción musical, te ahorras por completo las instalaciones de software y el trabajo de sincronizar a mano. ¿Quieres un generador de videos karaoke que no te consuma toda la tarde? Esa es la propuesta.

Gratis / $0 - $6/moVer detalles
Finalframe

Finalframe

Finalframe · Vídeo

Finalframe es un conjunto de herramientas gratuitas que funcionan en el navegador y sirven para sacar fotogramas exactos de un clip de vídeo. Su función más conocida, el Extractor de Último Fotograma, te deja extraer el último fotograma de cualquier vídeo para usarlo como imagen inicial en herramientas de vídeo con IA como Luma Dream Machine, Runway o Kling. ¿Quieres seguir un clip? Ese último fotograma es tu punto de partida. La herramienta se ejecuta en tu propio navegador, no pide registro y no cuesta nada. Una app aparte de generación de vídeo con IA, de pago y del mismo equipo, está fuera de línea mientras la reconstruyen.

Gratis / $0Ver detalles