
HunyuanVideo-I2V
Tencent Hunyuan Team · 동영상
HunyuanVideo-I2V는 Tencent의 오픈소스 이미지-투-비디오 모델로, 정지 이미지 한 장과 텍스트 프롬프트를 받아 짧은 애니메이션 클립으로 바꾼다. 이전의 HunyuanVideo 텍스트-투-비디오 시스템을 토대로 하되, 출발점을 글로 쓴 설명에서 실제 이미지로 바꾼 덕분에 첫 프레임이 항상 업로드한 내용과 맞는다. 모델은 Hugging Face에 오픈 가중치로 공개되며 추론 코드와 LoRA 학습 스크립트도 함께 제공된다. 즉, 클립마다 비용을 내는 대신 직접 실행하는 방식이다.

HunyuanVideo-I2V 소개
HunyuanVideo-I2V란
HunyuanVideo-I2V는 Tencent의 Hunyuan 팀이 2025년 3월에 공개한 이미지-투-비디오 AI 모델이다. 호스팅 서비스와 달리 다운로드하는 모델군이다. PyTorch 정의, 사전 학습된 가중치, 샘플링 코드가 모두 담겨 있고 전부 Tencent Hunyuan Community License 아래에 있다. 매력은 통제권에 있다. 파이프라인은 내 것이고, 하드웨어에서 무엇이 돌아갈지 내가 정하며, 생성 횟수에 요금이 붙지 않는다.
이 모델은 구체적인 문제를 푼다. 텍스트-투-비디오 모델은 상상한 장면에서 자주 벗어난다. 말로 장면을 묘사하는 방식이 느슨하기 때문이다. 이미지에서 시작하면 그 모호함이 사라진다. 출력은 참조 프레임의 피사체, 조명, 구도를 유지하고 그 위에 움직임을 더한다. 제품 사진, 인물 사진, 콘셉트 아트를 움직일 때 이 점이 중요하다.
걸림돌은 하드웨어다. 130억 파라미터 모델이고, 720p 파이프라인은 VRAM을 많이 요구한다. 커뮤니티 보고에 따르면 실질 하한은 45~60GB 정도이며, Tencent 자체 안내도 가장 매끄러운 실행에는 80GB 카드를 가리킨다. 양자화 가중치는 그 기준을 낮추지만 노트북 수준까지는 아니다. 게이밍 PC가 있는가? 그것으로는 부족하다. 데이터센터 GPU가 없다면 카드를 사기보다 클라우드 연산을 빌리는 편이 낫다.
시작하는 방법
- 공식 GitHub 저장소를 클론하고 Python 환경을 만든 뒤 requirements.txt에 나열된 의존성을 설치한다.
- Hugging Face(tencent/HunyuanVideo-I2V)에서 모델 가중치를 ckpts 폴더로 내려받거나 huggingface-cli 도구로 가져온다.
- 참조 이미지, 원하는 움직임을 적은 텍스트 프롬프트, 해상도 설정을 넣고 제공된 추론 스크립트를 실행한다.
- 샘플링 과정이 끝나기를 기다린 뒤 출력 영상을 확인한다. 움직임이 원하는 대로가 아니면 프롬프트나 시드를 조정한다.
- 반복해서 쓸 효과나 스타일이 있다면 자기 클립으로 LoRA를 미세 조정할 수 있다.
제품 정보
HunyuanVideo-I2V의 요금, 지원 플랫폼, 성능을 한눈에 확인해 보세요.
추천 대상
이 도구가 가장 잘 맞는 사용자, 작업, 상황입니다.
사용자
- AI 연구자와 ML 엔지니어
- 인디 애니메이터와 모션 디자이너
- 동영상 기능을 만드는 개발자
작업
- 정지 이미지 움직이기
- 맞춤형 동영상 효과 만들기
- 연구와 벤치마킹
활용 상황
- 고객의 정지 목업을 제안용 영상으로 바꾸기
- 짧은 장면의 프리비즈
- 자체 호스팅 동영상 도구 만들기
주요 기능
이미지-투-비디오 생성
핵심 작업은 단순하다. 참조 이미지와 프롬프트를 주면 720p, 최대 129프레임, 24fps 기준 약 5초의 클립을 돌려준다. 모델은 이미지를 닻으로 쓰기 때문에 첫 프레임이 쓴 설명을 처음부터 다시 해석하는 대신 제공한 내용과 맞는다.
첫 프레임 일관성
초기 오픈 동영상 모델에는 움직임이 시작되는 순간 피사체를 일그러뜨리는 고약한 습관이 있었다. Tencent는 2025년 3월에 정체성이 바뀌는 버그를 고쳤고, 갱신된 가중치는 첫 프레임을 훨씬 충실히 유지한다. 알아볼 수 있는 얼굴이나 브랜드 물체가 관련된 일이라면 그 일관성이 전부다. 실제로 작동한다. 많은 사람이 갈아탄 이유도 여기에 있다.
맞춤 효과를 위한 LoRA 학습
이번 공개에는 LoRA 학습 스크립트가 들어 있어 자기 소재로 작은 어댑터를 미세 조정할 수 있다. 특정 움직임이나 시각 스타일을 모델에 가르쳐 재사용할 수 있고, 130억 모델 전체를 다시 학습할 필요는 없다. 범용 모델을 내 작업에 맞춰 주는 기능이다.
MLLM 인코더를 통한 멀티모달 이해
HunyuanVideo-I2V는 흔한 CLIP과 T5 조합 대신 디코더 전용 멀티모달 언어 모델을 텍스트 인코더로 쓴다. 쉽게 말해 이미지와 프롬프트를 함께 읽고 둘을 동시에 추론한다. 무엇이 어떻게 움직여야 하는지에 대한 세밀한 지시를 따르는 데 도움이 된다.
멀티 GPU 병렬 추론
Tencent는 xDiT에 기반한 병렬 추론 코드를 함께 내놓아 한 번의 생성을 여러 GPU에 나눌 수 있다. 모델이 약한 하드웨어에 들어가게 해주지는 않지만, 멀티 GPU 머신과 렌더링할 클립 묶음이 이미 있다면 실제 시간을 줄여준다. 한 장으로 렌더링이 느리다고? 두 장이나 네 장을 묶으면 대기가 빠르게 줄어든다.
장단점
장점
- 가중치와 코드가 완전히 열려 있어 생성마다 비용을 내지 않고 실행하고 살펴보고 고칠 수 있다.
- 2025년 3월 수정 이후 첫 프레임 일관성이 강해 얼굴과 브랜드 물체에서 중요하다.
- LoRA 학습 스크립트가 포함되어 기성 효과에 만족하지 않고 자체 효과를 만들 수 있다.
- 720p, 최대 129프레임 출력을 지원해 쓸 만한 몇 초의 소재에는 충분하다.
- 병렬 추론 코드가 여러 GPU 머신에서 렌더링 시간을 줄여준다.
단점
- 130억 모델이고 실질 VRAM 하한이 45~60GB라 소비자용 카드는 양자화를 해도 버겁다.
- 이 저장소에 묶인 공식 호스팅 API가 없어 서빙 스택, 확장, 가동률을 직접 맡아야 한다.
- 클립은 5초 근처가 상한이라 더 긴 시퀀스는 이어 붙이기와 꼼꼼한 프롬프트 설계가 필요하다.
- 설치 과정이 Python 환경, 모델 가중치, 명령줄에 익숙하다고 전제해 비기술 사용자는 배제된다.
자주 묻는 질문
정지 이미지에서 영상을 생성하며 입력 프레임을 시각적 닻으로 유지한다. 대표적인 용도는 콘셉트 아트 움직이기, 제품 사진에 움직임 더하기, 연구나 프리비즈용 짧은 클립 만들기다.
관련 콘텐츠
HunyuanVideo-I2V와 관련된 도구, 스킬, 아티클을 살펴보세요.
HunyuanVideo-I2V 대안
Vadu AI
Vadu AI · 이미지 · 동영상Vadu AI는 작성한 프롬프트나 정지 이미지를 짧은 클립으로 바꾸는 웹 기반 AI 영상 생성기이며, 이미지를 단독으로 생성하기도 한다. 원하는 내용을 입력하고 모델과 스타일을 고르면 플랫폼이 몇 분 만에 결과를 렌더링한다. 무료 플랜은 가벼운 테스트를 감당하는 수준이고, 유료 등급은 소비한 크레딧에 따라 월 9달러에서 77.40달러까지 이어진다.
Mykaraoke Video
MyKaraoke Video · 동영상Mykaraoke Video는 온라인에서 쓰는 캐러오케 영상 및 가사 영상 제작기로, 어떤 노래든 브라우저 안에서 가사가 동기화된 완성 영상으로 만든다. 귀찮은 부분을 대신 처리한다. AI가 믹스에서 보컬을 뽑아내고 가사를 박자에 맞춘 뒤, 배경과 글꼴, 색상을 조정하고 1080p MP4로 내보낼 수 있다. SNS, 파티, 음악 홍보용 가사 영상을 만든다면 소프트웨어 설치와 수작업 타이밍 맞추기를 통째로 건너뛸 수 있다. 저녁 시간을 다 잡아먹지 않는 캐러오케 영상 생성기를 원하는가? 그게 이 도구의 제안이다.
Finalframe
Finalframe · 동영상Finalframe은 동영상 클립에서 정확한 프레임을 뽑아내는 무료 브라우저 도구 모음이다. 가장 잘 알려진 기능인 마지막 프레임 추출 도구를 쓰면 어떤 동영상이든 마지막 프레임을 뽑아 Luma Dream Machine, Runway, Kling 같은 AI 동영상 도구의 시작 이미지로 쓸 수 있다. 클립을 이어가고 싶은가? 그 마지막 프레임이 출발점이다. 도구는 사용자의 브라우저에서 실행되고 가입도 비용도 필요 없다. 같은 팀이 만든 별도의 유료 AI 동영상 생성 앱은 다시 만드는 중이라 현재 오프라인이다.
