LongCat Video Avatar 1.5의 기능
LongCat Avatar 1.5는 단순히 오디오에 맞춰 입술을 움직이는 것을 넘어, 사진과 음성 파일만으로 완전한 말하기, 노래하기, 애니메이션 영상을 조립해냅니다.

사진과 오디오 파일을 업로드하기만 하면, LongCat Avatar 1.5가 말하거나 노래하거나 애니메이션으로 움직이는 영상으로 만들어줍니다. 편집 기술은 필요 없습니다.
LongCat Video Avatar 무료로 사용해보기























LongCat Avatar 1.5는 단순히 오디오에 맞춰 입술을 움직이는 것을 넘어, 사진과 음성 파일만으로 완전한 말하기, 노래하기, 애니메이션 영상을 조립해냅니다.

한 모델이 3가지 작업을 동시에 처리합니다. '오디오 텍스트를 영상으로'는 스크립트와 음성 트랙만으로 말하는 캐릭터를 구성합니다. '오디오 텍스트 이미지를 영상으로'는 제공한 참조 사진을 애니메이션화하며, '영상 연속 생성'은 기존 클립을 확장하여 더 긴 말하는 장면을 만들어냅니다.
LongCat Avatar 1.5는 Whisper Large를 사용하여 오디오를 읽고 각 입술 움직임을 실제 음성에 맞춰 타이밍을 조정합니다. 이를 통해 톤과 속도가 변하는 긴 클립에서도 립싱크가 타이트하고 자연스럽게 유지됩니다.
이 도구는 2개의 별도 오디오 스트림을 받아 각각 프레임 내 다른 사람과 싱크를 맞출 수 있습니다. 이를 통해 두 화자가 같은 장면에서 자연스럽게 말하고, 반응하고, 번갈아 가며 대화할 수 있습니다. 인터뷰, 듀엣 또는 두 사람이 프레임을 공유하는 모든 클립에 완벽하게 적합합니다.
INT8 양자화와 함께 단 8개의 생성 단계만으로 실행되어, 품질의 실질적인 저하 없이 처리 시간을 단축합니다. 이는 더 빠른 출력을 의미하므로 영상 렌더링을 오래 기다릴 필요가 없습니다.
타사의 서버에서 모델을 운영한다는 것은 그들의 제한, 비용, 그리고 다운타임을 감수해야 한다는 뜻입니다. 팀들이 LongCat Avatar 1.5를 자체 호스팅하는 이유를 알려드립니다.
LongCat은 MIT 라이선스로 공개되어, 팀이 라이선스 비용을 지불하거나 허락을 구하지 않고도 사용, 수정, 배포할 수 있습니다. 이는 무료라고 하면서도 생성당 요금을 청구하거나 유료 기능 뒤에 숨기는 도구들과는 다릅니다.
무료로 제작 시작하기
이 도구는 긴 발언이나 노래 장면에서도 캐릭터의 얼굴, 특징, 정체성을 일관되게 유지합니다. 즉, 클립이 길어질수록 표정이 바뀌거나 미묘하게 변하는 일 없이, 동일한 인물이 처음부터 끝까지 알아볼 수 있게 합니다.
무료로 제작 시작하기
이 모델은 책상에 앉아 이야기하는 사람에 그치지 않습니다. 애니메이션 캐릭터, 동물, 다인원 장면, 물체를 다루는 샷도 안정적으로 구현됩니다.
무료로 제작 시작하기
아바타 도구를 고려하는 팀들은 보통 비용, 통제력, 그리고 실제 출력물의 품질을 중요하게 생각합니다. 다음은 LongCat Avatar 1.5가 호스팅 옵션들과 비교했을 때의 차이점입니다:
| 플랫폼 | 라이선스 | 필요한 하드웨어 | 해상도 | 주요 사용자 |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT, 상업적 무료 | 최소 40GB GPU | 480P 및 720P | ML 엔지니어 |
| Magiclight AI | 유료 플랜에서 권리 부여 | 없음, 브라우저에서 실행 | 1080p, 최대 50분 | 스토리 크리에이터 |
| Synthesia | 분 단위 구독 | 없음, 브라우저에서 실행 | 스튜디오 품질 | 엔터프라이즈 팀 |
| Mango AI | 구독 | 없음, 브라우저 또는 휴대폰 | 표준 비디오 | 마케터 |
| HeyGen | 구독 | 없음, 브라우저에서 실행 | 스튜디오 품질 | 성장팀 |
로컬에서 실행하든 호스팅 옵션을 통해 실행하든, LongCat Avatar 1.5 설정은 몇 단계만으로 완료됩니다.
모델과 오디오 인코더에 충분한 VRAM을 가진 GPU를 사용하세요. 공식 설정은 메모리 사용량을 줄이기 위한 INT8 모드를 지원하며, 이 구성에는 40GB급 GPU가 사용됩니다.
Hugging Face에서 LongCat-Video 기본 모델과 LongCat-Video-Avatar-1.5 가중치를 모두 다운로드하세요. Avatar 1.5 설정은 기본 모델과 자체 모델 가중치를 함께 사용합니다.
오디오와, 이미지 기반 생성의 경우 참조 이미지 및 텍스트 프롬프트를 제공하세요. 더 길고 상세한 프롬프트를 권장합니다. 일관성과 자연스러운 결과를 개선할 수 있기 때문입니다.
Avatar 1.5의 경우 8단계 증류 모드를 사용하고 480P 또는 720P 해상도를 선택하세요. 표준 샘플링 컨트롤을 사용할 때 오디오 CFG는 약 3~5를 권장하며, INT8 모드는 VRAM 사용량을 줄일 수 있습니다.
머신러닝 엔지니어
아바타 사용량보다 분당 요금이 더 빠르게 증가하고 있었습니다. LongCat을 자체 호스팅하면서 그 비용을 이미 보유한 하드웨어로 옮겼고, 야간에 유휴 상태였던 자원을 활용하게 되었죠.
스타트업 기술 리드
LongCat의 MIT 라이선스가 문서화가 더 잘된 세 가지 다른 옵션보다 선택한 이유입니다. 아무도 취소할 수 없는 가중치 위에 제품을 구축하는 것은 설정에 들인 모든 시간이 충분히 가치 있었습니다.
이커머스 영상 크리에이터
우리는 제품 내레이션을 하나씩이 아닌 일괄적으로 생성합니다. LongCat Video Avatar 1.5가 야간에 이를 처리해주니, 누구도 카메라 앞에 나설 필요가 없습니다.
애니메이션 스튜디오 리드
대부분의 아바타 모델은 스타일화된 캐릭터를 입력하면 바로 무너집니다. LongCat은 우리의 애니메 디자인을 샷 중간에 얼굴이 녹아내리지 않게 처리해줍니다.
2026년 5월에 출시된 Meituan의 LongCat 팀의 오픈 웨이트, 오디오 기반 아바타 비디오 모델입니다. 136억 파라미터 규모의 LongCat-Video 기초 모델을 기반으로 구축되었으며, 공식적으로는 하이픈을 사용하여 LongCat-Video-Avatar 1.5로 표기됩니다.
네, MIT 라이선스로 제공되며, 이는 오픈 웨이트 라이선스 중 가장 허용적인 수준입니다. 클라이언트 작업물을 제작하거나, 이를 기반으로 제품을 생산하거나, 대규모로 실행하더라도 라이선스 비용을 지불하거나 사용량을 누구에게도 보고할 필요가 없습니다.
현실적으로 최소 40GB GPU가 필요합니다. 실제 테스트에서는 A800 GPU에서 INT8 양자화와 8단계 디스틸 기법을 적용해 실행했으며, 완성된 비디오 1초당 약 44초의 GPU 연산 시간이 소요되었습니다.
애니메이션 캐릭터, 동물, 다인원 장면 모두 가능하며, 누군가 물건을 다루는 장면도 포함됩니다. 노래 부르기와 연기 장면도 잘 구현되는데, 이는 음성을 중심으로 만들어진 모델에서는 드문 특징입니다.
오디오 CFG 값을 높이세요. 보통 3에서 5 사이 값이 가장 효과적입니다. 또한 더 길고 설명적인 프롬프트를 작성하는 것이 좋습니다. 짧은 프롬프트는 클립 전체에 걸쳐 모델이 일관성을 유지할 정보가 부족하기 때문입니다.
팀 내에 GPU를 전문적으로 운영하는 사람이 없을 때입니다. 설정 과정이 진짜 어렵고, 연산 속도도 느리기 때문에, 이미 하드웨어와 엔지니어링 시간을 확보하지 않은 이상 구독형 도구가 훨씬 효율적입니다.



오늘 밤 모델을 클론하고 하나의 클립을 생성해 보세요. 누군가 구독료를 내기 전에 GPU 사용 시간을 직접 체험해 보십시오.