LongCat Video Avatar 1.5 的功能
LongCat Avatar 1.5 不僅僅是讓嘴巴動起來配合音訊。它能僅憑一張照片和一個聲音檔案,就組合成完整的說話、唱歌或動畫影片。

上傳一張照片和一個音訊檔案,LongCat Avatar 1.5 就能將它們轉換成說話、唱歌或動畫影片,無需任何剪輯技巧。
免費試用 LongCat Video Avatar























LongCat Avatar 1.5 不僅僅是讓嘴巴動起來配合音訊。它能僅憑一張照片和一個聲音檔案,就組合成完整的說話、唱歌或動畫影片。

一個模型同時處理三項工作。「音訊文字轉影片」僅憑腳本和聲音軌道就能建構說話角色;「音訊文字圖片轉影片」能讓您提供的參考照片動起來;而「影片延續」則能延伸現有片段,產生更長的說話鏡頭。
LongCat Avatar 1.5 使用 Whisper Large 讀取音訊,並根據實際語音為每個嘴部動作計時。這使得唇形同步緊密而自然,即使在語調和節奏變化的較長片段中也是如此。
此工具可以處理兩個獨立的音訊流,並將每個音訊同步到畫面中的不同人物。這讓兩位說話者能在同一場景中自然地交談、反應和輪流發言。非常適合訪談、二重唱或任何兩人同框的片段。
它僅需 8 個生成步驟並採用 INT8 量化,在品質無明顯下降的情況下縮短處理時間。這意味著更快的輸出速度,您無需長時間等待影片渲染。
在他人伺服器上運行模型,意味著必須接受其限制、成本和停機風險。這就是為什麼團隊選擇自行託管 LongCat Avatar 1.5。
團隊在評估分身工具時,通常會考量成本、控制權以及實際輸出效果。以下是 LongCat Avatar 1.5 與託管式方案在這些方面的比較:
| 平台 | 授權 | 所需硬體 | 解析度 | 適用使用者 |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT,可免費商用 | 至少 40GB GPU | 480P 與 720P | 機器學習工程師 |
| Magiclight AI | 付費方案享有權利 | 無需,瀏覽器內執行 | 1080p,最長 50 分鐘 | 故事創作者 |
| Synthesia | 分鐘制訂閱方案 | 無需硬體,瀏覽器即可執行 | 工作室級畫質 | 企業團隊 |
| Mango AI | 訂閱制 | 無需硬體,支援瀏覽器或手機 | 標準影片畫質 | 行銷人員 |
| HeyGen | 訂閱制 | 無需硬體,瀏覽器即可執行 | 工作室級畫質 | 成長團隊 |
無論是在本地執行還是透過託管方案,設定 LongCat Avatar 1.5 都僅需幾個步驟。
請使用具備足夠 VRAM 的 GPU 來運行模型及其音訊編碼器。官方設定支援 INT8 模式以減少記憶體使用,此配置建議使用 40GB 等級的 GPU。
請從 Hugging Face 下載 LongCat-Video 基礎模型以及 LongCat-Video-Avatar-1.5 的權重檔案。Avatar 1.5 設定需同時使用基礎模型及其專屬模型權重。
請提供音訊檔案,若為基於圖像的生成,則需提供參考圖像與文字提示詞。建議使用更長、更詳細的提示詞,因為這有助於提升結果的一致性和自然度。
針對 Avatar 1.5,請使用 8 步蒸餾模式,並選擇 480P 或 720P 解析度。在使用標準取樣控制時,建議將 Audio CFG 設定在 3 至 5 之間,而 INT8 模式則可降低 VRAM 使用量。
機器學習工程師
我們每分鐘的虛擬人像帳單增長速度比使用量還快。自行託管 LongCat 將這筆成本轉移到我們已擁有且夜間閒置的硬體上。
新創公司技術主管
LongCat 的 MIT 授權是我們選擇它而非另外三個文件更完善的選項的原因。在一個無人能撤銷的權重基礎上構建產品,值得我們投入每一個小時的設定心力。
電商影片創作者
我們批量生成產品旁白,而非逐個製作。LongCat Video Avatar 1.5 在夜間執行這些任務,完全不需要任何人親自出鏡。
動畫工作室主管
大多數虛擬人像模型一遇到風格化角色就會崩潰。LongCat 能完美處理我們的動漫設計,臉部在鏡頭中不會中途融化變形。
這是由美團龍貓團隊於2026年5月發布的開源權重、音訊驅動的虛擬化身影片模型。它基於136億參數的LongCat-Video基礎模型構建,官方正式寫法為帶連字號的 LongCat-Video-Avatar 1.5。
是的,它採用MIT許可證,這在開源權重中是最寬鬆的許可之一。您可以將其用於客戶專案、基於它開發產品,或大規模運行,無需支付許可費或向任何人報告使用情況。
實際最低需求是40GB記憶體的GPU。一項實測在A800 GPU上使用INT8量化與八步蒸餾運行,生成每秒影片仍需約44秒的GPU運算時間。
動漫角色、動物以及多人場景都能處理,包括人物手持物體的鏡頭。歌唱和表演的同步效果也很好,這在以語音為核心的模型中並不常見。
提高音訊CFG值,最佳範圍通常在3到5之間。同時,撰寫更長、更具描述性的提示詞,因為簡短的提示詞會讓模型在整個片段中更難保持一致性。
當團隊中沒有人專門負責運行GPU時。自行設置確實困難,運算速度也慢,除非您已經擁有硬體和工程時間,否則訂閱制工具通常更具優勢。



今晚就複製模型並生成一段影片。在簽訂任何訂閱服務前,先為自己的GPU時間買單試試看。