LongCat Video Avatar 1.5 的功能
LongCat Avatar 1.5 不仅仅是让嘴巴动起来匹配音频。它仅凭一张照片和一个声音文件,就能组装出完整的说话、唱歌或动画视频。

上传一张照片和一个音频文件,LongCat Avatar 1.5 即可将它们转化为说话、唱歌或动画视频,无需任何剪辑技能。
免费试用 LongCat Video Avatar























LongCat Avatar 1.5 不仅仅是让嘴巴动起来匹配音频。它仅凭一张照片和一个声音文件,就能组装出完整的说话、唱歌或动画视频。

一个模型同时处理三项任务。“音频文本转视频”仅凭脚本和语音轨道即可构建说话角色;“音频文本图像转视频”可让您提供的参考照片动起来;“视频延续”则能扩展现有片段,生成更长的说话镜头。
LongCat Avatar 1.5 使用 Whisper Large 读取音频,并根据实际语音为每个嘴部动作计时。这使得口型同步紧密而自然,即使在音调和语速变化的较长片段中也是如此。
该工具可以处理两个独立的音频流,并将每个音频同步到画面中的不同人物。这使得两位发言者能在同一场景中自然地交谈、互动和轮流发言。这非常适合访谈、二重唱或任何两人同框的片段。
它仅需 8 个生成步骤并采用 INT8 量化,在几乎不损失质量的前提下缩短了处理时间。这意味着更快的输出,您无需长时间等待视频渲染。
在他人服务器上运行模型,意味着必须接受其限制、成本和停机风险。这就是为什么团队选择自行托管 LongCat Avatar 1.5。
团队在选择化身工具时,通常关注成本、控制权以及实际输出效果。以下是 LongCat Avatar 1.5 在这些方面与托管式方案的对比:
| 平台 | 许可协议 | 所需硬件 | 分辨率 | 目标用户 |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT,商业免费 | 最低 40GB GPU | 480P 和 720P | 机器学习工程师 |
| Magiclight AI | 付费计划享有使用权 | 无需,浏览器内运行 | 1080p,最长50分钟 | 故事创作者 |
| Synthesia | 按分钟订阅 | 无需硬件,浏览器运行 | 工作室级画质 | 企业团队 |
| Mango AI | 订阅制 | 无需硬件,支持浏览器或手机 | 标准视频画质 | 市场营销人员 |
| HeyGen | 订阅制 | 无需硬件,浏览器运行 | 工作室级画质 | 增长团队 |
无论您选择本地部署还是托管方案,设置 LongCat Avatar 1.5 都仅需几个简单步骤。
请使用具备足够显存的 GPU 来运行模型及其音频编码器。官方设置支持 INT8 模式以降低内存占用,此配置推荐使用 40GB 级别的 GPU。
从 Hugging Face 下载 LongCat-Video 基础模型和 LongCat-Video-Avatar-1.5 的权重文件。Avatar 1.5 的设置需要将基础模型与其专属权重文件结合使用。
提供音频文件,若为基于图像的生成,还需提供参考图像和文本提示词。建议使用更长、更详细的提示词,这有助于提升结果的一致性和自然度。
对于 Avatar 1.5,请使用 8 步蒸馏模式,并选择 480P 或 720P 分辨率。在使用标准采样控制时,建议将音频 CFG 值设置在 3 至 5 之间,而 INT8 模式可有效降低显存占用。
机器学习工程师
我们的每分钟数字人账单增长速度比使用量还快。自托管 LongCat 将这部分成本转移到了我们已有的、夜间闲置的硬件上。
初创公司技术负责人
LongCat 的 MIT 许可证是我们选择它而非另外三个文档更完善的选项的原因。在一个无人能撤销的模型权重上构建产品,为此付出的每一小时部署时间都是值得的。
电商视频创作者
我们批量生成产品解说,而不是一次一个。LongCat Video Avatar 1.5 在夜间运行这些任务,无需任何人出镜。
动画工作室负责人
大多数数字人模型一旦输入风格化角色就会崩溃。LongCat 能够处理我们的动漫设计,而不会出现脸部在镜头中途融化的现象。
这是美团龙猫团队于2026年5月发布的开放权重、音频驱动的数字人视频模型。它基于136亿参数的龙猫视频基础模型构建,官方正式名称为LongCat-Video-Avatar 1.5。
是的,采用MIT许可协议,这是最宽松的开源许可之一。您可以将其用于客户项目、基于它开发产品,或大规模运行,无需支付许可费或向任何人报告使用情况。
至少需要一块40GB显存的GPU。一次实际测试在A800上使用INT8量化和八步蒸馏技术运行,生成每秒成品视频仍需约44秒的GPU计算时间。
动漫角色、动物以及多人场景均可驱动,包括人物手持物体的镜头。它还能处理唱歌和表演,这对于围绕语音创建的模型来说并不常见。
提高音频CFG值,最佳范围通常在3到5之间。同时,使用更长、更具描述性的提示词,因为简短的提示词会让模型在整段视频中更难保持一致性。
当团队中没有专人负责GPU运维时。自行部署确实困难,计算速度也慢,除非您已拥有硬件和工程时间,否则订阅托管工具通常是更好的选择。



今晚就克隆模型并生成一段视频。在任何人签署订阅协议之前,先为自己计算一下GPU成本。