Hero background

LongCat Video Avatar 1.5

上传一张照片和一个音频文件,LongCat Avatar 1.5 即可将它们转化为说话、唱歌或动画视频,无需任何剪辑技能。

免费试用 LongCat Video Avatar
LongCat Video Avatar 1.5 视频示例 1
LongCat Video Avatar 1.5 视频示例 2
LongCat Video Avatar 1.5 视频示例 3
LongCat Video Avatar 1.5 视频示例 4
LongCat Video Avatar 1.5 视频示例 5
LongCat Video Avatar 1.5 视频示例 6
LongCat Video Avatar 1.5 视频示例 7
LongCat Video Avatar 1.5 视频示例 8
LongCat Video Avatar 1.5 视频示例 1
LongCat Video Avatar 1.5 视频示例 2
LongCat Video Avatar 1.5 视频示例 3
LongCat Video Avatar 1.5 视频示例 4
LongCat Video Avatar 1.5 视频示例 5
LongCat Video Avatar 1.5 视频示例 6
LongCat Video Avatar 1.5 视频示例 7
LongCat Video Avatar 1.5 视频示例 8
LongCat Video Avatar 1.5 视频示例 1
LongCat Video Avatar 1.5 视频示例 2
LongCat Video Avatar 1.5 视频示例 3
LongCat Video Avatar 1.5 视频示例 4
LongCat Video Avatar 1.5 视频示例 5
LongCat Video Avatar 1.5 视频示例 6
LongCat Video Avatar 1.5 视频示例 7
LongCat Video Avatar 1.5 视频示例 8

LongCat Video Avatar 1.5 的功能

LongCat Avatar 1.5 不仅仅是让嘴巴动起来匹配音频。它仅凭一张照片和一个声音文件,就能组装出完整的说话、唱歌或动画视频。

探索视频生成器
LongCat Video Avatar 1.5 AI 数字人生成

一个模型,三种原生任务

一个模型同时处理三项任务。“音频文本转视频”仅凭脚本和语音轨道即可构建说话角色;“音频文本图像转视频”可让您提供的参考照片动起来;“视频延续”则能扩展现有片段,生成更长的说话镜头。

Whisper-Large 驱动唇形

LongCat Avatar 1.5 使用 Whisper Large 读取音频,并根据实际语音为每个嘴部动作计时。这使得口型同步紧密而自然,即使在音调和语速变化的较长片段中也是如此。

双人同框,双音频流

该工具可以处理两个独立的音频流,并将每个音频同步到画面中的不同人物。这使得两位发言者能在同一场景中自然地交谈、互动和轮流发言。这非常适合访谈、二重唱或任何两人同框的片段。

八步生成与 INT8 量化

它仅需 8 个生成步骤并采用 INT8 量化,在几乎不损失质量的前提下缩短了处理时间。这意味着更快的输出,您无需长时间等待视频渲染。

创作者为何选择LongCat Avatar 1.5

在他人服务器上运行模型,意味着必须接受其限制、成本和停机风险。这就是为什么团队选择自行托管 LongCat Avatar 1.5。

真正免费的 MIT 许可

LongCat 基于 MIT 许可证发布,团队可以自由使用、修改和部署,无需支付许可费或申请授权。这与那些自称免费,却按生成次数收费或将核心功能锁定在付费墙后的工具有本质区别。

立即免费创作
LongCat Avatar 1.5 的 MIT 开源许可证

面部特征全程一致

该工具能确保角色面部、特征和身份在长时间说话或歌唱镜头中始终保持一致。这意味着视频不会随着时长增加而产生漂移或细微变化,同一个人物从始至终都清晰可辨。

立即免费创作
LongCat Avatar 1.5 保持角色身份一致性

不止于“说话的头像”

该模型的功能远不止于人物坐在桌前说话。动漫角色、动物、多人场景以及涉及物体操作的镜头,同样能稳定生成。

立即免费创作
LongCat Avatar 1.5 的动漫角色、动物及多人场景

对比 LongCat 视频化身 与其他 AI 化身工具

团队在选择化身工具时,通常关注成本、控制权以及实际输出效果。以下是 LongCat Avatar 1.5 在这些方面与托管式方案的对比:

平台许可协议所需硬件分辨率目标用户
LongCat Avatar 1.5MIT,商业免费最低 40GB GPU480P 和 720P机器学习工程师
Magiclight AI付费计划享有使用权无需,浏览器内运行1080p,最长50分钟故事创作者
Synthesia按分钟订阅无需硬件,浏览器运行工作室级画质企业团队
Mango AI订阅制无需硬件,支持浏览器或手机标准视频画质市场营销人员
HeyGen订阅制无需硬件,浏览器运行工作室级画质增长团队

如何运行 LongCat Video Avatar 1.5 只需简单几步

无论您选择本地部署还是托管方案,设置 LongCat Avatar 1.5 都仅需几个简单步骤。

1.

首先检查您的 GPU

请使用具备足够显存的 GPU 来运行模型及其音频编码器。官方设置支持 INT8 模式以降低内存占用,此配置推荐使用 40GB 级别的 GPU。

2.

下载模型权重文件

从 Hugging Face 下载 LongCat-Video 基础模型和 LongCat-Video-Avatar-1.5 的权重文件。Avatar 1.5 的设置需要将基础模型与其专属权重文件结合使用。

3.

添加音频、图像和提示词

提供音频文件,若为基于图像的生成,还需提供参考图像和文本提示词。建议使用更长、更详细的提示词,这有助于提升结果的一致性和自然度。

4.

设置生成选项

对于 Avatar 1.5,请使用 8 步蒸馏模式,并选择 480P 或 720P 分辨率。在使用标准采样控制时,建议将音频 CFG 值设置在 3 至 5 之间,而 INT8 模式可有效降低显存占用。

用户评价关于 LongCat Video Avatar 1.5

Aurelio Fanti

机器学习工程师

我们的每分钟数字人账单增长速度比使用量还快。自托管 LongCat 将这部分成本转移到了我们已有的、夜间闲置的硬件上。

Nnamdi Okereke

初创公司技术负责人

LongCat 的 MIT 许可证是我们选择它而非另外三个文档更完善的选项的原因。在一个无人能撤销的模型权重上构建产品,为此付出的每一小时部署时间都是值得的。

Su-Jin Baek

电商视频创作者

我们批量生成产品解说,而不是一次一个。LongCat Video Avatar 1.5 在夜间运行这些任务,无需任何人出镜。

Gaspard Thibault

动画工作室负责人

大多数数字人模型一旦输入风格化角色就会崩溃。LongCat 能够处理我们的动漫设计,而不会出现脸部在镜头中途融化的现象。

常见问题 关于 LongCat Video Avatar 1.5

什么是 LongCat Video Avatar 1.5?

这是美团龙猫团队于2026年5月发布的开放权重、音频驱动的数字人视频模型。它基于136亿参数的龙猫视频基础模型构建,官方正式名称为LongCat-Video-Avatar 1.5。

真的可以免费商用吗?

是的,采用MIT许可协议,这是最宽松的开源许可之一。您可以将其用于客户项目、基于它开发产品,或大规模运行,无需支付许可费或向任何人报告使用情况。

需要什么硬件配置?

至少需要一块40GB显存的GPU。一次实际测试在A800上使用INT8量化和八步蒸馏技术运行,生成每秒成品视频仍需约44秒的GPU计算时间。

除了真人,它还能驱动什么?

动漫角色、动物以及多人场景均可驱动,包括人物手持物体的镜头。它还能处理唱歌和表演,这对于围绕语音创建的模型来说并不常见。

如何获得更好的口型同步效果?

提高音频CFG值,最佳范围通常在3到5之间。同时,使用更长、更具描述性的提示词,因为简短的提示词会让模型在整段视频中更难保持一致性。

什么时候选择托管工具更合适?

当团队中没有专人负责GPU运维时。自行部署确实困难,计算速度也慢,除非您已拥有硬件和工程时间,否则订阅托管工具通常是更好的选择。

立即使用 LongCat Video Avatar 1.5 开启创作

今晚就克隆模型并生成一段视频。在任何人签署订阅协议之前,先为自己计算一下GPU成本。