探索 MAGI-1 的核心功能
了解MAGI-1 AI如何作为一个连续流水线生成视频,而非一次性创建整个片段。在实际应用中比较其控制力、可扩展性和动作处理能力。

























视频以24帧为一个块进行生成,约等于24 FPS下的一秒时长。在MAGI-1中,每个块作为一个完整单元进行去噪处理,同时最多可并行运行四个块。这种流水线方式有助于持续生成,而无需将整个视频视为单一处理过程。
随着视频时长增加,峰值推理成本保持稳定,这使得更长时间的生成更具可预测性。在其最大版本中,MAGI-1达到240亿参数,并支持高达400万令牌的上下文长度,适用于扩展序列。
随着视频进展调整指令,而不是将单一提示锁定在整个片段上。MAGI-1的分块提示功能允许后续片段遵循新的方向,让创作者能更精细地控制整个时间轴上的动作、摄像机运动和场景变化。
从前面的视频上下文中延续运动,使每个新片段都能响应之前的内容。这种因果时序设计帮助MAGI-1在其原始评估中,在Physics-IQ视频延续基准测试中表现出色。
探索创作者为何选择 MAGI-1 构建开放式模型工作流。在将其加入您的技术栈之前,深入了解其技术访问权限、原生延续支持与架构设计。
从视频长度、上下文和控制能力等维度,对比 MAGI-1 的大规模自回归视频生成与其他视频模型。了解随着视频生成规模扩大,各选项的表现如何。
| 模型 | 生成方法 | 长度限制 | 最佳输入 | 主要用户 |
|---|---|---|---|---|
| MAGI-1 | 自回归,24帧片段 | 无限制,成本保持平稳 | 文本 + 视频 | 研究人员与开发者 |
| Magiclight AI | 脚本到故事板 | 最长 50 分钟 | 脚本 | 长篇故事与创作者工作流 |
| LongCat Avatar 1.5 | 音频驱动扩散 | 长镜头说话 | 音频 + 图像 | 机器学习工程师 |
| Wan 2.1 | 整片扩散 | 固定片段长度 | 文本 + 图像 | 开源社区 |
通过 4 个简单步骤,即可在您的硬件上运行 MAGI-1。选择模型、完成设置、选定生成方式,即刻开始创作。
上传首帧、尾帧或参考图像来引导场景。当您希望对主体、构图或最终视觉效果进行更精确控制时,请使用这些输入。
描述视频中应发生的内容。请清晰说明主体、动作、摄像机运动和场景细节,以便模型能直接遵循指令。
选择视频,设定宽高比,设置片段长度,并调整任何额外的生成设置。使这些选项与您计划使用的格式和平台相匹配。
审阅生成的视频,然后根据需要调整提示词、参考帧或设置。不断优化结果,直至运动和场景符合您的意图。
研究工程师
对我们而言,固定的推理成本至关重要。MAGI-1 让我们能在与生成 5 秒视频相同的硬件预算下,生成一段 2 分钟的序列。
独立动画师
其他模型都要求我拼接片段并掩盖接缝。而延续性是 MAGI-1 的原生能力,因此运动可以无缝衔接,无需我伪造过渡效果。
视觉特效创作者
物理运动是大多数模型露馅的地方。MAGI-1 能让下落的物体按照应有的方式持续运动,这为我们节省了一轮手动清理工作。
开发者
技术报告解答了 README 中没有说明的问题。在 MAGI-1 上创作,比在一个架构不公开的模型上生成要安全得多。
MAGI-1 是 Sand AI 推出的开源视频生成模型。它于 2025 年 4 月发布,采用自回归方式,以 24 帧为块生成视频,而非一次性处理整个片段。
每个 24 帧的块都是基于先前的视频上下文生成的。这种因果设置使得运动、场景细节和时间信息能够随着序列的增长而持续传递。
没有固定的上限,因为无论视频长度如何,峰值推理成本都保持恒定。延长视频与生成视频是相同的操作,因此片段是持续生成的,而不是事后拼接上去的。
是的。Sand AI 提供了 24B 和 4.5B 版本的模型权重和推理代码,包括蒸馏和量化版本。MAGI-1.1 24B 的权重也于 2026 年 6 月开源。
24B 模型专为多 GPU 系统设计,Sand AI 建议使用八块 H100 或 H800 GPU。4.5B 版本可在单块 RTX 4090 或其他至少具备 24GB 显存的 GPU 上运行。
主要不足在于可及性。MAGI-1 需要强大的 GPU 硬件、本地部署以及一定的技术知识,因此对于休闲创作者而言,不如托管式视频工具方便。



将片段推进到其他模型放弃的地方。之后研读论文,了解成本为何从未增加。