LongCat Video Avatar 1.5の機能
LongCat Avatar 1.5は、音声に合わせて口を動かす以上のことを行います。写真と音声ファイルだけで、完全な話す、歌う、またはアニメーション動画を組み立てます。

写真と音声ファイルをアップロードするだけで、LongCat Avatar 1.5がそれらを話す、歌う、またはアニメーション動画に変換します。編集スキルは不要です。
LongCat Video Avatarを無料で試す























LongCat Avatar 1.5は、音声に合わせて口を動かす以上のことを行います。写真と音声ファイルだけで、完全な話す、歌う、またはアニメーション動画を組み立てます。

1つのモデルが3つの作業を同時に処理します。「Audio Text to Video」は、スクリプトと音声トラックだけで話すキャラクターを構築します。「Audio Text Image to Video」は、提供した参照写真をアニメーション化し、「Video Continuation」は既存のクリップを拡張して、より長い話しシーンを生成します。
LongCat Avatar 1.5はWhisper Largeを使用して音声を読み取り、各口の動きを実際の音声に合わせてタイミングを調整します。これにより、トーンやペースが変化する長いクリップでも、口の同期が正確で自然に保たれます。
このツールは2つの別々の音声ストリームを取り込み、それぞれをフレーム内の異なる人物に同期させることができます。これにより、両方の話者が同じシーンで自然に話し、反応し、交代することができます。インタビュー、デュエット、または2人がフレームを共有するあらゆるクリップに最適です。
INT8量子化を用いたわずか8つの生成ステップで動作し、品質を実質的に低下させることなく処理時間を短縮します。これにより出力が高速化され、動画のレンダリングを長時間待たされることはありません。
他社のサーバーでモデルを実行することは、彼らの制限、コスト、ダウンタイムを受け入れることを意味します。チームがLongCat Avatar 1.5をセルフホストする理由をご紹介します。
アバターツールを検討するチームは、通常、コスト、制御性、出力の実際の見た目を重視します。LongCat Avatar 1.5がこれらの点でホスト型オプションとどう比較されるかをご覧ください。
| プラットフォーム | ライセンス | 必要なハードウェア | 解像度 | 主なユーザー |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT、商用利用無料 | 最低40GB GPU | 480P および 720P | MLエンジニア |
| Magiclight AI | 有料プランでの権利 | 不要、ブラウザで実行 | 1080p、最大50分 | ストーリークリエイター |
| Synthesia | 分単位サブスクリプション | 不要、ブラウザで動作 | スタジオ品質 | エンタープライズチーム |
| Mango AI | サブスクリプション | 不要、ブラウザまたはスマートフォン | 標準画質動画 | マーケター |
| HeyGen | サブスクリプション | 不要、ブラウザで動作 | スタジオ品質 | グロースチーム |
LongCat Avatar 1.5のセットアップは、ローカルで実行する場合でもホストされたオプションを利用する場合でも、わずか数ステップで完了します。
モデルとそのオーディオエンコーダーに十分なVRAMを備えたGPUを使用してください。公式セットアップはメモリ使用量を削減するINT8モードをサポートしており、この構成には40GBクラスのGPUが使用されています。
Hugging FaceからLongCat-VideoベースモデルとLongCat-Video-Avatar-1.5のウェイトの両方をダウンロードします。Avatar 1.5のセットアップでは、ベースモデルと独自のモデルウェイトを組み合わせて使用します。
音声を提供し、画像ベースの生成の場合は参照画像とテキストプロンプトを追加します。一貫性と自然な結果を向上させるため、より長く詳細なプロンプトの使用が推奨されます。
Avatar 1.5では、8ステップ蒸留モードを使用し、480Pまたは720Pの解像度を選択します。標準サンプリング制御を使用する場合、Audio CFGは3〜5前後が推奨され、INT8モードはVRAM使用量を削減できます。
MLエンジニア
アバターの分単位の請求額が利用量よりも速く増加していました。LongCatをセルフホスティングすることで、そのコストを夜間アイドル状態だった既存のハードウェアに移行できました。
スタートアップ技術責任者
LongCatのMITライセンスが、より詳細なドキュメントがある3つの選択肢よりもこちらを選んだ理由です。誰も取り消せない重みの上に製品を構築できることは、セットアップの苦労に十分に値します。
Eコマース動画クリエイター
私たちは製品ナレーションを一つずつではなく、バッチで生成します。LongCat Video Avatar 1.5で夜間に処理を行い、誰もカメラの前に立つ必要がありません。
アニメーションスタジオ責任者
ほとんどのアバターモデルは、スタイライズされたキャラクターを入力した瞬間に破綻します。LongCatは、顔が途中で溶けることなく、私たちのアニメデザインを処理できます。
MeituanのLongCatチームが2026年5月にリリースした、オーディオ駆動型のオープンウェイトアバター動画モデルです。136億パラメータのLongCat-Video基盤モデル上に構築されており、公式にはハイフン付きでLongCat-Video-Avatar 1.5と表記されます。
はい、MITライセンスの下で利用可能です。これはオープンウェイトとしては最も寛容なライセンスの一つで、クライアントワークへの組み込み、製品開発、大規模運用など、ライセンス料の支払いや使用報告なしで自由に利用できます。
現実的な最低ラインは40GBのGPUです。実際のテストでは、A800上でINT8量子化と8段階蒸留を適用して実行され、完成動画1秒あたり約44秒のGPU計算時間が計測されました。
アニメキャラクター、動物、複数人物のシーン、さらには人物が物体を扱うショットも可能です。歌唱や演技シーンも良好に動作し、これは音声中心に設計されたモデルとしては珍しい特徴です。
オーディオCFG値を上げてください。3から5の間が最適です。また、より長く詳細なプロンプトを書くことも有効です。短いプロンプトでは、クリップ全体で一貫性を保つための情報がモデルに不足しがちです。
チーム内にGPU運用の専門家がいない場合です。セットアップは実際に難しく、計算も低速です。既にハードウェアとエンジニアリング時間を確保していない限り、サブスクリプション型ツールの方が明らかに優れています。



モデルをクローンして、今夜中に1本のクリップを生成。サブスクリプション契約前に、GPU使用時間を自分に請求してみましょう。