ماذا يفعل LongCat Video Avatar 1.5؟
LongCat Avatar 1.5 يفعل أكثر من مجرد تحريك الفم لتتناسب مع الصوت. فهو يجمع فيديو كاملًا متحدثًا أو مغنيًا أو متحركًا من مجرد صورة وملف صوتي.

قم بتحميل صورة وملف صوتي، وسيحولها LongCat Avatar 1.5 إلى فيديو متحدث أو مغنٍ أو متحرك، دون الحاجة إلى مهارات تحرير.
جرب LongCat Video Avatar مجانًا























LongCat Avatar 1.5 يفعل أكثر من مجرد تحريك الفم لتتناسب مع الصوت. فهو يجمع فيديو كاملًا متحدثًا أو مغنيًا أو متحركًا من مجرد صورة وملف صوتي.

نموذج واحد يتولى 3 وظائف في وقت واحد. مهمة 'النص الصوتي إلى فيديو' تبني شخصية متحدثة من مجرد نص ومسار صوتي. مهمة 'الصورة والنص الصوتي إلى فيديو' تحرك صورة مرجعية تزودها بها، و'استمرارية الفيديو' تمد مقطعًا موجودًا لإنتاج لقطات متحدثة أطول.
يستخدم LongCat Avatar 1.5 تقنية Whisper Large لقراءة الصوت وتوقيت كل حركة فم لتتناسب مع الكلام الفعلي. هذا يحافظ على تزامن الشفاه بدقة وطبيعية، حتى عبر المقاطع الأطول ذات النبرة والسرعة المتغيرة.
يمكن للأداة أن تأخذ تدفقين صوتيين منفصلين وتزامن كل منهما مع شخص مختلف في الإطار. هذا يسمح لكلا المتحدثين بالتحدث والتفاعل وأخذ الأدوار بشكل طبيعي في نفس المشهد. إنه مناسب تمامًا للمقابلات أو الثنائيات أو أي مقطع يتشارك فيه شخصان الإطار.
يعمل على 8 خطوات توليد فقط مع تكميم INT8، مما يقلل وقت المعالجة دون انخفاض حقيقي في الجودة. هذا يعني إخراجًا أسرع، لذا لن تعلق منتظرًا وقتًا طويلاً حتى يتم عرض الفيديو الخاص بك.
تشغيل نموذج على خادم شخص آخر يعني قبول قيوده وتكاليفه وأوقات توقفه. إليكم السبب الذي يجعل الفرق تختار استضافة LongCat Avatar 1.5 ذاتيًا.
تم إصدار LongCat بموجب رخصة MIT، لذا يمكن للفرق استخدامه وتعديله ونشره دون دفع رسوم ترخيص أو طلب إذن. هذا يختلف عن الأدوات التي تطلق على نفسها اسم "مجانية" ولكنها لا تزال تفرض رسومًا لكل عملية توليد أو تحبس الميزات خلف جدار مدفوع.
ابدأ الإبداع مجانًا
يحافظ الأداة على وجه الشخصية وملامحها وهويتها متسقة حتى في لقطات الحديث أو الغناء الطويلة. هذا يعني عدم وجود انحراف أو تغييرات طفيفة مع طول المقطع، بحيث يظل الشخص نفسه معروفًا من البداية إلى النهاية.
ابدأ الإبداع مجانًا
هذا النموذج يفعل أكثر بكثير من مجرد شخص يجلس ويتحدث على مكتب. شخصيات الأنمي، والحيوانات، ومشاهد متعددة الأشخاص، ولقطات التعامل مع الأشياء تخرج أيضًا بثبات.
ابدأ الإبداع مجانًا
عادة ما تهتم الفرق التي تقيّم أدوات الصور الرمزية بالتكلفة والتحكم وكيف يبدو المخرج النهائي فعليًا. إليكم كيف يقارن LongCat Avatar 1.5 مع الخيارات المستضافة في هذه النقاط:
| المنصة | الترخيص | الأجهزة المطلوبة | الدقة | المستخدمون |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT، مجاني تجاريًا | 40GB GPU كحد أدنى | 480P و 720P | مهندسو تعلم الآلة |
| Magiclight AI | حقوق على الخطط المدفوعة | لا شيء، يعمل في المتصفح | 1080p، حتى 50 دقيقة | منشئو القصص |
| Synthesia | اشتراك يعتمد على الدقائق | لا شيء، يعمل عبر المتصفح | جودة استوديو | فرق المؤسسات |
| Mango AI | اشتراك | لا شيء، عبر المتصفح أو الهاتف | فيديو قياسي | مسوقون |
| HeyGen | اشتراك | لا شيء، يعمل عبر المتصفح | جودة استوديو | فرق النمو |
إعداد LongCat Avatar 1.5 يستغرق خطوات قليلة فقط، سواء قمت بتشغيله محليًا أو عبر خيار الاستضافة.
استخدم بطاقة رسومات (GPU) بسعة ذاكرة فيديو (VRAM) كافية للنموذج ومُشفر الصوت الخاص به. الإعداد الرسمي يدعم وضع INT8 لتقليل استخدام الذاكرة، مع استخدام بطاقات رسومات من فئة 40 جيجابايت لهذا الإعداد.
قم بتنزيل كل من نموذج LongCat-Video الأساسي وأوزان LongCat-Video-Avatar-1.5 من Hugging Face. إعداد Avatar 1.5 يستخدم النموذج الأساسي مع أوزان النموذج الخاصة به.
قم بتوفير الصوت، وللإنشاء القائم على الصور، قم بتوفير صورة مرجعية ومطالبة نصية. يُنصح باستخدام مطالبات نصية أطول وأكثر تفصيلاً لأنها يمكن أن تحسن الاتساق والنتائج الطبيعية.
بالنسبة لـ Avatar 1.5، استخدم الوضع المقطر ذو 8 خطوات واختر دقة 480P أو 720P. يُوصى بـ Audio CFG حول 3-5 عند استخدام عناصر التحكم القياسية لأخذ العينات، بينما يمكن لوضع INT8 تقليل استخدام VRAM.
مهندس تعلم آلي
كانت فاتورة الصورة الرمزية لكل دقيقة ترتفع أسرع من معدل الاستخدام. استضافة LongCat ذاتيًا نقلت هذه التكلفة إلى أجهزة نملكها بالفعل وكانت خاملة خلال الليل.
قائد تقني في شركة ناشئة
رخصة MIT على LongCat هي السبب وراء اختيارنا له على ثلاثة خيارات أخرى موثقة بشكل أفضل. بناء منتج على أوزان لا يمكن لأحد إلغاؤها كان يستحق كل ساعة من عناء الإعداد.
منشئ محتوى فيديو للتجارة الإلكترونية
نقوم بتوليف سرد المنتجات على دفعات بدلاً من واحدة تلو الأخرى. يعمل LongCat Video Avatar 1.5 عليها خلال الليل، ولا يتعين على أي شخص الظهور أمام الكاميرا.
قائد استوديو للرسوم المتحركة
معظم نماذج الصور الرمزية تتداعى في اللحظة التي تقدم لها شخصية ذات أسلوب فني. يتعامل LongCat مع تصاميم الأنيمي الخاصة بنا دون أن يذوب الوجه في منتصف اللقطة.
نموذج فيديو أفاتار مفتوح الأوزان يعمل بالصوت من فريق LongCat التابع لـ Meituan، تم إصداره في مايو 2026. تم بناؤه على نموذج الأساس LongCat-Video الذي يحتوي على 13.6 مليار معلمة، ويكتب رسميًا بشرطات على النحو التالي: LongCat-Video-Avatar 1.5.
نعم، بموجب ترخيص MIT، وهو ترخيص متساهل للغاية كما هو الحال مع النماذج مفتوحة الأوزان. يمكنك استخدامه في أعمال العملاء، أو تطوير منتج عليه، أو تشغيله على نطاق واسع دون دفع رسوم ترخيص أو الإبلاغ عن الاستخدام لأي شخص.
وحدة معالجة رسومية بسعة 40 جيجابايت هي الحد الأدنى العملي. أظهرت إحدى الاختبارات العملية تشغيله على بطاقة A800 مع تقنية INT8 للتقليل من الدقة والتقطير في ثماني خطوات. استغرق ذلك حوالي 44 ثانية من معالجة وحدة المعالجة الرسومية لكل ثانية من الفيديو النهائي.
يعمل النموذج مع شخصيات الأنمي، والحيوانات، والمشاهد متعددة الأشخاص، بما في ذلك اللقطات التي يتعامل فيها شخص مع جسم ما. كما يدعم الغناء والتمثيل، وهو أمر غير معتاد في نموذج تم إنشاؤه حول الكلام.
قم برفع قيمة CFG للصوت، حيث تعمل بشكل أفضل في نطاق ما بين 3 و5. اكتب أيضًا أوصافًا أطول وأكثر تفصيلاً، لأن الأوصاف القصيرة تمنح النموذج قدرة أقل على الحفاظ على الاتساق عبر المقطع.
عندما لا يكون لدى أي شخص في الفريق خبرة في تشغيل وحدات معالجة رسومية. الإعداد صعب حقًا، والحساب بطيء، وأداة بالاشتراك تفوقه تمامًا إلا إذا كنت تمتلك بالفعل الأجهزة والوقت الهندسي.



قم باستنساخ النموذج وجرب تشغيل مقطع واحد من خلاله الليلة. احسب تكلفة وقت وحدة المعالجة الرسومية لنفسك قبل أن يوقع أي شخص على اشتراك.