Was LongCat Video Avatar 1.5 kann
LongCat Avatar 1.5 macht mehr, als nur einen Mund zur Audiospur zu bewegen. Es erstellt aus nur einem Foto und einer Sounddatei ein komplettes sprechendes, singendes oder animiertes Video.

Laden Sie ein Foto und eine Audiodatei hoch, und LongCat Avatar 1.5 verwandelt sie in ein sprechendes, singendes oder animiertes Video – ganz ohne Bearbeitungskenntnisse.
LongCat Video Avatar kostenlos testen























LongCat Avatar 1.5 macht mehr, als nur einen Mund zur Audiospur zu bewegen. Es erstellt aus nur einem Foto und einer Sounddatei ein komplettes sprechendes, singendes oder animiertes Video.

Ein Modell erledigt drei Aufgaben gleichzeitig. 'Audio Text to Video' konstruiert eine sprechende Figur nur aus einem Skript und einer Sprachspur. 'Audio Text Image to Video' animiert ein von Ihnen bereitgestelltes Referenzfoto, und 'Video Continuation' verlängert einen bestehenden Clip für längere Sprechaufnahmen.
LongCat Avatar 1.5 nutzt Whisper Large, um das Audio zu analysieren und jede Mundbewegung präzise auf die tatsächliche Sprache abzustimmen. Das sorgt für eine enge und natürliche Lippensynchronisation, selbst über längere Clips mit wechselndem Tonfall und Tempo.
Das Tool kann zwei separate Audiospuren verarbeiten und jede auf eine andere Person im Bild synchronisieren. So können beide Sprecher in derselben Szene natürlich sprechen, reagieren und sich abwechseln. Perfekt für Interviews, Duette oder alle Clips, in denen zwei Personen im Bild sind.
Es läuft mit nur 8 Generierungsschritten und INT8-Quantisierung, was die Verarbeitungszeit reduziert, ohne die Qualität merklich zu beeinträchtigen. Das bedeutet schnellere Ergebnisse, sodass Sie nicht lange auf das Rendern Ihres Videos warten müssen.
Ein Modell auf den Servern anderer zu betreiben bedeutet, deren Grenzen, Kosten und Ausfallzeiten zu akzeptieren. Hier erfahren Sie, warum Teams sich stattdessen für das Self-Hosting von LongCat Avatar 1.5 entscheiden.
LongCat wird unter der MIT-Lizenz veröffentlicht, sodass Teams es ohne Lizenzgebühren oder Genehmigung nutzen, modifizieren und einsetzen können. Das unterscheidet sich von Tools, die sich als kostenlos bezeichnen, aber pro Erzeugung abrechnen oder Funktionen hinter einer Paywall verstecken.
Jetzt kostenlos starten
Das Tool bewahrt das Gesicht, die Gesichtszüge und die Identität einer Figur auch in langen Sprech- oder Singaufnahmen konsistent. Das bedeutet kein Abdriften oder subtile Veränderungen, wenn der Clip länger wird, sodass dieselbe Person von Anfang bis Ende erkennbar bleibt.
Jetzt kostenlos starten
Dieses Modell kann viel mehr als nur eine Person, die am Schreibtisch sitzt und spricht. Auch Anime-Charaktere, Tiere, Szenen mit mehreren Personen und Aufnahmen mit Objekthandhabung werden stabil dargestellt.
Jetzt kostenlos starten
Teams, die Avatar-Tools abwägen, legen meist Wert auf Kosten, Kontrolle und das tatsächliche Aussehen des Ergebnisses. So schneidet LongCat Avatar 1.5 im Vergleich zu gehosteten Optionen in diesen Punkten ab:
| Plattform | Lizenz | Benötigte Hardware | Auflösung | Nutzer |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT, kostenlos für kommerzielle Nutzung | Mindestens 40GB GPU | 480P und 720P | ML-Ingenieure |
| Magiclight AI | Nutzungsrechte auf kostenpflichtigen Plänen | Keine, läuft im Browser | 1080p, bis zu 50 Minuten | Story-Ersteller |
| Synthesia | Minutenbasiertes Abonnement | Keine, läuft im Browser | Studioqualität | Unternehmens-Teams |
| Mango AI | Abonnement | Keine, Browser oder Handy | Standard-Video | Marketing-Experten |
| HeyGen | Abonnement | Keine, läuft im Browser | Studioqualität | Growth-Teams |
Die Einrichtung von LongCat Avatar 1.5 dauert nur wenige Schritte, egal ob du es lokal oder über eine gehostete Option ausführst.
Verwende eine GPU mit ausreichend VRAM für das Modell und seinen Audio-Encoder. Das offizielle Setup unterstützt den INT8-Modus zur Reduzierung des Speicherverbrauchs, wofür GPUs der 40GB-Klasse verwendet werden.
Lade sowohl das LongCat-Video-Basismodell als auch die LongCat-Video-Avatar-1.5-Gewichte von Hugging Face herunter. Das Avatar-1.5-Setup verwendet das Basismodell zusammen mit seinen eigenen Modellgewichten.
Gib das Audio und für die bildbasierte Generierung ein Referenzbild sowie einen Text-Prompt an. Längere, detailliertere Prompts werden empfohlen, da sie die Konsistenz und Natürlichkeit der Ergebnisse verbessern können.
Für Avatar 1.5 verwende den 8-Schritte-Distilled-Modus und wähle 480P- oder 720P-Auflösung. Audio CFG wird bei Verwendung der Standard-Sampling-Steuerung im Bereich von 3–5 empfohlen, während der INT8-Modus den VRAM-Verbrauch reduzieren kann.
ML-Ingenieur
Unsere Kosten pro Minute für Avatare stiegen schneller als die Nutzung. Durch Self-Hosting von LongCat konnten wir diese Kosten auf Hardware verlagern, die wir bereits besaßen und die nachts ohnehin ungenutzt war.
Technischer Leiter Startup
Die MIT-Lizenz von LongCat war der Grund, warum wir es drei besser dokumentierten Alternativen vorgezogen haben. Ein Produkt auf Basis von Gewichten aufzubauen, die niemand widerrufen kann, war den Aufwand für die Einrichtung jede Stunde wert.
E-Commerce Video Creator
Wir generieren Produktnarrative in Batches und nicht einzeln. LongCat Video Avatar 1.5 erledigt das über Nacht, und niemand muss vor der Kamera erscheinen.
Leiter Animationsstudio
Die meisten Avatarmodelle versagen, sobald man ihnen einen stilisierten Charakter gibt. LongCat verarbeitet unsere Anime-Designs, ohne dass das Gesicht mitten in einer Aufnahme zerfließt.
Ein Open-Weight, audio-gesteuertes Avatar-Videomodell vom LongCat-Team von Meituan, veröffentlicht im Mai 2026. Es basiert auf dem LongCat-Video-Foundation-Modell mit 13,6 Milliarden Parametern und wird offiziell mit Bindestrichen als LongCat-Video-Avatar 1.5 geschrieben.
Ja, unter einer MIT-Lizenz, die so freizügig ist, wie Open Weights nur sein können. Sie können Kundenprojekte umsetzen, ein Produkt darauf aufbauen oder es im großen Maßstab einsetzen, ohne Lizenzgebühren zu zahlen oder die Nutzung an irgendjemanden melden zu müssen.
Eine 40-GB-GPU ist das praktische Minimum. In einem Praxistest lief es auf einer A800 mit INT8-Quantisierung und dem achtstufigen Distill. Dabei wurden immer noch etwa 44 Sekunden GPU-Rechenzeit pro Sekunde fertigen Videos gemessen.
Anime-Charaktere, Tiere und Szenen mit mehreren Personen funktionieren, einschließlich Aufnahmen, in denen jemand einen Gegenstand hält. Auch Singen und Schauspielern werden gut umgesetzt, was für ein Modell, das auf Sprache ausgelegt ist, ungewöhnlich ist.
Erhöhen Sie den Audio-CFG-Wert, der am besten zwischen 3 und 5 liegt. Schreiben Sie auch längere, beschreibendere Prompts, da kurze dem Modell weniger Informationen geben, um über einen Clip hinweg Konsistenz zu wahren.
Immer dann, wenn niemand im Team beruflich mit GPUs arbeitet. Der Aufbau ist wirklich schwierig, die Berechnung ist langsam, und ein Abonnement-Tool ist klar überlegen, es sei denn, Sie haben bereits die Hardware und die Entwicklungszeit.



Klonen Sie das Modell und lassen Sie noch heute einen Clip durchlaufen. Berechnen Sie sich die GPU-Zeit selbst, bevor jemand ein Abonnement abschließt.