O Que o LongCat Video Avatar 1.5 Faz
O LongCat Avatar 1.5 faz mais do que mover uma boca para sincronizar com o áudio. Ele monta um vídeo completo falante, cantando ou animado a partir de apenas uma foto e um arquivo de som.

Faça upload de uma foto e um arquivo de áudio, e o LongCat Avatar 1.5 os transforma em um vídeo falante, cantando ou animado, sem necessidade de habilidades de edição.
Experimente o LongCat Video Avatar Gratuitamente























O LongCat Avatar 1.5 faz mais do que mover uma boca para sincronizar com o áudio. Ele monta um vídeo completo falante, cantando ou animado a partir de apenas uma foto e um arquivo de som.

Um único modelo executa 3 tarefas simultaneamente. O Áudio e Texto para Vídeo constrói um personagem falante a partir de apenas um roteiro e uma faixa de voz. O Áudio, Texto e Imagem para Vídeo anima uma foto de referência que você fornece, e a Continuação de Vídeo estende um clipe existente para produzir cenas falantes mais longas.
O LongCat Avatar 1.5 usa o Whisper Large para ler o áudio e cronometrar cada movimento da boca de acordo com a fala real. Isso mantém a sincronização labial precisa e natural, mesmo em clipes mais longos com tom e ritmo variados.
A ferramenta pode receber 2 fluxos de áudio separados e sincronizar cada um com uma pessoa diferente no quadro. Isso permite que ambos os interlocutores falem, reajam e se alternem naturalmente na mesma cena. É ideal para entrevistas, duetos ou qualquer clipe onde 2 pessoas compartilhem o quadro.
Ele roda com apenas 8 passos de geração com quantização INT8, reduzindo o tempo de processamento sem uma queda real na qualidade. Isso significa uma saída mais rápida, para que você não fique esperando muito tempo para seu vídeo ser renderizado.
Executar um modelo no servidor de outra pessoa significa aceitar seus limites, custos e tempo de inatividade. Veja por que as equipes optam por hospedar o LongCat Avatar 1.5 em seus próprios servidores.
O LongCat é lançado sob a licença MIT, permitindo que as equipes o usem, modifiquem e implantem sem pagar taxas de licença ou pedir permissão. Isso difere de ferramentas que se dizem gratuitas, mas ainda cobram por geração ou bloqueiam recursos atrás de um paywall.
Comece a Criar Gratuitamente
A ferramenta mantém o rosto, as características e a identidade de um personagem consistentes, mesmo em cenas longas de fala ou canto. Isso significa que não há desvio ou mudanças sutis à medida que o clipe se prolonga, garantindo que a mesma pessoa seja reconhecível do início ao fim.
Comece a Criar Gratuitamente
Este modelo faz muito mais do que uma pessoa sentada e falando em uma mesa. Personagens de anime, animais, cenas com várias pessoas e cenas com manipulação de objetos também saem estáveis.
Comece a Criar Gratuitamente
As equipes que avaliam ferramentas de avatar geralmente se preocupam com custo, controle e como a saída realmente se parece. Veja como o LongCat Avatar 1.5 se compara às opções hospedadas nesses pontos:
| Plataforma | Licença | Hardware Necessário | Resolução | Usuários |
|---|---|---|---|---|
| LongCat Avatar 1.5 | MIT, gratuito para uso comercial | GPU de 40GB no mínimo | 480P e 720P | Engenheiros de ML |
| Magiclight AI | Direitos em planos pagos | Nenhum, roda em um navegador | 1080p, até 50 minutos | Criadores de histórias |
| Synthesia | Assinatura baseada em minutos | Nenhum, roda no navegador | Qualidade de estúdio | Equipes corporativas |
| Mango AI | Assinatura | Nenhum, navegador ou celular | Vídeo padrão | Profissionais de marketing |
| HeyGen | Assinatura | Nenhum, roda no navegador | Qualidade de estúdio | Equipes de crescimento |
Configurar o LongCat Avatar 1.5 leva apenas alguns passos, seja executando localmente ou por meio de uma opção hospedada.
Use uma GPU com VRAM suficiente para o modelo e seu codificador de áudio. A configuração oficial suporta o modo INT8 para reduzir o uso de memória, com GPUs da classe de 40GB usadas para esta configuração.
Baixe tanto o modelo base LongCat-Video quanto os pesos do LongCat-Video-Avatar-1.5 do Hugging Face. A configuração do Avatar 1.5 usa o modelo base junto com seus próprios pesos de modelo.
Forneça o áudio e, para geração baseada em imagem, uma imagem de referência e um prompt de texto. Prompts mais longos e detalhados são recomendados, pois podem melhorar a consistência e os resultados naturais.
Para o Avatar 1.5, use o modo destilado de 8 etapas e escolha a resolução 480P ou 720P. O CFG de áudio é recomendado em torno de 3 a 5 ao usar os controles de amostragem padrão, enquanto o modo INT8 pode reduzir o uso de VRAM.
Engenheiro de Machine Learning
Nossa fatura por minuto de avatar estava subindo mais rápido que o uso. Hospedar o LongCat internamente transferiu esse custo para o hardware que já possuíamos e que ficava ocioso durante a noite.
Líder Técnico de Startup
A licença MIT do LongCat é o motivo pelo qual o escolhemos em vez de três opções melhor documentadas. Construir um produto sobre pesos que ninguém pode revogar valeu cada hora de dificuldade na configuração.
Criadora de Vídeos para E-commerce
Geramos narrações de produtos em lotes, em vez de uma por uma. O LongCat Video Avatar 1.5 as executa durante a noite, e ninguém precisa aparecer em câmera.
Líder de Estúdio de Animação
A maioria dos modelos de avatar desmorona no momento em que você insere um personagem estilizado. O LongCat lida com nossos designs de anime sem que o rosto derreta no meio de uma cena.
Um modelo de vídeo de avatar com pesos abertos e conduzido por áudio, desenvolvido pela equipe LongCat da Meituan e lançado em maio de 2026. É construído sobre o modelo base LongCat-Video de 13,6 bilhões de parâmetros e é oficialmente escrito com hífens como LongCat-Video-Avatar 1.5.
Sim, sob uma licença MIT, que é tão permissiva quanto os pesos abertos permitem. Você pode usar em trabalhos para clientes, desenvolver um produto com ele ou executá-lo em escala sem pagar taxas de licença ou reportar o uso a qualquer pessoa.
Uma GPU de 40GB é o mínimo realista. Um teste prático o executou em uma A800 com quantização INT8 e a destilação de oito etapas. Mesmo assim, mediu cerca de 44 segundos de computação na GPU por segundo de vídeo finalizado.
Personagens de anime, animais e cenas com múltiplas pessoas funcionam, incluindo cenas em que alguém manipula um objeto. Cantar e atuar também são bem suportados, o que é incomum para um modelo criado em torno da fala.
Aumente o valor de CFG de áudio, que funciona melhor entre 3 e 5. Escreva também prompts mais longos e descritivos, porque os curtos dão ao modelo menos informações para manter a consistência ao longo de um clipe.
Sempre que ninguém da equipe trabalha profissionalmente com GPUs. A configuração é genuinamente difícil, a computação é lenta e uma ferramenta por assinatura supera isso completamente, a menos que você já tenha o hardware e o tempo de engenharia.



Clone o modelo e execute um clipe hoje mesmo. Cobra-se pelo tempo de GPU antes de alguém assinar uma assinatura.