VideoAI

Teste de foto → voz → lip sync no VideoAI

Por Emerson Amorim, fundador do KingFy · Atualizado 2026-08-16

Um recado só. Várias fotos. A tela anima a boca no tempo da fala. Este guia é a matriz — frontal, lateral, baixa luz, expressão, idioma — para você gerar e anotar o clipe, não mais um artigo de “o que é foto falante”.

O recado que não muda

Trave um texto curto, o mesmo em todos os clipes. Exemplo: “A padaria abre sábado às oito. Encomenda pelo recado da página.” Até 2 mil caracteres. Sem crédito o botão não gera; o pacote da tela é de sete vídeos.

Use só o próprio rosto ou o de quem combinou. JPG, PNG ou WEBP até 10 MB. Este artigo não publica os seus clipes: descreve o que a tela faz e o que anotar depois de assistir.

O que a tela faz, nesta ordem

Foto primeiro — a voz só destrava depois. Recado por texto, microfone (até 5 minutos) ou arquivo (MP3, WAV, M4A, OGG até 25 MB). Idioma e voz. Gerar.

Enquanto gera, a tela conta: enviar arquivos, preparar o áudio, animar o avatar, sincronizar os lábios, finalizar. No fim você assiste. “Melhorar qualidade” pode demorar mais e gastar mais crédito — deixe desligado no primeiro giro da matriz.

Quatro fotos, um texto

Frontal, luz boa, rosto visível: o recado do produto para o melhor caso. Lateral: o mesmo texto, outra foto. Baixa luz: o mesmo texto. Expressão forte (sorriso ou sobrancelha): o mesmo texto.

Em cada clipe anote: a boca acompanhou? O recado ficou inteligível? Quem aparece se reconhece? Não trate um clipe ruim como “o VideoAI não funciona” se a foto violou o que a tela pede.

Idiomas e vozes

Português: Antônio e Francisca. Inglês: Guy e Aria. Espanhol, francês e alemão estão no seletor de idioma. Combine o idioma do texto com o da lista — texto em português com idioma inglês costuma soar estranho.

Rode o mesmo texto em português e, se fizer sentido para o recado, em inglês. São duas células da matriz, não dez artigos novos.

Matriz: o que variar e o que conferir

Uma fala. Cinco eixos. Preencha o resultado na sua sessão — não há ranking oficial de “melhor foto” neste texto.

EixoO que enviarO que olhar no clipe
FrontalRosto visível, luz boa, sem objeto na frenteBoca no tempo da fala; recado claro
LateralO mesmo texto, foto de três quartos ou perfilSe o lip sync quebra ou o rosto distorce
Baixa luzO mesmo texto, foto escuraSe a boca e o recado ainda se entendem
ExpressãoSorriso ou sobrancelha marcadosSe a expressão sobrevive à animação
IdiomaPT (Antônio/Francisca) ou EN (Guy/Aria)Se a voz combina com o texto que você escreveu

Foto de terceiro, de criança sem responsável ou de famoso não é o uso do produto. Conferir o clipe é a etapa que vale o crédito.

Fontes

Perguntas frequentes

Preciso gerar cinco vídeos de uma vez?

Não. A matriz é um protocolo. Um clipe frontal já ensina o funil. Os outros eixos existem para você comparar, não para encher a biblioteca.

Qual foto o produto pede como ponto de partida?

Frontal, bem iluminada, rosto visível. JPG, PNG ou WEBP, até 10 MB. Lateral e baixa luz entram como teste, não como recado de “use sempre”.

Consigo só escrever o texto, sem gravar a voz?

Sim. A aba Texto lê o que você escreveu com a voz escolhida. Gravar e arquivo são as outras duas abas.

O vídeo publica sozinho?

Só se você marcar “postar na timeline após gerar”. Sem essa marca, o clipe fica para você conferir na tela.

Mais sobre vídeo com foto falante

Pronto para experimentar?

Foto falante no VideoAI: frontal, luz, expressão e idioma