VideoAI
Teste de foto → voz → lip sync no VideoAI
Por Emerson Amorim, fundador do KingFy · Atualizado 2026-08-16
Um recado só. Várias fotos. A tela anima a boca no tempo da fala. Este guia é a matriz — frontal, lateral, baixa luz, expressão, idioma — para você gerar e anotar o clipe, não mais um artigo de “o que é foto falante”.
O recado que não muda
Trave um texto curto, o mesmo em todos os clipes. Exemplo: “A padaria abre sábado às oito. Encomenda pelo recado da página.” Até 2 mil caracteres. Sem crédito o botão não gera; o pacote da tela é de sete vídeos.
Use só o próprio rosto ou o de quem combinou. JPG, PNG ou WEBP até 10 MB. Este artigo não publica os seus clipes: descreve o que a tela faz e o que anotar depois de assistir.
O que a tela faz, nesta ordem
Foto primeiro — a voz só destrava depois. Recado por texto, microfone (até 5 minutos) ou arquivo (MP3, WAV, M4A, OGG até 25 MB). Idioma e voz. Gerar.
Enquanto gera, a tela conta: enviar arquivos, preparar o áudio, animar o avatar, sincronizar os lábios, finalizar. No fim você assiste. “Melhorar qualidade” pode demorar mais e gastar mais crédito — deixe desligado no primeiro giro da matriz.
Quatro fotos, um texto
Frontal, luz boa, rosto visível: o recado do produto para o melhor caso. Lateral: o mesmo texto, outra foto. Baixa luz: o mesmo texto. Expressão forte (sorriso ou sobrancelha): o mesmo texto.
Em cada clipe anote: a boca acompanhou? O recado ficou inteligível? Quem aparece se reconhece? Não trate um clipe ruim como “o VideoAI não funciona” se a foto violou o que a tela pede.
Idiomas e vozes
Português: Antônio e Francisca. Inglês: Guy e Aria. Espanhol, francês e alemão estão no seletor de idioma. Combine o idioma do texto com o da lista — texto em português com idioma inglês costuma soar estranho.
Rode o mesmo texto em português e, se fizer sentido para o recado, em inglês. São duas células da matriz, não dez artigos novos.
Matriz: o que variar e o que conferir
Uma fala. Cinco eixos. Preencha o resultado na sua sessão — não há ranking oficial de “melhor foto” neste texto.
| Eixo | O que enviar | O que olhar no clipe |
|---|---|---|
| Frontal | Rosto visível, luz boa, sem objeto na frente | Boca no tempo da fala; recado claro |
| Lateral | O mesmo texto, foto de três quartos ou perfil | Se o lip sync quebra ou o rosto distorce |
| Baixa luz | O mesmo texto, foto escura | Se a boca e o recado ainda se entendem |
| Expressão | Sorriso ou sobrancelha marcados | Se a expressão sobrevive à animação |
| Idioma | PT (Antônio/Francisca) ou EN (Guy/Aria) | Se a voz combina com o texto que você escreveu |
Foto de terceiro, de criança sem responsável ou de famoso não é o uso do produto. Conferir o clipe é a etapa que vale o crédito.
Fontes
Perguntas frequentes
Preciso gerar cinco vídeos de uma vez?
Não. A matriz é um protocolo. Um clipe frontal já ensina o funil. Os outros eixos existem para você comparar, não para encher a biblioteca.
Qual foto o produto pede como ponto de partida?
Frontal, bem iluminada, rosto visível. JPG, PNG ou WEBP, até 10 MB. Lateral e baixa luz entram como teste, não como recado de “use sempre”.
Consigo só escrever o texto, sem gravar a voz?
Sim. A aba Texto lê o que você escreveu com a voz escolhida. Gravar e arquivo são as outras duas abas.
O vídeo publica sozinho?
Só se você marcar “postar na timeline após gerar”. Sem essa marca, o clipe fica para você conferir na tela.