Gerador de Avatar AI OmniHuman 1.5

Dê vida a um único retrato com o OmniHuman 1.5 — carregue uma foto e um clipe de áudio (ou digite um texto e escolha uma voz) para gerar um avatar falante realista com lábios, expressões e gestos sincronizados.

Foto + voz → vídeoGestos controlados por áudioBiblioteca de vozes TTS
0 / 2,000
130 cr/s · ≤35s

Outros modelos de vídeo como o OmniHuman 1.5

Compare o OmniHuman 1.5 com outros modelos de vídeo — mesmo espaço de trabalho, um clique para alternar.

OmniHuman 1.5 — transforme uma foto e uma voz em um avatar falante realista.

O OmniHuman 1.5 da ByteDance cria um retrato único a partir do áudio: lábios sincronizados, expressões naturais e gestos corporais completos que respondem ao ritmo e ao significado da voz — e não apenas ao movimento da boca. Carregue uma foto e um clipe de vídeo ou digite um texto e escolha uma voz.

Frame de vídeo por IA da silhueta de uma dançarina em um palco enfumaçado sob luz âmbar

Uma foto + uma voz se transformam em um avatar falante.

Forneça ao OmniHuman 1.5 um único retrato e um clipe de áudio e ele animará o rosto, transformando-o em uma performance de fala convincente com sincronização labial precisa, preservando a identidade, a estrutura facial e a iluminação da pessoa. Sem necessidade de manipulação, tela verde ou estúdio.

Frame de vídeo por IA de um astronauta caminhando por um corredor iluminado de nave espacial

Movimento de todo o corpo, não apenas dos lábios

Diferentemente das ferramentas básicas de simulação de pessoas falando diretamente para a câmera, o OmniHuman 1.5 lê o ritmo, a prosódia e o significado do áudio para controlar os movimentos da cabeça, as mudanças de postura e os gestos com as mãos — de modo que o avatar enfatiza, pausa e reage como um apresentador real, em vez de um retrato estático com a boca em movimento.

Frame de vídeo por IA de chuva escorrendo pela janela de um café com bokeh aconchegante

Digite o texto, escolha uma voz — sem necessidade de gravação.

Sem áudio disponível? Mude para o modo de texto: digite o que o avatar deve dizer, escolha uma voz da biblioteca de conversão de texto em fala integrada e o OmniHuman 1.5 gera a performance falada para você. Ideal para apresentadores com roteiro, vídeos explicativos e vídeos para redes sociais.

Frame de vídeo por IA da aurora boreal girando sobre uma cabana nevada

Narração, diálogo ou canto

O modelo se adapta a diferentes estilos de áudio — narração calma, diálogo expressivo e até mesmo canto — e pode seguir orientações de texto opcionais para direção da câmera e gestos, produzindo resultados refinados adequados para marketing, treinamento e conteúdo para redes sociais.

Como usar o OmniHuman 1.5

Três passos, de uma caixa de prompt vazia a um clipe acabado.

  1. 1

    Selecione OmniHuman 1.5

    Abra o seletor de modelos e escolha OmniHuman 1.5. O painel mostra o custo em créditos, as opções de resolução e os limites de duração antes de você gastar qualquer coisa.

  2. 2

    Descreva o que quer

    Escreva o sujeito, a ação e como a câmera se comporta. Anexe um primeiro quadro se quiser que o clipe comece de uma imagem específica.

  3. 3

    Gere e depois continue

    Baixe o clipe, estenda a duração ou mande para mais edição. Prompt, modelo e configurações continuam salvos junto com ele no seu histórico.

Além do OmniHuman 1.5

Uma conta, todo o fluxo de geração de imagem e vídeo.

OmniHuman 1.5: preços e créditos diários grátis

Rode o OmniHuman 1.5 com os créditos diários do plano gratuito, ou faça upgrade para modelos premium, geração mais rápida e saída em 4K.

Gratuito

$0

Perfeito para começar

  • 80 créditos por dia, 400 por mês
  • Rascunhos do Z Image Turbo a 0 créditos
  • Velocidade de geração padrão
  • Histórico de geração incluído
Começar

Premium

Mais popular
$29/month

Cobrado anualmente · US$ 240/ano

  • 1.600 créditos/dia, 8.000 créditos/mês
  • Todos os modelos premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Geração 5x mais rápida, fila prioritária
  • Aprimoramento de prompt por IA
Atualizar para Premium

Ultimate

$49/month

Cobrado anualmente · US$ 300/ano

  • 4.000 créditos/dia, 18.000 créditos/mês
  • Geração em HD até resolução 4K
  • Suporte prioritário
  • Fila mais rápida e acesso antecipado a novos modelos
Atualizar para Ultimate

OmniHuman 1.5 — perguntas frequentes

1

O que é o OmniHuman 1.5?

O OmniHuman 1.5 é o modelo de avatar da ByteDance baseado em áudio: ele transforma um único retrato mais uma faixa de voz em um vídeo falante realista com lábios, expressões e gestos sincronizados.

2

O que preciso fornecer?

Uma foto de retrato nítida de uma única pessoa, além de um clipe de áudio (mp3/wav) ou — no modo de texto — o texto que você deseja que seja falado e uma voz selecionada da biblioteca integrada, que é sintetizada no áudio de condução.

3

Qual a duração máxima do vídeo do avatar?

Até 35 segundos de áudio por geração. Roteiros mais longos devem ser divididos em vários clipes. A cobrança é feita por segundo de áudio, arredondado para cima.

4

Será que se move mais do que a boca?

Sim. O OmniHuman 1.5 gera movimentos de cabeça, postura e gestos com as mãos que respondem ao ritmo e significado do áudio, de modo que o avatar atua em vez de apenas sincronizar os lábios.

5

O que caracteriza uma boa foto de referência?

Uma única pessoa, claramente visível, de frente, com boa iluminação e rosto desobstruído. Fotos de grupo, rostos muito pequenos ou com muitos olhos cobertos reduzem a qualidade ou podem não ser capturadas adequadamente.

6

Qual é o preço do OmniHuman 1.5?

Por segundo de áudio gerado. O custo exato em créditos é exibido antes da geração, e as execuções com falha são reembolsadas automaticamente.

Dê vida à sua foto com o OmniHuman 1.5.

Comece a gerar vídeos

NovidadesOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.