Gerador de Avatares Falantes com IA OmniHuman 1.5

Dê ao OmniHuman 1.5 um retrato e uma faixa de voz, e devolve um vídeo dessa pessoa a dizer as suas palavras exatas — lábios, expressões e gestos seguem o som.

0 / 2,000
130 cr/s · ≤35s

O que é o OmniHuman 1.5?

O OmniHuman 1.5 é o modelo de avatares da ByteDance conduzido por áudio: dê-lhe um retrato e uma faixa de voz, e devolve um vídeo dessa pessoa a dizer o seu áudio — lábios, expressões, movimento de cabeça e gestos, todos conduzidos pelo som. Ao contrário dos modelos de vídeo conduzidos por prompt, é você que fornece as palavras exatas. O artigo de investigação junta um modelo multimodal de linguagem a um transformador de difusão, por isso a interpretação reage ao que está a ser dito em vez de apenas seguir a boca.

A parte honesta: precisa de um retrato frontal. O nosso teste de perfil de três quartos abaixo mostra lábios que quase não articulam e uma cabeça que se afasta. O áudio está limitado a 35 segundos por execução, por isso guiões mais longos implicam dividir e coser, e o diálogo com várias pessoas — uma funcionalidade de destaque do artigo — não está disponível aqui. É vídeo de fala, não vídeo de cena: para movimento de câmara ou ação, use o Seedance 2.5 ou o Kling 3.0 Turbo.

A arquitetura, o posicionamento e os números do estudo com utilizadores vêm do artigo de investigação da ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

O que dizem os testadores

A versão 1.5 demonstra maior robustez perante entradas difíceis.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Um retrato até à cintura com mãos, ombros e iluminação natural bem visíveis costuma dar melhor movimento corporal.
Z.Tools — OmniHuman-1.5 deep dive
Sombras pesadas, óculos de sol, oclusões estranhas e rostos minúsculos tornam o trabalho mais difícil.
Z.Tools — OmniHuman-1.5 deep dive

Porquê correr o OmniHuman 1.5 na CreateVision AI?

O modelo é da ByteDance; a razão para o usar aqui é que as outras duas entradas — o rosto e a voz — vêm do mesmo espaço de trabalho.

Retrato gerado com o GPT Image 2 usado como rosto de entrada num clipe de avatar do OmniHuman 1.5

Toda a cadeia de entrada vive numa página

Um clipe de avatar falante precisa de três coisas: um rosto, uma voz e o modelo. Aqui as três vêm do mesmo espaço de trabalho — gere o retrato com o GPT Image 2 ou o Seedream, escreva o guião e sintetize-o com uma das 60 vozes integradas, depois leve ambos diretamente para o OmniHuman 1.5. Todos os clipes desta página foram feitos exatamente assim, de ponta a ponta, sem gravar um segundo de áudio nem carregar uma única fotografia de uma pessoa real.

Retrato de entrada do caso da casa de chá em mandarim do OmniHuman 1.5

Uma biblioteca de vozes em vez de uma cabine de gravação

O modo de texto não é um acessório: 60 vozes em inglês, chinês, japonês, coreano, francês, alemão, espanhol, italiano, russo e português, cada uma com uma pré-audição que pode ouvir antes de gastar seja o que for. Escreva até 600 caracteres, escolha uma voz, e a plataforma sintetiza a fala e conduz o avatar com ela numa única execução. O clipe da casa de chá em mandarim acima é exatamente este caminho — sem microfone envolvido.

Retrato de entrada do caso do pivô de notícias do OmniHuman 1.5

Uma subscrição, e o custo à vista à partida

O OmniHuman 1.5 fatura por segundo de áudio — 130 créditos por segundo, arredondados para cima — e o espaço de trabalho mostra o custo exato do seu clipe antes de premir gerar. O mesmo plano cobre o GPT Image 2, o Nano Banana Pro, o Seedream, o Seedance, o Kling e o Veo, por isso o fluxo sensato é barato: rascunhe o retrato por uns poucos créditos, feche o guião, e só depois gaste em segundos de avatar. Corte o silêncio do seu áudio — está a pagar por cada segundo dele.

Retrato de entrada em perfil de três quartos usado no teste de esforço do OmniHuman 1.5

Medido, não prometido — incluindo a falha

O nosso conjunto de teste de sete clipes foi gerado a 19 de agosto de 2026 — uma apresentação de produto, um noticiário breve, uma conversa motivacional de ginásio, uma receção em mandarim numa casa de chá, uma personagem de livro infantil, uma falha deliberada em perfil de três quartos, e um plano geral de palco. Todas as tarefas aceites renderizaram com sucesso à primeira tentativa, entre 3m 20s e 4m 42s para cerca de dez segundos de áudio. Publicamos também o que correu mal: numa terça-feira à noite de muito movimento, o fornecedor a montante rejeitou 13 das nossas 20 submissões com erros de capacidade antes de as aceitar (as execuções rejeitadas são reembolsadas automaticamente), uma tarefa aceite esteve 14 minutos em fila, e o clipe de perfil desta página mostra exatamente o que acontece quando se ignora o conselho do retrato frontal.

Clipes reais do OmniHuman 1.5 feitos neste espaço de trabalho

Os 7 clipes abaixo foram todos gerados aqui a 19 de agosto de 2026 — cada um é o primeiro render que as suas entradas produziram, sem repetições e sem escolhas a dedo. Os retratos são resultados do GPT Image 2; todas as vozes foram escritas como texto e sintetizadas com a biblioteca integrada. As tarefas aceites voltaram entre 3m 20s e 4m 42s para cerca de 10 segundos de áudio (uma exceção esteve 14 minutos em fila); numa noite de muito movimento, o fornecedor a montante rejeitou várias submissões com erros de capacidade antes de aceitar — as execuções rejeitadas são reembolsadas. Com som.

Prompt9,2 s de áudio · voz Trustworthy Man · 1.300 créditos · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s de áudio · voz News Anchor · 1.430 créditos · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s de áudio · voz Energetic Guy · 1.430 créditos · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s de áudio · voz Mandarin Sweet Girl · 1.560 créditos · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s de áudio · voz Sweet Girl · 1.300 créditos · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s de áudio · voz Wise Lady · 1.170 créditos · a sincronia labial degrada-se visivelmente neste ângulo

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s de áudio · voz Movie Narrator · 780 créditos · este fotograma é o fundo da página

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Para quem é realmente o OmniHuman 1.5

Cada um destes corresponde a um clipe demonstrado acima — não a uma lista de desejos.

  • Criadores de cursos e de explicadores

    Escreva a narração e obtenha um apresentador no ecrã — sem câmara, iluminação nem repetições. O limite de 35 segundos por clipe encaixa bem em um conceito por clipe, que é como a maioria dos editores de cursos monta de qualquer forma.

  • Marketing de produto e de UGC

    O caso da apresentação da coluna acima é o fluxo todo: gere um retrato estilo criador com o seu produto na mão, escreva a apresentação, escolha uma voz. Sem honorários de talento e sem autorizações de imagem para perseguir — o rosto nunca existiu.

  • Equipas de localização

    O mesmo rosto pode entregar a mesma mensagem em dez idiomas: mantenha o retrato, troque a voz. A sincronia labial segue o áudio que fornecer — o caso em mandarim acima é a prova.

  • Canais sem rosto e apresentadores virtuais

    Uma persona que gera é uma persona que lhe pertence. Desenhe o rosto uma vez, dê-lhe uma voz consistente da biblioteca, e ele pode apresentar todos os episódios — a personagem ilustrada de livro infantil acima mostra que nem sequer tem de ser fotorrealista.

  • Podcasters e criadores que começam pelo áudio

    Já tem a parte difícil: o áudio. Corte um excerto para 35 segundos, junte um retrato, e tem um clipe visual para redes sociais sem abrir um editor.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Vídeo de fala versus vídeo de cena — o que cada modelo precisa de si, e o que devolve neste espaço de trabalho.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
O que fornece1 fotografia de retrato + o seu áudio, ou texto escrito e uma voz da bibliotecaUm prompt, mais referências opcionais de imagem, vídeo e áudioUm prompt, mais uma imagem de referência opcionalUm prompt ou uma imagem inicial
Quem diz as palavrasÉ você — o avatar sincroniza os lábios com a sua banda sonora exataO modelo gera vozes a partir do promptO modelo gera vozes a partir do promptO áudio é gerado com o clipe
Duração do clipe aquiA duração do seu áudio, até 35 s4–30 s4–8 s3–15 s
Créditos130 por segundo de áudio110/s em 480p · 230/s em 720p320–1.920 por clipe (4–8 s · 720p–4K · ± áudio)55/s em 720p · 70/s em 1080p
Medido aqui~4 min para ~10 s de áudio (7 clipes, agosto de 2026)Não medimos nesta tarefaNão medimos nesta tarefaNão medimos nesta tarefa

Os créditos, as durações e as opções de entrada são lidos do registo de modelos deste espaço de trabalho a 19 de agosto de 2026 — descrevem o que obtém aqui, não as especificações publicadas pelos fornecedores. Os tempos são medições nossas nos clipes mostrados acima; não passámos os mesmos guiões pelos outros três modelos, por isso essas células dizem-no em vez de adivinharem.

Outros modelos de vídeo como o OmniHuman 1.5

Compare o OmniHuman 1.5 com outros modelos de vídeo — mesmo espaço de trabalho, um clique para alternar.

Especificações do OmniHuman 1.5 na CreateVision AI

Modeloomnihuman-1.5, da ByteDance (artigo de investigação publicado em agosto de 2025)
ModoAvatar falante: uma fotografia + uma faixa de áudio → vídeo de fala, no espaço de trabalho de avatares desta página
EntradasExatamente 1 imagem de retrato, mais áudio até 35 segundos (carregamento mp3/wav) — ou texto escrito até 600 caracteres, sintetizado em fala
Biblioteca de vozes60 vozes integradas em 10 idiomas: inglês, chinês, japonês, coreano, francês, alemão, espanhol, italiano, russo, português
Orientação opcionalUma nota curta de interpretação para ações, emoção e câmara — útil, nunca obrigatória
SaídaUm único plano contínuo que mantém o enquadramento da sua fotografia; a duração do clipe é igual à do áudio. Saída medida: 1248×1664 a partir de uma fotografia 2:3, 1920×1088 a partir de 16:9, 25 fps, H.264 com áudio AAC mono
Créditos130 por segundo de áudio, arredondados para cima — 130 no mínimo, 4.550 nos 35 segundos completos; o custo exato é mostrado antes de gerar
Velocidade medida3m 20s–4m 42s por tarefa aceite para ~10 s de áudio no nosso teste de 7 clipes; uma exceção esteve 14 minutos em fila (agosto de 2026, uma terça-feira à noite de muito movimento)

Como fazer um avatar falante a partir de uma fotografia

Comece a gerar vídeos
  1. Acrescente o rosto

    Carregue um retrato nítido, de frente e até à cintura — ou gere um com o GPT Image 2 ou o Seedream neste mesmo espaço de trabalho, que foi como todos os rostos desta página foram feitos. Uma pessoa por fotografia; mantenha o rosto grande e desobstruído.

  2. Dê-lhe uma voz

    Carregue um clipe de áudio (mp3 ou wav, até 35 segundos), ou mude para o modo de texto: escreva até 600 caracteres e escolha uma de 60 vozes em 10 idiomas, cada uma com uma pré-audição que pode ouvir primeiro.

  3. Se quiser, dirija a interpretação

    Uma nota curta como «calmo, pequenos acenos, sorriso subtil» orienta o gesto e a emoção. Deixe-a vazia e o modelo lê sozinho o ritmo e o sentido do áudio.

  4. Gere e verifique a sincronia

    O custo exato em créditos aparece antes de executar — escala com a duração do áudio. A geração é assíncrona; o clipe aterra no seu histórico com todas as entradas anexadas, por isso uma configuração que funcione é reproduzível na semana seguinte.

Além do OmniHuman 1.5

Uma conta, todo o fluxo de geração de imagem e vídeo.

Leituras relacionadas

OmniHuman 1.5: preços e créditos diários grátis

Rode o OmniHuman 1.5 com os créditos diários do plano gratuito, ou faça upgrade para modelos premium, geração mais rápida e saída em 4K.

Gratuito

$0

Perfeito para começar

  • 200 créditos de boas-vindas, até 80/dia
  • Rascunhos do Z Image Turbo a 0 créditos
  • Velocidade de geração padrão
  • Histórico de geração incluído
Começar

Premium

Mais popular
$29/month

Cobrado anualmente · US$ 240/ano

  • 8.000 créditos/mês, sem limites diários
  • Todos os modelos premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Geração 5x mais rápida, fila prioritária
  • Aprimoramento de prompt por IA
Atualizar para Premium

Ultimate

$49/month

Cobrado anualmente · US$ 380/ano

  • 18.000 créditos/mês, sem limites diários
  • Geração em HD até resolução 4K
  • Suporte prioritário
  • Fila mais rápida e acesso antecipado a novos modelos
Atualizar para Ultimate

OmniHuman 1.5 — perguntas frequentes

1

O que é o OmniHuman 1.5?

O modelo de avatares da ByteDance conduzido por áudio. Aceita uma fotografia de retrato e uma faixa de áudio e devolve um vídeo dessa pessoa a dizer o áudio — lábios, expressões, movimento de cabeça e gestos das mãos seguem todos o som. O artigo de investigação que lhe deu origem foi publicado em agosto de 2025.

2

O avatar consegue dizer as minhas palavras exatas?

Sim — é essa a diferença face aos modelos de vídeo conduzidos por prompt. É você que fornece a banda sonora, seja como carregamento mp3/wav, seja escrevendo o guião e escolhendo uma voz integrada, e o avatar sincroniza os lábios com ela palavra por palavra. Os modelos conduzidos por prompt geram as suas próprias vozes e raramente dizem exatamente o que escreveu.

3

O OmniHuman 1.5 é gratuito?

Não — fatura a 130 créditos por segundo de áudio, arredondados para cima, por isso um clipe de 10 segundos são 1.300 créditos. O custo exato é mostrado antes de gerar, e as execuções falhadas são reembolsadas automaticamente. Mantenha os guiões curtos e corte o silêncio: cada segundo de áudio é um segundo que paga.

4

O que caracteriza uma boa foto de referência?

De frente, até à cintura, uma pessoa, com o rosto grande, bem iluminado e desobstruído — os analistas e os nossos próprios testes concordam. O nosso teste deliberado em perfil de três quartos acima mostra o que acontece de outra forma: os lábios quase não articulam, o modelo roda lentamente a cabeça para mais longe, e aparecem objetos na secretária que nunca estiveram na fotografia. Os retratos gerados funcionam exatamente tão bem como fotografias de câmara.

5

Funciona com ilustrações ou personagens anime?

Sim — o nosso teste do livro infantil acima é uma ilustração 2D plana, e o OmniHuman 1.5 animou-a de forma convincente mantendo o estilo gráfico: olhos, sobrancelhas e boca mexem-se como numa personagem animada à mão. Uma particularidade que observámos: quando a boca abre muito, o modelo desenha dentes surpreendentemente realistas para uma ilustração plana. O artigo da ByteDance alega também sujeitos não humanos; nós só testámos esta personagem ilustrada.

6

Que duração pode ter um clipe, e quanto tempo demora a geração?

Até 35 segundos de áudio por clipe nesta plataforma — guiões mais longos têm de ser divididos e cosidos. No nosso teste de agosto de 2026, as tarefas aceites voltaram entre 3m 20s e 4m 42s para cerca de 10 segundos de áudio. Uma ressalva da mesma noite: sob carga elevada, o fornecedor a montante rejeitou várias submissões com erros de capacidade antes de aceitar a tarefa. As execuções rejeitadas não custam nada, mas conte com repetições nas horas de pico e não com um prazo daqui a cinco minutos.

7

Em que é que o OmniHuman 1.5 é mau?

Rostos que não estão de frente, acima de tudo: o nosso teste em perfil de três quartos mostra lábios quase imóveis, uma cabeça que se afasta da câmara e objetos na secretária que nunca estiveram na fotografia. Pequenos detalhes de identidade podem alterar-se a meio do clipe — um brinco mudou de forma nesse teste, e a cor dos lábios lê-se ligeiramente mais forte do que na entrada noutros dois. O diálogo com várias pessoas não está disponível aqui, a resolução de saída é modesta (1248×1664 nos nossos testes de retrato — sem 4K), e só faz vídeo de fala: para ação, movimento de câmara ou mudanças de cena, use o Seedance 2.5 ou o Kling 3.0 Turbo.

8

Posso usar os vídeos comercialmente — e que rosto posso usar?

Os vídeos que gerar podem ser usados em projetos pessoais e comerciais ao abrigo dos nossos termos de serviço. O rosto é a parte a levar a sério: animar a fotografia de uma pessoa real sem o seu consentimento pode violar direitos de imagem e de personalidade, e várias jurisdições exigem agora a divulgação de apresentadores sintéticos. Os rostos gerados — como todos os rostos desta página — evitam por completo o problema do consentimento.

Dê a uma fotografia algo para dizer

Comece a gerar vídeos

Preços e acesso — os fatosOmniHuman 1.5

Modelo
OmniHuman 1.5
Desenvolvedor
ByteDance
Acesso
Funciona no espaço de trabalho do CreateVision AI via API — faça login e gere. Sem chave de API, sem projeto na nuvem, sem instalação.
Preço por geração
A partir de 650 créditos ≈ $2.36 por clipe de 5 segundos no plano Premium ($29/mês por 8,000 créditos). O plano gratuito inclui 80 créditos por dia.
Privacidade
Privado por padrão — nenhum outro usuário pode ver suas gerações, em nenhum plano. Não vendemos nem fazemos mau uso dos dados dos membros. Política de Privacidade

NovidadesOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.