Generador de avatares parlantes con IA OmniHuman 1.5

Dale a OmniHuman 1.5 un retrato y una pista de voz, y devuelve un vídeo de esa persona diciendo tus palabras exactas — los labios, las expresiones y los gestos siguen al sonido.

0 / 2,000
130 cr/s · ≤35s

¿Qué es OmniHuman 1.5?

OmniHuman 1.5 es el modelo de avatar dirigido por audio de ByteDance: dale un retrato y una pista de voz y devuelve un vídeo de esa persona diciendo tu audio — labios, expresiones, movimiento de cabeza y gestos, todo dirigido por el sonido. A diferencia de los modelos de vídeo dirigidos por prompt, las palabras exactas las pones tú. El artículo de investigación combina un modelo de lenguaje multimodal con un transformador de difusión, así que la interpretación reacciona a lo que se está diciendo y no se limita a seguir la boca.

La parte honesta: necesita un retrato frontal. Nuestra prueba de perfil de tres cuartos de abajo muestra unos labios que apenas articulan y una cabeza que se va desviando. El audio está limitado a 35 segundos por ejecución, así que los guiones más largos hay que dividirlos y coserlos, y el diálogo entre varias personas — una función estrella del artículo — no está disponible aquí. Es vídeo de habla, no vídeo de escena: para movimiento de cámara o acción, usa Seedance 2.5 o Kling 3.0 Turbo.

La arquitectura, el posicionamiento y las cifras del estudio con usuarios proceden del artículo de investigación de ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Lo que dicen los evaluadores

La versión 1.5 demuestra una robustez mejorada ante entradas difíciles.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Un retrato de medio cuerpo con manos y hombros bien visibles e iluminación natural suele dar un mejor movimiento corporal.
Z.Tools — OmniHuman-1.5 deep dive
Las sombras marcadas, las gafas de sol, las oclusiones raras y las caras diminutas complican el trabajo.
Z.Tools — OmniHuman-1.5 deep dive

¿Por qué ejecutar OmniHuman 1.5 en CreateVision AI?

El modelo es de ByteDance; la razón para usarlo aquí es que las otras dos entradas — la cara y la voz — salen del mismo espacio de trabajo.

Retrato de GPT Image 2 usado como cara de entrada para un clip de avatar de OmniHuman 1.5

Toda la cadena de entradas vive en una sola página

Un clip de avatar parlante necesita tres cosas: una cara, una voz y el modelo. Aquí las tres salen del mismo espacio de trabajo — genera el retrato con GPT Image 2 o Seedream, escribe el guion y sintetízalo con una de las 60 voces integradas, y después mete ambos directamente en OmniHuman 1.5. Todos los clips de esta página se hicieron exactamente así, de principio a fin, sin grabar un segundo de audio ni subir una sola foto de una persona real.

Retrato de entrada para el caso de la tetería en mandarín de OmniHuman 1.5

Una biblioteca de voces en vez de una cabina de grabación

El modo de texto no es un añadido de última hora: 60 voces en inglés, chino, japonés, coreano, francés, alemán, español, italiano, ruso y portugués, cada una con una vista previa que puedes escuchar antes de gastar nada. Escribe hasta 600 caracteres, elige una voz, y la plataforma sintetiza el habla y dirige con ella el avatar en una sola ejecución. El clip de la tetería en mandarín de arriba es exactamente este camino — sin ningún micrófono de por medio.

Retrato de entrada para el caso del presentador de informativos de OmniHuman 1.5

Una sola suscripción, y el coste visible por adelantado

OmniHuman 1.5 factura por segundo de audio — 130 créditos por segundo, redondeando hacia arriba — y el espacio de trabajo muestra el coste exacto de tu clip antes de que pulses generar. El mismo plan cubre GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling y Veo, así que el flujo sensato sale barato: boceta el retrato por un puñado de créditos, cierra el guion y solo entonces gasta en segundos de avatar. Recorta el silencio de tu audio — estás pagando por cada segundo.

Retrato de entrada de perfil de tres cuartos usado para la prueba de esfuerzo de OmniHuman 1.5

Medido, no prometido — incluido el fallo

Nuestro conjunto de pruebas de siete clips se generó el 19 de agosto de 2026 — una presentación de producto, un informativo breve, una charla motivadora de gimnasio, una bienvenida en una tetería en mandarín, un personaje de cuento, un fallo deliberado con perfil de tres cuartos y un plano general de escenario. Todos los trabajos aceptados se renderizaron con éxito a la primera toma, en entre 3m 20s y 4m 42s para unos diez segundos de audio. También publicamos lo que salió mal: un martes por la tarde con mucha carga, el proveedor de origen rechazó 13 de nuestros 20 envíos con errores de capacidad antes de aceptarlos (las ejecuciones rechazadas se reembolsan automáticamente), un trabajo aceptado estuvo 14 minutos en cola, y el clip de perfil de esta página muestra exactamente qué pasa cuando se ignora el consejo del retrato frontal.

Clips reales de OmniHuman 1.5 hechos en este espacio de trabajo

Los 7 clips de abajo se generaron aquí el 19 de agosto de 2026 — cada uno es el primer render que produjeron sus entradas, sin repeticiones y sin selección interesada. Los retratos son salidas de GPT Image 2; cada voz se escribió como texto y se sintetizó con la biblioteca integrada. Los trabajos aceptados volvieron en entre 3m 20s y 4m 42s para unos 10 segundos de audio (uno atípico estuvo 14 minutos en cola); en una tarde con mucha carga, el proveedor de origen rechazó varios envíos con errores de capacidad antes de aceptarlos — las ejecuciones rechazadas se reembolsan. Con sonido.

Prompt9,2 s de audio · voz Trustworthy Man · 1300 créditos · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s de audio · voz News Anchor · 1430 créditos · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s de audio · voz Energetic Guy · 1430 créditos · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s de audio · voz Mandarin Sweet Girl · 1560 créditos · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s de audio · voz Sweet Girl · 1300 créditos · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s de audio · voz Wise Lady · 1170 créditos · la sincronía labial se degrada visiblemente en este ángulo

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s de audio · voz Movie Narrator · 780 créditos · este fotograma es el fondo de la página

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Para quién es realmente OmniHuman 1.5

Cada uno de estos casos remite a un clip demostrado más arriba — no a una lista de deseos.

  • Creadores de cursos y de contenido explicativo

    Escribe la narración y consigue un presentador en pantalla — sin cámara, sin iluminación y sin repetir tomas. El tope de 35 segundos por clip encaja limpiamente con un concepto por clip, que es como monta de todos modos la mayoría de los editores de cursos.

  • Profesionales de marketing de UGC y de producto

    El caso de la presentación del altavoz de arriba es todo el flujo de trabajo: genera un retrato con estilo de creador sosteniendo tu producto, escribe el argumento, elige una voz. Sin caché de talento y sin cesión de derechos de imagen que perseguir — la cara nunca existió.

  • Equipos de localización

    La misma cara puede dar el mismo mensaje en diez idiomas: conserva el retrato, cambia la voz. La sincronía labial sigue al audio que aportes — el caso en mandarín de arriba es la prueba.

  • Canales sin rostro y presentadores virtuales

    Un personaje que generas es un personaje que te pertenece. Diseña la cara una vez, dale una voz consistente de la biblioteca, y puede encabezar todos los episodios — el personaje ilustrado de cuento de arriba demuestra que ni siquiera tiene que ser fotorrealista.

  • Podcasters y creadores que empiezan por el audio

    Ya tienes la parte difícil: el audio. Recorta un fragmento destacado a 35 segundos, añade un retrato y tienes un clip visual para redes sin abrir un editor.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Vídeo de habla frente a vídeo de escena — qué necesita de ti cada modelo y qué te devuelve en este espacio de trabajo.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Qué aportas tú1 foto de retrato + tu audio, o texto escrito y una voz de la bibliotecaUn prompt, más referencias opcionales de imagen, vídeo y audioUn prompt, más una imagen de referencia opcionalUn prompt o una imagen de inicio
Quién dice las palabrasTú — el avatar sincroniza los labios con tu banda sonora exactaEl modelo genera las voces a partir del promptEl modelo genera las voces a partir del promptEl audio se genera con el clip
Duración del clip aquíLa duración de tu audio, hasta 35 s4–30 s4–8 s3–15 s
Créditos130 por segundo de audio110/s en 480p · 230/s en 720p320–1920 por clip (4–8 s · 720p–4K · ± audio)55/s en 720p · 70/s en 1080p
Medido aquí~4 min por ~10 s de audio (7 clips, agosto de 2026)No lo hemos medido en esta tareaNo lo hemos medido en esta tareaNo lo hemos medido en esta tarea

Los créditos, la duración y las opciones de entrada están leídos del registro de modelos propio de este espacio de trabajo el 19 de agosto de 2026 — describen lo que obtienes aquí, no las especificaciones publicadas por los proveedores. Los tiempos son mediciones nuestras sobre los clips mostrados arriba; no hemos pasado los mismos guiones por los otros tres modelos, así que esas celdas lo dicen en vez de adivinar.

Más modelos de vídeo como OmniHuman 1.5

Compara OmniHuman 1.5 con otros modelos de vídeo: mismo espacio de trabajo, un solo clic para cambiar.

Especificaciones de OmniHuman 1.5 en CreateVision AI

Modeloomnihuman-1.5, de ByteDance (artículo de investigación publicado en agosto de 2025)
ModoAvatar parlante: una foto + una pista de audio → vídeo hablando, en el espacio de trabajo de avatares de esta página
EntradasExactamente 1 imagen de retrato, más audio de hasta 35 segundos (subida de mp3/wav) — o texto escrito de hasta 600 caracteres, sintetizado a voz
Biblioteca de voces60 voces integradas en 10 idiomas: inglés, chino, japonés, coreano, francés, alemán, español, italiano, ruso y portugués
Indicaciones opcionalesUna nota breve de interpretación para acciones, emoción y cámara — útil, nunca obligatoria
SalidaUn plano continuo que conserva el encuadre de tu foto; la duración del clip es igual a la del audio. Salida medida: 1248×1664 a partir de una foto 2:3, 1920×1088 a partir de 16:9, 25 fps, H.264 con audio AAC mono
Créditos130 por segundo de audio, redondeando hacia arriba — 130 como mínimo, 4550 con los 35 segundos completos; el coste exacto se muestra antes de generar
Velocidad medidaDe 3m 20s a 4m 42s por trabajo aceptado para ~10 s de audio en nuestra prueba de 7 clips; uno atípico estuvo 14 minutos en cola (agosto de 2026, un martes por la tarde con mucha carga)

Cómo hacer un avatar parlante a partir de una foto

Empieza a generar vídeos
  1. Añade la cara

    Sube un retrato nítido, frontal y de medio cuerpo — o genera uno con GPT Image 2 o Seedream en este mismo espacio de trabajo, que es como se hizo cada cara de esta página. Una persona por foto; mantén la cara grande y sin obstrucciones.

  2. Dale una voz

    Sube un clip de audio (mp3 o wav, de hasta 35 segundos), o cambia al modo de texto: escribe hasta 600 caracteres y elige una de las 60 voces en 10 idiomas, cada una con una vista previa que puedes escuchar antes.

  3. Dirige la interpretación si quieres

    Una nota breve como «tranquilo, asentimientos pequeños, sonrisa sutil» orienta el gesto y la emoción. Déjala vacía y el modelo leerá por su cuenta el ritmo y el sentido del audio.

  4. Genera y comprueba la sincronía

    El coste exacto en créditos aparece antes de ejecutar — escala con la duración del audio. La generación es asíncrona; el clip aterriza en tu historial con todas sus entradas adjuntas, así que una configuración que funciona se puede reproducir la semana que viene.

Más allá de OmniHuman 1.5

Una sola cuenta, todo el flujo de generación de imágenes y vídeo.

Lecturas relacionadas

OmniHuman 1.5: precios y créditos diarios gratis

Usa OmniHuman 1.5 con los créditos diarios del plan gratuito, o mejora tu plan para acceder a modelos premium, generación más rápida y salida en 4K.

Gratis

$0

Perfecto para empezar

  • 200 créditos de bienvenida, hasta 80/día
  • Borradores de Z Image Turbo a 0 créditos
  • Velocidad de generación estándar
  • Historial de generaciones incluido
Comenzar

Premium

Más popular
$29/month

Facturación anual · $240/año

  • 8.000 créditos/mes, sin límites diarios
  • Todos los modelos premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Velocidad de generación 5x, cola prioritaria
  • Mejora de prompts con IA
Mejorar a Premium

Ultimate

$49/month

Facturación anual · $380/año

  • 18.000 créditos/mes, sin límites diarios
  • Generación en HD hasta resolución 4K
  • Soporte prioritario
  • La cola más rápida y acceso anticipado a nuevos modelos
Mejorar a Ultimate

OmniHuman 1.5: preguntas frecuentes

1

¿Qué es OmniHuman 1.5?

El modelo de avatar dirigido por audio de ByteDance. Toma una foto de retrato y una pista de audio y devuelve un vídeo de esa persona diciendo el audio — labios, expresiones, movimiento de cabeza y gestos de las manos siguen todos al sonido. El artículo de investigación que hay detrás se publicó en agosto de 2025.

2

¿Puede el avatar decir mis palabras exactas?

Sí — esa es la diferencia con los modelos de vídeo dirigidos por prompt. Tú aportas la banda sonora, ya sea como una subida de mp3/wav o escribiendo el guion y eligiendo una voz integrada, y el avatar sincroniza los labios con ella palabra por palabra. Los modelos dirigidos por prompt generan sus propias voces y rara vez dicen exactamente lo que escribiste.

3

¿Se puede usar OmniHuman 1.5 gratis?

No — factura a 130 créditos por segundo de audio, redondeando hacia arriba, así que un clip de 10 segundos son 1300 créditos. El coste exacto se muestra antes de generar, y las ejecuciones fallidas se reembolsan automáticamente. Mantén los guiones ajustados y recorta el silencio: cada segundo de audio es un segundo que pagas.

4

¿Qué características debe tener una buena foto de referencia?

Frontal, de medio cuerpo, una sola persona, con la cara grande, iluminada de forma uniforme y sin obstrucciones — los analistas y nuestras propias pruebas coinciden. Nuestra prueba deliberada de perfil de tres cuartos de arriba muestra qué pasa si no: los labios apenas articulan, el modelo gira lentamente la cabeza aún más lejos, y aparecen objetos sobre el escritorio que nunca estuvieron en la foto. Los retratos generados funcionan exactamente igual de bien que las fotos de cámara.

5

¿Funciona con ilustraciones o personajes de anime?

Sí — nuestra prueba del cuento de arriba es una ilustración 2D plana, y OmniHuman 1.5 la animó de forma convincente manteniendo el estilo gráfico: los ojos, las cejas y la boca se mueven como en un personaje animado a mano. Una rareza que observamos: cuando la boca se abre mucho, el modelo dibuja unos dientes sorprendentemente realistas para una ilustración plana. El artículo de ByteDance también afirma admitir sujetos no humanos; nosotros solo hemos probado este personaje ilustrado.

6

¿Cuánto puede durar un clip y cuánto tarda la generación?

Hasta 35 segundos de audio por clip en esta plataforma — los guiones más largos hay que dividirlos y coserlos. En nuestra prueba de agosto de 2026, los trabajos aceptados volvieron en entre 3m 20s y 4m 42s para unos 10 segundos de audio. Una salvedad de esa misma tarde: con mucha carga, el proveedor de origen rechazó varios envíos con errores de capacidad antes de aceptar el trabajo. Las ejecuciones rechazadas no cuestan nada, pero cuenta con reintentos en horas punta en vez de con una entrega dentro de cinco minutos.

7

¿En qué es malo OmniHuman 1.5?

Las caras no frontales, por encima de todo: nuestra prueba de perfil de tres cuartos muestra unos labios casi estáticos, una cabeza que se va alejando de la cámara y objetos de escritorio que nunca estuvieron en la foto. Los detalles pequeños de identidad pueden irse a mitad de clip — un pendiente cambió de forma en esa prueba, y el color de labios se lee algo más intenso que en la entrada en otras dos. El diálogo entre varias personas no está disponible aquí, la resolución de salida es modesta (1248×1664 en nuestras pruebas de retrato — sin 4K), y solo hace vídeo de habla: para acción, movimiento de cámara o cambios de escena, usa Seedance 2.5 o Kling 3.0 Turbo.

8

¿Puedo usar los vídeos comercialmente — y qué cara puedo usar?

Los vídeos que generes pueden usarse en proyectos personales y comerciales según nuestros términos de servicio. La cara es la parte que hay que tomarse en serio: animar la foto de una persona real sin su consentimiento puede vulnerar sus derechos de imagen y de publicidad, y varias jurisdicciones exigen ya declarar el uso de presentadores sintéticos. Las caras generadas — como todas las caras de esta página — evitan por completo el problema del consentimiento.

Dale a una foto algo que decir

Empieza a generar vídeos

Precios y acceso — los datosOmniHuman 1.5

Modelo
OmniHuman 1.5
Desarrollador
ByteDance
Acceso
Funciona en el espacio de trabajo de CreateVision AI mediante API: inicia sesión y genera. Sin clave API, sin proyecto en la nube, sin instalar nada.
Precio por generación
Desde 650 créditos ≈ $2.36 por clip de 5 segundos con el plan Premium ($29/mes por 8,000 créditos). El plan gratuito incluye 80 créditos al día.
Privacidad
Privado por defecto: ningún otro usuario puede ver tus generaciones, en ningún plan. No vendemos ni hacemos mal uso de los datos de los miembros. Política de privacidad

NovedadesOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.