Générateur d'avatars parlants IA OmniHuman 1.5

Donnez à OmniHuman 1.5 un portrait et une piste de voix, et il renvoie une vidéo de cette personne disant vos mots exacts — lèvres, expressions et gestes suivent le son.

0 / 2,000
130 cr/s · ≤35s

Qu'est-ce qu'OmniHuman 1.5 ?

OmniHuman 1.5 est le modèle d'avatar piloté par l'audio de ByteDance : donnez-lui un portrait et une piste de voix, et il renvoie une vidéo de cette personne prononçant votre audio — lèvres, expressions, mouvements de tête et gestes, tous pilotés par le son. Contrairement aux modèles vidéo pilotés par prompt, c'est vous qui fournissez les mots exacts. L'article de recherche associe un modèle de langage multimodal à un transformeur de diffusion, si bien que l'interprétation réagit à ce qui est dit et ne se contente pas de suivre la bouche.

La part honnête : il lui faut un portrait de face. Notre test de trois-quarts profil ci-dessous montre des lèvres qui s'articulent à peine et une tête qui s'éloigne. L'audio est plafonné à 35 secondes par exécution : les scripts plus longs supposent donc de découper et de recoller, et le dialogue à plusieurs personnes — fonction phare de l'article — n'est pas disponible ici. C'est de la vidéo de parole, pas de la vidéo de scène : pour du mouvement de caméra ou de l'action, utilisez Seedance 2.5 ou Kling 3.0 Turbo.

L'architecture, le positionnement et les chiffres de l'étude utilisateur proviennent de l'article de recherche de ByteDance : OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Ce que disent les testeurs

La version 1.5 fait preuve d'une robustesse améliorée sur les entrées difficiles.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Un portrait à mi-corps avec des mains et des épaules nettes et une lumière naturelle donne en général de meilleurs mouvements du corps.
Z.Tools — OmniHuman-1.5 deep dive
Les ombres marquées, les lunettes de soleil, les occlusions bizarres et les visages minuscules compliquent la tâche.
Z.Tools — OmniHuman-1.5 deep dive

Pourquoi faire tourner OmniHuman 1.5 sur CreateVision AI ?

Le modèle est celui de ByteDance ; la raison de l'utiliser ici, c'est que les deux autres entrées — le visage et la voix — viennent du même espace de travail.

Portrait GPT Image 2 utilisé comme visage d'entrée pour un clip d'avatar OmniHuman 1.5

Toute la chaîne d'entrée tient sur une seule page

Un clip d'avatar parlant demande trois choses : un visage, une voix et le modèle. Ici, les trois viennent du même espace de travail — générez le portrait avec GPT Image 2 ou Seedream, tapez le script et synthétisez-le avec l'une des 60 voix intégrées, puis envoyez les deux directement à OmniHuman 1.5. Chaque clip de cette page a été fait exactement comme cela, de bout en bout, sans enregistrer une seconde d'audio ni importer une seule photo d'une personne réelle.

Portrait d'entrée du cas OmniHuman 1.5 du salon de thé en mandarin

Une bibliothèque de voix plutôt qu'une cabine d'enregistrement

Le mode texte n'est pas un ajout tardif : 60 voix en anglais, chinois, japonais, coréen, français, allemand, espagnol, italien, russe et portugais, chacune avec un aperçu que vous pouvez écouter avant de dépenser quoi que ce soit. Tapez jusqu'à 600 caractères, choisissez une voix, et la plateforme synthétise la parole et pilote l'avatar avec elle en une seule exécution. Le clip du salon de thé en mandarin ci-dessus emprunte exactement ce chemin — sans aucun micro.

Portrait d'entrée du cas OmniHuman 1.5 du présentateur de journal

Un seul abonnement, et le coût visible d'avance

OmniHuman 1.5 facture à la seconde d'audio — 130 crédits par seconde, arrondie au supérieur — et l'espace de travail affiche le coût exact de votre clip avant que vous n'appuyiez sur générer. La même formule couvre GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling et Veo : le flux de travail sensé est donc bon marché — ébauchez le portrait pour une poignée de crédits, verrouillez le script, et ne dépensez qu'ensuite en secondes d'avatar. Coupez les silences de votre audio — vous payez chacune de ses secondes.

Portrait d'entrée en trois-quarts profil utilisé pour le test de résistance OmniHuman 1.5

Mesuré, pas promis — l'échec compris

Notre jeu de sept clips a été généré le 19 août 2026 — un argumentaire produit, un flash d'actualité, un discours de motivation en salle de sport, un accueil en mandarin dans un salon de thé, un personnage de livre illustré, un échec délibéré en trois-quarts profil, et un plan large de scène. Chaque tâche acceptée a été rendue avec succès au premier essai, en 3 min 20 s à 4 min 42 s pour une dizaine de secondes d'audio. Nous publions aussi ce qui a mal tourné : un mardi soir chargé, l'amont a rejeté 13 de nos 20 soumissions avec des erreurs de capacité avant de les accepter (les exécutions rejetées sont remboursées automatiquement), une tâche acceptée est restée 14 minutes en file, et le clip de profil de cette page montre exactement ce qui arrive quand on ignore le conseil du portrait de face.

De vrais clips OmniHuman 1.5 issus de cet espace de travail

Les 7 clips ci-dessous ont tous été générés ici le 19 août 2026 — chacun est le premier rendu produit par ses entrées, sans reprise et sans tri sélectif. Les portraits sont des sorties de GPT Image 2 ; chaque voix a été saisie sous forme de texte et synthétisée avec la bibliothèque intégrée. Les tâches acceptées sont revenues en 3 min 20 s à 4 min 42 s pour une dizaine de secondes d'audio (une valeur aberrante a attendu 14 minutes en file) ; lors d'une soirée chargée, l'amont a rejeté plusieurs soumissions avec des erreurs de capacité avant d'accepter — les exécutions rejetées sont remboursées. Son activé.

Prompt9,2 s d'audio · voix Trustworthy Man · 1 300 crédits · 4 min 42 s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s d'audio · voix News Anchor · 1 430 crédits · 4 min 09 s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s d'audio · voix Energetic Guy · 1 430 crédits · 4 min 00 s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s d'audio · voix Mandarin Sweet Girl · 1 560 crédits · 4 min 19 s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s d'audio · voix Sweet Girl · 1 300 crédits · 4 min 01 s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s d'audio · voix Wise Lady · 1 170 crédits · la synchronisation labiale se dégrade visiblement à cet angle

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s d'audio · voix Movie Narrator · 780 crédits · cette image sert de fond à la page

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

À qui s'adresse vraiment OmniHuman 1.5

Chacun de ces cas correspond à un clip démontré ci-dessus — ce n'est pas une liste de vœux.

  • Créateurs de cours et d'explicatifs

    Tapez la narration et obtenez un présentateur à l'écran — sans caméra, sans éclairage, sans nouvelle prise. Le plafond de 35 secondes par clip correspond bien à un concept par clip, ce qui est de toute façon la manière dont la plupart des monteurs de cours découpent.

  • Marketeurs UGC et produit

    Le cas de l'argumentaire sur l'enceinte ci-dessus, c'est tout le flux de travail : générez un portrait de style créateur tenant votre produit, tapez l'argumentaire, choisissez une voix. Pas de cachet d'artiste, et pas d'autorisation d'exploitation d'image à courir après — le visage n'a jamais existé.

  • Équipes de localisation

    Le même visage peut délivrer le même message en dix langues : gardez le portrait, changez la voix. La synchronisation labiale suit l'audio que vous fournissez, quel qu'il soit — le cas en mandarin ci-dessus le prouve.

  • Chaînes sans visage et présentateurs virtuels

    Un personnage que vous générez est un personnage qui vous appartient. Concevez le visage une fois, donnez-lui une voix de bibliothèque constante, et il peut porter chaque épisode — le personnage de livre illustré ci-dessus montre qu'il n'a même pas besoin d'être photoréaliste.

  • Podcasteurs et créateurs qui partent de l'audio

    Vous avez déjà le plus dur : l'audio. Réduisez un extrait à 35 secondes, ajoutez un portrait, et vous avez un clip visuel pour les réseaux sans ouvrir de logiciel de montage.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Vidéo de parole contre vidéo de scène — ce que chaque modèle attend de vous, et ce qu'il rend dans cet espace de travail.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Ce que vous fournissez1 photo de portrait + votre audio, ou du texte saisi et une voix de la bibliothèqueUn prompt, plus des références image, vidéo et audio optionnellesUn prompt, plus une image de référence optionnelleUn prompt ou une image de départ
Qui prononce les motsVous — l'avatar se synchronise sur votre bande-son exacteLe modèle génère les voix à partir du promptLe modèle génère les voix à partir du promptL'audio est généré avec le clip
Durée du clip iciLa durée de votre audio, jusqu'à 35 s4–30 s4–8 s3–15 s
Crédits130 par seconde d'audio110/s en 480p · 230/s en 720p320–1 920 par clip (4–8 s · 720p–4K · ± audio)55/s en 720p · 70/s en 1080p
Mesuré ici~4 min pour ~10 s d'audio (7 clips, août 2026)Non mesuré sur cette tâcheNon mesuré sur cette tâcheNon mesuré sur cette tâche

Les crédits, les durées et les options d'entrée sont lus dans le registre de modèles de cet espace de travail le 19 août 2026 — ils décrivent ce que vous obtenez ici, pas les spécifications publiées par les fournisseurs. Les temps sont nos propres mesures sur les clips montrés ci-dessus ; nous n'avons pas fait passer les mêmes scripts par les trois autres modèles, donc ces cases le disent plutôt que de deviner.

D'autres modèles vidéo comme OmniHuman 1.5

Comparez OmniHuman 1.5 avec d'autres modèles vidéo : même espace de travail, un clic pour changer.

Caractéristiques d'OmniHuman 1.5 sur CreateVision AI

Modèleomnihuman-1.5, par ByteDance (article de recherche publié en août 2025)
ModeAvatar parlant : une photo + une piste audio → une vidéo parlante, dans l'espace de travail avatar de cette page
EntréesExactement 1 image de portrait, plus un audio jusqu'à 35 secondes (import mp3/wav) — ou du texte saisi jusqu'à 600 caractères, synthétisé en parole
Bibliothèque de voix60 voix intégrées en 10 langues : anglais, chinois, japonais, coréen, français, allemand, espagnol, italien, russe, portugais
Indications optionnellesUne brève note d'interprétation pour les actions, l'émotion et la caméra — utile, jamais obligatoire
SortieUn seul plan continu qui conserve le cadrage de votre photo ; la durée du clip est égale à celle de l'audio. Sortie mesurée : 1248×1664 depuis une photo en 2:3, 1920×1088 depuis du 16:9, 25 ips, H.264 avec audio AAC mono
Crédits130 par seconde d'audio, arrondie au supérieur — 130 au minimum, 4 550 pour les 35 secondes complètes ; le coût exact est affiché avant de générer
Vitesse mesurée3 min 20 s–4 min 42 s par tâche acceptée pour ~10 s d'audio dans notre test de 7 clips ; une valeur aberrante a attendu 14 minutes en file (août 2026, un mardi soir chargé)

Comment faire un avatar parlant à partir d'une photo

Commencez à générer des vidéos
  1. Ajoutez le visage

    Importez un portrait net, de face, à mi-corps — ou générez-en un avec GPT Image 2 ou Seedream dans ce même espace de travail, ce qui est la manière dont chaque visage de cette page a été fait. Une seule personne par photo ; gardez le visage grand et dégagé.

  2. Donnez-lui une voix

    Importez un clip audio (mp3 ou wav, jusqu'à 35 secondes), ou passez en mode texte : tapez jusqu'à 600 caractères et choisissez l'une des 60 voix en 10 langues, chacune avec un aperçu que vous pouvez écouter d'abord.

  3. Dirigez l'interprétation, si vous voulez

    Une brève note comme « calme, petits hochements de tête, sourire discret » oriente le geste et l'émotion. Laissez-la vide et le modèle lit seul le rythme et le sens de l'audio.

  4. Générez et vérifiez la synchronisation

    Le coût exact en crédits apparaît avant l'exécution — il suit la durée de l'audio. La génération est asynchrone ; le clip arrive dans votre historique avec toutes ses entrées attachées, si bien qu'un réglage qui marche est reproductible la semaine suivante.

Au-delà de OmniHuman 1.5

Un seul compte, l'ensemble du flux de génération d'images et de vidéos.

Lectures connexes

OmniHuman 1.5 : tarifs et crédits quotidiens gratuits

Utilisez OmniHuman 1.5 avec les crédits quotidiens de l'offre gratuite, ou passez à un forfait supérieur pour les modèles premium, une génération plus rapide et une sortie 4K.

Gratuit

$0

Parfait pour débuter

  • 200 crédits de bienvenue, jusqu’à 80/jour
  • Z Image Turbo ébauche à 0 crédit
  • Vitesse de génération standard
  • Historique de génération inclus
Commencer

Premium

Le plus populaire
$29/month

Facturé annuellement · 240 $/an

  • 8 000 crédits/mois, aucune limite quotidienne
  • Tous les modèles premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Vitesse de génération 5x, file d'attente prioritaire
  • Amélioration des prompts par IA
Passer à Premium

Ultimate

$49/month

Facturé annuellement · 380 $/an

  • 18 000 crédits/mois, aucune limite quotidienne
  • Génération HD jusqu'à une résolution 4K
  • Support prioritaire
  • File d'attente la plus rapide et accès anticipé aux nouveaux modèles
Passer à Ultimate

OmniHuman 1.5 — questions fréquentes

1

Qu'est-ce qu'OmniHuman 1.5 ?

Le modèle d'avatar piloté par l'audio de ByteDance. Il prend une photo de portrait et une piste audio et renvoie une vidéo de cette personne prononçant l'audio — lèvres, expressions, mouvements de tête et gestes des mains suivent tous le son. L'article de recherche qui le sous-tend a été publié en août 2025.

2

L'avatar peut-il dire mes mots exacts ?

Oui — c'est ce qui le distingue des modèles vidéo pilotés par prompt. Vous fournissez la bande-son, soit en important un mp3/wav, soit en tapant le script et en choisissant une voix intégrée, et l'avatar s'y synchronise mot pour mot. Les modèles pilotés par prompt génèrent leurs propres voix et disent rarement précisément ce que vous avez écrit.

3

OmniHuman 1.5 est-il gratuit ?

Non — il facture 130 crédits par seconde d'audio, arrondie au supérieur : un clip de 10 secondes coûte donc 1 300 crédits. Le coût exact est affiché avant de générer, et les exécutions échouées sont remboursées automatiquement. Gardez des scripts serrés et coupez les silences : chaque seconde d'audio est une seconde que vous payez.

4

Qu'est-ce qui fait une bonne photo source ?

De face, à mi-corps, une seule personne, le visage grand, éclairé uniformément et dégagé — les testeurs et nos propres essais s'accordent. Notre test délibéré en trois-quarts profil ci-dessus montre ce qui arrive sinon : les lèvres s'articulent à peine, le modèle tourne lentement la tête encore plus loin, et des objets apparaissent sur le bureau qui n'étaient pas sur la photo. Les portraits générés fonctionnent exactement aussi bien que les photos prises à l'appareil.

5

Fonctionne-t-il avec des illustrations ou des personnages d'anime ?

Oui — notre test de livre illustré ci-dessus est une illustration 2D plate, et OmniHuman 1.5 l'a animée de manière convaincante tout en gardant le style graphique : yeux, sourcils et bouche bougent comme un personnage animé à la main. Une bizarrerie que nous avons observée : quand la bouche s'ouvre grand, le modèle dessine des dents étonnamment réalistes pour une illustration plate. L'article de ByteDance revendique aussi des sujets non humains ; nous n'avons testé que ce personnage illustré.

6

Quelle durée peut faire un clip, et combien de temps prend la génération ?

Jusqu'à 35 secondes d'audio par clip sur cette plateforme — les scripts plus longs doivent être découpés puis recollés. Dans notre test d'août 2026, les tâches acceptées sont revenues en 3 min 20 s à 4 min 42 s pour une dizaine de secondes d'audio. Une réserve issue de la même soirée : en forte charge, l'amont a rejeté plusieurs soumissions avec des erreurs de capacité avant d'accepter la tâche. Les exécutions rejetées ne coûtent rien, mais prévoyez des relances aux heures de pointe plutôt qu'une échéance dans cinq minutes.

7

En quoi OmniHuman 1.5 est-il mauvais ?

Les visages qui ne sont pas de face, avant tout : notre test en trois-quarts profil montre des lèvres presque immobiles, une tête qui s'éloigne encore de la caméra, et des objets de bureau qui n'étaient pas sur la photo. De petits détails d'identité peuvent dériver en cours de clip — une boucle d'oreille a changé de forme dans ce test, et la couleur des lèvres ressort un peu plus soutenue que sur l'entrée dans deux autres. Le dialogue à plusieurs personnes n'est pas disponible ici, la résolution de sortie est modeste (1248×1664 dans nos tests de portrait — pas de 4K), et il ne fait que de la vidéo de parole : pour l'action, le mouvement de caméra ou les changements de scène, utilisez Seedance 2.5 ou Kling 3.0 Turbo.

8

Puis-je utiliser les vidéos commercialement — et quel visage puis-je utiliser ?

Les vidéos que vous générez peuvent servir à des projets personnels et commerciaux dans le cadre de nos conditions d'utilisation. Le visage est la partie à prendre au sérieux : animer la photo d'une personne réelle sans son consentement peut violer ses droits à l'image et à la personnalité, et plusieurs juridictions exigent désormais de signaler les présentateurs synthétiques. Les visages générés — comme tous ceux de cette page — évitent complètement le problème du consentement.

Donnez à une photo quelque chose à dire

Commencez à générer des vidéos

Tarifs et accès — les faitsOmniHuman 1.5

Modèle
OmniHuman 1.5
Développeur
ByteDance
Accès
Fonctionne dans l'espace de travail CreateVision AI via API — connectez-vous et générez. Pas de clé API, pas de projet cloud, aucune installation.
Prix par génération
À partir de 650 crédits ≈ $2.36 par clip de 5 secondes avec le forfait Premium ($29/mois pour 8,000 crédits). Le forfait gratuit inclut 80 crédits par jour.
Confidentialité
Privé par défaut — aucun autre utilisateur ne peut voir vos créations, quel que soit le forfait. Nous ne vendons ni ne détournons les données des membres. Politique de confidentialité

NouveautésOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.