Générateur d'avatars IA OmniHuman 1.5

Donnez vie à un simple portrait avec OmniHuman 1.5 — téléchargez une photo et un clip audio (ou saisissez du texte et choisissez une voix) pour générer un avatar parlant réaliste avec des lèvres, des expressions et des gestes synchronisés.

Photo + voix → vidéoGestes déclenchés par le sonBibliothèque vocale TTS
0 / 2,000
130 cr/s · ≤35s

D'autres modèles vidéo comme OmniHuman 1.5

Comparez OmniHuman 1.5 avec d'autres modèles vidéo : même espace de travail, un clic pour changer.

OmniHuman 1.5 — Transformez une photo et une voix en un avatar parlant plus vrai que nature

OmniHuman 1.5 de ByteDance crée un portrait unique à partir de l'audio : des lèvres synchronisées, des expressions naturelles et une gestuelle corporelle complète qui réagissent au rythme et au sens de la voix, et non pas seulement aux mouvements des lèvres. Importez une photo et une vidéo, ou saisissez du texte et choisissez une voix.

Image extraite d'une vidéo IA d'une silhouette de danseuse sur une scène enfumée sous une lumière ambrée

Une photo et une voix donnent naissance à un avatar parlant

Fournissez à OmniHuman 1.5 un simple portrait et un extrait audio, et il anime le visage pour créer une performance vocale crédible avec une synchronisation labiale précise, tout en préservant l'identité, la structure faciale et l'éclairage de la personne. Sans armature, sans fond vert, sans studio.

Image extraite d'une vidéo IA d'un astronaute marchant dans un couloir de vaisseau spatial lumineux

Un mouvement de tout le corps, pas seulement des lèvres

Contrairement aux outils de base de tête parlante, OmniHuman 1.5 lit le rythme, la prosodie et la signification de l'audio pour piloter les mouvements de la tête, les changements de posture et les gestes des mains — de sorte que l'avatar souligne, fait des pauses et réagit comme un vrai présentateur plutôt que comme un portrait statique avec une bouche qui bouge.

Image extraite d'une vidéo IA de pluie ruisselant sur la vitre d'un café avec un bokeh chaleureux

Saisissez du texte, choisissez une voix — aucun enregistrement nécessaire

Pas d'audio sous la main ? Passez en mode texte : saisissez le texte que l'avatar doit dire, choisissez une voix dans la bibliothèque de synthèse vocale intégrée, et OmniHuman 1.5 génère l'interprétation vocale pour vous. Idéal pour les présentations scriptées, les vidéos explicatives et les clips pour les réseaux sociaux.

Image extraite d'une vidéo IA d'aurores boréales tourbillonnant au-dessus d'un chalet enneigé

Narration, dialogue ou chant

Le modèle s'adapte à différents styles audio (narration calme, dialogue expressif, voire chant) et peut suivre des instructions textuelles optionnelles pour la direction de la caméra et des gestes, produisant des résultats soignés adaptés au marketing, à la formation et aux contenus pour les réseaux sociaux.

Comment utiliser OmniHuman 1.5

Trois étapes, d'un champ de prompt vide à un clip fini.

  1. 1

    Sélectionnez OmniHuman 1.5

    Ouvrez le sélecteur de modèles et choisissez OmniHuman 1.5. Le panneau affiche son coût en crédits, ses options de résolution et ses limites de durée avant la moindre dépense.

  2. 2

    Décrivez ce que vous voulez

    Décrivez le sujet, l'action et le comportement de la caméra. Joignez une première image si vous voulez que le clip démarre d'une image précise.

  3. 3

    Générez, puis continuez

    Téléchargez le clip, prolongez-le ou envoyez-le vers une édition plus poussée. Le prompt, le modèle et les réglages restent attachés dans votre historique.

Au-delà de OmniHuman 1.5

Un seul compte, l'ensemble du flux de génération d'images et de vidéos.

OmniHuman 1.5 : tarifs et crédits quotidiens gratuits

Utilisez OmniHuman 1.5 avec les crédits quotidiens de l'offre gratuite, ou passez à un forfait supérieur pour les modèles premium, une génération plus rapide et une sortie 4K.

Gratuit

$0

Parfait pour débuter

  • 80 crédits par jour, 400 par mois
  • Z Image Turbo ébauche à 0 crédit
  • Vitesse de génération standard
  • Historique de génération inclus
Commencer

Premium

Le plus populaire
$29/month

Facturé annuellement · 240 $/an

  • 1 600 crédits/jour, 8 000 crédits/mois
  • Tous les modèles premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Vitesse de génération 5x, file d'attente prioritaire
  • Amélioration des prompts par IA
Passer à Premium

Ultimate

$49/month

Facturé annuellement · 300 $/an

  • 4 000 crédits/jour, 18 000 crédits/mois
  • Génération HD jusqu'à une résolution 4K
  • Support prioritaire
  • File d'attente la plus rapide et accès anticipé aux nouveaux modèles
Passer à Ultimate

OmniHuman 1.5 — questions fréquentes

1

Qu'est-ce qu'OmniHuman 1.5 ?

OmniHuman 1.5 est le modèle d'avatar audio de ByteDance : il transforme un simple portrait et une piste vocale en une vidéo parlante réaliste avec des lèvres, des expressions et des gestes synchronisés.

2

Que dois-je fournir ?

Une photo de portrait nette d'une seule personne, plus soit un clip audio (mp3/wav), soit — en mode texte — le texte que vous souhaitez faire prononcer et une voix choisie dans la bibliothèque intégrée, qui est synthétisée dans l'audio de conduite.

3

Quelle peut être la durée maximale du clip d'avatar ?

Jusqu'à 35 secondes d'audio par génération. Pour les scripts plus longs, il est préférable de les diviser en plusieurs clips. La facturation se fait à la seconde d'audio, arrondie à la seconde supérieure.

4

Est-ce que ça bouge plus que la bouche ?

Oui. OmniHuman 1.5 génère des mouvements de tête, une posture et des gestes des mains qui répondent au rythme et à la signification de l'audio, de sorte que l'avatar joue un rôle plutôt que de simplement synchroniser ses lèvres.

5

Qu'est-ce qui fait une bonne photo source ?

Une seule personne, bien visible de face, avec un bon éclairage et le visage dégagé. Les photos de groupe, les visages très petits ou fortement masqués réduisent la qualité ou peuvent être ratées.

6

Quel est le prix d'OmniHuman 1.5 ?

Par seconde d'audio généré. Le coût exact en crédits est affiché avant la génération, et les exécutions infructueuses sont remboursées automatiquement.

Donnez vie à vos photos avec OmniHuman 1.5

Commencez à générer des vidéos

NouveautésOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.