OmniHuman 1.5 AI-generator voor pratende avatars

Geef OmniHuman 1.5 één portret en een stemspoor, en het geeft een video terug van die persoon die precies jouw woorden zegt — lippen, gezichtsuitdrukkingen en gebaren volgen het geluid.

0 / 2,000
130 cr/s · ≤35s

Wat is OmniHuman 1.5?

OmniHuman 1.5 is ByteDance's door audio aangestuurde avatarmodel: geef het één portret en een stemspoor, en het geeft een video terug van die persoon die jouw audio uitspreekt — lippen, gezichtsuitdrukkingen, hoofdbeweging en gebaren, allemaal aangestuurd door het geluid. Anders dan bij promptgestuurde videomodellen lever jij de exacte woorden aan. Het onderzoeksartikel koppelt een multimodaal taalmodel aan een diffusion transformer, zodat de uitvoering reageert op wat er gezegd wordt in plaats van alleen de mond te volgen.

Het eerlijke deel: het heeft een frontaal portret nodig. Onze test met een driekwartprofiel hieronder laat lippen zien die nauwelijks articuleren en een hoofd dat wegdraait. De audio is geplafonneerd op 35 seconden per run, dus langere scripts betekenen opdelen en aan elkaar zetten, en dialoog met meerdere personen — een kernfunctie uit het artikel — is hier niet beschikbaar. Het is spraakvideo, geen scènevideo: voor camerabeweging of actie gebruik je Seedance 2.5 of Kling 3.0 Turbo.

Architectuur, positionering en de cijfers uit het gebruikersonderzoek komen uit het onderzoeksartikel van ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Wat testers zeggen

Versie 1.5 toont een verbeterde robuustheid bij lastige invoer.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Een portret tot het middel met duidelijk zichtbare handen, schouders en natuurlijke belichting geeft meestal betere lichaamsbeweging.
Z.Tools — OmniHuman-1.5 deep dive
Zware schaduwen, zonnebrillen, vreemde afdekkingen en piepkleine gezichten maken de klus moeilijker.
Z.Tools — OmniHuman-1.5 deep dive

Waarom OmniHuman 1.5 op CreateVision AI draaien?

Het model is van ByteDance; de reden om het hier te gebruiken is dat de andere twee invoeren — het gezicht en de stem — uit dezelfde werkomgeving komen.

GPT Image 2-portret gebruikt als invoergezicht voor een OmniHuman 1.5-avatarclip

De hele invoerketen staat op één pagina

Een clip met een pratende avatar heeft drie dingen nodig: een gezicht, een stem en het model. Hier komen alle drie uit dezelfde werkomgeving — genereer het portret met GPT Image 2 of Seedream, typ het script en synthetiseer het met een van de 60 ingebouwde stemmen, en voer beide rechtstreeks in OmniHuman 1.5. Elke clip op deze pagina is precies zo gemaakt, van begin tot eind, zonder ook maar één seconde audio op te nemen of één foto van een echt persoon te uploaden.

Invoerportret voor het Mandarijnsprekende OmniHuman 1.5-theewinkelvoorbeeld

Een stemmenbibliotheek in plaats van een opnamestudio

De tekstmodus is geen bijgedachte: 60 stemmen verdeeld over Engels, Chinees, Japans, Koreaans, Frans, Duits, Spaans, Italiaans, Russisch en Portugees, elk met een voorbeeld dat je kunt afspelen voordat je iets uitgeeft. Typ tot 600 tekens, kies een stem, en het platform synthetiseert de spraak en stuurt de avatar ermee aan in één run. De Mandarijnse theewinkelclip hierboven is precies deze route — er kwam geen microfoon aan te pas.

Invoerportret voor het OmniHuman 1.5-voorbeeld met de nieuwslezer

Eén abonnement, en de kosten zijn vooraf zichtbaar

OmniHuman 1.5 rekent af per seconde audio — 130 credits per seconde, naar boven afgerond — en de werkomgeving toont de exacte kosten van je clip voordat je op genereren drukt. Hetzelfde abonnement dekt GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling en Veo, dus de verstandige werkwijze is goedkoop: schets het portret voor een handvol credits, leg het script vast, en geef pas daarna uit aan avatarseconden. Knip de stilte van je audio af — je betaalt voor elke seconde ervan.

Invoerportret in driekwartprofiel dat voor de OmniHuman 1.5-stresstest is gebruikt

Gemeten, niet beloofd — inclusief de mislukking

Onze testset van zeven clips is gegenereerd op 19 augustus 2026 — een productpitch, een nieuwsbericht, een peptalk in de sportschool, een Mandarijnse welkomstgroet in een theewinkel, een prentenboekpersonage, een opzettelijke mislukking met een driekwartprofiel, en een wijde podiumopname. Elke geaccepteerde taak rendeerde met succes in de eerste poging, in 3m 20s tot 4m 42s voor ongeveer tien seconden audio. We publiceren ook wat er misging: op een drukke dinsdagavond weigerde de upstream 13 van onze 20 inzendingen met capaciteitsfouten voordat hij ze accepteerde (geweigerde runs worden automatisch terugbetaald), één geaccepteerde taak stond 14 minuten in de wachtrij, en de profielclip op deze pagina laat precies zien wat er gebeurt als je het advies over een frontaal portret negeert.

Echte OmniHuman 1.5-clips uit deze werkomgeving

Alle 7 clips hieronder zijn hier op 19 augustus 2026 gegenereerd — elke clip is de eerste render die zijn invoer opleverde, geen nieuwe pogingen en niets uitgeselecteerd. De portretten zijn uitvoer van GPT Image 2; elke stem is als tekst ingetypt en gesynthetiseerd met de ingebouwde bibliotheek. Geaccepteerde taken kwamen terug in 3m 20s tot 4m 42s voor ongeveer 10 seconden audio (één uitschieter stond 14 minuten in de wachtrij); op een drukke avond weigerde de upstream meerdere inzendingen met capaciteitsfouten voordat hij accepteerde — geweigerde runs worden terugbetaald. Geluid aan.

Prompt9,2 s audio · stem Trustworthy Man · 1.300 credits · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s audio · stem News Anchor · 1.430 credits · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s audio · stem Energetic Guy · 1.430 credits · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s audio · stem Mandarin Sweet Girl · 1.560 credits · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s audio · stem Sweet Girl · 1.300 credits · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s audio · stem Wise Lady · 1.170 credits · de lipsynchronisatie takelt bij deze hoek zichtbaar af

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s audio · stem Movie Narrator · 780 credits · dit beeld is de achtergrond van de pagina

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Voor wie OmniHuman 1.5 echt is

Elk van deze punten verwijst naar een clip die hierboven is getoond — geen verlanglijstje.

  • Makers van cursussen en uitlegmateriaal

    Typ het commentaar en je krijgt een presentator op het scherm — geen camera, belichting of nieuwe opnamen. Het plafond van 35 seconden per clip valt netjes samen met één concept per clip, en zo monteren de meeste cursusmonteurs toch al.

  • UGC- en productmarketeers

    Het voorbeeld met de speakerpitch hierboven is de hele werkwijze: genereer een portret in makersstijl met jouw product in de hand, typ de pitch, kies een stem. Geen gages, en geen portretrechtverklaring om achteraan te jagen — het gezicht heeft nooit bestaan.

  • Lokalisatieteams

    Hetzelfde gezicht kan dezelfde boodschap in tien talen brengen: houd het portret, wissel de stem. De lipsynchronisatie volgt welke audio je ook aanlevert — het Mandarijnse voorbeeld hierboven is het bewijs.

  • Gezichtsloze kanalen en virtuele presentatoren

    Een persona die je genereert is een persona die je bezit. Ontwerp het gezicht één keer, geef het een consistente stem uit de bibliotheek, en het kan elke aflevering voorop staan — het geïllustreerde prentenboekpersonage hierboven laat zien dat het niet eens fotorealistisch hoeft te zijn.

  • Podcasters en makers die met audio beginnen

    Je hebt het moeilijke deel al: de audio. Knip een hoogtepunt terug tot 35 seconden, voeg een portret toe, en je hebt een visuele clip voor social zonder een montageprogramma te openen.

OmniHuman 1.5 versus Seedance 2.5 versus Veo 3.1 Pro versus Kling 3.0 Turbo

Spraakvideo tegenover scènevideo — wat elk model van je nodig heeft, en wat het in deze werkomgeving teruggeeft.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Wat jij aanlevert1 portretfoto + jouw audio, of ingetypte tekst en een stem uit de bibliotheekEen prompt, plus optionele beeld-, video- en audioreferentiesEen prompt, plus een optioneel referentiebeeldEen prompt of een startbeeld
Wie de woorden uitspreektJij — de avatar synchroniseert zijn lippen met precies jouw geluidsspoorHet model genereert stemmen vanuit de promptHet model genereert stemmen vanuit de promptAudio wordt met de clip gegenereerd
Cliplengte hierDe lengte van jouw audio, tot 35 s4–30 s4–8 s3–15 s
Credits130 per audioseconde110/s bij 480p · 230/s bij 720p320–1.920 per clip (4–8 s · 720p–4K · ± audio)55/s bij 720p · 70/s bij 1080p
Hier gemeten~4 min voor ~10 s audio (7 clips, augustus 2026)Niet gemeten op deze taakNiet gemeten op deze taakNiet gemeten op deze taak

Credits, duur en invoeropties zijn op 19 augustus 2026 uitgelezen uit het eigen modelregister van deze werkomgeving — ze beschrijven wat je hier krijgt, niet de gepubliceerde specificaties van de leveranciers. Tijden zijn onze eigen metingen op de clips die hierboven staan; we hebben dezelfde scripts niet door de andere drie modellen gehaald, dus die cellen zeggen dat, in plaats van te gokken.

Meer videomodellen zoals OmniHuman 1.5

Vergelijk OmniHuman 1.5 met andere videomodellen — dezelfde werkruimte, schakelen met één klik.

OmniHuman 1.5-specificaties op CreateVision AI

Modelomnihuman-1.5, van ByteDance (onderzoeksartikel gepubliceerd in augustus 2025)
ModusPratende avatar: één foto + één audiospoor → sprekende video, in de avatarwerkomgeving op deze pagina
InvoerPrecies 1 portretbeeld, plus audio tot 35 seconden (upload van mp3/wav) — of ingetypte tekst tot 600 tekens, gesynthetiseerd tot spraak
Stemmenbibliotheek60 ingebouwde stemmen in 10 talen: Engels, Chinees, Japans, Koreaans, Frans, Duits, Spaans, Italiaans, Russisch, Portugees
Optionele aanwijzingEen korte spelaanwijzing voor handelingen, emotie en camera — nuttig, nooit verplicht
UitvoerEén doorlopende opname die de kadrering van je foto aanhoudt; de cliplengte is gelijk aan de audiolengte. Gemeten uitvoer: 1248×1664 vanuit een 2:3-foto, 1920×1088 vanuit 16:9, 25 fps, H.264 met mono-AAC-audio
Credits130 per seconde audio, naar boven afgerond — minimaal 130, 4.550 bij de volle 35 seconden; de exacte kosten worden getoond voordat je genereert
Gemeten snelheid3m 20s–4m 42s per geaccepteerde taak voor ~10 s audio in onze test met 7 clips; één uitschieter stond 14 minuten in de wachtrij (augustus 2026, een drukke dinsdagavond)

Zo maak je een pratende avatar van een foto

Begin met video's genereren
  1. Voeg het gezicht toe

    Upload een scherp, frontaal portret tot het middel — of genereer er een met GPT Image 2 of Seedream in dezelfde werkomgeving, want zo is elk gezicht op deze pagina gemaakt. Eén persoon per foto; houd het gezicht groot en onbedekt.

  2. Geef het een stem

    Upload een audioclip (mp3 of wav, tot 35 seconden), of schakel over naar de tekstmodus: typ tot 600 tekens en kies een van de 60 stemmen in 10 talen, elk met een voorbeeld dat je eerst kunt afspelen.

  3. Regisseer desgewenst de uitvoering

    Een korte aanwijzing als "kalm, kleine knikjes, subtiele glimlach" stuurt gebaar en emotie. Laat je hem leeg, dan leest het model het ritme en de betekenis van de audio zelf.

  4. Genereer en controleer de synchronisatie

    De exacte creditkosten verschijnen voordat je runt — ze schalen mee met de audiolengte. Genereren gebeurt asynchroon; de clip landt in je geschiedenis met alle invoer eraan vast, zodat een werkende opzet volgende week reproduceerbaar is.

Verder dan OmniHuman 1.5

Eén account, de volledige workflow voor beeld- en videogeneratie.

Verder lezen

OmniHuman 1.5: prijzen en dagelijkse gratis credits

Gebruik OmniHuman 1.5 met de dagelijkse credits van het gratis pakket, of upgrade voor premium modellen, snellere generatie en 4K-uitvoer.

Gratis

$0

Perfect om mee te beginnen

  • 200 welkomstcredits, maximaal 80/dag
  • Z Image Turbo-schetsen voor 0 credits
  • Standaard generatiesnelheid
  • Generatiegeschiedenis inbegrepen
Aan de slag

Premium

Populairst
$29/month

Jaarlijks gefactureerd · $240/jaar

  • 8.000 credits/maand, geen daglimieten
  • Alle premium modellen — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x generatiesnelheid, voorrangswachtrij
  • AI-promptverbetering
Upgraden naar Premium

Ultimate

$49/month

Jaarlijks gefactureerd · $380/jaar

  • 18.000 credits/maand, geen daglimieten
  • HD-generatie tot 4K-resolutie
  • Prioriteitssupport
  • Snelste wachtrij en vroege toegang tot nieuwe modellen
Upgraden naar Ultimate

OmniHuman 1.5 — veelgestelde vragen

1

Wat is OmniHuman 1.5?

ByteDance's door audio aangestuurde avatarmodel. Het neemt één portretfoto en één audiospoor en geeft een video terug van die persoon die de audio uitspreekt — lippen, gezichtsuitdrukkingen, hoofdbeweging en handgebaren volgen allemaal het geluid. Het onderzoeksartikel erachter is in augustus 2025 gepubliceerd.

2

Kan de avatar precies mijn woorden zeggen?

Ja — dat is het verschil met promptgestuurde videomodellen. Jij levert het geluidsspoor aan, als upload van mp3/wav of door het script te typen en een ingebouwde stem te kiezen, en de avatar synchroniseert zijn lippen er woord voor woord mee. Promptgestuurde modellen genereren hun eigen stemmen en zeggen zelden precies wat jij geschreven hebt.

3

Is OmniHuman 1.5 gratis te gebruiken?

Nee — het rekent 130 credits per seconde audio, naar boven afgerond, dus een clip van 10 seconden is 1.300 credits. De exacte kosten worden getoond voordat je genereert, en mislukte runs worden automatisch terugbetaald. Houd scripts strak en knip stilte weg: elke seconde audio is een seconde waarvoor je betaalt.

4

Wat maakt een goede bronfoto?

Frontaal, tot het middel, één persoon, met het gezicht groot, gelijkmatig belicht en onbedekt — recensenten en onze eigen tests zijn het daarover eens. Onze opzettelijke test met een driekwartprofiel hierboven laat zien wat er anders gebeurt: de lippen articuleren nauwelijks, het model draait het hoofd langzaam verder weg, en er verschijnen voorwerpen op het bureau die nooit op de foto stonden. Gegenereerde portretten werken precies even goed als camerafoto's.

5

Werkt het met illustraties of animepersonages?

Ja — onze prentenboektest hierboven is een vlakke 2D-illustratie, en OmniHuman 1.5 bracht die overtuigend tot leven met behoud van de tekenstijl: ogen, wenkbrauwen en mond bewegen als bij een handgetekend personage. Eén eigenaardigheid die we zagen: wanneer de mond wijd opengaat, tekent het model verrassend realistische tanden voor een vlakke illustratie. Het artikel van ByteDance claimt ook niet-menselijke onderwerpen; wij hebben alleen dit geïllustreerde personage getest.

6

Hoe lang kan een clip zijn, en hoe lang duurt het genereren?

Tot 35 seconden audio per clip op dit platform — langere scripts moeten worden opgedeeld en aan elkaar gezet. In onze test van augustus 2026 kwamen geaccepteerde taken terug in 3m 20s tot 4m 42s voor ongeveer 10 seconden audio. Eén kanttekening van diezelfde avond: onder zware belasting weigerde de upstream meerdere inzendingen met capaciteitsfouten voordat hij de taak accepteerde. Geweigerde runs kosten niets, maar reken op nieuwe pogingen tijdens piekuren in plaats van op een deadline over vijf minuten.

7

Waar is OmniHuman 1.5 slecht in?

Niet-frontale gezichten, bovenal: onze test met een driekwartprofiel laat bijna stilstaande lippen zien, een hoofd dat verder van de camera afdrijft, en bureauvoorwerpen die nooit op de foto stonden. Kleine identiteitsdetails kunnen halverwege de clip afdwalen — een oorbel veranderde in die test van vorm, en de lipkleur komt in twee andere iets sterker over dan in de invoer. Dialoog met meerdere personen is hier niet beschikbaar, de uitvoerresolutie is bescheiden (1248×1664 in onze portrettests — geen 4K), en het maakt alleen spraakvideo: voor actie, camerabeweging of scènewisselingen gebruik je Seedance 2.5 of Kling 3.0 Turbo.

8

Mag ik de video's commercieel gebruiken — en wiens gezicht mag ik gebruiken?

Video's die je genereert mogen worden gebruikt in persoonlijke en commerciële projecten onder onze servicevoorwaarden. Het gezicht is het deel dat je serieus moet nemen: de foto van een echt persoon tot leven brengen zonder diens toestemming kan portret- en publiciteitsrechten schenden, en verschillende rechtsgebieden vereisen inmiddels dat synthetische presentatoren als zodanig worden vermeld. Gegenereerde gezichten — zoals elk gezicht op deze pagina — omzeilen het toestemmingsprobleem volledig.

Geef een foto iets te zeggen

Begin met video's genereren

Prijzen en toegang — de feitenOmniHuman 1.5

Model
OmniHuman 1.5
Ontwikkelaar
ByteDance
Toegang
Draait in de CreateVision AI-werkruimte via API — log in en genereer. Geen API-sleutel, geen cloudproject, geen installatie.
Prijs per generatie
Vanaf 650 credits ≈ $2.36 per clip van 5 seconden met het Premium-abonnement ($29/maand voor 8,000 credits). Het gratis abonnement bevat dagelijks 80 credits.
Privacy
Standaard privé — geen enkele andere gebruiker kan jouw generaties zien, bij geen enkel abonnement. We verkopen of misbruiken geen ledengegevens. Privacybeleid

Wat is nieuwOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.