OmniHuman 1.5 AI-generator för talande avatarer

Ge OmniHuman 1.5 ett porträtt och ett röstspår, så returnerar den en video av den personen som säger exakt dina ord — läppar, ansiktsuttryck och gester följer ljudet.

0 / 2,000
130 cr/s · ≤35s

Vad är OmniHuman 1.5?

OmniHuman 1.5 är ByteDances ljuddrivna avatarmodell: ge den ett porträtt och ett röstspår, så returnerar den en video av den personen som talar ditt ljud — läppar, ansiktsuttryck, huvudrörelser och gester alla drivna av ljudet. Till skillnad från promptdrivna videomodeller levererar du de exakta orden. Forskningsartikeln parar en multimodal språkmodell med en diffusionstransformer, så framförandet reagerar på vad som sägs snarare än att bara följa munnen.

Den ärliga delen: den behöver ett porträtt rakt framifrån. Vårt test med trekvartsprofil nedan visar läppar som knappt artikulerar och ett huvud som glider bort. Ljudet är begränsat till 35 sekunder per körning, så längre manus måste delas och fogas ihop, och dialog med flera personer — en huvudfunktion i artikeln — är inte tillgänglig här. Det är talvideo, inte scenvideo: för kamerarörelse eller action, använd Seedance 2.5 eller Kling 3.0 Turbo.

Arkitektur, positionering och siffror från användarstudien kommer från ByteDances forskningsartikel: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Vad testarna säger

Version 1.5 visar förbättrad robusthet för svåra indata.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Ett porträtt i midjebild med tydliga händer, axlar och naturlig ljussättning ger oftast bättre kroppsrörelser.
Z.Tools — OmniHuman-1.5 deep dive
Tunga skuggor, solglasögon, konstiga skymningar och pyttesmå ansikten gör jobbet svårare.
Z.Tools — OmniHuman-1.5 deep dive

Varför köra OmniHuman 1.5 på CreateVision AI?

Modellen är ByteDances; skälet att använda den här är att de andra två indatakomponenterna — ansiktet och rösten — kommer från samma arbetsyta.

GPT Image 2-porträtt använt som indataansikte för ett OmniHuman 1.5-avatarklipp

Hela indatakedjan bor på en sida

Ett klipp med talande avatar behöver tre saker: ett ansikte, en röst och modellen. Här kommer alla tre från samma arbetsyta — generera porträttet med GPT Image 2 eller Seedream, skriv manuset och syntetisera det med en av 60 inbyggda röster, och mata sedan in båda direkt i OmniHuman 1.5. Varje klipp på den här sidan gjordes exakt så, från början till slut, utan att spela in en sekund ljud eller ladda upp ett enda foto på en verklig person.

Indataporträtt för OmniHuman 1.5-fallet med den mandarintalande tebutiken

Ett röstbibliotek i stället för en inspelningsstudio

Textläget är ingen eftertanke: 60 röster på engelska, kinesiska, japanska, koreanska, franska, tyska, spanska, italienska, ryska och portugisiska, var och en med en förhandslyssning du kan spela upp innan du spenderar något. Skriv upp till 600 tecken, välj en röst, så syntetiserar plattformen talet och driver avataren med det i en enda körning. Mandarinklippet från tebutiken ovan är exakt den vägen — ingen mikrofon inblandad.

Indataporträtt för OmniHuman 1.5-fallet med nyhetsankaret

En prenumeration, och kostnaden syns i förväg

OmniHuman 1.5 debiterar per sekund ljud — 130 krediter per sekund, uppåtavrundat — och arbetsytan visar den exakta kostnaden för ditt klipp innan du trycker på generera. Samma plan täcker GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling och Veo, så det förnuftiga arbetsflödet är billigt: skissa porträttet för en handfull krediter, lås manuset, och spendera först då på avatarsekunder. Klipp bort tystnaden ur ditt ljud — du betalar för varje sekund av det.

Indataporträtt i trekvartsprofil använt för OmniHuman 1.5-stresstestet

Uppmätt, inte utlovat — inklusive misslyckandet

Vår testuppsättning med sju klipp genererades den 19 augusti 2026 — en produktpitch, en nyhetsbriefing, ett peptalk på gymmet, ett mandarinspråkigt välkomnande i en tebutik, en sagobokskaraktär, ett avsiktligt misslyckande med trekvartsprofil och en vid scenbild. Varje accepterat uppdrag renderades framgångsrikt på första tagningen, på 3m 20s till 4m 42s för omkring tio sekunder ljud. Vi publicerar också vad som gick fel: en hektisk tisdagskväll avvisade uppströmsleverantören 13 av våra 20 inlämningar med kapacitetsfel innan de accepterades (avvisade körningar återbetalas automatiskt), ett accepterat uppdrag köade i 14 minuter, och profilklippet på den här sidan visar exakt vad som händer när man ignorerar rådet om porträtt rakt framifrån.

Riktiga OmniHuman 1.5-klipp från den här arbetsytan

Alla 7 klipp nedan genererades här den 19 augusti 2026 — vart och ett är den första rendering som dess indata gav, inga omtagningar och inget körsbärsplockande. Porträtten är utdata från GPT Image 2; varje röst skrevs in som text och syntetiserades med det inbyggda biblioteket. Accepterade uppdrag kom tillbaka på 3m 20s till 4m 42s för ungefär 10 sekunder ljud (en avvikare köade i 14 minuter); en hektisk kväll avvisade uppströmsleverantören flera inlämningar med kapacitetsfel innan den accepterade — avvisade körningar återbetalas. Ljud på.

Prompt9,2 s ljud · rösten Trustworthy Man · 1 300 krediter · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s ljud · rösten News Anchor · 1 430 krediter · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s ljud · rösten Energetic Guy · 1 430 krediter · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s ljud · rösten Mandarin Sweet Girl · 1 560 krediter · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s ljud · rösten Sweet Girl · 1 300 krediter · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s ljud · rösten Wise Lady · 1 170 krediter · läppsynken försämras synligt i den här vinkeln

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s ljud · rösten Movie Narrator · 780 krediter · den här bildrutan är sidans bakgrund

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Vem OmniHuman 1.5 faktiskt är för

Var och en av de här punkterna motsvarar ett klipp som visats ovan — inte en önskelista.

  • Kursskapare och förklarare

    Skriv berättarrösten och få en presentatör i bild — ingen kamera, ingen ljussättning, inga omtagningar. Taket på 35 sekunder per klipp motsvarar snyggt ett begrepp per klipp, vilket är hur de flesta kursredigerare klipper ändå.

  • UGC- och produktmarknadsförare

    Högtalarpitchen ovan är hela arbetsflödet: generera ett kreatörsliknande porträtt som håller din produkt, skriv pitchen, välj en röst. Inga talangarvoden, och inget medgivande för bildrättigheter att jaga — ansiktet har aldrig existerat.

  • Lokaliseringsteam

    Samma ansikte kan leverera samma budskap på tio språk: behåll porträttet, byt röst. Läppsynken följer vilket ljud du än ger den — mandarinfallet ovan är beviset.

  • Ansiktslösa kanaler och virtuella värdar

    En persona du genererar är en persona du äger. Utforma ansiktet en gång, ge det en konsekvent biblioteksröst, så kan det leda varje avsnitt — den illustrerade sagobokskaraktären ovan visar att det inte ens behöver vara fotorealistiskt.

  • Poddare och ljudfokuserade kreatörer

    Du har redan den svåra delen: ljudet. Klipp ner ett höjdpunktsavsnitt till 35 sekunder, lägg till ett porträtt, och du har ett visuellt klipp för sociala medier utan att öppna en redigerare.

OmniHuman 1.5 mot Seedance 2.5, Veo 3.1 Pro och Kling 3.0 Turbo

Talvideo mot scenvideo — vad varje modell behöver från dig, och vad var och en lämnar tillbaka i den här arbetsytan.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Vad du levererar1 porträttfoto + ditt ljud, eller inskriven text och en biblioteksröstEn prompt, plus valfria bild-, video- och ljudreferenserEn prompt, plus en valfri referensbildEn prompt eller en startbild
Vem som talar ordenDet gör du — avataren läppsynkar mot exakt ditt ljudspårModellen genererar röster utifrån promptenModellen genererar röster utifrån promptenLjudet genereras med klippet
Kliplängd härDitt ljuds längd, upp till 35 s4–30 s4–8 s3–15 s
Credits130 per ljudsekund110/s vid 480p · 230/s vid 720p320–1 920 per klipp (4–8 s · 720p–4K · ± ljud)55/s vid 720p · 70/s vid 1080p
Uppmätt här~4 min för ~10 s ljud (7 klipp, augusti 2026)Inte mätt på den här uppgiftenInte mätt på den här uppgiftenInte mätt på den här uppgiften

Krediter, längd och indataalternativ är hämtade ur den här arbetsytans eget modellregister den 19 augusti 2026 — de beskriver vad du får här, inte leverantörernas publicerade specifikationer. Tiderna är våra egna mätningar på klippen som visas ovan; vi har inte kört samma manus genom de andra tre modellerna, så de cellerna säger det i stället för att gissa.

Fler videomodeller som OmniHuman 1.5

Jämför OmniHuman 1.5 med andra videomodeller — samma arbetsyta, ett klick för att växla.

OmniHuman 1.5-specifikationer på CreateVision AI

Modellomnihuman-1.5, från ByteDance (forskningsartikel publicerad augusti 2025)
LägeTalande avatar: ett foto + ett ljudspår → talande video, i avatararbetsytan på den här sidan
IndataExakt 1 porträttbild, plus ljud upp till 35 sekunder (uppladdning av mp3/wav) — eller inskriven text upp till 600 tecken, syntetiserad till tal
Röstbibliotek60 inbyggda röster på 10 språk: engelska, kinesiska, japanska, koreanska, franska, tyska, spanska, italienska, ryska, portugisiska
Valfri styrningEn kort regianvisning för handling, känsla och kamera — användbar, aldrig nödvändig
UtdataEn enda obruten tagning som behåller ditt fotos bildutsnitt; kliplängden är lika med ljudets längd. Uppmätt utdata: 1248×1664 från ett 2:3-foto, 1920×1088 från 16:9, 25 bilder/s, H.264 med mono-AAC-ljud
Credits130 per sekund ljud, uppåtavrundat — 130 som minst, 4 550 vid fulla 35 sekunder; den exakta kostnaden visas innan du genererar
Uppmätt hastighet3m 20s–4m 42s per accepterat uppdrag för ~10 s ljud i vårt test med 7 klipp; en avvikare köade i 14 minuter (augusti 2026, en hektisk tisdagskväll)

Så gör du en talande avatar av ett foto

Börja generera videor
  1. Lägg till ansiktet

    Ladda upp ett tydligt porträtt rakt framifrån i midjebild — eller generera ett med GPT Image 2 eller Seedream i samma arbetsyta, vilket är hur varje ansikte på den här sidan gjordes. En person per foto; håll ansiktet stort och fritt från skymmande föremål.

  2. Ge den en röst

    Ladda upp ett ljudklipp (mp3 eller wav, upp till 35 sekunder), eller byt till textläge: skriv upp till 600 tecken och välj en av 60 röster på 10 språk, var och en med en förhandslyssning du kan spela upp först.

  3. Regissera framförandet om du vill

    En kort anvisning som "lugn, små nickar, subtilt leende" styr gest och känsla. Lämna den tom så läser modellen ljudets rytm och innebörd på egen hand.

  4. Generera och kontrollera synken

    Den exakta kreditkostnaden visas innan du kör — den skalar med ljudets längd. Genereringen är asynkron; klippet landar i din historik med varje indata bifogad, så ett upplägg som fungerar går att återskapa nästa vecka.

Bortom OmniHuman 1.5

Ett konto, hela arbetsflödet för bild- och videogenerering.

Relaterad läsning

OmniHuman 1.5: priser och gratis dagliga credits

Kör OmniHuman 1.5 på gratisnivåns dagliga credits, eller uppgradera för premiummodeller, snabbare generering och 4K-utdata.

Gratis

$0

Perfekt för att komma igång

  • 200 välkomstkrediter, upp till 80/dag
  • Z Image Turbo skissar för 0 credits
  • Standardhastighet för generering
  • Genereringshistorik ingår
Kom igång

Premium

Mest populär
$29/month

Faktureras årligen · 240 USD/år

  • 8 000 krediter/månad, inga dagliga gränser
  • Alla premiummodeller — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x genereringshastighet, prioriterad kö
  • AI-promptförbättring
Uppgradera till Premium

Ultimate

$49/month

Faktureras årligen · 380 USD/år

  • 18 000 krediter/månad, inga dagliga gränser
  • HD-generering upp till 4K-upplösning
  • Prioriterad support
  • Snabbaste kön och tidig tillgång till nya modeller
Uppgradera till Ultimate

OmniHuman 1.5 — vanliga frågor

1

Vad är OmniHuman 1.5?

ByteDances ljuddrivna avatarmodell. Den tar ett porträttfoto och ett ljudspår och returnerar en video av den personen som talar ljudet — läppar, ansiktsuttryck, huvudrörelser och handgester följer alla ljudet. Forskningsartikeln bakom den publicerades i augusti 2025.

2

Kan avataren säga exakt mina ord?

Ja — det är skillnaden mot promptdrivna videomodeller. Du levererar ljudspåret, antingen som en uppladdad mp3/wav eller genom att skriva manuset och välja en inbyggd röst, och avataren läppsynkar mot det ord för ord. Promptdrivna modeller genererar sina egna röster och säger sällan exakt det du skrev.

3

Är OmniHuman 1.5 gratis att använda?

Nej — den debiterar 130 krediter per sekund ljud, uppåtavrundat, så ett 10-sekundersklipp kostar 1 300 krediter. Den exakta kostnaden visas innan du genererar, och misslyckade körningar återbetalas automatiskt. Håll manusen strama och klipp bort tystnad: varje sekund ljud är en sekund du betalar för.

4

Vad kännetecknar ett bra källfoto?

Rakt framifrån, midjebild, en person, med ansiktet stort, jämnt ljussatt och fritt från skymmande föremål — recensenter och våra egna tester är eniga. Vårt avsiktliga test med trekvartsprofil ovan visar vad som händer annars: läpparna artikulerar knappt, modellen roterar långsamt huvudet ännu längre bort, och föremål dyker upp på skrivbordet som aldrig fanns i fotot. Genererade porträtt fungerar precis lika bra som kamerafoton.

5

Fungerar den med illustrationer eller animefigurer?

Ja — vårt sagoboktest ovan är en platt 2D-illustration, och OmniHuman 1.5 animerade den övertygande samtidigt som den behöll stilen: ögon, ögonbryn och mun rör sig som hos en handanimerad karaktär. En egenhet vi observerade: när munnen öppnas vid ritar modellen förvånansvärt realistiska tänder för en platt illustration. ByteDances artikel hävdar också icke-mänskliga motiv; vi har bara testat den här illustrerade karaktären.

6

Hur långt kan ett klipp vara, och hur lång tid tar genereringen?

Upp till 35 sekunder ljud per klipp på den här plattformen — längre manus måste delas och fogas ihop. I vårt test i augusti 2026 kom accepterade uppdrag tillbaka på 3m 20s till 4m 42s för ungefär 10 sekunder ljud. En reservation från samma kväll: under hög belastning avvisade uppströmsleverantören flera inlämningar med kapacitetsfel innan uppdraget accepterades. Avvisade körningar kostar ingenting, men planera för omförsök under rusningstid snarare än en deadline om fem minuter.

7

Vad är OmniHuman 1.5 dålig på?

Ansikten som inte är vända rakt fram, framför allt: vårt test med trekvartsprofil visar nästan stillastående läppar, ett huvud som glider längre bort från kameran, och föremål på skrivbordet som aldrig fanns i fotot. Små identitetsdetaljer kan vandra mitt i klippet — ett örhänge bytte form i det testet, och läppfärgen läses något starkare än i indata i två andra. Dialog med flera personer är inte tillgänglig här, utdataupplösningen är blygsam (1248×1664 i våra porträttester — ingen 4K), och den gör bara talvideo: för action, kamerarörelse eller scenbyten, använd Seedance 2.5 eller Kling 3.0 Turbo.

8

Kan jag använda videorna kommersiellt — och vems ansikte får jag använda?

Videor du genererar får användas i personliga och kommersiella projekt enligt våra användarvillkor. Ansiktet är den del du ska ta på allvar: att animera en verklig persons foto utan deras samtycke kan kränka rätten till egen bild och personlighetsrätten, och flera jurisdiktioner kräver numera att syntetiska presentatörer redovisas. Genererade ansikten — som varje ansikte på den här sidan — undviker samtyckesproblemet helt.

Ge ett foto något att säga

Börja generera videor

Priser och åtkomst — faktaOmniHuman 1.5

Modell
OmniHuman 1.5
Utvecklare
ByteDance
Åtkomst
Körs i CreateVision AI:s arbetsyta via API — logga in och generera. Ingen API-nyckel, inget molnprojekt, ingen installation.
Pris per generering
Från 650 krediter ≈ $2.36 per 5-sekundersklipp med Premium-planen ($29/månad för 8,000 krediter). Gratisplanen innehåller 80 krediter varje dag.
Integritet
Privat som standard — ingen annan användare kan se dina genereringar, oavsett plan. Vi säljer eller missbrukar aldrig medlemsdata. Integritetspolicy

NyheterOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.