OmniHuman 1.5 — generator mówiących awatarów AI

Daj OmniHuman 1.5 jeden portret i ścieżkę głosu, a zwróci wideo, w którym ta osoba mówi twoje dokładne słowa — usta, mimika i gesty idą za dźwiękiem.

0 / 2,000
130 cr/s · ≤35s

Czym jest OmniHuman 1.5?

OmniHuman 1.5 to model awatarowy ByteDance sterowany dźwiękiem: dajesz mu jeden portret i ścieżkę głosu, a on zwraca wideo, w którym ta osoba mówi twoim nagraniem — usta, mimika, ruch głowy i gesty, wszystko napędzane dźwiękiem. W odróżnieniu od modeli wideo prowadzonych promptem to ty podajesz dokładne słowa. Praca badawcza łączy multimodalny model językowy z transformerem dyfuzyjnym, więc wykonanie reaguje na to, co jest mówione, a nie tylko śledzi usta.

Uczciwa część: potrzebuje portretu na wprost. Nasz test z profilem trzy czwarte poniżej pokazuje usta, które ledwie artykułują, i głowę, która odpływa. Audio jest ograniczone do 35 sekund na przebieg, więc dłuższe scenariusze oznaczają dzielenie i sklejanie, a dialog wieloosobowy — sztandarowa funkcja z pracy badawczej — nie jest tu dostępny. To wideo mowy, a nie wideo sceny: po ruch kamery albo akcję sięgnij po Seedance 2.5 albo Kling 3.0 Turbo.

Architektura, pozycjonowanie i liczby z badania na użytkownikach pochodzą z pracy badawczej ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Co mówią testerzy

Wersja 1.5 wykazuje lepszą odporność na trudne wejścia.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Portret do pasa z wyraźnymi dłońmi, ramionami i naturalnym oświetleniem zwykle daje lepszy ruch ciała.
Z.Tools — OmniHuman-1.5 deep dive
Głębokie cienie, okulary przeciwsłoneczne, dziwne przesłonięcia i drobne twarze utrudniają zadanie.
Z.Tools — OmniHuman-1.5 deep dive

Po co uruchamiać OmniHuman 1.5 w CreateVision AI?

Model należy do ByteDance; powodem, by używać go tutaj, jest to, że pozostałe dwa wejścia — twarz i głos — pochodzą z tego samego obszaru roboczego.

Portret z GPT Image 2 użyty jako twarz wejściowa do klipu awatarowego OmniHuman 1.5

Cały łańcuch wejść mieszka na jednej stronie

Klip z mówiącym awatarem potrzebuje trzech rzeczy: twarzy, głosu i modelu. Tutaj wszystkie trzy pochodzą z tego samego obszaru roboczego — wygeneruj portret w GPT Image 2 albo Seedream, wpisz scenariusz i zsyntetyzuj go jednym z 60 wbudowanych głosów, a potem podaj oba prosto do OmniHuman 1.5. Każdy klip na tej stronie powstał dokładnie tak, od początku do końca, bez nagrywania sekundy dźwięku i bez wgrywania ani jednego zdjęcia prawdziwej osoby.

Portret wejściowy do przypadku OmniHuman 1.5 z herbaciarnią i mandaryńskim

Biblioteka głosów zamiast kabiny lektorskiej

Tryb tekstowy nie jest doczepiony na końcu: 60 głosów w angielskim, chińskim, japońskim, koreańskim, francuskim, niemieckim, hiszpańskim, włoskim, rosyjskim i portugalskim, każdy z podglądem, który możesz odsłuchać, zanim cokolwiek wydasz. Wpisz do 600 znaków, wybierz głos, a platforma zsyntetyzuje mowę i napędzi nią awatara w jednym przebiegu. Klip z herbaciarni po mandaryńsku powyżej to dokładnie ta droga — bez udziału mikrofonu.

Portret wejściowy do przypadku OmniHuman 1.5 z prezenterem wiadomości

Jedna subskrypcja, a koszt jest widoczny z góry

OmniHuman 1.5 rozlicza się za sekundę audio — 130 kredytów za sekundę, w górę do pełnej — a obszar roboczy pokazuje dokładny koszt twojego klipu, zanim naciśniesz generuj. Ten sam plan obejmuje GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling i Veo, więc rozsądny przepływ pracy jest tani: naszkicuj portret za garść kredytów, ustal scenariusz i dopiero wtedy wydawaj na sekundy awatara. Obetnij ciszę ze swojego audio — płacisz za każdą jego sekundę.

Portret wejściowy w profilu trzy czwarte użyty do testu obciążeniowego OmniHuman 1.5

Zmierzone, a nie obiecane — łącznie z porażką

Nasz zestaw testowy siedmiu klipów wygenerowano 19 sierpnia 2026 — prezentacja produktu, komunikat wiadomości, mowa motywacyjna na siłowni, powitanie w herbaciarni po mandaryńsku, postać z książeczki, celowa porażka z profilem trzy czwarte i szeroki kadr sceny. Każde przyjęte zadanie wyrenderowało się pomyślnie w pierwszym podejściu, w 3 min 20 s do 4 min 42 s dla około dziesięciu sekund audio. Publikujemy też, co poszło źle: w ruchliwy wtorkowy wieczór dostawca odrzucił 13 z naszych 20 zgłoszeń błędami przepustowości, zanim je przyjął (odrzucone przebiegi są zwracane automatycznie), jedno przyjęte zadanie czekało w kolejce 14 minut, a klip z profilem na tej stronie pokazuje dokładnie, co się dzieje, gdy zignorujesz radę o portrecie na wprost.

Prawdziwe klipy OmniHuman 1.5 z tego obszaru roboczego

Wszystkie 7 klipów poniżej wygenerowano tutaj 19 sierpnia 2026 — każdy jest pierwszym renderem, jaki dały jego wejścia, bez powtórek i bez wybierania rodzynków. Portrety to wyjścia GPT Image 2; każdy głos wpisano jako tekst i zsyntetyzowano wbudowaną biblioteką. Przyjęte zadania wracały w 3 min 20 s do 4 min 42 s dla mniej więcej 10 sekund audio (jedno odstające czekało w kolejce 14 minut); w ruchliwy wieczór dostawca odrzucił kilka zgłoszeń błędami przepustowości, zanim je przyjął — odrzucone przebiegi są zwracane. Włącz dźwięk.

Prompt9,2 s audio · głos Trustworthy Man · 1 300 kredytów · 4 min 42 s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s audio · głos News Anchor · 1 430 kredytów · 4 min 09 s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s audio · głos Energetic Guy · 1 430 kredytów · 4 min 00 s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s audio · głos Mandarin Sweet Girl · 1 560 kredytów · 4 min 19 s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s audio · głos Sweet Girl · 1 300 kredytów · 4 min 01 s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s audio · głos Wise Lady · 1 170 kredytów · synchronizacja ust wyraźnie degraduje się przy tym kącie

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s audio · głos Movie Narrator · 780 kredytów · ta klatka jest tłem tej strony

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Dla kogo naprawdę jest OmniHuman 1.5

Każdy z tych punktów odsyła do klipu pokazanego powyżej — a nie do listy życzeń.

  • Twórcy kursów i materiałów objaśniających

    Wpisz narrację i dostań prezentera na ekranie — bez kamery, świateł i dokrętek. Limit 35 sekund na klip ładnie odwzorowuje jedno pojęcie na klip, a i tak właśnie tak tnie większość montażystów kursów.

  • Marketerzy UGC i produktowi

    Przypadek z prezentacją głośnika powyżej to cały przepływ pracy: wygeneruj portret w stylu twórcy trzymającego twój produkt, wpisz prezentację, wybierz głos. Bez honorariów dla aktorów i bez ganiania za zgodą na wizerunek — ta twarz nigdy nie istniała.

  • Zespoły lokalizacyjne

    Ta sama twarz może wygłosić ten sam komunikat w dziesięciu językach: zachowaj portret, podmień głos. Synchronizacja ust idzie za dowolnym audio, jakie podasz — dowodem jest przypadek mandaryński powyżej.

  • Kanały bez twarzy i wirtualni prowadzący

    Persona, którą wygenerujesz, jest personą, którą posiadasz. Zaprojektuj twarz raz, daj jej spójny głos z biblioteki, a może firmować każdy odcinek — ilustrowana postać z książeczki powyżej pokazuje, że nie musi nawet być fotorealistyczna.

  • Podkasterzy i twórcy pracujący najpierw dźwiękiem

    Trudną część już masz: audio. Przytnij fragment do 35 sekund, dodaj portret i masz klip wizualny do mediów społecznościowych, nie otwierając programu do montażu.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Wideo mowy kontra wideo sceny — czego każdy model od ciebie potrzebuje i co oddaje w tym obszarze roboczym.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Co dostarczasz1 zdjęcie portretowe + twoje audio albo wpisany tekst i głos z bibliotekiPrompt plus opcjonalne referencje obrazowe, wideo i audioPrompt plus opcjonalny obraz referencyjnyPrompt albo obraz początkowy
Kto wypowiada słowaTy — awatar synchronizuje usta z twoją dokładną ścieżką dźwiękowąModel generuje głosy z promptuModel generuje głosy z promptuDźwięk jest generowany razem z klipem
Długość klipu tutajDługość twojego audio, do 35 s4–30 s4–8 s3–15 s
Kredyty130 za sekundę audio110/s przy 480p · 230/s przy 720p320–1 920 za klip (4–8 s · 720p–4K · ± dźwięk)55/s przy 720p · 70/s przy 1080p
Zmierzone tutaj~4 min dla ~10 s audio (7 klipów, sierpień 2026)Nie mierzyliśmy przy tym zadaniuNie mierzyliśmy przy tym zadaniuNie mierzyliśmy przy tym zadaniu

Kredyty, długości i opcje wejścia są odczytane z własnego rejestru modeli tego obszaru roboczego 19 sierpnia 2026 — opisują to, co dostajesz tutaj, a nie publikowane specyfikacje producentów. Czasy to nasze własne pomiary na klipach pokazanych powyżej; nie przepuściliśmy tych samych scenariuszy przez pozostałe trzy modele, więc te komórki mówią to wprost, zamiast zgadywać.

Więcej modeli wideo podobnych do OmniHuman 1.5

Porównaj OmniHuman 1.5 z innymi modelami wideo — ten sam obszar roboczy, przełączanie się jednym kliknięciem.

Specyfikacja OmniHuman 1.5 w CreateVision AI

Modelomnihuman-1.5, od ByteDance (praca badawcza opublikowana w sierpniu 2025)
TrybMówiący awatar: jedno zdjęcie + jedna ścieżka audio → wideo z mową, w obszarze roboczym awatarów na tej stronie
WejściaDokładnie 1 obraz portretowy plus audio do 35 sekund (wgranie mp3/wav) — albo wpisany tekst do 600 znaków, zsyntetyzowany do mowy
Biblioteka głosów60 wbudowanych głosów w 10 językach: angielski, chiński, japoński, koreański, francuski, niemiecki, hiszpański, włoski, rosyjski, portugalski
Opcjonalne wskazówkiKrótka notatka reżyserska o czynnościach, emocji i kamerze — przydatna, nigdy wymagana
WynikJedno ciągłe ujęcie zachowujące kadrowanie twojego zdjęcia; długość klipu równa się długości audio. Zmierzone wyjście: 1248×1664 ze zdjęcia 2:3, 1920×1088 z 16:9, 25 kl./s, H.264 z dźwiękiem mono AAC
Kredyty130 za sekundę audio, w górę do pełnej — minimum 130, 4 550 przy pełnych 35 sekundach; dokładny koszt jest pokazany przed generowaniem
Zmierzona szybkość3 min 20 s–4 min 42 s na przyjęte zadanie dla ~10 s audio w naszym teście z 7 klipami; jedno odstające czekało w kolejce 14 minut (sierpień 2026, ruchliwy wtorkowy wieczór)

Jak zrobić mówiącego awatara ze zdjęcia

Zacznij generować wideo
  1. Dodaj twarz

    Wgraj wyraźny portret do pasa, twarzą na wprost — albo wygeneruj go w GPT Image 2 lub Seedream w tym samym obszarze roboczym, bo tak powstała każda twarz na tej stronie. Jedna osoba na zdjęcie; trzymaj twarz dużą i niezasłoniętą.

  2. Daj mu głos

    Wgraj klip audio (mp3 albo wav, do 35 sekund) albo przełącz się na tryb tekstowy: wpisz do 600 znaków i wybierz jeden z 60 głosów w 10 językach, każdy z podglądem, który możesz najpierw odsłuchać.

  3. Opcjonalnie wyreżyseruj wykonanie

    Krótka notatka w rodzaju „spokojnie, drobne skinienia głową, subtelny uśmiech” steruje gestem i emocją. Zostaw ją pustą, a model sam odczyta rytm i sens audio.

  4. Wygeneruj i sprawdź synchronizację

    Dokładny koszt w kredytach pojawia się przed uruchomieniem — skaluje się z długością audio. Generowanie jest asynchroniczne; klip ląduje w twojej historii z dołączonymi wszystkimi wejściami, więc działające ustawienia da się odtworzyć za tydzień.

Więcej niż OmniHuman 1.5

Jedno konto, cały proces generowania obrazów i wideo.

Powiązane artykuły

OmniHuman 1.5: cennik i darmowe kredyty dzienne

Uruchom OmniHuman 1.5 na dziennych kredytach planu darmowego albo przejdź na wyższy plan, by korzystać z modeli premium, szybszego generowania i wyjścia 4K.

Darmowy

$0

Idealny na początek

  • 200 kredytów powitalnych, do 80/dzień
  • Szkice w Z Image Turbo za 0 kredytów
  • Standardowa prędkość generowania
  • Historia generacji w zestawie
Zacznij

Premium

Najpopularniejszy
$29/month

Rozliczenie roczne · $240/rok

  • 8000 kredytów/mies., brak dziennych limitów
  • Wszystkie modele premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x szybsze generowanie, priorytetowa kolejka
  • Ulepszanie promptów przez AI
Przejdź na Premium

Ultimate

$49/month

Rozliczenie roczne · $380/rok

  • 18 000 kredytów/mies., brak dziennych limitów
  • Generowanie w HD aż do rozdzielczości 4K
  • Priorytetowe wsparcie
  • Najszybsza kolejka i wcześniejszy dostęp do nowych modeli
Przejdź na Ultimate

OmniHuman 1.5 — najczęściej zadawane pytania

1

Czym jest OmniHuman 1.5?

Model awatarowy ByteDance sterowany dźwiękiem. Bierze jedno zdjęcie portretowe i jedną ścieżkę audio i zwraca wideo, w którym ta osoba mówi tym nagraniem — usta, mimika, ruch głowy i gesty dłoni, wszystko idzie za dźwiękiem. Praca badawcza, która za nim stoi, została opublikowana w sierpniu 2025.

2

Czy awatar może powiedzieć moje dokładne słowa?

Tak — to jest różnica wobec modeli wideo prowadzonych promptem. To ty dostarczasz ścieżkę dźwiękową, albo wgrywając mp3/wav, albo wpisując scenariusz i wybierając wbudowany głos, a awatar synchronizuje z nią usta słowo w słowo. Modele prowadzone promptem generują własne głosy i rzadko mówią dokładnie to, co napisałeś.

3

Czy OmniHuman 1.5 jest darmowy?

Nie — rozlicza się po 130 kredytów za sekundę audio, w górę do pełnej, więc 10-sekundowy klip to 1 300 kredytów. Dokładny koszt jest pokazany przed generowaniem, a nieudane przebiegi są zwracane automatycznie. Trzymaj scenariusze zwięzłe i obcinaj ciszę: każda sekunda audio to sekunda, za którą płacisz.

4

Co sprawia, że zdjęcie źródłowe jest dobre?

Twarz na wprost, kadr do pasa, jedna osoba, twarz duża, równomiernie oświetlona i niezasłonięta — recenzenci i nasze własne testy są zgodni. Nasz celowy test z profilem trzy czwarte powyżej pokazuje, co dzieje się inaczej: usta ledwie artykułują, model powoli obraca głowę jeszcze dalej, a na biurku pojawiają się przedmioty, których na zdjęciu nigdy nie było. Wygenerowane portrety działają dokładnie tak samo dobrze jak zdjęcia z aparatu.

5

Czy działa z ilustracjami albo postaciami anime?

Tak — nasz test z książeczką powyżej to płaska ilustracja 2D, a OmniHuman 1.5 zanimował ją przekonująco, zachowując styl rysunku: oczy, brwi i usta poruszają się jak w animacji ręcznej. Jeden kwiatek, który zaobserwowaliśmy: gdy usta otwierają się szeroko, model rysuje zaskakująco realistyczne zęby jak na płaską ilustrację. Praca ByteDance deklaruje też obiekty nie-ludzkie; my testowaliśmy wyłącznie tę ilustrowaną postać.

6

Jak długi może być klip i ile trwa generowanie?

Do 35 sekund audio na klip na tej platformie — dłuższe scenariusze trzeba podzielić i skleić. W naszym teście z sierpnia 2026 przyjęte zadania wracały w 3 min 20 s do 4 min 42 s dla mniej więcej 10 sekund audio. Jedno zastrzeżenie z tego samego wieczoru: przy dużym obciążeniu dostawca odrzucił kilka zgłoszeń błędami przepustowości, zanim przyjął zadanie. Odrzucone przebiegi nic nie kosztują, ale planuj powtórki w godzinach szczytu, a nie termin za pięć minut.

7

W czym OmniHuman 1.5 jest słaby?

Przede wszystkim twarze nie na wprost: nasz test z profilem trzy czwarte pokazuje niemal nieruchome usta, głowę odpływającą dalej od kamery i przedmioty na biurku, których na zdjęciu nigdy nie było. Drobne szczegóły tożsamości potrafią powędrować w trakcie klipu — kolczyk zmienił w tym teście kształt, a kolor ust czyta się w dwóch innych nieco mocniej niż na wejściu. Dialog wieloosobowy nie jest tu dostępny, rozdzielczość wyjściowa jest skromna (1248×1664 w naszych testach portretowych — bez 4K), a robi wyłącznie wideo mowy: po akcję, ruch kamery albo zmiany scen sięgnij po Seedance 2.5 albo Kling 3.0 Turbo.

8

Czy mogę używać tych filmów komercyjnie — i czyjej twarzy mogę użyć?

Filmy, które wygenerujesz, mogą być używane w projektach osobistych i komercyjnych zgodnie z naszym regulaminem. Twarz to część, którą trzeba potraktować poważnie: animowanie zdjęcia prawdziwej osoby bez jej zgody może naruszać prawa do wizerunku i prawa do komercyjnego wykorzystania podobizny, a kilka jurysdykcji wymaga dziś ujawniania syntetycznych prezenterów. Wygenerowane twarze — jak każda twarz na tej stronie — całkowicie omijają problem zgody.

Daj zdjęciu coś do powiedzenia

Zacznij generować wideo

Ceny i dostęp — faktyOmniHuman 1.5

Model
OmniHuman 1.5
Deweloper
ByteDance
Dostęp
Działa w przestrzeni roboczej CreateVision AI przez API — zaloguj się i generuj. Bez klucza API, bez projektu w chmurze, bez instalacji.
Cena za generację
Od 650 kredytów ≈ $2.36 za klip 5-sekundowy w planie Premium ($29/mies. za 8,000 kredytów). Plan darmowy obejmuje 80 kredytów dziennie.
Prywatność
Prywatne domyślnie — żaden inny użytkownik nie zobaczy Twoich generacji, w żadnym planie. Nie sprzedajemy ani nie nadużywamy danych członków. Polityka prywatności

NowościOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.