OmniHuman 1.5 KI-Sprechavatar-Generator

Geben Sie OmniHuman 1.5 ein Porträt und eine Sprachspur, und es liefert ein Video dieser Person, die Ihre exakten Wörter sagt — Lippen, Mimik und Gesten folgen dem Ton.

0 / 2,000
130 cr/s · ≤35s

Was ist OmniHuman 1.5?

OmniHuman 1.5 ist ByteDances audiogesteuertes Avatar-Modell: Geben Sie ihm ein Porträt und eine Sprachspur, und es liefert ein Video dieser Person, die Ihr Audio spricht — Lippen, Mimik, Kopfbewegung und Gesten alle vom Ton gesteuert. Anders als bei prompt-gesteuerten Videomodellen liefern Sie die exakten Wörter. Das Forschungspapier kombiniert ein multimodales Sprachmodell mit einem Diffusion Transformer, die Darbietung reagiert also auf das, was gesagt wird, statt nur den Mund zu verfolgen.

Der ehrliche Teil: Es braucht ein frontales Porträt. Unser Test mit einem Dreiviertelprofil unten zeigt Lippen, die kaum artikulieren, und einen Kopf, der wegdriftet. Der Ton ist auf 35 Sekunden pro Lauf begrenzt, längere Skripte heißen also Aufteilen und Zusammenfügen, und Dialoge mit mehreren Personen — eine Hauptfunktion des Papiers — sind hier nicht verfügbar. Es ist Sprechvideo, kein Szenenvideo: Für Kamerabewegung oder Handlung nehmen Sie Seedance 2.5 oder Kling 3.0 Turbo.

Architektur, Positionierung und die Zahlen aus der Nutzerstudie stammen aus dem Forschungspapier von ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Was Tester sagen

Version 1.5 zeigt eine verbesserte Robustheit bei schwierigen Eingaben.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Ein Porträt bis zur Hüfte mit deutlich sichtbaren Händen, Schultern und natürlicher Beleuchtung ergibt meist bessere Körperbewegung.
Z.Tools — OmniHuman-1.5 deep dive
Harte Schatten, Sonnenbrillen, seltsame Verdeckungen und winzige Gesichter erschweren die Aufgabe.
Z.Tools — OmniHuman-1.5 deep dive

Warum OmniHuman 1.5 auf CreateVision AI laufen lassen?

Das Modell ist ByteDances; der Grund, es hier zu nutzen, ist, dass die beiden anderen Eingaben — das Gesicht und die Stimme — aus demselben Arbeitsplatz kommen.

GPT Image 2 Porträt, das als Eingabegesicht für einen OmniHuman 1.5 Avatar-Clip diente

Die ganze Eingabekette lebt auf einer Seite

Ein Clip mit sprechendem Avatar braucht drei Dinge: ein Gesicht, eine Stimme und das Modell. Hier kommen alle drei aus demselben Arbeitsplatz — erzeugen Sie das Porträt mit GPT Image 2 oder Seedream, tippen Sie das Skript und synthetisieren Sie es mit einer von 60 eingebauten Stimmen, und geben Sie dann beides direkt in OmniHuman 1.5. Jeder Clip auf dieser Seite ist genau so entstanden, von Anfang bis Ende, ohne eine Sekunde Ton aufzunehmen und ohne ein einziges Foto einer echten Person hochzuladen.

Eingabeporträt für den OmniHuman 1.5 Teeladen-Fall auf Mandarin

Eine Stimmenbibliothek statt einer Aufnahmekabine

Der Textmodus ist kein nachträglicher Einfall: 60 Stimmen in Englisch, Chinesisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch, Italienisch, Russisch und Portugiesisch, jede mit einer Vorschau, die Sie abspielen können, bevor Sie etwas ausgeben. Tippen Sie bis zu 600 Zeichen, wählen Sie eine Stimme, und die Plattform synthetisiert die Sprache und steuert den Avatar damit in einem Lauf. Der Mandarin-Teeladen-Clip oben ist genau dieser Weg — ohne Mikrofon.

Eingabeporträt für den OmniHuman 1.5 Nachrichtensprecher-Fall

Ein Abo, und die Kosten sind vorab sichtbar

OmniHuman 1.5 rechnet pro Sekunde Audio ab — 130 Credits pro Sekunde, aufgerundet — und der Arbeitsplatz zeigt die genauen Kosten Ihres Clips, bevor Sie auf Generieren drücken. Derselbe Tarif deckt GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling und Veo ab, der sinnvolle Ablauf ist also günstig: Entwerfen Sie das Porträt für eine Handvoll Credits, legen Sie das Skript fest, und geben Sie erst dann für Avatar-Sekunden aus. Schneiden Sie die Stille aus Ihrem Audio — Sie zahlen für jede Sekunde davon.

Dreiviertelprofil-Eingabeporträt, das für den OmniHuman 1.5 Belastungstest verwendet wurde

Gemessen, nicht versprochen — einschließlich des Fehlschlags

Unser Testsatz aus sieben Clips wurde am 19. August 2026 erzeugt — ein Produktpitch, eine Nachrichtenmeldung, eine Aufmunterung im Fitnessstudio, eine Mandarin-Begrüßung im Teeladen, eine Bilderbuchfigur, ein absichtliches Dreiviertelprofil zum Scheitern und eine weite Bühnenaufnahme. Jeder angenommene Auftrag wurde beim ersten Versuch erfolgreich gerendert, in 3 min 20 s bis 4 min 42 s für rund zehn Sekunden Audio. Wir veröffentlichen auch, was schiefging: An einem stark ausgelasteten Dienstagabend lehnte der Upstream 13 unserer 20 Einreichungen mit Kapazitätsfehlern ab, bevor er sie annahm (abgelehnte Läufe werden automatisch erstattet), ein angenommener Auftrag stand 14 Minuten in der Warteschlange, und der Profil-Clip auf dieser Seite zeigt genau, was passiert, wenn man den Rat mit dem frontalen Porträt ignoriert.

Echte OmniHuman 1.5 Clips aus diesem Arbeitsplatz

Alle 7 Clips unten wurden hier am 19. August 2026 erzeugt — jeder ist das erste Rendering, das seine Eingaben hervorgebracht haben, keine Wiederholungen und keine Rosinenpickerei. Die Porträts sind Ausgaben von GPT Image 2; jede Stimme wurde als Text getippt und mit der eingebauten Bibliothek synthetisiert. Angenommene Aufträge kamen für rund 10 Sekunden Audio in 3 min 20 s bis 4 min 42 s zurück (ein Ausreißer stand 14 Minuten in der Warteschlange); an einem stark ausgelasteten Abend lehnte der Upstream mehrere Einreichungen mit Kapazitätsfehlern ab, bevor er annahm — abgelehnte Läufe werden erstattet. Ton an.

Prompt9,2 s Audio · Stimme Trustworthy Man · 1.300 Credits · 4 min 42 s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s Audio · Stimme News Anchor · 1.430 Credits · 4 min 09 s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s Audio · Stimme Energetic Guy · 1.430 Credits · 4 min 00 s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s Audio · Stimme Mandarin Sweet Girl · 1.560 Credits · 4 min 19 s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s Audio · Stimme Sweet Girl · 1.300 Credits · 4 min 01 s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s Audio · Stimme Wise Lady · 1.170 Credits · die Lippensynchronität verschlechtert sich in diesem Winkel sichtbar

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s Audio · Stimme Movie Narrator · 780 Credits · dieses Bild ist der Seitenhintergrund

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Für wen OmniHuman 1.5 tatsächlich gedacht ist

Jeder dieser Punkte verweist auf einen Clip, der oben gezeigt wird — keine Wunschliste.

  • Kursersteller und Erklärvideo-Macher

    Tippen Sie die Erzählung und bekommen Sie einen Vortragenden auf dem Bildschirm — keine Kamera, kein Licht, keine Nachdrehs. Die Obergrenze von 35 Sekunden pro Clip passt sauber auf ein Konzept pro Clip, und so schneiden die meisten Kurs-Editoren ohnehin.

  • UGC- und Produktmarketer

    Der Lautsprecher-Pitch oben ist der ganze Ablauf: Erzeugen Sie ein Porträt im Creator-Stil, in dem Ihr Produkt gehalten wird, tippen Sie den Pitch, wählen Sie eine Stimme. Keine Gagen und keine Persönlichkeitsrechtsfreigabe hinterherzujagen — das Gesicht hat nie existiert.

  • Lokalisierungsteams

    Dasselbe Gesicht kann dieselbe Botschaft in zehn Sprachen vortragen: Porträt behalten, Stimme tauschen. Die Lippensynchronität folgt dem Audio, das Sie liefern — der Mandarin-Fall oben ist der Beleg.

  • Gesichtslose Kanäle und virtuelle Moderatoren

    Eine Persona, die Sie erzeugen, ist eine Persona, die Ihnen gehört. Gestalten Sie das Gesicht einmal, geben Sie ihm eine gleichbleibende Stimme aus der Bibliothek, und es kann jede Folge moderieren — die illustrierte Bilderbuchfigur oben zeigt, dass es nicht einmal fotorealistisch sein muss.

  • Podcaster und Audio-First-Creator

    Den schwierigen Teil haben Sie schon: das Audio. Schneiden Sie ein Highlight auf 35 Sekunden, fügen Sie ein Porträt hinzu, und Sie haben einen visuellen Clip für Social, ohne ein Schnittprogramm zu öffnen.

OmniHuman 1.5 vs. Seedance 2.5 vs. Veo 3.1 Pro vs. Kling 3.0 Turbo

Sprechvideo gegen Szenenvideo — was jedes Modell von Ihnen braucht und was es Ihnen in diesem Arbeitsplatz zurückgibt.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Was Sie liefern1 Porträtfoto + Ihr Audio, oder getippter Text und eine Stimme aus der BibliothekEin Prompt, plus optionale Bild-, Video- und AudioreferenzenEin Prompt, plus ein optionales ReferenzbildEin Prompt oder ein Startbild
Wer die Wörter sprichtSie — der Avatar synchronisiert die Lippen zu Ihrem exakten SoundtrackDas Modell erzeugt Stimmen aus dem PromptDas Modell erzeugt Stimmen aus dem PromptDer Ton wird mit dem Clip erzeugt
Cliplänge hierLänge Ihres Audios, bis zu 35 s4–30 s4–8 s3–15 s
Credits130 pro Audiosekunde110/s bei 480p · 230/s bei 720p320–1.920 pro Clip (4–8 s · 720p–4K · ± Ton)55/s bei 720p · 70/s bei 1080p
Hier gemessen~4 min für ~10 s Audio (7 Clips, August 2026)Für diese Aufgabe nicht gemessenFür diese Aufgabe nicht gemessenFür diese Aufgabe nicht gemessen

Credits, Dauer und Eingabeoptionen stammen aus der eigenen Modell-Registry dieses Arbeitsplatzes, Stand 19. August 2026 — sie beschreiben, was Sie hier bekommen, nicht die veröffentlichten Spezifikationen der Anbieter. Die Zeiten sind unsere eigenen Messungen an den oben gezeigten Clips; wir haben dieselben Skripte nicht durch die anderen drei Modelle geschickt, diese Zellen sagen das also, statt zu raten.

Weitere Videomodelle wie OmniHuman 1.5

Vergleichen Sie OmniHuman 1.5 mit anderen Videomodellen – gleicher Arbeitsbereich, Wechsel mit einem Klick.

OmniHuman 1.5 – technische Daten auf CreateVision AI

Modellomnihuman-1.5, von ByteDance (Forschungspapier veröffentlicht im August 2025)
ModusSprechender Avatar: ein Foto + eine Audiospur → sprechendes Video, im Avatar-Arbeitsbereich auf dieser Seite
EingabenGenau 1 Porträtbild, plus Audio bis zu 35 Sekunden (mp3/wav-Upload) — oder getippter Text bis zu 600 Zeichen, zu Sprache synthetisiert
Stimmenbibliothek60 eingebaute Stimmen in 10 Sprachen: Englisch, Chinesisch, Japanisch, Koreanisch, Französisch, Deutsch, Spanisch, Italienisch, Russisch, Portugiesisch
Optionale AnleitungEine kurze Regieanweisung für Handlungen, Emotion und Kamera — nützlich, nie erforderlich
AusgabeEine durchgehende Einstellung, die die Bildaufteilung Ihres Fotos behält; die Cliplänge entspricht der Audiolänge. Gemessene Ausgabe: 1248×1664 aus einem 2:3-Foto, 1920×1088 aus 16:9, 25 fps, H.264 mit Mono-AAC-Ton
Credits130 pro Sekunde Audio, aufgerundet — mindestens 130, 4.550 bei den vollen 35 Sekunden; die genauen Kosten werden vor dem Generieren angezeigt
Gemessene Geschwindigkeit3 min 20 s–4 min 42 s pro angenommenem Auftrag für ~10 s Audio in unserem Test mit 7 Clips; ein Ausreißer stand 14 Minuten in der Warteschlange (August 2026, ein stark ausgelasteter Dienstagabend)

So machen Sie aus einem Foto einen sprechenden Avatar

Beginne mit dem Generieren von Videos
  1. Das Gesicht hinzufügen

    Laden Sie ein klares, frontales Porträt bis zur Hüfte hoch — oder erzeugen Sie eines mit GPT Image 2 oder Seedream in genau diesem Arbeitsplatz, so ist jedes Gesicht auf dieser Seite entstanden. Eine Person pro Foto; halten Sie das Gesicht groß und unverdeckt.

  2. Geben Sie ihm eine Stimme

    Laden Sie einen Audioclip hoch (mp3 oder wav, bis zu 35 Sekunden), oder wechseln Sie in den Textmodus: Tippen Sie bis zu 600 Zeichen und wählen Sie eine von 60 Stimmen in 10 Sprachen, jede mit einer Vorschau, die Sie vorher abspielen können.

  3. Optional die Darbietung führen

    Eine kurze Notiz wie „ruhig, kleines Nicken, feines Lächeln“ steuert Gestik und Emotion. Lassen Sie sie leer, und das Modell liest Rhythmus und Bedeutung des Audios von selbst.

  4. Generieren und die Synchronität prüfen

    Die genauen Credit-Kosten erscheinen vor dem Lauf — sie skalieren mit der Audiolänge. Die Generierung läuft asynchron; der Clip landet in Ihrem Verlauf mit allen Eingaben daran, ein funktionierendes Setup ist also nächste Woche reproduzierbar.

Über OmniHuman 1.5 hinaus

Ein Konto, der vollständige Bild- und Video-Generierungs-Workflow.

Weiterführende Lektüre

OmniHuman 1.5: Preise und kostenlose Tages-Credits

Nutze OmniHuman 1.5 mit den täglichen Credits des kostenlosen Tarifs – oder mach ein Upgrade für Premium-Modelle, schnellere Generierung und 4K-Ausgabe.

Kostenlos

$0

Perfekt für den Einstieg

  • 200 Willkommens-Credits, bis zu 80/Tag
  • Z Image Turbo entwirft zu 0 Credits
  • Standard-Generierungsgeschwindigkeit
  • Generierungsverlauf inklusive
Loslegen

Premium

Am beliebtesten
$29/month

Jährliche Abrechnung · 240 $/Jahr

  • 8.000 Credits/Monat, keine Tageslimits
  • Alle Premium-Modelle — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x schnellere Generierung, Prioritäts-Warteschlange
  • KI-Prompt-Verbesserung
Upgrade auf Premium

Ultimate

$49/month

Jährliche Abrechnung · 380 $/Jahr

  • 18.000 Credits/Monat, keine Tageslimits
  • HD-Generierung bis zu 4K-Auflösung
  • Priorisierter Support
  • Schnellste Warteschlange und früher Zugang zu neuen Modellen
Upgrade auf Ultimate

OmniHuman 1.5 – häufig gestellte Fragen

1

Was ist OmniHuman 1.5?

ByteDances audiogesteuertes Avatar-Modell. Es nimmt ein Porträtfoto und eine Audiospur und gibt ein Video dieser Person zurück, die das Audio spricht — Lippen, Mimik, Kopfbewegung und Handgesten folgen alle dem Ton. Das zugrunde liegende Forschungspapier wurde im August 2025 veröffentlicht.

2

Kann der Avatar meine exakten Wörter sagen?

Ja — das ist der Unterschied zu prompt-gesteuerten Videomodellen. Sie liefern den Soundtrack, entweder als mp3/wav-Upload oder indem Sie das Skript tippen und eine eingebaute Stimme wählen, und der Avatar synchronisiert die Lippen Wort für Wort dazu. Prompt-gesteuerte Modelle erzeugen ihre eigenen Stimmen und sagen selten genau das, was Sie geschrieben haben.

3

Ist OmniHuman 1.5 kostenlos nutzbar?

Nein — es rechnet mit 130 Credits pro Sekunde Audio ab, aufgerundet, ein 10-Sekunden-Clip kostet also 1.300 Credits. Die genauen Kosten werden vor dem Generieren angezeigt, und fehlgeschlagene Läufe werden automatisch erstattet. Halten Sie Skripte knapp und schneiden Sie Stille heraus: Jede Sekunde Audio ist eine Sekunde, die Sie bezahlen.

4

Was macht ein gutes Quellfoto aus?

Frontal, bis zur Hüfte, eine Person, mit großem, gleichmäßig beleuchtetem und unverdecktem Gesicht — Reviewer und unsere eigenen Tests sind sich einig. Unser absichtlicher Dreiviertelprofil-Test oben zeigt, was sonst passiert: Die Lippen artikulieren kaum, das Modell dreht den Kopf langsam weiter weg, und auf dem Schreibtisch erscheinen Objekte, die nie auf dem Foto waren. Generierte Porträts funktionieren genauso gut wie Kamerafotos.

5

Funktioniert es mit Illustrationen oder Anime-Figuren?

Ja — unser Bilderbuch-Test oben ist eine flache 2D-Illustration, und OmniHuman 1.5 hat sie überzeugend animiert und dabei den Zeichenstil behalten: Augen, Brauen und Mund bewegen sich wie bei einer handanimierten Figur. Eine Eigenart, die uns aufgefallen ist: Wenn der Mund weit aufgeht, zeichnet das Modell für eine flache Illustration überraschend realistische Zähne. ByteDances Papier behauptet auch nicht-menschliche Motive; wir haben nur diese illustrierte Figur getestet.

6

Wie lang kann ein Clip sein, und wie lange dauert die Generierung?

Bis zu 35 Sekunden Audio pro Clip auf dieser Plattform — längere Skripte müssen aufgeteilt und zusammengefügt werden. In unserem Test im August 2026 kamen angenommene Aufträge für rund 10 Sekunden Audio in 3 min 20 s bis 4 min 42 s zurück. Ein Vorbehalt vom selben Abend: Unter hoher Last lehnte der Upstream mehrere Einreichungen mit Kapazitätsfehlern ab, bevor er den Auftrag annahm. Abgelehnte Läufe kosten nichts, aber rechnen Sie zu Stoßzeiten mit Wiederholungen statt mit einer Deadline in fünf Minuten.

7

Worin ist OmniHuman 1.5 schlecht?

Vor allem in nicht-frontalen Gesichtern: Unser Dreiviertelprofil-Test zeigt nahezu unbewegte Lippen, einen Kopf, der weiter von der Kamera wegdriftet, und Schreibtischobjekte, die nie auf dem Foto waren. Kleine Identitätsdetails können mitten im Clip wandern — in diesem Test änderte ein Ohrring seine Form, und in zwei anderen liest sich die Lippenfarbe etwas kräftiger als in der Eingabe. Dialoge mit mehreren Personen sind hier nicht verfügbar, die Ausgabeauflösung ist bescheiden (1248×1664 in unseren Porträttests — kein 4K), und es macht nur Sprechvideo: Für Handlung, Kamerabewegung oder Szenenwechsel nehmen Sie Seedance 2.5 oder Kling 3.0 Turbo.

8

Darf ich die Videos kommerziell nutzen — und wessen Gesicht darf ich verwenden?

Videos, die Sie erzeugen, dürfen im Rahmen unserer Nutzungsbedingungen in privaten und kommerziellen Projekten verwendet werden. Das Gesicht ist der Teil, den man ernst nehmen muss: Das Foto einer echten Person ohne deren Einwilligung zu animieren, kann Persönlichkeits- und Bildnisrechte verletzen, und mehrere Rechtsräume verlangen inzwischen eine Kennzeichnung synthetischer Vortragender. Generierte Gesichter — wie jedes Gesicht auf dieser Seite — umgehen das Einwilligungsproblem vollständig.

Geben Sie einem Foto etwas zu sagen

Beginne mit dem Generieren von Videos

Preise & Zugang — die FaktenOmniHuman 1.5

Modell
OmniHuman 1.5
Entwickler
ByteDance
Zugang
Läuft im CreateVision-AI-Workspace über API — anmelden und generieren. Kein API-Schlüssel, kein Cloud-Projekt, keine Installation.
Preis pro Generierung
Ab 650 Credits ≈ $2.36 pro 5-Sekunden-Clip im Premium-Tarif ($29/Monat für 8,000 Credits). Der Gratis-Tarif enthält täglich 80 Credits.
Datenschutz
Standardmäßig privat — kein anderer Nutzer kann Ihre Generierungen sehen, in keinem Tarif. Wir verkaufen oder missbrauchen keine Mitgliederdaten. Datenschutzerklärung

NeuigkeitenOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.