OmniHuman 1.5 Generatore di avatar parlanti AI

Dai a OmniHuman 1.5 un ritratto e una traccia vocale, e restituisce un video di quella persona che dice le tue parole esatte — labbra, espressioni e gesti seguono il suono.

0 / 2,000
130 cr/s · ≤35s

Cos'è OmniHuman 1.5?

OmniHuman 1.5 è il modello avatar guidato dall'audio di ByteDance: dagli un ritratto e una traccia vocale, e restituisce un video di quella persona che pronuncia il tuo audio — labbra, espressioni, movimento della testa e gesti tutti guidati dal suono. A differenza dei modelli video guidati dal prompt, le parole esatte le fornisci tu. Il paper di ricerca abbina un modello linguistico multimodale a un diffusion transformer, quindi la recitazione reagisce a ciò che viene detto invece di limitarsi a seguire la bocca.

La parte onesta: gli serve un ritratto frontale. Il nostro test su un tre quarti di profilo qui sotto mostra labbra che si articolano appena e una testa che si allontana. L'audio è limitato a 35 secondi per esecuzione, quindi i copioni più lunghi vanno spezzati e ricuciti, e il dialogo a più persone — una funzione di punta del paper — qui non è disponibile. È video di parlato, non video di scena: per movimenti di macchina o azione, usa Seedance 2.5 o Kling 3.0 Turbo.

Architettura, posizionamento e numeri dello studio con utenti vengono dal paper di ricerca di ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Cosa dicono i tester

La versione 1.5 dimostra una maggiore robustezza sugli input difficili.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Un ritratto a mezzo busto con mani, spalle e illuminazione naturale ben visibili di solito dà un movimento del corpo migliore.
Z.Tools — OmniHuman-1.5 deep dive
Ombre pesanti, occhiali da sole, occlusioni strane e volti minuscoli rendono il lavoro più difficile.
Z.Tools — OmniHuman-1.5 deep dive

Perché eseguire OmniHuman 1.5 su CreateVision AI?

Il modello è di ByteDance; il motivo per usarlo qui è che gli altri due input — il volto e la voce — vengono dallo stesso spazio di lavoro.

Ritratto di GPT Image 2 usato come volto di input per una clip avatar di OmniHuman 1.5

L'intera catena di input vive in una sola pagina

Una clip con avatar parlante ha bisogno di tre cose: un volto, una voce e il modello. Qui tutte e tre vengono dallo stesso spazio di lavoro — genera il ritratto con GPT Image 2 o Seedream, scrivi il copione e sintetizzalo con una delle 60 voci integrate, poi manda entrambi direttamente a OmniHuman 1.5. Ogni clip di questa pagina è stata fatta esattamente così, dall'inizio alla fine, senza registrare un secondo di audio e senza caricare una sola foto di una persona reale.

Ritratto di input per il caso in mandarino di OmniHuman 1.5 nella sala da tè

Una libreria di voci invece di una cabina di registrazione

La modalità testo non è un ripensamento: 60 voci in inglese, cinese, giapponese, coreano, francese, tedesco, spagnolo, italiano, russo e portoghese, ciascuna con un'anteprima che puoi ascoltare prima di spendere qualcosa. Scrivi fino a 600 caratteri, scegli una voce, e la piattaforma sintetizza il parlato e ci guida l'avatar in una sola esecuzione. La clip in mandarino nella sala da tè qui sopra è esattamente questo percorso — nessun microfono coinvolto.

Ritratto di input per il caso del conduttore di notiziario di OmniHuman 1.5

Un solo abbonamento, e il costo è visibile in anticipo

OmniHuman 1.5 fattura al secondo di audio — 130 crediti al secondo, arrotondati per eccesso — e lo spazio di lavoro mostra il costo esatto della tua clip prima che tu prema genera. Lo stesso piano copre GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling e Veo, quindi il flusso di lavoro sensato è economico: abbozza il ritratto per una manciata di crediti, fissa il copione, e solo allora spendi sui secondi dell'avatar. Taglia i silenzi dall'audio — stai pagando ogni suo secondo.

Ritratto di input a tre quarti di profilo usato per lo stress test di OmniHuman 1.5

Misurato, non promesso — fallimento compreso

Il nostro set di test da sette clip è stato generato il 19 agosto 2026 — un pitch di prodotto, un notiziario, una carica in palestra, un benvenuto in mandarino in una sala da tè, un personaggio da libro di fiabe, un fallimento deliberato su un tre quarti di profilo e un campo lungo su un palco. Ogni lavoro accettato è stato renderizzato con successo al primo tentativo, in un tempo tra 3m 20s e 4m 42s per circa dieci secondi di audio. Pubblichiamo anche quello che è andato storto: in un martedì sera carico il servizio upstream ha rifiutato 13 dei nostri 20 invii con errori di capacità prima di accettarli (le esecuzioni rifiutate vengono rimborsate automaticamente), un lavoro accettato è rimasto in coda per 14 minuti, e la clip di profilo in questa pagina mostra esattamente cosa succede se ignori il consiglio del ritratto frontale.

Clip reali di OmniHuman 1.5 da questo spazio di lavoro

Tutte e 7 le clip qui sotto sono state generate qui il 19 agosto 2026 — ciascuna è il primo render prodotto dai suoi input, senza ritentativi e senza selezione di comodo. I ritratti sono output di GPT Image 2; ogni voce è stata scritta come testo e sintetizzata con la libreria integrata. I lavori accettati sono tornati in un tempo tra 3m 20s e 4m 42s per circa 10 secondi di audio (un caso limite è rimasto in coda 14 minuti); in una serata carica il servizio upstream ha rifiutato diversi invii con errori di capacità prima di accettarli — le esecuzioni rifiutate vengono rimborsate. Audio acceso.

Prompt9,2 s di audio · voce Trustworthy Man · 1.300 crediti · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 s di audio · voce News Anchor · 1.430 crediti · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 s di audio · voce Energetic Guy · 1.430 crediti · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 s di audio · voce Mandarin Sweet Girl · 1.560 crediti · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 s di audio · voce Sweet Girl · 1.300 crediti · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 s di audio · voce Wise Lady · 1.170 crediti · la sincronizzazione labiale degrada visibilmente a questa angolazione

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 s di audio · voce Movie Narrator · 780 crediti · questo fotogramma è lo sfondo della pagina

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Per chi è davvero OmniHuman 1.5

Ognuno di questi punti rimanda a una clip dimostrata qui sopra — non a una lista dei desideri.

  • Chi crea corsi e contenuti esplicativi

    Scrivi la narrazione e ottieni un presentatore sullo schermo — nessuna camera, nessuna luce, nessuna ripresa da rifare. Il limite di 35 secondi per clip corrisponde bene a un concetto per clip, che è comunque il modo in cui monta la maggior parte dei corsi.

  • Marketer UGC e di prodotto

    Il caso del pitch dello speaker qui sopra è tutto il flusso di lavoro: genera un ritratto in stile creator con il tuo prodotto in mano, scrivi il pitch, scegli una voce. Nessun compenso ai talent, e nessuna liberatoria d'immagine da rincorrere — quel volto non è mai esistito.

  • Team di localizzazione

    Lo stesso volto può pronunciare lo stesso messaggio in dieci lingue: tieni il ritratto, cambia la voce. La sincronizzazione labiale segue qualsiasi audio tu fornisca — il caso in mandarino qui sopra ne è la prova.

  • Canali senza volto e presentatori virtuali

    Un personaggio che generi è un personaggio che possiedi. Disegna il volto una volta, dagli una voce coerente dalla libreria, e può presentare ogni episodio — il personaggio illustrato da libro di fiabe qui sopra mostra che non deve nemmeno essere fotorealistico.

  • Podcaster e creator che partono dall'audio

    La parte difficile ce l'hai già: l'audio. Taglia un estratto a 35 secondi, aggiungi un ritratto, e hai una clip visiva per i social senza aprire un editor.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Video di parlato contro video di scena — cosa chiede a te ciascun modello, e cosa ti restituisce in questo spazio di lavoro.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Cosa fornisci tu1 foto di ritratto + il tuo audio, oppure testo scritto e una voce della libreriaUn prompt, più riferimenti opzionali di immagine, video e audioUn prompt, più una immagine di riferimento opzionaleUn prompt oppure un'immagine di partenza
Chi pronuncia le paroleTu — l'avatar sincronizza le labbra sulla tua traccia audio esattaIl modello genera le voci dal promptIl modello genera le voci dal promptL'audio è generato con la clip
Durata della clip quiLa durata del tuo audio, fino a 35 s4–30 s4–8 s3–15 s
Crediti130 per secondo di audio110/s a 480p · 230/s a 720p320–1.920 per clip (4–8 s · 720p–4K · ± audio)55/s a 720p · 70/s a 1080p
Misurato qui~4 min per ~10 s di audio (7 clip, agosto 2026)Non misurato su questo compitoNon misurato su questo compitoNon misurato su questo compito

Crediti, durata e opzioni di input sono letti dal registro modelli di questo spazio di lavoro il 19 agosto 2026 — descrivono quello che ottieni qui, non le specifiche pubblicate dai fornitori. I tempi sono nostre misurazioni sulle clip mostrate qui sopra; non abbiamo fatto passare gli stessi copioni attraverso gli altri tre modelli, quindi quelle celle lo dicono invece di tirare a indovinare.

Altri modelli video come OmniHuman 1.5

Confronta OmniHuman 1.5 con altri modelli video: stessa area di lavoro, un clic per passare da una modalità all'altra.

Specifiche di OmniHuman 1.5 su CreateVision AI

Modelloomnihuman-1.5, di ByteDance (paper di ricerca pubblicato ad agosto 2025)
ModalitàAvatar parlante: una foto + una traccia audio → video parlante, nello spazio di lavoro avatar di questa pagina
InputEsattamente 1 immagine di ritratto, più audio fino a 35 secondi (caricamento mp3/wav) — oppure testo scritto fino a 600 caratteri, sintetizzato in parlato
Libreria di voci60 voci integrate in 10 lingue: inglese, cinese, giapponese, coreano, francese, tedesco, spagnolo, italiano, russo, portoghese
Indicazioni opzionaliUna breve nota di regia per azioni, emozione e macchina — utile, mai obbligatoria
OutputUna sola inquadratura continua che mantiene l'inquadratura della tua foto; la durata della clip è pari alla durata dell'audio. Output misurato: 1248×1664 da una foto 2:3, 1920×1088 da un 16:9, 25 fps, H.264 con audio AAC mono
Crediti130 per secondo di audio, arrotondati per eccesso — 130 minimo, 4.550 ai 35 secondi pieni; il costo esatto è mostrato prima di generare
Velocità misurata3m 20s–4m 42s per lavoro accettato per ~10 s di audio nel nostro test da 7 clip; un caso limite è rimasto in coda 14 minuti (agosto 2026, un martedì sera carico)

Come creare un avatar parlante da una foto

Inizia a generare video
  1. Aggiungi il volto

    Carica un ritratto nitido, frontale, a mezzo busto — oppure generane uno con GPT Image 2 o Seedream in questo stesso spazio di lavoro, che è come è stato fatto ogni volto di questa pagina. Una persona per foto; tieni il volto grande e non coperto.

  2. Dagli una voce

    Carica una clip audio (mp3 o wav, fino a 35 secondi), oppure passa alla modalità testo: scrivi fino a 600 caratteri e scegli una delle 60 voci in 10 lingue, ciascuna con un'anteprima che puoi ascoltare prima.

  3. Dirigi la recitazione, se vuoi

    Una breve nota come «calmo, piccoli cenni del capo, sorriso accennato» orienta gesti ed emozione. Lasciala vuota e il modello legge da solo il ritmo e il senso dell'audio.

  4. Genera e controlla la sincronizzazione

    Il costo esatto in crediti compare prima di eseguire — cresce con la durata dell'audio. La generazione è asincrona; la clip atterra nella tua cronologia con ogni input allegato, quindi una configurazione che funziona è riproducibile la settimana prossima.

Oltre OmniHuman 1.5

Un solo account, l'intero flusso di generazione di immagini e video.

Letture correlate

OmniHuman 1.5: prezzi e crediti giornalieri gratuiti

Usa OmniHuman 1.5 con i crediti giornalieri del piano gratuito, oppure passa a un piano superiore per modelli premium, generazione più veloce e output 4K.

Gratis

$0

Perfetto per iniziare

  • 200 crediti di benvenuto, fino a 80/giorno
  • Z Image Turbo crea bozze a 0 crediti
  • Velocità di generazione standard
  • Cronologia delle generazioni inclusa
Inizia

Premium

Più popolare
$29/month

Fatturazione annuale · 240 $/anno

  • 8.000 crediti/mese, nessun limite giornaliero
  • Tutti i modelli premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Velocità di generazione 5x, coda prioritaria
  • Ottimizzazione dei prompt con IA
Passa a Premium

Ultimate

$49/month

Fatturazione annuale · 380 $/anno

  • 18.000 crediti/mese, nessun limite giornaliero
  • Generazione HD fino alla risoluzione 4K
  • Supporto prioritario
  • Coda più rapida e accesso anticipato ai nuovi modelli
Passa a Ultimate

OmniHuman 1.5 — domande frequenti

1

Cos'è OmniHuman 1.5?

Il modello avatar guidato dall'audio di ByteDance. Prende una foto di ritratto e una traccia audio e restituisce un video di quella persona che pronuncia l'audio — labbra, espressioni, movimento della testa e gesti delle mani seguono tutti il suono. Il paper di ricerca che c'è dietro è stato pubblicato ad agosto 2025.

2

L'avatar può dire le mie parole esatte?

Sì — è questa la differenza rispetto ai modelli video guidati dal prompt. La colonna sonora la fornisci tu, o caricando un mp3/wav o scrivendo il copione e scegliendo una voce integrata, e l'avatar ci sincronizza le labbra parola per parola. I modelli guidati dal prompt generano voci proprie e raramente dicono esattamente quello che hai scritto.

3

OmniHuman 1.5 è gratuito?

No — fattura 130 crediti per secondo di audio, arrotondati per eccesso, quindi una clip da 10 secondi costa 1.300 crediti. Il costo esatto è mostrato prima di generare, e le esecuzioni fallite vengono rimborsate automaticamente. Tieni i copioni stretti e taglia i silenzi: ogni secondo di audio è un secondo che paghi.

4

Quali sono le caratteristiche di una buona foto di origine?

Frontale, a mezzo busto, una sola persona, con il volto grande, illuminato in modo uniforme e non coperto — i recensori e i nostri test concordano. Il nostro test deliberato su un tre quarti di profilo qui sopra mostra cosa succede altrimenti: le labbra si articolano appena, il modello ruota lentamente la testa sempre più lontano, e sulla scrivania compaiono oggetti che nella foto non c'erano mai stati. I ritratti generati funzionano esattamente come le foto scattate con una fotocamera.

5

Funziona con illustrazioni o personaggi anime?

Sì — il nostro test del libro di fiabe qui sopra è un'illustrazione 2D piatta, e OmniHuman 1.5 l'ha animata in modo convincente mantenendo lo stile grafico: occhi, sopracciglia e bocca si muovono come in un personaggio animato a mano. Una stranezza che abbiamo osservato: quando la bocca si apre molto, il modello disegna denti sorprendentemente realistici per un'illustrazione piatta. Il paper di ByteDance dichiara anche soggetti non umani; noi abbiamo testato solo questo personaggio illustrato.

6

Quanto può durare una clip, e quanto ci mette la generazione?

Fino a 35 secondi di audio per clip su questa piattaforma — i copioni più lunghi vanno spezzati e ricuciti. Nel nostro test di agosto 2026 i lavori accettati sono tornati in un tempo tra 3m 20s e 4m 42s per circa 10 secondi di audio. Un'avvertenza dalla stessa serata: sotto carico pesante il servizio upstream ha rifiutato diversi invii con errori di capacità prima di accettare il lavoro. Le esecuzioni rifiutate non costano nulla, ma metti in conto dei ritentativi nelle ore di punta invece di una scadenza a cinque minuti.

7

In cosa OmniHuman 1.5 è scarso?

I volti non frontali, prima di tutto: il nostro test a tre quarti di profilo mostra labbra quasi immobili, una testa che si allontana sempre più dalla camera e oggetti sulla scrivania che nella foto non c'erano mai stati. Piccoli dettagli dell'identità possono vagare a metà clip — in quel test un orecchino ha cambiato forma, e in altri due il colore delle labbra risulta un po' più acceso rispetto all'input. Il dialogo a più persone qui non è disponibile, la risoluzione di output è modesta (1248×1664 nei nostri test in verticale — niente 4K), e fa solo video di parlato: per azione, movimenti di macchina o cambi di scena, usa Seedance 2.5 o Kling 3.0 Turbo.

8

Posso usare i video commercialmente — e di chi posso usare il volto?

I video che generi possono essere usati in progetti personali e commerciali secondo i nostri termini di servizio. Il volto è la parte da prendere sul serio: animare la foto di una persona reale senza il suo consenso può violare i diritti di immagine e di pubblicità, e diverse giurisdizioni ora richiedono di dichiarare i presentatori sintetici. I volti generati — come ogni volto di questa pagina — evitano del tutto il problema del consenso.

Dai a una foto qualcosa da dire

Inizia a generare video

Prezzi e accesso — i fattiOmniHuman 1.5

Modello
OmniHuman 1.5
Sviluppatore
ByteDance
Accesso
Funziona nell'area di lavoro di CreateVision AI tramite API: accedi e genera. Nessuna chiave API, nessun progetto cloud, nessuna installazione.
Prezzo per generazione
Da 650 crediti ≈ $2.36 per clip da 5 secondi con il piano Premium ($29/mese per 8,000 crediti). Il piano gratuito include 80 crediti al giorno.
Privacy
Privato per impostazione predefinita: nessun altro utente può vedere le tue generazioni, con qualsiasi piano. Non vendiamo né usiamo impropriamente i dati dei membri. Informativa sulla privacy

NovitàOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.