Penjana Avatar Bercakap AI OmniHuman 1.5

Beri OmniHuman 1.5 satu potret dan satu trek suara, dan ia memulangkan video orang itu menuturkan perkataan tepat anda — bibir, riak wajah dan isyarat mengikut bunyi.

0 / 2,000
130 cr/s · ≤35s

Apakah itu OmniHuman 1.5?

OmniHuman 1.5 ialah model avatar dipacu audio daripada ByteDance: beri ia satu potret dan satu trek suara, dan ia memulangkan video orang itu menuturkan audio anda — bibir, riak wajah, gerakan kepala dan isyarat tangan semuanya dipacu oleh bunyi. Tidak seperti model video yang dipacu gesaan, andalah yang membekalkan perkataan yang tepat. Kertas penyelidikannya menggandingkan model bahasa multimodal dengan pengubah resapan, jadi lakonannya bertindak balas kepada apa yang sedang dituturkan dan bukan sekadar menjejak mulut.

Bahagian yang jujur: ia perlukan potret hadapan. Ujian profil tiga suku kami di bawah menunjukkan bibir yang hampir tidak berartikulasi dan kepala yang hanyut menjauh. Audio dihadkan pada 35 saat setiap larian, jadi skrip yang lebih panjang bermakna memecah dan mencantum, dan dialog berbilang orang — satu ciri utama dalam kertas itu — tidak tersedia di sini. Ia video pertuturan, bukan video adegan: untuk pergerakan kamera atau aksi, gunakan Seedance 2.5 atau Kling 3.0 Turbo.

Seni bina, kedudukan dan angka kajian pengguna adalah daripada kertas penyelidikan ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Apa kata penguji

Versi 1.5 menunjukkan keteguhan yang lebih baik untuk input yang mencabar.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Potret separuh badan dengan tangan, bahu yang jelas dan pencahayaan semula jadi biasanya memberikan pergerakan badan yang lebih baik.
Z.Tools — OmniHuman-1.5 deep dive
Bayang yang tebal, cermin mata hitam, halangan yang pelik, dan wajah yang terlalu kecil menjadikan kerjanya lebih sukar.
Z.Tools — OmniHuman-1.5 deep dive

Mengapa menjalankan OmniHuman 1.5 di CreateVision AI?

Modelnya milik ByteDance; sebab menggunakannya di sini ialah kerana dua input yang lain — wajah dan suara — datang daripada ruang kerja yang sama.

Potret GPT Image 2 yang digunakan sebagai wajah input untuk klip avatar OmniHuman 1.5

Keseluruhan rantaian input hidup pada satu halaman

Satu klip avatar bercakap perlukan tiga perkara: satu wajah, satu suara, dan modelnya. Di sini ketiga-tiganya datang daripada ruang kerja yang sama — jana potret dengan GPT Image 2 atau Seedream, taip skrip dan sintesiskannya dengan salah satu daripada 60 suara terbina dalam, kemudian suapkan kedua-duanya terus ke dalam OmniHuman 1.5. Setiap klip pada halaman ini dibuat tepat begitu, dari mula hingga akhir, tanpa merakam satu saat audio pun atau memuat naik satu foto orang sebenar pun.

Potret input untuk kes kedai teh OmniHuman 1.5 yang bertutur Mandarin

Pustaka suara dan bukan bilik rakaman

Mod teks bukan sekadar tambahan: 60 suara merentas bahasa Inggeris, Cina, Jepun, Korea, Perancis, Jerman, Sepanyol, Itali, Rusia dan Portugis, setiap satu dengan pratonton yang boleh anda mainkan sebelum membelanjakan apa-apa. Taip sehingga 600 aksara, pilih satu suara, dan platform mensintesis pertuturan itu dan memacu avatar dengannya dalam satu larian. Klip kedai teh Mandarin di atas ialah tepat laluan ini — tiada mikrofon terlibat.

Potret input untuk kes penyampai berita OmniHuman 1.5

Satu langganan, dan kosnya kelihatan di awal

OmniHuman 1.5 membil mengikut saat audio — 130 kredit sesaat, dibundarkan ke atas — dan ruang kerja memaparkan kos tepat klip anda sebelum anda menekan jana. Pelan yang sama merangkumi GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling dan Veo, jadi aliran kerja yang munasabah adalah murah: buat draf potret dengan beberapa kredit, tetapkan skrip, dan barulah membelanja pada saat avatar. Pangkas senyap daripada audio anda — anda membayar untuk setiap saatnya.

Potret input profil tiga suku yang digunakan untuk ujian tekanan OmniHuman 1.5

Diukur, bukan dijanjikan — termasuk kegagalannya

Set ujian tujuh klip kami dijana pada 19 Ogos 2026 — satu promosi produk, satu berita ringkas, satu ucapan semangat gim, satu ucapan selamat datang kedai teh Mandarin, satu watak buku cerita, satu kegagalan profil tiga suku yang disengajakan, dan satu syot pentas lebar. Setiap tugas yang diterima berjaya dirender pada ambilan pertama, dalam 3m 20s hingga 4m 42s untuk kira-kira sepuluh saat audio. Kami juga menerbitkan apa yang tidak menjadi: pada satu petang Selasa yang sibuk, huluan menolak 13 daripada 20 penyerahan kami dengan ralat kapasiti sebelum menerimanya (larian yang ditolak dibayar balik secara automatik), satu tugas yang diterima beratur selama 14 minit, dan klip profil pada halaman ini menunjukkan dengan tepat apa yang berlaku apabila anda mengabaikan nasihat potret hadapan.

Klip OmniHuman 1.5 sebenar daripada ruang kerja ini

Kesemua 7 klip di bawah dijana di sini pada 19 Ogos 2026 — setiap satu ialah render pertama yang dihasilkan inputnya, tiada ambilan semula dan tiada pemilihan hasil terbaik. Potretnya ialah output GPT Image 2; setiap suara ditaip sebagai teks dan disintesis dengan pustaka terbina dalam. Tugas yang diterima kembali dalam 3m 20s hingga 4m 42s untuk kira-kira 10 saat audio (satu kes terpencil beratur 14 minit); pada petang yang sibuk, huluan menolak beberapa penyerahan dengan ralat kapasiti sebelum menerimanya — larian yang ditolak dibayar balik. Pasang bunyi.

GesaanAudio 9.2 s · suara Trustworthy Man · 1,300 kredit · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

GesaanAudio 10.2 s · suara News Anchor · 1,430 kredit · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

GesaanAudio 10.7 s · suara Energetic Guy · 1,430 kredit · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

GesaanAudio 11.8 s · suara Mandarin Sweet Girl · 1,560 kredit · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

GesaanAudio 9.7 s · suara Sweet Girl · 1,300 kredit · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

GesaanAudio 8.6 s · suara Wise Lady · 1,170 kredit · segerak bibir jelas merosot pada sudut ini

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

GesaanAudio 5.4 s · suara Movie Narrator · 780 kredit · bingkai ini ialah latar belakang halaman

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Untuk siapa OmniHuman 1.5 ini sebenarnya

Setiap satu daripada ini merujuk kepada klip yang ditunjukkan di atas — bukan senarai hajat.

  • Pencipta kursus dan penerangan

    Taip naratifnya dan dapatkan seorang penyampai di skrin — tiada kamera, pencahayaan atau rakaman semula. Had 35 saat setiap klip sepadan kemas dengan satu konsep setiap klip, dan itulah cara kebanyakan penyunting kursus memotong.

  • Pemasar UGC dan produk

    Kes promosi pembesar suara di atas ialah keseluruhan aliran kerjanya: jana potret bergaya pencipta yang memegang produk anda, taip promosinya, pilih satu suara. Tiada bayaran bakat, dan tiada pelepasan rupa diri untuk dikejar — wajah itu tidak pernah wujud.

  • Pasukan penyetempatan

    Wajah yang sama boleh menyampaikan mesej yang sama dalam sepuluh bahasa: kekalkan potret itu, tukar suaranya. Segerak bibir mengikut apa jua audio yang anda bekalkan — kes Mandarin di atas ialah buktinya.

  • Saluran tanpa wajah dan hos maya

    Persona yang anda jana ialah persona yang anda miliki. Reka wajah itu sekali, beri ia suara pustaka yang konsisten, dan ia boleh mengetuai setiap episod — watak buku cerita berilustrasi di atas menunjukkan ia tidak perlu pun fotoreal.

  • Podcaster dan pencipta mengutamakan audio

    Anda sudah ada bahagian yang sukar: audionya. Pangkas satu sorotan kepada 35 saat, tambah satu potret, dan anda mempunyai klip visual untuk media sosial tanpa membuka penyunting.

OmniHuman 1.5 lawan Seedance 2.5 lawan Veo 3.1 Pro lawan Kling 3.0 Turbo

Video pertuturan berbanding video adegan — apa yang setiap model perlukan daripada anda, dan apa yang ia pulangkan dalam ruang kerja ini.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Apa yang anda bekalkan1 foto potret + audio anda, atau teks yang ditaip dan satu suara pustakaSatu gesaan, tambah rujukan imej, video dan audio yang bersifat pilihanSatu gesaan, tambah satu imej rujukan yang bersifat pilihanSatu gesaan atau satu imej permulaan
Siapa yang menuturkan perkataan ituAnda — avatar menyegerakkan bibir dengan runut bunyi tepat andaModel menjana suara daripada gesaanModel menjana suara daripada gesaanAudio dijana bersama klip
Panjang klip di siniPanjang audio anda, sehingga 35 s4–30 s4–8 s3–15 s
Kredit130 setiap saat audio110/s pada 480p · 230/s pada 720p320–1,920 setiap klip (4–8 s · 720p–4K · ± audio)55/s pada 720p · 70/s pada 1080p
Diukur di sini~4 min untuk ~10 s audio (7 klip, Ogos 2026)Tidak diukur pada tugas iniTidak diukur pada tugas iniTidak diukur pada tugas ini

Kredit, tempoh dan pilihan input dibaca daripada registri model ruang kerja ini sendiri pada 19 Ogos 2026 — ia menerangkan apa yang anda dapat di sini, bukan spesifikasi yang diterbitkan vendor. Masa ialah ukuran kami sendiri pada klip yang ditunjukkan di atas; kami belum menjalankan skrip yang sama melalui tiga model yang lain, jadi sel tersebut menyatakan sedemikian dan bukan meneka.

Model Video Lain Seperti OmniHuman 1.5

Bandingkan OmniHuman 1.5 dengan model video lain — ruang kerja yang sama, satu klik untuk bertukar.

Spesifikasi OmniHuman 1.5 di CreateVision AI

Modelomnihuman-1.5, oleh ByteDance (kertas penyelidikan diterbitkan Ogos 2025)
ModAvatar bercakap: satu foto + satu trek audio → video bertutur, dalam ruang kerja avatar pada halaman ini
InputTepat 1 imej potret, tambah audio sehingga 35 saat (muat naik mp3/wav) — atau teks yang ditaip sehingga 600 aksara, disintesis menjadi pertuturan
Pustaka suara60 suara terbina dalam merentas 10 bahasa: Inggeris, Cina, Jepun, Korea, Perancis, Jerman, Sepanyol, Itali, Rusia, Portugis
Panduan pilihanSatu nota lakonan ringkas untuk aksi, emosi dan kamera — berguna, tidak pernah diwajibkan
OutputSatu ambilan berterusan yang mengekalkan bingkai foto anda; panjang klip sama dengan panjang audio. Output yang diukur: 1248×1664 daripada foto 2:3, 1920×1088 daripada 16:9, 25 fps, H.264 dengan audio AAC mono
Kredit130 setiap saat audio, dibundarkan ke atas — minimum 130, 4,550 pada 35 saat penuh; kos tepat dipaparkan sebelum anda menjana
Kelajuan terukur3m 20s–4m 42s setiap tugas yang diterima untuk ~10 s audio dalam ujian 7 klip kami; satu kes terpencil beratur 14 minit (Ogos 2026, satu petang Selasa yang sibuk)

Cara membuat avatar bercakap daripada sekeping foto

Mula Menjana Video
  1. Tambah wajahnya

    Muat naik potret separuh badan yang jelas dan menghadap depan — atau jana satu dengan GPT Image 2 atau Seedream dalam ruang kerja yang sama ini, dan itulah cara setiap wajah pada halaman ini dibuat. Satu orang setiap foto; kekalkan wajah itu besar dan tidak terhalang.

  2. Beri ia suara

    Muat naik klip audio (mp3 atau wav, sehingga 35 saat), atau tukar ke mod teks: taip sehingga 600 aksara dan pilih satu daripada 60 suara dalam 10 bahasa, setiap satu dengan pratonton yang boleh anda mainkan dahulu.

  3. Arahkan lakonannya jika mahu

    Nota ringkas seperti "tenang, anggukan kecil, senyuman halus" mengemudi isyarat dan emosi. Biarkan kosong dan model membaca rentak serta makna audio itu dengan sendirinya.

  4. Jana dan periksa penyegerakannya

    Kos kredit tepat muncul sebelum anda menjalankannya — ia berskala dengan panjang audio. Penjanaan bersifat tak segerak; klip mendarat dalam sejarah anda dengan setiap input dilampirkan, jadi persediaan yang berkesan boleh dihasilkan semula minggu depan.

Lebih Daripada OmniHuman 1.5

Satu akaun, aliran kerja penjanaan imej dan video yang lengkap.

Bacaan berkaitan

Harga OmniHuman 1.5 dan Kredit Harian Percuma

Jalankan OmniHuman 1.5 dengan kredit harian pelan percuma, atau naik taraf untuk model premium, penjanaan lebih pantas, dan output 4K.

Percuma

$0

Sesuai untuk bermula

  • 200 kredit alu-aluan, sehingga 80/hari
  • Z Image Turbo mendraf pada 0 kredit
  • Kelajuan penjanaan standard
  • Sejarah penjanaan disertakan
Mulakan

Premium

Paling popular
$29/month

Dikenakan bil setiap tahun · $240/tahun

  • 8,000 kredit/bulan, tiada had harian
  • Semua model premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Kelajuan penjanaan 5x, baris gilir keutamaan
  • Penambahbaikan gesaan AI
Naik taraf ke Premium

Ultimate

$49/month

Dikenakan bil setiap tahun · $380/tahun

  • 18,000 kredit/bulan, tiada had harian
  • Penjanaan HD sehingga resolusi 4K
  • Sokongan keutamaan
  • Baris gilir terpantas dan akses awal kepada model baharu
Naik taraf ke Ultimate

OmniHuman 1.5 — Soalan Lazim

1

Apakah itu OmniHuman 1.5?

Model avatar dipacu audio daripada ByteDance. Ia mengambil satu foto potret dan satu trek audio dan memulangkan video orang itu menuturkan audio tersebut — bibir, riak wajah, gerakan kepala dan isyarat tangan semuanya mengikut bunyi. Kertas penyelidikan di sebaliknya diterbitkan pada Ogos 2025.

2

Bolehkah avatar itu menuturkan perkataan tepat saya?

Ya — itulah bezanya daripada model video yang dipacu gesaan. Anda membekalkan runut bunyinya, sama ada sebagai muat naik mp3/wav atau dengan menaip skrip dan memilih suara terbina dalam, dan avatar menyegerakkan bibir dengannya perkataan demi perkataan. Model yang dipacu gesaan menjana suaranya sendiri dan jarang menuturkan tepat apa yang anda tulis.

3

Adakah OmniHuman 1.5 percuma digunakan?

Tidak — ia membil pada 130 kredit setiap saat audio, dibundarkan ke atas, jadi klip 10 saat ialah 1,300 kredit. Kos tepat dipaparkan sebelum anda menjana, dan larian yang gagal dibayar balik secara automatik. Kekalkan skrip yang padat dan pangkas senyap: setiap saat audio ialah satu saat yang anda bayar.

4

Apakah yang menjadikan foto sumber yang baik?

Menghadap depan, separuh badan, satu orang, dengan wajah yang besar, bercahaya sekata dan tidak terhalang — pengulas dan ujian kami sendiri bersetuju. Ujian profil tiga suku kami yang disengajakan di atas menunjukkan apa yang berlaku jika tidak: bibir hampir tidak berartikulasi, model perlahan-lahan memutarkan kepala itu semakin menjauh, dan objek muncul di atas meja yang tidak pernah ada dalam foto. Potret yang dijana berfungsi sama baiknya dengan foto kamera.

5

Adakah ia berfungsi dengan ilustrasi atau watak anime?

Ya — ujian buku cerita kami di atas ialah ilustrasi 2D rata, dan OmniHuman 1.5 menganimasikannya dengan meyakinkan sambil mengekalkan gaya seninya: mata, kening dan mulut bergerak seperti watak animasi lukisan tangan. Satu keanehan yang kami perhatikan: apabila mulut terbuka luas, model melukis gigi yang mengejutkan realistiknya bagi satu ilustrasi rata. Kertas ByteDance turut mendakwa subjek bukan manusia; kami hanya menguji watak berilustrasi ini.

6

Berapa panjang boleh satu klip, dan berapa lama penjanaan mengambil masa?

Sehingga 35 saat audio setiap klip pada platform ini — skrip yang lebih panjang perlu dipecah dan dicantum. Dalam ujian Ogos 2026 kami, tugas yang diterima kembali dalam 3m 20s hingga 4m 42s untuk kira-kira 10 saat audio. Satu kaveat daripada petang yang sama: di bawah beban berat, huluan menolak beberapa penyerahan dengan ralat kapasiti sebelum menerima tugas itu. Larian yang ditolak tidak berkos apa-apa, tetapi rancanglah untuk percubaan semula pada waktu puncak dan bukan tarikh akhir lima minit lagi.

7

Apa kelemahan OmniHuman 1.5?

Wajah bukan hadapan, di atas segalanya: ujian profil tiga suku kami menunjukkan bibir yang hampir statik, kepala yang hanyut semakin jauh daripada kamera, dan objek di atas meja yang tidak pernah ada dalam foto. Butiran identiti kecil boleh merayau di pertengahan klip — satu subang bertukar bentuk dalam ujian itu, dan warna bibir terbaca sedikit lebih kuat daripada input dalam dua yang lain. Dialog berbilang orang tidak tersedia di sini, resolusi outputnya sederhana (1248×1664 dalam ujian potret kami — tiada 4K), dan ia hanya membuat video pertuturan: untuk aksi, pergerakan kamera atau perubahan adegan, gunakan Seedance 2.5 atau Kling 3.0 Turbo.

8

Bolehkah saya menggunakan videonya secara komersial — dan wajah siapa boleh saya guna?

Video yang anda jana boleh digunakan dalam projek peribadi dan komersial di bawah terma perkhidmatan kami. Wajah ialah bahagian yang perlu diambil serius: menganimasikan foto orang sebenar tanpa kebenaran mereka boleh melanggar hak rupa diri dan hak publisiti, dan beberapa bidang kuasa kini menuntut pendedahan penyampai sintetik. Wajah yang dijana — seperti setiap wajah pada halaman ini — mengelakkan masalah kebenaran itu sepenuhnya.

Beri sekeping foto sesuatu untuk dituturkan

Mula Menjana Video

Harga & Akses — FaktaOmniHuman 1.5

Model
OmniHuman 1.5
Pembangun
ByteDance
Akses
Berjalan dalam ruang kerja CreateVision AI melalui API — log masuk dan jana. Tiada kunci API, tiada projek awan, tiada pemasangan.
Harga setiap penjanaan
Dari 650 kredit ≈ $2.36 setiap klip 5 saat dengan pelan Premium ($29/bulan untuk 8,000 kredit). Pelan percuma merangkumi 80 kredit setiap hari.
Privasi
Peribadi secara lalai — tiada pengguna lain boleh melihat hasil janaan anda, dalam mana-mana pelan. Kami tidak menjual atau menyalahgunakan data ahli. Dasar Privasi

Apa yang baharuOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.