Generator Avatar Bicara AI OmniHuman 1.5

Beri OmniHuman 1.5 satu potret dan satu trek suara, dan ia mengembalikan video orang itu mengucapkan kata-kata persis Anda — bibir, ekspresi, dan gestur mengikuti suaranya.

0 / 2,000
130 cr/s · ≤35s

Apa itu OmniHuman 1.5?

OmniHuman 1.5 adalah model avatar berbasis audio milik ByteDance: beri ia satu potret dan satu trek suara, dan ia mengembalikan video orang itu yang mengucapkan audio Anda — bibir, ekspresi, gerak kepala, dan gestur semuanya digerakkan oleh suaranya. Tidak seperti model video yang digerakkan prompt, Anda yang menyediakan kata-kata persisnya. Makalah risetnya memasangkan model bahasa multimodal dengan diffusion transformer, sehingga pertunjukannya bereaksi terhadap apa yang sedang diucapkan alih-alih sekadar melacak mulut.

Bagian jujurnya: ia butuh potret menghadap depan. Uji profil tiga perempat kami di bawah menunjukkan bibir yang nyaris tidak berartikulasi dan kepala yang menjauh. Audio dibatasi 35 detik per proses, jadi naskah yang lebih panjang berarti memecah dan menyambung, dan dialog banyak orang — fitur utama makalahnya — tidak tersedia di sini. Ia video ucapan, bukan video adegan: untuk gerak kamera atau aksi, pakai Seedance 2.5 atau Kling 3.0 Turbo.

Arsitektur, pemosisian, dan angka studi pengguna berasal dari makalah riset ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Kata para penguji

Versi 1.5 menunjukkan ketangguhan yang lebih baik untuk masukan yang sulit.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Potret setengah badan dengan tangan, bahu, dan pencahayaan alami yang jelas biasanya memberi gerak tubuh yang lebih baik.
Z.Tools — OmniHuman-1.5 deep dive
Bayangan pekat, kacamata hitam, halangan aneh, dan wajah yang terlalu kecil membuat pekerjaannya lebih sulit.
Z.Tools — OmniHuman-1.5 deep dive

Mengapa menjalankan OmniHuman 1.5 di CreateVision AI?

Modelnya milik ByteDance; alasan memakainya di sini adalah karena dua masukan lainnya — wajah dan suaranya — berasal dari ruang kerja yang sama.

Potret GPT Image 2 yang dipakai sebagai wajah masukan untuk klip avatar OmniHuman 1.5

Seluruh rantai masukan ada di satu halaman

Sebuah klip avatar bicara butuh tiga hal: wajah, suara, dan modelnya. Di sini ketiganya berasal dari ruang kerja yang sama — hasilkan potretnya dengan GPT Image 2 atau Seedream, ketik naskahnya dan sintesis dengan salah satu dari 60 suara bawaan, lalu umpankan keduanya langsung ke OmniHuman 1.5. Setiap klip di halaman ini dibuat persis dengan cara itu, dari awal sampai akhir, tanpa merekam satu detik audio pun dan tanpa mengunggah satu foto pun dari orang sungguhan.

Potret masukan untuk kasus kedai teh OmniHuman 1.5 berbahasa Mandarin

Pustaka suara alih-alih bilik rekaman

Mode teks bukan sekadar tambahan: 60 suara dalam bahasa Inggris, Mandarin, Jepang, Korea, Prancis, Jerman, Spanyol, Italia, Rusia, dan Portugis, masing-masing dengan pratinjau yang bisa Anda putar sebelum mengeluarkan biaya. Ketik hingga 600 karakter, pilih suara, dan platform mensintesis ucapannya lalu menggerakkan avatarnya dengan itu dalam satu proses. Klip kedai teh berbahasa Mandarin di atas adalah persis jalur ini — tanpa mikrofon sama sekali.

Potret masukan untuk kasus pembaca berita OmniHuman 1.5

Satu langganan, dan biayanya terlihat di muka

OmniHuman 1.5 menagih per detik audio — 130 kredit per detik, dibulatkan ke atas — dan ruang kerja menampilkan biaya persis klip Anda sebelum Anda menekan generate. Paket yang sama mencakup GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling, dan Veo, jadi alur kerja yang masuk akal itu murah: buat draf potretnya dengan beberapa kredit, kunci naskahnya, lalu barulah keluarkan biaya untuk detik-detik avatarnya. Pangkas keheningan dari audio Anda — Anda membayar setiap detiknya.

Potret masukan profil tiga perempat yang dipakai untuk uji beban OmniHuman 1.5

Diukur, bukan dijanjikan — termasuk kegagalannya

Set uji tujuh klip kami dihasilkan pada 19 Agustus 2026 — sebuah presentasi produk, laporan berita, pep talk di gym, sapaan kedai teh berbahasa Mandarin, karakter buku cerita, kegagalan profil tiga perempat yang disengaja, dan bidikan panggung lebar. Setiap tugas yang diterima berhasil dirender pada percobaan pertama, dalam 3m 20s sampai 4m 42s untuk audio sekitar sepuluh detik. Kami juga menerbitkan apa yang salah: pada satu malam Selasa yang sibuk, pihak hulu menolak 13 dari 20 pengiriman kami dengan kesalahan kapasitas sebelum menerimanya (proses yang ditolak otomatis dikembalikan), satu tugas yang diterima mengantre 14 menit, dan klip profil di halaman ini menunjukkan persis apa yang terjadi ketika Anda mengabaikan saran potret menghadap depan.

Klip OmniHuman 1.5 asli dari ruang kerja ini

Ketujuh klip di bawah dihasilkan di sini pada 19 Agustus 2026 — masing-masing adalah render pertama yang dihasilkan masukannya, tanpa pengulangan dan tanpa memilih-milih. Potretnya adalah keluaran GPT Image 2; setiap suara diketik sebagai teks dan disintesis dengan pustaka bawaan. Tugas yang diterima kembali dalam 3m 20s sampai 4m 42s untuk audio sekitar 10 detik (satu pencilan mengantre 14 menit); pada satu malam yang sibuk, pihak hulu menolak beberapa pengiriman dengan kesalahan kapasitas sebelum menerimanya — proses yang ditolak dikembalikan. Nyalakan suaranya.

PromptAudio 9,2 s · suara Trustworthy Man · 1.300 kredit · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

PromptAudio 10,2 s · suara News Anchor · 1.430 kredit · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

PromptAudio 10,7 s · suara Energetic Guy · 1.430 kredit · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

PromptAudio 11,8 s · suara Mandarin Sweet Girl · 1.560 kredit · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

PromptAudio 9,7 s · suara Sweet Girl · 1.300 kredit · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

PromptAudio 8,6 s · suara Wise Lady · 1.170 kredit · lip-sync terlihat memburuk pada sudut ini

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

PromptAudio 5,4 s · suara Movie Narrator · 780 kredit · frame ini adalah latar halaman

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Untuk siapa OmniHuman 1.5 sebenarnya

Masing-masing poin ini merujuk pada klip yang ditunjukkan di atas — bukan daftar keinginan.

  • Pembuat kursus dan penjelas

    Ketik narasinya dan dapatkan seorang presenter di layar — tanpa kamera, pencahayaan, atau pengambilan ulang. Batas 35 detik per klip pas dengan satu konsep per klip, dan begitulah kebanyakan editor kursus memotong.

  • Pemasar UGC dan produk

    Kasus presentasi speaker di atas adalah seluruh alur kerjanya: hasilkan potret bergaya kreator yang memegang produk Anda, ketik presentasinya, pilih suara. Tanpa biaya talent, dan tanpa perlu mengejar izin penggunaan rupa — wajahnya tidak pernah ada.

  • Tim lokalisasi

    Wajah yang sama bisa menyampaikan pesan yang sama dalam sepuluh bahasa: pertahankan potretnya, tukar suaranya. Lip-sync mengikuti audio apa pun yang Anda sediakan — kasus Mandarin di atas adalah buktinya.

  • Kanal tanpa wajah dan pembawa acara virtual

    Persona yang Anda hasilkan adalah persona yang Anda miliki. Rancang wajahnya sekali, beri ia satu suara pustaka yang konsisten, dan ia bisa memandu setiap episode — karakter buku cerita berilustrasi di atas menunjukkan ia bahkan tidak harus fotoreal.

  • Podcaster dan kreator yang mengutamakan audio

    Anda sudah punya bagian yang sulit: audionya. Pangkas satu sorotan menjadi 35 detik, tambahkan satu potret, dan Anda punya klip visual untuk media sosial tanpa membuka editor.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

Video ucapan versus video adegan — apa yang dibutuhkan masing-masing model dari Anda, dan apa yang dikembalikannya di ruang kerja ini.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Apa yang Anda sediakan1 foto potret + audio Anda, atau teks yang diketik dan suara dari pustakaSebuah prompt, plus referensi gambar, video, dan audio yang opsionalSebuah prompt, plus satu gambar referensi opsionalSebuah prompt atau gambar awal
Siapa yang mengucapkan kata-katanyaAnda — avatarnya melakukan lip-sync ke soundtrack persis milik AndaModel menghasilkan suara dari promptModel menghasilkan suara dari promptAudio dihasilkan bersama klipnya
Panjang klip di siniPanjang audio Anda, sampai 35 s4–30 s4–8 s3–15 s
Kredit130 per detik audio110/s pada 480p · 230/s pada 720p320–1.920 per klip (4–8 s · 720p–4K · ± audio)55/s pada 720p · 70/s pada 1080p
Diukur di sini~4 menit untuk audio ~10 s (7 klip, Agustus 2026)Belum diukur pada tugas iniBelum diukur pada tugas iniBelum diukur pada tugas ini

Kredit, durasi, dan opsi masukan dibaca dari registry model milik ruang kerja ini pada 19 Agustus 2026 — semuanya menggambarkan apa yang Anda dapat di sini, bukan spesifikasi yang dipublikasikan vendor. Waktu adalah pengukuran kami sendiri pada klip yang ditampilkan di atas; kami belum menjalankan naskah yang sama lewat tiga model lainnya, jadi sel-sel itu menyatakan demikian alih-alih menebak.

Model Video Lain Seperti OmniHuman 1.5

Bandingkan OmniHuman 1.5 dengan model video lainnya — ruang kerja yang sama, satu klik untuk beralih.

Spesifikasi OmniHuman 1.5 di CreateVision AI

Modelomnihuman-1.5, dari ByteDance (makalah riset diterbitkan Agustus 2025)
ModeAvatar bicara: satu foto + satu trek audio → video berbicara, di ruang kerja avatar pada halaman ini
MasukanPersis 1 gambar potret, plus audio sampai 35 detik (unggahan mp3/wav) — atau teks yang diketik hingga 600 karakter, disintesis menjadi ucapan
Pustaka suara60 suara bawaan dalam 10 bahasa: Inggris, Mandarin, Jepang, Korea, Prancis, Jerman, Spanyol, Italia, Rusia, Portugis
Arahan opsionalCatatan pertunjukan singkat untuk aksi, emosi, dan kamera — berguna, tidak pernah wajib
OutputSatu bidikan berkelanjutan yang mempertahankan framing foto Anda; panjang klip sama dengan panjang audio. Keluaran terukur: 1248×1664 dari foto 2:3, 1920×1088 dari 16:9, 25 fps, H.264 dengan audio AAC mono
Kredit130 per detik audio, dibulatkan ke atas — minimum 130, 4.550 pada 35 detik penuh; biaya persisnya ditampilkan sebelum Anda menghasilkan
Kecepatan terukur3m 20s–4m 42s per tugas yang diterima untuk audio ~10 s dalam uji 7 klip kami; satu pencilan mengantre 14 menit (Agustus 2026, satu malam Selasa yang sibuk)

Cara membuat avatar bicara dari sebuah foto

Mulai Membuat Video
  1. Tambahkan wajahnya

    Unggah potret setengah badan yang jelas dan menghadap depan — atau hasilkan satu dengan GPT Image 2 atau Seedream di ruang kerja yang sama, dan begitulah setiap wajah di halaman ini dibuat. Satu orang per foto; jaga wajahnya besar dan tidak terhalang.

  2. Beri ia suara

    Unggah klip audio (mp3 atau wav, sampai 35 detik), atau beralih ke mode teks: ketik hingga 600 karakter dan pilih salah satu dari 60 suara dalam 10 bahasa, masing-masing dengan pratinjau yang bisa Anda putar lebih dulu.

  3. Arahkan pertunjukannya kalau perlu

    Catatan singkat seperti "tenang, anggukan kecil, senyum tipis" mengarahkan gestur dan emosi. Biarkan kosong dan model membaca ritme serta makna audionya sendiri.

  4. Hasilkan dan periksa sinkronisasinya

    Biaya kredit persisnya muncul sebelum Anda menjalankan — ia berskala dengan panjang audio. Generasi berjalan asinkron; klipnya mendarat di riwayat Anda dengan setiap masukan terlampir, jadi penyiapan yang berhasil bisa diulang minggu depan.

Lebih dari Sekadar OmniHuman 1.5

Satu akun, alur kerja lengkap generasi gambar dan video.

Bacaan terkait

Harga OmniHuman 1.5 dan Kredit Harian Gratis

Jalankan OmniHuman 1.5 dengan kredit harian paket gratis, atau tingkatkan untuk model premium, generasi lebih cepat, dan output 4K.

Gratis

$0

Sempurna untuk memulai

  • 200 kredit sambutan, hingga 80/hari
  • Z Image Turbo membuat draf dengan 0 kredit
  • Kecepatan generasi standar
  • Termasuk riwayat generasi
Mulai

Premium

Paling populer
$29/month

Ditagih tahunan · $240/year

  • 8.000 kredit/bulan, tanpa batas harian
  • Semua model premium — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Kecepatan generasi 5x, antrean prioritas
  • Penyempurnaan prompt AI
Tingkatkan ke Premium

Ultimate

$49/month

Ditagih tahunan · $380/year

  • 18.000 kredit/bulan, tanpa batas harian
  • Generasi HD hingga resolusi 4K
  • Dukungan prioritas
  • Antrean tercepat dan akses awal ke model baru
Tingkatkan ke Ultimate

OmniHuman 1.5 — Pertanyaan yang Sering Diajukan

1

Apa itu OmniHuman 1.5?

Model avatar berbasis audio milik ByteDance. Ia menerima satu foto potret dan satu trek audio dan mengembalikan video orang itu mengucapkan audionya — bibir, ekspresi, gerak kepala, dan gestur tangan semuanya mengikuti suaranya. Makalah riset di baliknya diterbitkan pada Agustus 2025.

2

Bisakah avatarnya mengucapkan kata-kata persis saya?

Ya — itulah bedanya dari model video yang digerakkan prompt. Anda menyediakan soundtrack-nya, entah sebagai unggahan mp3/wav atau dengan mengetik naskahnya dan memilih suara bawaan, dan avatarnya melakukan lip-sync ke situ kata demi kata. Model yang digerakkan prompt menghasilkan suaranya sendiri dan jarang mengucapkan persis apa yang Anda tulis.

3

Apakah OmniHuman 1.5 gratis dipakai?

Tidak — ia menagih 130 kredit per detik audio, dibulatkan ke atas, jadi klip 10 detik adalah 1.300 kredit. Biaya persisnya ditampilkan sebelum Anda menghasilkan, dan proses yang gagal otomatis dikembalikan. Jaga naskah tetap ringkas dan pangkas keheningan: setiap detik audio adalah detik yang Anda bayar.

4

Apa yang membuat foto sumber menjadi bagus?

Menghadap depan, setengah badan, satu orang, dengan wajah yang besar, tersinari merata, dan tidak terhalang — para pengulas dan uji kami sendiri sepakat. Uji profil tiga perempat kami yang disengaja di atas menunjukkan apa yang terjadi kalau tidak: bibirnya nyaris tidak berartikulasi, model perlahan memutar kepalanya makin menjauh, dan benda-benda muncul di meja yang tidak pernah ada di fotonya. Potret hasil generasi bekerja sama baiknya dengan foto kamera.

5

Apakah ia bekerja dengan ilustrasi atau karakter anime?

Ya — uji buku cerita kami di atas adalah ilustrasi 2D datar, dan OmniHuman 1.5 menganimasikannya secara meyakinkan sambil mempertahankan gaya seninya: mata, alis, dan mulut bergerak seperti karakter animasi buatan tangan. Satu keanehan yang kami amati: ketika mulutnya terbuka lebar, model menggambar gigi yang mengejutkan realistisnya untuk sebuah ilustrasi datar. Makalah ByteDance juga mengklaim subjek non-manusia; kami baru menguji karakter berilustrasi ini.

6

Berapa panjang sebuah klip bisa dibuat, dan berapa lama generasinya?

Sampai 35 detik audio per klip di platform ini — naskah yang lebih panjang perlu dipecah dan disambung. Dalam uji Agustus 2026 kami, tugas yang diterima kembali dalam 3m 20s sampai 4m 42s untuk audio sekitar 10 detik. Satu catatan dari malam yang sama: di bawah beban berat, pihak hulu menolak beberapa pengiriman dengan kesalahan kapasitas sebelum menerima tugasnya. Proses yang ditolak tidak berbiaya apa pun, tetapi rencanakan adanya pengulangan pada jam sibuk alih-alih tenggat lima menit lagi.

7

Apa kelemahan OmniHuman 1.5?

Wajah yang tidak menghadap depan, terutama: uji profil tiga perempat kami menunjukkan bibir yang nyaris diam, kepala yang menjauh makin jauh dari kamera, dan benda-benda meja yang tidak pernah ada di fotonya. Detail identitas kecil bisa mengembara di tengah klip — sebuah anting berubah bentuk dalam uji itu, dan warna bibir terbaca sedikit lebih kuat daripada masukannya di dua klip lain. Dialog banyak orang tidak tersedia di sini, resolusi keluarannya sederhana (1248×1664 dalam uji potret kami — tanpa 4K), dan ia hanya membuat video ucapan: untuk aksi, gerak kamera, atau perubahan adegan, pakai Seedance 2.5 atau Kling 3.0 Turbo.

8

Bisakah saya memakai videonya secara komersial — dan wajah siapa yang boleh saya pakai?

Video yang Anda hasilkan bisa dipakai dalam proyek pribadi maupun komersial di bawah ketentuan layanan kami. Wajahnya adalah bagian yang harus ditanggapi serius: menganimasikan foto orang sungguhan tanpa persetujuan mereka bisa melanggar hak atas rupa dan publisitas, dan beberapa yurisdiksi kini mewajibkan pengungkapan presenter sintetis. Wajah hasil generasi — seperti setiap wajah di halaman ini — menghindari masalah persetujuan itu sepenuhnya.

Beri sebuah foto sesuatu untuk diucapkan

Mulai Membuat Video

Harga & Akses — FaktanyaOmniHuman 1.5

Model
OmniHuman 1.5
Pengembang
ByteDance
Akses
Berjalan di ruang kerja CreateVision AI melalui API — masuk dan langsung membuat. Tanpa kunci API, tanpa proyek cloud, tanpa instalasi.
Harga per pembuatan
Mulai 650 kredit ≈ $2.36 per klip 5 detik dengan paket Premium ($29/bulan untuk 8,000 kredit). Paket gratis mencakup 80 kredit setiap hari.
Privasi
Privat secara default — tidak ada pengguna lain yang dapat melihat hasil buatan Anda, di paket mana pun. Kami tidak menjual atau menyalahgunakan data anggota. Kebijakan Privasi

Yang baruOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.