OmniHuman 1.5 AI Konuşan Avatar Üretici

OmniHuman 1.5'e bir portre ve bir ses parçası verin, o kişinin tam olarak sizin kelimelerinizi söylediği bir video döndürsün — dudaklar, ifadeler ve jestler sesi izliyor.

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5 nedir?

OmniHuman 1.5, ByteDance'in sesle sürülen avatar modeli: ona bir portre ve bir ses parçası verin, o kişinin sizin sesinizi konuştuğu bir video döndürsün — dudaklar, ifadeler, kafa hareketi ve jestler tamamen sesle sürülüyor. İstem güdümlü video modellerinin aksine kelimeleri tam olarak siz veriyorsunuz. Araştırma makalesi çok modlu bir dil modelini bir difüzyon transformatörüyle eşleştiriyor, dolayısıyla performans yalnızca ağzı takip etmek yerine söylenene tepki veriyor.

Dürüst kısım: cepheden bir portreye ihtiyacı var. Aşağıdaki dörtte üç profil testimiz zar zor eklemlenen dudakları ve uzaklaşarak kayan bir kafayı gösteriyor. Ses çalıştırma başına 35 saniyeyle sınırlı, dolayısıyla uzun metinler bölünüp dikilmek zorunda ve makalenin öne çıkan özelliği olan çok kişili diyalog burada mevcut değil. Bu konuşma videosu, sahne videosu değil: kamera hareketi ya da aksiyon için Seedance 2.5 ya da Kling 3.0 Turbo kullanın.

Mimari, konumlandırma ve kullanıcı çalışması rakamları ByteDance araştırma makalesinden alındı: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Test edenler ne diyor

Sürüm 1.5, zorlu girdiler için gelişmiş dayanıklılık gösteriyor.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Elleri, omuzları net ve doğal aydınlatmalı, bel üstü bir portre genelde daha iyi vücut hareketi veriyor.
Z.Tools — OmniHuman-1.5 deep dive
Ağır gölgeler, güneş gözlükleri, tuhaf kapanmalar ve küçücük yüzler işi zorlaştırıyor.
Z.Tools — OmniHuman-1.5 deep dive

OmniHuman 1.5'i neden CreateVision AI'da çalıştırmalı?

Model ByteDance'e ait; onu burada kullanmanın sebebi diğer iki girdinin — yüz ve ses — aynı çalışma alanından gelmesi.

Bir OmniHuman 1.5 avatar klibi için girdi yüzü olarak kullanılan GPT Image 2 portresi

Bütün girdi zinciri tek bir sayfada

Konuşan avatar klibi üç şey gerektiriyor: bir yüz, bir ses ve model. Burada üçü de aynı çalışma alanından geliyor — portreyi GPT Image 2 ya da Seedream ile üretin, metni yazıp 60 yerleşik sesten biriyle sentezleyin, sonra ikisini de doğrudan OmniHuman 1.5'e verin. Bu sayfadaki her klip tam olarak böyle, baştan sona, tek saniye ses kaydetmeden ve gerçek bir insanın tek bir fotoğrafını yüklemeden yapıldı.

Mandarin konuşan OmniHuman 1.5 çay dükkânı örneği için girdi portresi

Kayıt kabini yerine bir ses kütüphanesi

Metin modu sonradan akla gelmiş bir şey değil: İngilizce, Çince, Japonca, Korece, Fransızca, Almanca, İspanyolca, İtalyanca, Rusça ve Portekizce olmak üzere 60 ses, her biri harcama yapmadan önce dinleyebileceğiniz bir önizlemeyle. En fazla 600 karakter yazın, bir ses seçin ve platform konuşmayı sentezleyip tek bir çalıştırmada avatarı onunla sürsün. Yukarıdaki Mandarin çay dükkânı klibi tam olarak bu yol — hiçbir mikrofon yok.

Haber spikeri OmniHuman 1.5 örneği için girdi portresi

Tek abonelik ve maliyet baştan görünür

OmniHuman 1.5 ses saniyesi başına faturalandırıyor — saniye başına 130 kredi, yukarı yuvarlanarak — ve çalışma alanı üret düğmesine basmadan önce klibinizin tam maliyetini gösteriyor. Aynı plan GPT Image 2'yi, Nano Banana Pro'yu, Seedream'i, Seedance'i, Kling'i ve Veo'yu kapsıyor, dolayısıyla mantıklı iş akışı ucuz: portrenin taslağını birkaç krediye çıkarın, metni sabitleyin ve ancak ondan sonra avatar saniyelerine harcayın. Sesinizin başındaki sessizliği kırpın — her saniyesi için ödüyorsunuz.

OmniHuman 1.5 zorlama testi için kullanılan dörtte üç profil girdi portresi

Vaat edilmiş değil ölçülmüş — başarısızlık dahil

Yedi klipten oluşan test setimiz 19 Ağustos 2026'da üretildi — bir ürün sunumu, bir haber bülteni, bir spor salonu motivasyon konuşması, bir Mandarin çay dükkânı karşılaması, bir masal kitabı karakteri, kasıtlı bir dörtte üç profil başarısızlığı ve geniş bir sahne çekimi. Kabul edilen her iş yaklaşık on saniyelik ses için ilk denemede, 3 dk 20 sn ile 4 dk 42 sn arasında başarıyla render edildi. Neyin ters gittiğini de yayımlıyoruz: yoğun bir salı akşamı yukarı akış, 20 gönderimimizin 13'ünü kabul etmeden önce kapasite hatasıyla reddetti (reddedilen çalıştırmalar otomatik iade ediliyor), kabul edilen bir iş 14 dakika kuyrukta bekledi ve bu sayfadaki profil klibi cepheden portre tavsiyesini görmezden gelince tam olarak ne olduğunu gösteriyor.

Bu çalışma alanından gerçek OmniHuman 1.5 klipleri

Aşağıdaki 7 klibin hepsi 19 Ağustos 2026'da burada üretildi — her biri girdilerinin ürettiği ilk render, yeniden çekim yok, seçip ayıklama yok. Portreler GPT Image 2 çıktıları; her ses metin olarak yazıldı ve yerleşik kütüphaneyle sentezlendi. Kabul edilen işler yaklaşık 10 saniyelik ses için 3 dk 20 sn ile 4 dk 42 sn arasında geri döndü (biri 14 dakika kuyrukta bekleyen bir istisna); yoğun bir akşamda yukarı akış, kabul etmeden önce birkaç gönderimi kapasite hatasıyla reddetti — reddedilen çalıştırmalar iade edilir. Sesi açın.

Prompt9,2 sn ses · Trustworthy Man sesi · 1.300 kredi · 4 dk 42 sn

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Prompt10,2 sn ses · News Anchor sesi · 1.430 kredi · 4 dk 09 sn

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Prompt10,7 sn ses · Energetic Guy sesi · 1.430 kredi · 4 dk 00 sn

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Prompt11,8 sn ses · Mandarin Sweet Girl sesi · 1.560 kredi · 4 dk 19 sn

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Prompt9,7 sn ses · Sweet Girl sesi · 1.300 kredi · 4 dk 01 sn

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Prompt8,6 sn ses · Wise Lady sesi · 1.170 kredi · bu açıda dudak senkronu gözle görülür biçimde bozuluyor

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Prompt5,4 sn ses · Movie Narrator sesi · 780 kredi · bu kare sayfanın arka planı

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 gerçekte kimin için

Bunların her biri yukarıda gösterilen bir klibe karşılık geliyor — bir dilek listesine değil.

  • Kurs üreticileri ve açıklayıcı içerik yapanlar

    Anlatımı yazın, ekranda bir sunucu alın — kamera, aydınlatma ya da yeniden çekim yok. Klip başına 35 saniye sınırı, klip başına tek bir konseptle güzelce örtüşüyor; çoğu kurs kurgucusu zaten böyle kesiyor.

  • UGC ve ürün pazarlamacıları

    Yukarıdaki hoparlör sunumu örneği bütün iş akışı: ürününüzü tutan üretici tarzı bir portre üretin, sunumu yazın, bir ses seçin. Oyuncu ücreti yok ve peşine düşülecek bir kişilik hakkı izni de yok — o yüz hiç var olmadı.

  • Yerelleştirme ekipleri

    Aynı yüz aynı mesajı on dilde verebilir: portreyi koruyun, sesi değiştirin. Dudak senkronu hangi sesi verirseniz onu izliyor — yukarıdaki Mandarin örneği bunun kanıtı.

  • Yüzsüz kanallar ve sanal sunucular

    Ürettiğiniz bir persona, sahibi olduğunuz bir persona. Yüzü bir kez tasarlayın, ona tutarlı bir kütüphane sesi verin ve her bölümün önünde durabilsin — yukarıdaki illüstrasyonlu masal karakteri, fotogerçekçi olmasının bile gerekmediğini gösteriyor.

  • Podcast'çiler ve ses öncelikli üreticiler

    Zor kısım zaten elinizde: ses. Bir öne çıkan bölümü 35 saniyeye kırpın, bir portre ekleyin ve bir kurgu programı açmadan sosyal için görsel bir klibiniz olsun.

OmniHuman 1.5, Seedance 2.5, Veo 3.1 Pro ve Kling 3.0 Turbo karşılaştırması

Konuşma videosuna karşı sahne videosu — her modelin sizden ne istediği ve bu çalışma alanında size ne geri verdiği.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Siz ne veriyorsunuz1 portre fotoğrafı + kendi sesiniz ya da yazılmış metin ve bir kütüphane sesiBir istem, artı isteğe bağlı görsel, video ve ses referanslarıBir istem, artı isteğe bağlı bir referans görselBir istem ya da bir başlangıç görseli
Kelimeleri kim söylüyorSiz — avatar tam olarak sizin ses parçanıza dudak senkronu yapıyorModel sesleri istemden üretiyorModel sesleri istemden üretiyorSes klip ile birlikte üretiliyor
Buradaki klip uzunluğuSesinizin uzunluğu, en fazla 35 sn4–30 s4–8 s3–15 s
KrediSes saniyesi başına 130480p'de 110/s · 720p'de 230/sKlip başına 320–1.920 (4–8 sn · 720p–4K · ± ses)720p'de 55/s · 1080p'de 70/s
Burada ölçülen~10 sn ses için ~4 dk (7 klip, Ağustos 2026)Bu görevde ölçmedikBu görevde ölçmedikBu görevde ölçmedik

Krediler, süre ve girdi seçenekleri 19 Ağustos 2026'da bu çalışma alanının kendi model kayıt defterinden okundu — satıcıların yayımladığı teknik özellikleri değil, burada ne aldığınızı anlatıyorlar. Süreler yukarıda gösterilen kliplerde yaptığımız kendi ölçümlerimiz; aynı metinleri diğer üç modelden geçirmedik, o yüzden o hücreler tahmin yürütmek yerine bunu söylüyor.

OmniHuman 1.5 Gibi Diğer Video Modelleri

OmniHuman 1.5'i diğer video modelleriyle karşılaştırın — aynı çalışma alanı, tek tıklamayla geçiş.

CreateVision AI'da OmniHuman 1.5 teknik özellikleri

Modelomnihuman-1.5, ByteDance tarafından (araştırma makalesi Ağustos 2025'te yayımlandı)
ModKonuşan avatar: bir fotoğraf + bir ses parçası → konuşan video, bu sayfadaki avatar çalışma alanında
GirdilerTam olarak 1 portre görseli, artı en fazla 35 saniye ses (mp3/wav yükleme) — ya da en fazla 600 karakter yazılı metin, konuşmaya sentezlenerek
Ses kütüphanesi10 dilde 60 yerleşik ses: İngilizce, Çince, Japonca, Korece, Fransızca, Almanca, İspanyolca, İtalyanca, Rusça, Portekizce
İsteğe bağlı yönlendirmeAksiyon, duygu ve kamera için kısa bir performans notu — işe yarar, asla zorunlu değil
ÇıktıFotoğrafınızın kadrajını koruyan tek kesintisiz bir çekim; klip uzunluğu ses uzunluğuna eşit. Ölçülen çıktı: 2:3 bir fotoğraftan 1248×1664, 16:9'dan 1920×1088, 25 fps, mono AAC sesle H.264
KrediSes saniyesi başına 130, yukarı yuvarlanarak — en az 130, tam 35 saniyede 4.550; tam maliyet üretmeden önce gösteriliyor
Ölçülmüş hız7 klipli testimizde ~10 sn ses için kabul edilen iş başına 3 dk 20 sn–4 dk 42 sn; bir istisna 14 dakika kuyrukta bekledi (Ağustos 2026, yoğun bir salı akşamı)

Bir fotoğraftan konuşan avatar nasıl yapılır

Video Üretmeye Başlayın
  1. Yüzü ekleyin

    Net, cepheden, bel üstü bir portre yükleyin — ya da aynı çalışma alanında GPT Image 2 veya Seedream ile bir tane üretin; bu sayfadaki her yüz böyle yapıldı. Fotoğraf başına tek kişi; yüzü büyük ve kapanmamış tutun.

  2. Ona bir ses verin

    Bir ses klibi yükleyin (mp3 ya da wav, en fazla 35 saniye) ya da metin moduna geçin: en fazla 600 karakter yazın ve 10 dildeki 60 sesten birini seçin, her birinin önce dinleyebileceğiniz bir önizlemesi var.

  3. İsterseniz performansı yönetin

    "sakin, küçük baş sallamalar, hafif gülümseme" gibi kısa bir not jesti ve duyguyu yönlendiriyor. Boş bırakın, model sesin ritmini ve anlamını kendi başına okusun.

  4. Üretin ve senkronu kontrol edin

    Tam kredi maliyeti çalıştırmadan önce görünüyor — ses uzunluğuyla ölçekleniyor. Üretim eşzamansız; klip her girdisi ekli olarak geçmişinize düşüyor, dolayısıyla işe yarayan bir kurulum haftaya tekrarlanabilir.

Sadece OmniHuman 1.5 Değil

Tek bir hesap, eksiksiz görsel ve video üretim iş akışı.

İlgili okumalar

OmniHuman 1.5 Fiyatlandırması ve Ücretsiz Günlük Krediler

OmniHuman 1.5 modelini ücretsiz planın günlük kredileriyle çalıştırın veya premium modeller, daha hızlı üretim ve 4K çıktı için yükseltin.

Ücretsiz

$0

Başlamak için ideal

  • 200 hoş geldin kredisi, günde en fazla 80
  • Z Image Turbo 0 kredi ile taslak oluşturur
  • Standart üretim hızı
  • Üretim geçmişi dahil
Başla

Premium

En popüler
$29/month

Yıllık faturalandırılır · $240/year

  • Ayda 8.000 kredi, günlük sınır yok
  • Tüm premium modeller — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5 kat üretim hızı, öncelikli kuyruk
  • Yapay zeka prompt iyileştirme
Premium sürümüne yükselt

Ultimate

$49/month

Yıllık faturalandırılır · $380/year

  • Ayda 18.000 kredi, günlük sınır yok
  • 4K çözünürlüğe kadar HD üretim
  • Öncelikli destek
  • En hızlı kuyruk ve yeni modellere erken erişim
Ultimate sürümüne yükselt

OmniHuman 1.5 — Sıkça Sorulan Sorular

1

OmniHuman 1.5 nedir?

ByteDance'in sesle sürülen avatar modeli. Bir portre fotoğrafı ve bir ses parçası alıyor ve o kişinin o sesi konuştuğu bir video döndürüyor — dudaklar, ifadeler, kafa hareketi ve el jestleri sesi izliyor. Ardındaki araştırma makalesi Ağustos 2025'te yayımlandı.

2

Avatar tam olarak benim kelimelerimi söyleyebilir mi?

Evet — istem güdümlü video modellerinden farkı bu. Ses parçasını siz veriyorsunuz, ya bir mp3/wav yükleyerek ya da metni yazıp yerleşik bir ses seçerek ve avatar ona kelimesi kelimesine dudak senkronu yapıyor. İstem güdümlü modeller kendi seslerini üretiyor ve tam olarak yazdığınızı nadiren söylüyor.

3

OmniHuman 1.5 ücretsiz mi?

Hayır — ses saniyesi başına 130 kredi, yukarı yuvarlanarak faturalandırıyor, yani 10 saniyelik bir klip 1.300 kredi. Tam maliyet üretmeden önce gösteriliyor ve başarısız çalıştırmalar otomatik iade ediliyor. Metinleri sıkı tutun ve sessizlikleri kırpın: sesin her saniyesi ödediğiniz bir saniye.

4

İyi bir kaynak fotoğrafı neyi ifade eder?

Cepheden, bel üstü, tek kişi, yüz büyük, eşit aydınlatılmış ve kapanmamış — incelemeciler ve kendi testlerimiz hemfikir. Yukarıdaki kasıtlı dörtte üç profil testimiz aksi hâlde ne olduğunu gösteriyor: dudaklar zar zor eklemleniyor, model kafayı yavaşça daha da uzağa çeviriyor ve masada fotoğrafta hiç olmayan nesneler beliriyor. Üretilmiş portreler tam olarak kamera fotoğrafları kadar iyi çalışıyor.

5

İllüstrasyonlar ya da anime karakterlerle çalışıyor mu?

Evet — yukarıdaki masal kitabı testimiz düz bir 2B illüstrasyon ve OmniHuman 1.5 sanat üslubunu korurken onu inandırıcı biçimde canlandırdı: gözler, kaşlar ve ağız elle çizilmiş bir karakter gibi hareket ediyor. Gözlemlediğimiz bir tuhaflık: ağız iyice açıldığında model, düz bir illüstrasyon için şaşırtıcı derecede gerçekçi dişler çiziyor. ByteDance'in makalesi ayrıca insan olmayan özneler iddia ediyor; biz yalnızca bu illüstrasyonlu karakteri test ettik.

6

Bir klip ne kadar uzun olabilir ve üretim ne kadar sürüyor?

Bu platformda klip başına en fazla 35 saniye ses — daha uzun metinlerin bölünüp dikilmesi gerekiyor. Ağustos 2026 testimizde kabul edilen işler yaklaşık 10 saniyelik ses için 3 dk 20 sn ile 4 dk 42 sn arasında geri döndü. Aynı akşamdan bir uyarı: yoğun yük altında yukarı akış, işi kabul etmeden önce birkaç gönderimi kapasite hatasıyla reddetti. Reddedilen çalıştırmalar hiçbir şeye mal olmuyor, ama yoğun saatlerde beş dakika sonraya bir teslim tarihi değil, yeniden denemeler planlayın.

7

OmniHuman 1.5 neyde kötü?

Her şeyden önce cepheden olmayan yüzler: dörtte üç profil testimiz neredeyse hareketsiz dudaklar, kameradan giderek uzaklaşan bir kafa ve fotoğrafta hiç olmayan masa nesneleri gösteriyor. Küçük kimlik ayrıntıları klibin ortasında kayabiliyor — o testte bir küpe biçim değiştirdi ve iki klipte dudak rengi girdiden biraz daha kuvvetli okundu. Çok kişili diyalog burada mevcut değil, çıktı çözünürlüğü mütevazı (portre testlerimizde 1248×1664 — 4K yok) ve yalnızca konuşma videosu yapıyor: aksiyon, kamera hareketi ya da sahne değişimleri için Seedance 2.5 ya da Kling 3.0 Turbo kullanın.

8

Videoları ticari olarak kullanabilir miyim — ve kimin yüzünü kullanabilirim?

Ürettiğiniz videolar hizmet şartlarımız kapsamında kişisel ve ticari projelerde kullanılabilir. Ciddiye alınması gereken kısım yüz: gerçek bir insanın fotoğrafını rızası olmadan canlandırmak kişilik ve tanıtım haklarını ihlal edebilir ve birkaç ülke artık sentetik sunucuların açıklanmasını zorunlu kılıyor. Üretilmiş yüzler — bu sayfadaki her yüz gibi — rıza sorununu tamamen ortadan kaldırıyor.

Bir fotoğrafa söyleyecek bir şey verin

Video Üretmeye Başlayın

Fiyatlar ve Erişim — GerçeklerOmniHuman 1.5

Model
OmniHuman 1.5
Geliştirici
ByteDance
Erişim
CreateVision AI çalışma alanında API üzerinden çalışır — giriş yapın ve üretin. API anahtarı yok, bulut projesi yok, kurulum yok.
Üretim başına fiyat
Premium planda 5 saniyelik klip başına 650 krediden ≈ $2.36 (ayda $29 karşılığında 8,000 kredi). Ücretsiz plan her gün 80 kredi içerir.
Gizlilik
Varsayılan olarak gizli — hiçbir planda başka bir kullanıcı üretimlerinizi göremez. Üye verilerini satmaz veya kötüye kullanmayız. Gizlilik Politikası

Neler yeniOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.