OmniHuman 1.5 AI بولتا اوتار جنریٹر

OmniHuman 1.5 کو ایک پورٹریٹ اور ایک آواز کا ٹریک دیں، اور یہ اسی شخص کی ویڈیو واپس کرتا ہے جو آپ کے بالکل وہی الفاظ بول رہا ہو — ہونٹ، تاثرات اور اشارے آواز کی پیروی کرتے ہیں۔

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5 کیا ہے؟

OmniHuman 1.5، ByteDance کا آڈیو سے چلنے والا اوتار ماڈل ہے: اسے ایک پورٹریٹ اور ایک آواز کا ٹریک دیں، اور یہ اسی شخص کی ویڈیو واپس کرتا ہے جو آپ کا آڈیو بول رہا ہو — ہونٹ، تاثرات، سر کی حرکت اور اشارے، سب آواز سے چلتے ہیں۔ پرامپٹ سے چلنے والے ویڈیو ماڈلوں کے برعکس، الفاظ آپ خود دیتے ہیں۔ تحقیقی مقالہ ایک کثیر الوسائط زبان ماڈل کو ایک ڈفیوژن ٹرانسفارمر کے ساتھ جوڑتا ہے، اس لیے اداکاری صرف منہ کا پیچھا کرنے کے بجائے اس بات پر ردِعمل دیتی ہے جو کہی جا رہی ہے۔

کھری بات: اسے سامنے سے کھینچا گیا پورٹریٹ چاہیے۔ نیچے ہمارا تین چوتھائی رخ والا ٹیسٹ ایسے ہونٹ دکھاتا ہے جو مشکل سے حرکت کرتے ہیں اور ایک ایسا سر جو بہک جاتا ہے۔ آڈیو فی رن 35 سیکنڈ تک محدود ہے، اس لیے لمبے اسکرپٹ کاٹ کر جوڑنے پڑتے ہیں، اور کئی افراد کا مکالمہ — مقالے کی ایک نمایاں خصوصیت — یہاں دستیاب نہیں۔ یہ تقریر کی ویڈیو ہے، منظر کی ویڈیو نہیں: کیمرے کی حرکت یا ایکشن کے لیے Seedance 2.5 یا Kling 3.0 Turbo استعمال کریں۔

ساخت، پوزیشننگ اور صارف مطالعے کے اعداد ByteDance کے تحقیقی مقالے سے ہیں: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

جانچنے والے کیا کہتے ہیں

ورژن 1.5 مشکل ان پٹ کے لیے بہتر مضبوطی دکھاتا ہے۔
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
کمر تک کا ایسا پورٹریٹ جس میں ہاتھ، کندھے صاف نظر آئیں اور روشنی قدرتی ہو، عموماً جسم کی بہتر حرکت دیتا ہے۔
Z.Tools — OmniHuman-1.5 deep dive
گہرے سائے، دھوپ کے چشمے، عجیب رکاوٹیں اور بہت چھوٹے چہرے کام مشکل بنا دیتے ہیں۔
Z.Tools — OmniHuman-1.5 deep dive

OmniHuman 1.5 کو CreateVision AI پر کیوں چلائیں؟

ماڈل ByteDance کا ہے؛ اسے یہاں استعمال کرنے کی وجہ یہ ہے کہ باقی دونوں ان پٹ — چہرہ اور آواز — اسی ورک اسپیس سے آتے ہیں۔

GPT Image 2 کا بنایا ہوا پورٹریٹ جو OmniHuman 1.5 کی اوتار کلپ کے لیے ان پٹ چہرے کے طور پر استعمال ہوا

ان پٹ کی پوری زنجیر ایک ہی صفحے پر رہتی ہے

بولتے اوتار کی کلپ کے لیے تین چیزیں چاہئیں: ایک چہرہ، ایک آواز، اور ماڈل۔ یہاں تینوں اسی ورک اسپیس سے آتے ہیں — پورٹریٹ GPT Image 2 یا Seedream سے بنائیں، اسکرپٹ لکھ کر 60 اندرونی آوازوں میں سے کسی ایک سے بنوائیں، پھر دونوں سیدھے OmniHuman 1.5 میں ڈال دیں۔ اس صفحے کی ہر کلپ بالکل اسی طرح، شروع سے آخر تک بنائی گئی، بغیر ایک سیکنڈ آڈیو ریکارڈ کیے اور بغیر کسی حقیقی شخص کی ایک بھی تصویر اپ لوڈ کیے۔

مینڈرن بولنے والی OmniHuman 1.5 چائے کی دکان والی مثال کا ان پٹ پورٹریٹ

ریکارڈنگ بوتھ کے بجائے آوازوں کی ایک لائبریری

متن والا موڈ کوئی بعد کی سوچ نہیں: انگریزی، چینی، جاپانی، کورین، فرانسیسی، جرمن، ہسپانوی، اطالوی، روسی اور پرتگالی میں 60 آوازیں، اور ہر ایک کی ایسی جھلک جو کچھ خرچ کرنے سے پہلے سنی جا سکتی ہے۔ 600 حروف تک لکھیں، ایک آواز چنیں، اور پلیٹ فارم ایک ہی رن میں تقریر بنا کر اسی سے اوتار کو چلا دیتا ہے۔ اوپر مینڈرن چائے کی دکان والی کلپ بالکل یہی راستہ ہے — کوئی مائیکروفون شامل نہیں۔

نیوز اینکر والی OmniHuman 1.5 مثال کا ان پٹ پورٹریٹ

ایک سبسکرپشن، اور لاگت پہلے ہی سامنے

OmniHuman 1.5 کی بلنگ آڈیو کے فی سیکنڈ ہے — فی سیکنڈ 130 کریڈٹ، اوپر کی طرف پورا کر کے — اور ورک اسپیس جنریٹ دبانے سے پہلے آپ کی کلپ کی درست لاگت دکھا دیتا ہے۔ وہی پلان GPT Image 2، Nano Banana Pro، Seedream، Seedance، Kling اور Veo کو بھی ڈھانپتا ہے، اس لیے سمجھ دار طریقہ سستا ہے: پورٹریٹ چند کریڈٹ میں بنائیں، اسکرپٹ پکا کریں، اور اس کے بعد ہی اوتار کے سیکنڈوں پر خرچ کریں۔ اپنے آڈیو سے خاموشی کاٹ دیں — آپ اس کے ہر سیکنڈ کے پیسے دے رہے ہیں۔

OmniHuman 1.5 کے دباؤ ٹیسٹ کے لیے استعمال ہونے والا تین چوتھائی رخ کا ان پٹ پورٹریٹ

ناپا ہوا، وعدہ کیا ہوا نہیں — بشمول ناکامی

ہمارا سات کلپ کا ٹیسٹ سیٹ 19 اگست 2026 کو بنایا گیا — ایک پروڈکٹ کی پیشکش، ایک خبر، جم میں حوصلہ افزائی، مینڈرن میں چائے کی دکان کا خیرمقدم، ایک کہانی کی کتاب کا کردار، جان بوجھ کر کیا گیا ایک تین چوتھائی رخ کا ناکام ٹیسٹ، اور ایک وسیع اسٹیج شاٹ۔ ہر منظور شدہ کام پہلی ہی کوشش میں کامیابی سے بنا، اور تقریباً دس سیکنڈ کے آڈیو کے لیے 3m 20s سے 4m 42s لگے۔ ہم یہ بھی شائع کرتے ہیں کہ کیا غلط ہوا: ایک مصروف منگل کی شام اپ اسٹریم نے ہماری 20 میں سے 13 درخواستیں قبول کرنے سے پہلے گنجائش کی خرابیوں کے ساتھ رد کیں (رد ہونے والے رنز کے کریڈٹ خود بخود واپس ہو جاتے ہیں)، ایک منظور شدہ کام 14 منٹ قطار میں رہا، اور اس صفحے کی رخ والی کلپ بالکل دکھاتی ہے کہ سامنے سے پورٹریٹ والا مشورہ نظر انداز کرنے پر کیا ہوتا ہے۔

اس ورک اسپیس سے OmniHuman 1.5 کی اصل کلپ

نیچے کی تمام 7 کلپ یہاں 19 اگست 2026 کو بنائی گئیں — ہر ایک اپنے ان پٹ سے بنی پہلی ہی رینڈر ہے، نہ کوئی دوبارہ کوشش اور نہ چن چن کر نکالنا۔ پورٹریٹ GPT Image 2 کے نتائج ہیں؛ ہر آواز متن کی صورت میں لکھی گئی اور اندرونی لائبریری سے بنائی گئی۔ منظور شدہ کام تقریباً 10 سیکنڈ کے آڈیو کے لیے 3m 20s سے 4m 42s میں واپس آئے (ایک استثنا 14 منٹ قطار میں رہا)؛ ایک مصروف شام میں اپ اسٹریم نے قبول کرنے سے پہلے کئی درخواستیں گنجائش کی خرابی کے ساتھ رد کیں — رد ہونے والے رنز کے کریڈٹ واپس ہو جاتے ہیں۔ آواز آن رکھیں۔

پرامپٹ9.2 س آڈیو · Trustworthy Man آواز · 1,300 کریڈٹ · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

پرامپٹ10.2 س آڈیو · News Anchor آواز · 1,430 کریڈٹ · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

پرامپٹ10.7 س آڈیو · Energetic Guy آواز · 1,430 کریڈٹ · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

پرامپٹ11.8 س آڈیو · Mandarin Sweet Girl آواز · 1,560 کریڈٹ · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

پرامپٹ9.7 س آڈیو · Sweet Girl آواز · 1,300 کریڈٹ · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

پرامپٹ8.6 س آڈیو · Wise Lady آواز · 1,170 کریڈٹ · اس زاویے پر ہونٹوں کی ہم آہنگی صاف بگڑ جاتی ہے

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

پرامپٹ5.4 س آڈیو · Movie Narrator آواز · 780 کریڈٹ · یہی فریم اس صفحے کا پس منظر ہے

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 دراصل کن کے لیے ہے

ان میں سے ہر ایک بات اوپر دکھائی گئی کسی کلپ سے جڑی ہے — یہ خواہشوں کی فہرست نہیں۔

  • کورس بنانے والے اور وضاحت کرنے والے

    بیانیہ لکھیں اور اسکرین پر ایک میزبان حاصل کریں — نہ کیمرہ، نہ روشنی، نہ دوبارہ شوٹ۔ فی کلپ 35 سیکنڈ کی حد صاف طور پر ایک کلپ میں ایک تصور پر بیٹھتی ہے، اور کورس ایڈیٹر ویسے بھی اسی طرح کاٹتے ہیں۔

  • UGC اور پروڈکٹ مارکیٹر

    اوپر اسپیکر کی پیشکش والی مثال ہی پورا طریقہ ہے: تخلیق کار جیسا ایک پورٹریٹ بنائیں جو آپ کا پروڈکٹ تھامے ہو، پیشکش لکھیں، ایک آواز چنیں۔ نہ فنکار کی فیس، اور نہ شبیہ کی اجازت کا پیچھا — وہ چہرہ کبھی موجود ہی نہیں تھا۔

  • مقامی بنانے والی ٹیمیں

    وہی چہرہ وہی پیغام دس زبانوں میں پہنچا سکتا ہے: پورٹریٹ وہی رکھیں، آواز بدل دیں۔ ہونٹوں کی ہم آہنگی اُسی آڈیو کی پیروی کرتی ہے جو آپ دیتے ہیں — اوپر مینڈرن والی مثال اس کا ثبوت ہے۔

  • بغیر چہرے کے چینل اور مجازی میزبان

    جو شخصیت آپ خود بناتے ہیں وہ آپ کی اپنی ہوتی ہے۔ چہرہ ایک بار ڈیزائن کریں، اسے لائبریری کی ایک مستقل آواز دیں، اور یہ ہر قسط کی قیادت کر سکتا ہے — اوپر کہانی کی کتاب والا مصور کردار دکھاتا ہے کہ اسے فوٹو ریئل ہونا بھی ضروری نہیں۔

  • پوڈکاسٹر اور آڈیو کو ترجیح دینے والے تخلیق کار

    مشکل حصہ آپ کے پاس پہلے سے ہے: آڈیو۔ کوئی جھلک 35 سیکنڈ تک کاٹیں، ایک پورٹریٹ لگائیں، اور آپ کے پاس سوشل کے لیے ایک بصری کلپ تیار ہے، بغیر کوئی ایڈیٹر کھولے۔

OmniHuman 1.5 بمقابلہ Seedance 2.5 بمقابلہ Veo 3.1 Pro بمقابلہ Kling 3.0 Turbo

تقریر کی ویڈیو بمقابلہ منظر کی ویڈیو — ہر ماڈل آپ سے کیا مانگتا ہے، اور اس ورک اسپیس میں کیا واپس دیتا ہے۔

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
آپ کیا دیتے ہیں1 پورٹریٹ تصویر + آپ کا آڈیو، یا لکھا ہوا متن اور لائبریری کی ایک آوازایک پرامپٹ، اور ساتھ اختیاری تصویر، ویڈیو اور آڈیو حوالےایک پرامپٹ، اور ساتھ ایک اختیاری حوالہ تصویرایک پرامپٹ یا ایک ابتدائی تصویر
الفاظ کون بولتا ہےآپ — اوتار آپ کے بالکل اُسی ساؤنڈ ٹریک سے ہونٹ ملاتا ہےماڈل پرامپٹ سے آوازیں خود بناتا ہےماڈل پرامپٹ سے آوازیں خود بناتا ہےآڈیو کلپ کے ساتھ ہی بنتا ہے
یہاں کلپ کی لمبائیآپ کے آڈیو کی لمبائی، 35 س تک4–30 s4–8 s3–15 s
کریڈٹسفی آڈیو سیکنڈ 130480p پر 110/s · 720p پر 230/sفی کلپ 320–1,920 (4–8 س · 720p–4K · آڈیو کے ساتھ یا بغیر)720p پر 55/s · 1080p پر 70/s
یہاں ناپا گیاتقریباً 10 س آڈیو کے لیے تقریباً 4 منٹ (7 کلپ، اگست 2026)اس کام پر ہم نے ناپا نہیںاس کام پر ہم نے ناپا نہیںاس کام پر ہم نے ناپا نہیں

کریڈٹ، دورانیہ اور ان پٹ کے آپشن 19 اگست 2026 کو اسی ورک اسپیس کی اپنی ماڈل رجسٹری سے پڑھے گئے ہیں — یہ بتاتے ہیں کہ آپ کو یہاں کیا ملتا ہے، نہ کہ وینڈروں کی شائع شدہ تفصیلات۔ اوقات ہماری اپنی پیمائش ہیں جو اوپر دکھائی گئی کلپوں پر لی گئیں؛ ہم نے وہی اسکرپٹ باقی تین ماڈلوں سے نہیں گزارے، اس لیے وہ خانے اندازہ لگانے کے بجائے یہی بتاتے ہیں۔

OmniHuman 1.5 جیسے مزید ویڈیو ماڈلز

دوسرے ویڈیو ماڈلز کے ساتھ OmniHuman 1.5 کا موازنہ کریں — وہی ورک اسپیس، سوئچ کرنے کے لیے ایک کلک۔

CreateVision AI پر OmniHuman 1.5 کی تفصیلات

ماڈلomnihuman-1.5، از ByteDance (تحقیقی مقالہ اگست 2025 میں شائع ہوا)
موڈبولتا اوتار: ایک تصویر + ایک آڈیو ٹریک ← بولتی ویڈیو، اس صفحے کے اوتار ورک اسپیس میں
ان پٹبالکل 1 پورٹریٹ تصویر، اور ساتھ 35 سیکنڈ تک آڈیو (mp3/wav اپ لوڈ) — یا 600 حروف تک لکھا ہوا متن، جسے تقریر میں بدلا جاتا ہے
آوازوں کی لائبریری10 زبانوں میں 60 اندرونی آوازیں: انگریزی، چینی، جاپانی، کورین، فرانسیسی، جرمن، ہسپانوی، اطالوی، روسی، پرتگالی
اختیاری رہنمائیحرکات، جذبے اور کیمرے کے بارے میں ایک مختصر ہدایت — کارآمد، مگر کبھی لازمی نہیں
آؤٹ پُٹایک ہی مسلسل شاٹ جو آپ کی تصویر کی فریمنگ قائم رکھتا ہے؛ کلپ کی لمبائی آڈیو کی لمبائی کے برابر ہوتی ہے۔ ناپا گیا آؤٹ پٹ: 2:3 تصویر سے 1248×1664، 16:9 سے 1920×1088، 25 fps، H.264 اور مونو AAC آڈیو کے ساتھ
کریڈٹسفی سیکنڈ آڈیو 130، اوپر کی طرف پورا کر کے — کم از کم 130، اور پورے 35 سیکنڈ پر 4,550؛ درست لاگت جنریٹ کرنے سے پہلے دکھائی جاتی ہے
ماپی گئی رفتارہمارے 7 کلپ کے ٹیسٹ میں تقریباً 10 س آڈیو کے لیے فی منظور شدہ کام 3m 20s–4m 42s؛ ایک استثنا 14 منٹ قطار میں رہا (اگست 2026، ایک مصروف منگل کی شام)

ایک تصویر سے بولتا اوتار کیسے بنائیں

ویڈیوز بنانا شروع کریں
  1. چہرہ شامل کریں

    ایک صاف، سامنے کا رخ، کمر تک کا پورٹریٹ اپ لوڈ کریں — یا اسی ورک اسپیس میں GPT Image 2 یا Seedream سے بنا لیں، اور اس صفحے کا ہر چہرہ اسی طرح بنایا گیا ہے۔ فی تصویر ایک شخص؛ چہرہ بڑا اور بغیر کسی رکاوٹ کے رکھیں۔

  2. اسے ایک آواز دیں

    ایک آڈیو کلپ اپ لوڈ کریں (mp3 یا wav، 35 سیکنڈ تک)، یا متن والے موڈ پر جائیں: 600 حروف تک لکھیں اور 10 زبانوں کی 60 آوازوں میں سے ایک چنیں، جن میں سے ہر ایک کی جھلک آپ پہلے سن سکتے ہیں۔

  3. چاہیں تو اداکاری کی ہدایت دیں

    "پُرسکون، ہلکے سر ہلانا، ہلکی مسکراہٹ" جیسی ایک مختصر ہدایت اشاروں اور جذبے کو موڑ دیتی ہے۔ اسے خالی چھوڑ دیں تو ماڈل خود آڈیو کی روانی اور معنی پڑھ لیتا ہے۔

  4. جنریٹ کریں اور ہم آہنگی جانچیں

    کریڈٹ کی درست لاگت چلانے سے پہلے نظر آ جاتی ہے — یہ آڈیو کی لمبائی کے ساتھ بڑھتی ہے۔ جنریشن غیر ہم وقت ہے؛ کلپ اپنے ہر ان پٹ کے ساتھ آپ کی ہسٹری میں آ جاتی ہے، اس لیے کوئی کارآمد سیٹ اپ اگلے ہفتے دہرایا جا سکتا ہے۔

OmniHuman 1.5 سے آگے

ایک اکاؤنٹ، مکمل امیج اور ویڈیو جنریشن ورک فلو۔

متعلقہ مضامین

OmniHuman 1.5 کی قیمتیں اور روزانہ مفت کریڈٹس

OmniHuman 1.5 کو مفت پلان کے روزانہ کریڈٹس پر چلائیں، یا پریمیم ماڈلز، تیز تر جنریشن اور 4K آؤٹ پٹ کے لیے اپ گریڈ کریں۔

Free

$0

شروعات کرنے کے لیے بہترین

  • 200 ویلکم کریڈٹس، روزانہ زیادہ سے زیادہ 80
  • Z Image Turbo کے ڈرافٹس 0 credits پر
  • معیاری جنریشن رفتار
  • جنریشن ہسٹری شامل
شروع کریں

Premium

سب سے مقبول
$29/month

سالانہ بل · $240/سال

  • ماہانہ 8,000 کریڈٹس، کوئی یومیہ حد نہیں
  • تمام Premium ماڈلز — GPT Image 2، Nano Banana، Seedream، Seedance، Veo، Kling
  • 5 گنا جنریشن رفتار، ترجیحی قطار
  • AI پرامپٹ بہتری
Premium میں اپ گریڈ کریں

Ultimate

$49/month

سالانہ بل · $380/سال

  • ماہانہ 18,000 کریڈٹس، کوئی یومیہ حد نہیں
  • 4K ریزولوشن تک HD جنریشن
  • ترجیحی سپورٹ
  • سب سے تیز قطار اور نئے ماڈلز تک ابتدائی رسائی
Ultimate میں اپ گریڈ کریں

OmniHuman 1.5 — اکثر پوچھے جانے والے سوالات

1

OmniHuman 1.5 کیا ہے؟

ByteDance کا آڈیو سے چلنے والا اوتار ماڈل۔ یہ ایک پورٹریٹ تصویر اور ایک آڈیو ٹریک لیتا ہے اور اسی شخص کی ویڈیو واپس کرتا ہے جو وہ آڈیو بول رہا ہو — ہونٹ، تاثرات، سر کی حرکت اور ہاتھوں کے اشارے، سب آواز کی پیروی کرتے ہیں۔ اس کے پیچھے کا تحقیقی مقالہ اگست 2025 میں شائع ہوا۔

2

کیا اوتار میرے بالکل وہی الفاظ بول سکتا ہے؟

ہاں — پرامپٹ سے چلنے والے ویڈیو ماڈلوں سے فرق یہی ہے۔ ساؤنڈ ٹریک آپ دیتے ہیں، یا تو mp3/wav اپ لوڈ کر کے یا اسکرپٹ لکھ کر اور کوئی اندرونی آواز چن کر، اور اوتار اس سے لفظ بہ لفظ ہونٹ ملاتا ہے۔ پرامپٹ سے چلنے والے ماڈل اپنی آوازیں خود بناتے ہیں اور شاذ ہی بالکل وہی کہتے ہیں جو آپ نے لکھا۔

3

کیا OmniHuman 1.5 مفت استعمال ہوتا ہے؟

نہیں — یہ فی سیکنڈ آڈیو 130 کریڈٹ لیتا ہے، اوپر کی طرف پورا کر کے، اس لیے 10 سیکنڈ کی کلپ 1,300 کریڈٹ کی ہے۔ درست لاگت جنریٹ کرنے سے پہلے دکھائی جاتی ہے، اور ناکام رنز کے کریڈٹ خود بخود واپس ہو جاتے ہیں۔ اسکرپٹ مختصر رکھیں اور خاموشی کاٹ دیں: آڈیو کا ہر سیکنڈ ایک ایسا سیکنڈ ہے جس کے آپ پیسے دیتے ہیں۔

4

کیا ایک اچھا ذریعہ تصویر بناتا ہے؟

سامنے کا رخ، کمر تک، ایک شخص، اور چہرہ بڑا، یکساں روشنی میں اور بغیر کسی رکاوٹ کے — جائزہ لینے والے اور ہمارے اپنے ٹیسٹ دونوں یہی کہتے ہیں۔ اوپر جان بوجھ کر کیا گیا ہمارا تین چوتھائی رخ کا ٹیسٹ دکھاتا ہے کہ ورنہ کیا ہوتا ہے: ہونٹ مشکل سے حرکت کرتے ہیں، ماڈل آہستہ آہستہ سر کو مزید دور موڑ دیتا ہے، اور میز پر ایسی چیزیں نمودار ہو جاتی ہیں جو تصویر میں تھیں ہی نہیں۔ بنائے گئے پورٹریٹ بالکل اتنے ہی اچھے چلتے ہیں جتنے کیمرے کی تصویریں۔

5

کیا یہ تصویری خاکوں یا اینیمے کرداروں کے ساتھ چلتا ہے؟

ہاں — اوپر ہمارا کہانی کی کتاب والا ٹیسٹ ایک چپٹا 2D خاکہ ہے، اور OmniHuman 1.5 نے اسے قائل کن انداز میں حرکت دی اور آرٹ کا انداز بھی قائم رکھا: آنکھیں، ابرو اور منہ کسی ہاتھ سے بنائے گئے کردار کی طرح حرکت کرتے ہیں۔ ایک بات جو ہم نے دیکھی: جب منہ کھلتا ہے تو ماڈل ایک چپٹے خاکے کے لیے حیرت انگیز حد تک حقیقی دانت بنا دیتا ہے۔ ByteDance کا مقالہ غیر انسانی مضامین کا بھی دعویٰ کرتا ہے؛ ہم نے صرف یہی مصور کردار آزمایا ہے۔

6

ایک کلپ کتنی لمبی ہو سکتی ہے، اور جنریشن میں کتنا وقت لگتا ہے؟

اس پلیٹ فارم پر فی کلپ 35 سیکنڈ تک آڈیو — اس سے لمبے اسکرپٹ کاٹ کر جوڑنے پڑتے ہیں۔ اگست 2026 کے ہمارے ٹیسٹ میں منظور شدہ کام تقریباً 10 سیکنڈ کے آڈیو کے لیے 3m 20s سے 4m 42s میں واپس آئے۔ اسی شام سے ایک تنبیہ: زیادہ بوجھ کے وقت اپ اسٹریم نے کام قبول کرنے سے پہلے کئی درخواستیں گنجائش کی خرابی کے ساتھ رد کیں۔ رد ہونے والے رنز کی کوئی قیمت نہیں، مگر مصروف اوقات میں دوبارہ کوششوں کی گنجائش رکھیں، پانچ منٹ بعد کی ڈیڈ لائن نہ رکھیں۔

7

OmniHuman 1.5 کس کام میں کمزور ہے؟

سب سے بڑھ کر، وہ چہرے جو سامنے کے رخ نہ ہوں: ہمارا تین چوتھائی رخ کا ٹیسٹ تقریباً ساکن ہونٹ، ایک ایسا سر جو کیمرے سے مزید دور ہٹتا جاتا ہے، اور میز پر ایسی چیزیں دکھاتا ہے جو تصویر میں تھیں ہی نہیں۔ شناخت کی چھوٹی تفصیلیں کلپ کے بیچ میں بہک سکتی ہیں — اُس ٹیسٹ میں ایک بالی کی شکل بدل گئی، اور دو دوسری کلپوں میں ہونٹوں کا رنگ ان پٹ سے کچھ گہرا لگتا ہے۔ کئی افراد کا مکالمہ یہاں دستیاب نہیں، آؤٹ پٹ کا ریزولوشن معمولی ہے (ہمارے پورٹریٹ ٹیسٹوں میں 1248×1664 — کوئی 4K نہیں)، اور یہ صرف تقریر کی ویڈیو بناتا ہے: ایکشن، کیمرے کی حرکت یا منظر کی تبدیلی کے لیے Seedance 2.5 یا Kling 3.0 Turbo استعمال کریں۔

8

کیا میں ویڈیوز کاروباری طور پر استعمال کر سکتا ہوں — اور کس کا چہرہ استعمال کر سکتا ہوں؟

آپ کی بنائی ہوئی ویڈیوز ہماری شرائطِ خدمت کے تحت ذاتی اور کاروباری منصوبوں میں استعمال ہو سکتی ہیں۔ اصل سنجیدہ معاملہ چہرہ ہے: کسی حقیقی شخص کی تصویر کو اس کی اجازت کے بغیر حرکت دینا شبیہ اور تشہیر کے حقوق کی خلاف ورزی ہو سکتی ہے، اور کئی ممالک اب مصنوعی میزبانوں کے بارے میں بتانا لازمی قرار دیتے ہیں۔ بنائے گئے چہرے — جیسے اس صفحے کا ہر چہرہ — اجازت کا مسئلہ سرے سے ختم کر دیتے ہیں۔

کسی تصویر کو کہنے کے لیے کچھ دیں

ویڈیوز بنانا شروع کریں

قیمت اور رسائی — حقائقOmniHuman 1.5

ماڈل
OmniHuman 1.5
ڈیولپر
ByteDance
رسائی
CreateVision AI ورک اسپیس میں API کے ذریعے چلتا ہے — سائن اِن کریں اور بنائیں۔ نہ API کلید، نہ کلاؤڈ پروجیکٹ، نہ انسٹالیشن۔
فی جنریشن قیمت
Premium پلان پر 5 سیکنڈ کلپ کے لیے 650 کریڈٹس سے ≈ $2.36 ($29/ماہ میں 8,000 کریڈٹس)۔ مفت پلان میں روزانہ 80 کریڈٹس شامل ہیں۔
رازداری
بطورِ طےشدہ نجی — کسی بھی پلان پر کوئی دوسرا صارف آپ کی تخلیقات نہیں دیکھ سکتا۔ ہم ممبر ڈیٹا نہ بیچتے ہیں نہ اس کا غلط استعمال کرتے ہیں۔ رازداری کی پالیسی

نیا کیا ہےOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.