مولّد الأفاتار المتكلم بالذكاء الاصطناعي OmniHuman 1.5

أعطِ OmniHuman 1.5 بورتريهًا واحدًا ومسار صوت، فيعيد فيديو لذلك الشخص وهو يقول كلماتك بالضبط — الشفاه والتعبيرات والإيماءات تتبع الصوت.

0 / 2,000
130 cr/s · ≤35s

ما هو OmniHuman 1.5؟

OmniHuman 1.5 هو نموذج الأفاتار المدفوع بالصوت من ByteDance: أعطه بورتريهًا واحدًا ومسار صوت، فيعيد فيديو لذلك الشخص وهو ينطق صوتك — الشفاه والتعبيرات وحركة الرأس والإيماءات كلها يقودها الصوت. وخلافًا لنماذج الفيديو التي تقودها المطالبات، أنت تزوّده بالكلمات الدقيقة. وتقرن الورقة البحثية نموذج لغة متعدد الوسائط بمحوّل انتشار، فالأداء يتفاعل مع ما يُقال لا يتتبع الفم فحسب.

الجزء الصادق: يحتاج بورتريهًا أماميًا. واختبارنا بزاوية ثلاثة أرباع أدناه يُظهر شفاهًا تكاد لا تنطق ورأسًا ينجرف بعيدًا. والصوت محدود بـ 35 ثانية لكل تشغيلة، فالنصوص الأطول تعني التقسيم والخياطة، والحوار متعدد الأشخاص — وهو ميزة رئيسية في الورقة — غير متاح هنا. إنه فيديو كلام لا فيديو مشهد: ولحركة الكاميرا أو الحركة الفعلية، استخدم Seedance 2.5 أو Kling 3.0 Turbo.

البنية والتموضع وأرقام دراسة المستخدمين مأخوذة من الورقة البحثية لـ ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

ماذا يقول المختبرون

يُظهر الإصدار 1.5 متانة محسّنة أمام المدخلات الصعبة.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
البورتريه من الخصر فأعلى بيدين واضحتين وكتفين وإضاءة طبيعية يعطي عادةً حركة جسد أفضل.
Z.Tools — OmniHuman-1.5 deep dive
الظلال الثقيلة، والنظارات الشمسية، والحجب الغريب، والوجوه الصغيرة جدًا تجعل المهمة أصعب.
Z.Tools — OmniHuman-1.5 deep dive

لماذا تشغّل OmniHuman 1.5 على CreateVision AI؟

النموذج من ByteDance؛ وسبب استخدامه هنا أن المدخلين الآخرين — الوجه والصوت — يأتيان من مساحة العمل نفسها.

بورتريه من GPT Image 2 استُخدم كوجه دخل لمقطع أفاتار من OmniHuman 1.5

سلسلة المدخلات كلها تعيش في صفحة واحدة

مقطع الأفاتار المتكلم يحتاج ثلاثة أشياء: وجهًا، وصوتًا، والنموذج. وهنا الثلاثة كلها تأتي من مساحة العمل نفسها — ولّد البورتريه بـ GPT Image 2 أو Seedream، واكتب النص وركّبه بواحد من 60 صوتًا مدمجًا، ثم مرّر كليهما مباشرة إلى OmniHuman 1.5. وكل مقطع على هذه الصفحة صُنع بهذه الطريقة بالضبط، من أوله إلى آخره، دون تسجيل ثانية صوت واحدة ودون رفع صورة واحدة لشخص حقيقي.

بورتريه الدخل لحالة متجر الشاي الناطقة بالماندرين من OmniHuman 1.5

مكتبة أصوات بدل كابينة تسجيل

وضع النص ليس فكرة لاحقة: 60 صوتًا عبر الإنجليزية والصينية واليابانية والكورية والفرنسية والألمانية والإسبانية والإيطالية والروسية والبرتغالية، لكل واحد معاينة تشغّلها قبل أن تنفق شيئًا. اكتب حتى 600 حرف، واختر صوتًا، فتركّب المنصة الكلام وتقود به الأفاتار في تشغيلة واحدة. ومقطع متجر الشاي بالماندرين أعلاه هو هذا المسار بالضبط — بلا ميكروفون.

بورتريه الدخل لحالة مذيع الأخبار من OmniHuman 1.5

اشتراك واحد، والتكلفة ظاهرة مسبقًا

يحاسب OmniHuman 1.5 لكل ثانية من الصوت — 130 نقطة لكل ثانية، بالتقريب لأعلى — وتعرض مساحة العمل التكلفة الدقيقة لمقطعك قبل أن تضغط على التوليد. والخطة نفسها تغطي GPT Image 2 وNano Banana Pro وSeedream وSeedance وKling وVeo، فسير العمل المعقول رخيص: سوّد البورتريه بحفنة نقاط، وثبّت النص، وعندها فقط أنفق على ثواني الأفاتار. واقصص الصمت من صوتك — فأنت تدفع مقابل كل ثانية منه.

بورتريه الدخل بزاوية ثلاثة أرباع المستخدَم في اختبار إجهاد OmniHuman 1.5

مقيس، لا موعود — بما في ذلك الإخفاق

مجموعة اختبارنا بسبعة مقاطع وُلِّدت في 19 أغسطس 2026 — عرض منتج، وموجز أخبار، وخطبة تحفيز في صالة رياضية، وترحيب بالماندرين في متجر شاي، وشخصية من كتاب قصص، وإخفاق مقصود بزاوية ثلاثة أرباع، ولقطة مسرح واسعة. وكل مهمة مقبولة صُيِّرت بنجاح من المحاولة الأولى، في 3m 20s إلى 4m 42s لنحو عشر ثوانٍ من الصوت. وننشر أيضًا ما الذي أخفق: في مساء ثلاثاء مزدحم رفض المصدر 13 من 20 طلبًا أرسلناها بأخطاء سعة قبل أن يقبلها (والتشغيلات المرفوضة تُردّ تلقائيًا)، وانتظرت مهمة مقبولة واحدة 14 دقيقة في الطابور، ومقطع البورتريه الجانبي على هذه الصفحة يُظهر بالضبط ما يحدث حين تتجاهل نصيحة البورتريه الأمامي.

مقاطع OmniHuman 1.5 حقيقية من مساحة العمل هذه

المقاطع الـ 7 كلها أدناه وُلِّدت هنا في 19 أغسطس 2026 — وكل واحد هو أول تصيير أنتجته مدخلاته، بلا إعادات وبلا انتقاء. والبورتريهات مخرجات GPT Image 2؛ وكل صوت كُتب نصًا وركّبته المكتبة المدمجة. وعادت المهام المقبولة في 3m 20s إلى 4m 42s لنحو 10 ثوانٍ من الصوت (وواحدة شاذة انتظرت 14 دقيقة)؛ وفي أمسية مزدحمة رفض المصدر عدة طلبات بأخطاء سعة قبل القبول — والتشغيلات المرفوضة تُردّ. شغّل الصوت.

الموجِّه9.2 ثانية صوت · صوت Trustworthy Man · 1,300 نقطة · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

الموجِّه10.2 ثانية صوت · صوت News Anchor · 1,430 نقطة · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

الموجِّه10.7 ثانية صوت · صوت Energetic Guy · 1,430 نقطة · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

الموجِّه11.8 ثانية صوت · صوت Mandarin Sweet Girl · 1,560 نقطة · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

الموجِّه9.7 ثانية صوت · صوت Sweet Girl · 1,300 نقطة · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

الموجِّه8.6 ثانية صوت · صوت Wise Lady · 1,170 نقطة · مزامنة الشفاه تتدهور بوضوح عند هذه الزاوية

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

الموجِّه5.4 ثانية صوت · صوت Movie Narrator · 780 نقطة · هذا الكادر هو خلفية الصفحة

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

لمن OmniHuman 1.5 فعلًا

كل نقطة من هذه تقابل مقطعًا مُبرهنًا أعلاه — لا قائمة أمنيات.

  • صنّاع الدورات والشروحات

    اكتب السرد فتحصل على مقدّم على الشاشة — بلا كاميرا ولا إضاءة ولا إعادة تصوير. وسقف 35 ثانية لكل مقطع ينطبق بدقة على مفهوم واحد لكل مقطع، وهي الطريقة التي يقصّ بها معظم محرري الدورات أصلًا.

  • مسوّقو UGC والمنتجات

    حالة عرض مكبر الصوت أعلاه هي سير العمل كله: ولّد بورتريهًا بأسلوب صانعي المحتوى يحمل منتجك، واكتب العرض، واختر صوتًا. بلا أتعاب مواهب، وبلا تصريح صورة شخصية تلاحقه — فالوجه لم يوجد قط.

  • فرق التوطين

    الوجه نفسه يستطيع إلقاء الرسالة نفسها بعشر لغات: أبقِ البورتريه، وبدّل الصوت. ومزامنة الشفاه تتبع أي صوت تزوّده به — وحالة الماندرين أعلاه هي البرهان.

  • القنوات بلا وجوه والمقدّمون الافتراضيون

    الشخصية التي تولّدها شخصية تملكها. صمّم الوجه مرة، وأعطه صوت مكتبة ثابتًا، فيستطيع تصدّر كل حلقة — وشخصية كتاب القصص المرسومة أعلاه تُظهر أنه لا يلزم حتى أن يكون فوتوغرافيًا.

  • صنّاع البودكاست ومن يبدأون من الصوت

    أنت تملك الجزء الصعب أصلًا: الصوت. اقصص مقطعًا بارزًا إلى 35 ثانية، وأضف بورتريهًا، فيصير لديك مقطع بصري للتواصل الاجتماعي دون فتح برنامج مونتاج.

OmniHuman 1.5 مقابل Seedance 2.5 مقابل Veo 3.1 Pro مقابل Kling 3.0 Turbo

فيديو الكلام في مواجهة فيديو المشهد — ما يحتاجه كل نموذج منك، وما يعيده لك في مساحة العمل هذه.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
ما تزوّده به1 صورة بورتريه + صوتك، أو نص مكتوب وصوت من المكتبةمطالبة، زائد مراجع اختيارية من صور وفيديو وصوتمطالبة، زائد صورة مرجعية اختياريةمطالبة أو صورة بداية
من ينطق الكلماتأنت — والأفاتار يزامن شفاهه مع مسارك الصوتي بالضبطالنموذج يولّد الأصوات من المطالبةالنموذج يولّد الأصوات من المطالبةالصوت يُولَّد مع المقطع
طول المقطع هناطول صوتك، حتى 35 ثانية4–30 s4–8 s3–15 s
النقاط130 لكل ثانية صوت110/s عند 480p · 230/s عند 720p320–1,920 لكل مقطع (4–8 ثوانٍ · 720p–4K · ± صوت)55/s عند 720p · 70/s عند 1080p
مقيس هنا~4 دقائق لنحو 10 ثوانٍ من الصوت (7 مقاطع، أغسطس 2026)لم يُقَس في هذه المهمةلم يُقَس في هذه المهمةلم يُقَس في هذه المهمة

قرأنا النقاط والمدة وخيارات الدخل من سجل النماذج الخاص بمساحة العمل هذه في 19 أغسطس 2026 — وهي تصف ما تحصل عليه هنا، لا مواصفات المزوّدين المنشورة. والأزمنة قياساتنا نحن على المقاطع المعروضة أعلاه؛ ولم نُمرِّر النصوص نفسها عبر النماذج الثلاثة الأخرى، فتقول تلك الخانات ذلك بدل التخمين.

نماذج فيديو أخرى مثل OmniHuman 1.5

قارن OmniHuman 1.5 مع نماذج الفيديو الأخرى - نفس مساحة العمل، بنقرة واحدة للتبديل.

مواصفات OmniHuman 1.5 على CreateVision AI

النموذجomnihuman-1.5، من ByteDance (الورقة البحثية نُشرت في أغسطس 2025)
الوضعأفاتار متكلم: صورة واحدة + مسار صوت واحد ← فيديو ناطق، في مساحة عمل الأفاتار على هذه الصفحة
المدخلات1 صورة بورتريه بالضبط، زائد صوت حتى 35 ثانية (رفع mp3/wav) — أو نص مكتوب حتى 600 حرف، يُركَّب كلامًا
مكتبة الأصوات60 صوتًا مدمجًا عبر 10 لغات: الإنجليزية، والصينية، واليابانية، والكورية، والفرنسية، والألمانية، والإسبانية، والإيطالية، والروسية، والبرتغالية
توجيه اختياريملاحظة أداء قصيرة للحركات والانفعال والكاميرا — مفيدة، وغير مطلوبة أبدًا
المُخرَجلقطة واحدة متصلة تحتفظ بتأطير صورتك؛ وطول المقطع يساوي طول الصوت. الخرج المقيس: 1248×1664 من صورة 2:3، و1920×1088 من 16:9، و25 fps، وH.264 بصوت AAC أحادي
النقاط130 لكل ثانية صوت، بالتقريب لأعلى — 130 كحد أدنى، و4,550 عند 35 ثانية كاملة؛ وتُعرض التكلفة الدقيقة قبل التوليد
السرعة المُقاسة3m 20s–4m 42s لكل مهمة مقبولة لنحو 10 ثوانٍ من الصوت في اختبارنا بـ 7 مقاطع؛ وواحدة شاذة انتظرت 14 دقيقة في الطابور (أغسطس 2026، مساء ثلاثاء مزدحم)

كيف تصنع أفاتارًا متكلمًا من صورة

ابدأ توليد مقاطع الفيديو
  1. أضف الوجه

    ارفع بورتريهًا واضحًا، أماميًا، من الخصر فأعلى — أو ولّد واحدًا بـ GPT Image 2 أو Seedream في مساحة العمل هذه نفسها، وهي الطريقة التي صُنع بها كل وجه على هذه الصفحة. شخص واحد لكل صورة؛ وأبقِ الوجه كبيرًا وغير محجوب.

  2. أعطه صوتًا

    ارفع مقطعًا صوتيًا (mp3 أو wav، حتى 35 ثانية)، أو انتقل إلى وضع النص: اكتب حتى 600 حرف واختر واحدًا من 60 صوتًا بـ 10 لغات، لكل واحد معاينة تشغّلها أولًا.

  3. وجّه الأداء اختياريًا

    ملاحظة قصيرة مثل "هادئ، إيماءات رأس صغيرة، ابتسامة خفيفة" توجّه الإيماءة والانفعال. واتركها فارغة فيقرأ النموذج إيقاع الصوت ومعناه بنفسه.

  4. ولّد وافحص المزامنة

    تظهر تكلفة النقاط الدقيقة قبل التشغيل — وهي تتناسب مع طول الصوت. والتوليد غير متزامن؛ ويهبط المقطع في سجلك ومعه كل مدخلاته، فأي إعداد ناجح قابل لإعادة الإنتاج الأسبوع القادم.

أبعد من OmniHuman 1.5

حساب واحد، وسير العمل الكامل لتوليد الصور والفيديو.

قراءات ذات صلة

أسعار OmniHuman 1.5 والأرصدة اليومية المجانية

شغّل OmniHuman 1.5 برصيد الخطة المجانية اليومي، أو رقِّ اشتراكك للحصول على نماذج متميزة وتوليد أسرع وإخراج 4K.

مجاني

$0

مثالي للبدء

  • 200 رصيد ترحيبي، بحد أقصى 80 يوميًا
  • مسوّدات Z Image Turbo بـ 0 رصيد
  • سرعة توليد قياسية
  • سجل التوليد مُضمّن
ابدأ

Premium

الأكثر شيوعًا
$29/month

يُحاسَب سنويًا · $240/year

  • 8,000 رصيد/شهر، بلا حدود يومية
  • جميع النماذج المتميزة — GPT Image 2 وNano Banana وSeedream وSeedance وVeo وKling
  • سرعة توليد 5 أضعاف، طابور أولوية
  • تحسين الموجِّهات بالذكاء الاصطناعي
الترقية إلى Premium

Ultimate

$49/month

يُحاسَب سنويًا · $380/year

  • 18,000 رصيد/شهر، بلا حدود يومية
  • توليد عالي الدقة حتى دقة 4K
  • دعم ذو أولوية
  • أسرع طابور ووصول مبكر للنماذج الجديدة
الترقية إلى Ultimate

OmniHuman 1.5 — الأسئلة الشائعة

1

ما هو OmniHuman 1.5؟

نموذج الأفاتار المدفوع بالصوت من ByteDance. يأخذ صورة بورتريه واحدة ومسار صوت واحد ويعيد فيديو لذلك الشخص وهو ينطق الصوت — الشفاه والتعبيرات وحركة الرأس وإيماءات اليد كلها تتبع الصوت. والورقة البحثية وراءه نُشرت في أغسطس 2025.

2

هل يستطيع الأفاتار قول كلماتي بالضبط؟

نعم — وهذا هو الفرق عن نماذج الفيديو التي تقودها المطالبات. أنت تزوّده بالمسار الصوتي، إما برفع mp3/wav أو بكتابة النص واختيار صوت مدمج، والأفاتار يزامن شفاهه معه كلمة بكلمة. أما النماذج التي تقودها المطالبات فتولّد أصواتها الخاصة ونادرًا ما تقول ما كتبته بدقة.

3

هل استخدام OmniHuman 1.5 مجاني؟

لا — يحاسب بـ 130 نقطة لكل ثانية من الصوت، بالتقريب لأعلى، فمقطع من 10 ثوانٍ يساوي 1,300 نقطة. وتُعرض التكلفة الدقيقة قبل التوليد، والتشغيلات الفاشلة تُردّ تلقائيًا. أبقِ النصوص محكمة واقصص الصمت: فكل ثانية صوت ثانية تدفع مقابلها.

4

ما الذي يجعل الصورة المصدرية جيدة؟

أمامي، من الخصر فأعلى، شخص واحد، والوجه كبير ومضاء بانتظام وغير محجوب — والمراجعون واختباراتنا يتفقون. واختبارنا المقصود بزاوية ثلاثة أرباع أعلاه يُظهر ما يحدث خلاف ذلك: الشفاه تكاد لا تنطق، والنموذج يدير الرأس ببطء أبعد، وتظهر أشياء على المكتب لم تكن في الصورة قط. والبورتريهات المولَّدة تعمل بجودة صور الكاميرا تمامًا.

5

هل يعمل مع الرسوم التوضيحية أو شخصيات الأنمي؟

نعم — اختبار كتاب القصص عندنا أعلاه رسم مسطّح ثنائي الأبعاد، وقد حرّكه OmniHuman 1.5 بشكل مقنع مع الحفاظ على الأسلوب الفني: العينان والحاجبان والفم تتحرك كشخصية مرسومة يدويًا. وغرابة واحدة لاحظناها: حين ينفتح الفم على اتساعه، يرسم النموذج أسنانًا واقعية بشكل مفاجئ لرسم مسطّح. وتدّعي ورقة ByteDance أيضًا دعم مواضيع غير بشرية؛ ونحن لم نختبر سوى هذه الشخصية المرسومة.

6

كم يمكن أن يطول المقطع، وكم يستغرق التوليد؟

حتى 35 ثانية من الصوت لكل مقطع على هذه المنصة — والنصوص الأطول تحتاج تقسيمًا وخياطة. وفي اختبارنا في أغسطس 2026، عادت المهام المقبولة في 3m 20s إلى 4m 42s لنحو 10 ثوانٍ من الصوت. وتحفّظ واحد من الأمسية نفسها: تحت حمل ثقيل رفض المصدر عدة طلبات بأخطاء سعة قبل قبول المهمة. والتشغيلات المرفوضة لا تكلّف شيئًا، لكن خطّط لإعادات المحاولة في ساعات الذروة لا لموعد تسليم بعد خمس دقائق.

7

في ماذا يسوء OmniHuman 1.5؟

الوجوه غير الأمامية قبل كل شيء: فاختبارنا بزاوية ثلاثة أرباع يُظهر شفاهًا شبه ساكنة، ورأسًا ينجرف أبعد عن الكاميرا، وأشياء على المكتب لم تكن في الصورة قط. وتفاصيل الهوية الصغيرة قد تشرد في منتصف المقطع — فقد تغيّر شكل قرط في ذلك الاختبار، ولون الشفاه يُقرأ أقوى قليلًا من الدخل في اثنين آخرين. والحوار متعدد الأشخاص غير متاح هنا، ودقة الخرج متواضعة (1248×1664 في اختبارات البورتريه عندنا — بلا 4K)، وهو لا يصنع إلا فيديو كلام: وللحركة أو حركة الكاميرا أو تغيّر المشاهد، استخدم Seedance 2.5 أو Kling 3.0 Turbo.

8

هل أستطيع استخدام الفيديوهات تجاريًا — وأي وجه أستطيع استخدامه؟

الفيديوهات التي تولّدها يمكن استخدامها في مشاريع شخصية وتجارية بموجب شروط الخدمة عندنا. والوجه هو الجزء الذي يجب أخذه على محمل الجد: فتحريك صورة شخص حقيقي دون موافقته قد ينتهك حقوق الصورة الشخصية والدعاية، وعدة ولايات قضائية تفرض الآن الإفصاح عن المقدّمين الاصطناعيين. أما الوجوه المولَّدة — مثل كل وجه على هذه الصفحة — فتتجنب مشكلة الموافقة كليًا.

أعطِ صورة شيئًا تقوله

ابدأ توليد مقاطع الفيديو

الأسعار والوصول — الحقائقOmniHuman 1.5

النموذج
OmniHuman 1.5
المطوِّر
ByteDance
طريقة الوصول
يعمل داخل مساحة عمل CreateVision AI عبر واجهة API — سجِّل الدخول وابدأ الإنشاء. لا حاجة لمفتاح API ولا لمشروع سحابي ولا لتثبيت أي برنامج.
السعر لكل عملية إنشاء
ابتداءً من 650 رصيدًا ≈ $2.36 لكل مقطع مدته 5 ثوانٍ مع خطة Premium ‏($29/شهريًا مقابل 8,000 رصيد). تتضمن الخطة المجانية 80 رصيدًا يوميًا.
الخصوصية
خاص افتراضيًا — لا يمكن لأي مستخدم آخر رؤية إنشاءاتك في أي خطة. نحن لا نبيع بيانات الأعضاء ولا نسيء استخدامها. سياسة الخصوصية

ما الجديدOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.