OmniHuman 1.5 AI مولد الصور الرمزية

أضف الحياة إلى صورة واحدة باستخدام OmniHuman 1.5 - قم بتحميل صورة ومقطع صوتي (أو اكتب نصًا واختر صوتًا) لإنشاء صورة رمزية واقعية تتحدث مع شفاه وتعبيرات وإيماءات متزامنة.

صورة + صوت → فيديوالإيماءات التي تعمل بالصوتمكتبة أصوات تحويل النص إلى كلام
0 / 2,000
130 cr/s · ≤35s

نماذج فيديو أخرى مثل OmniHuman 1.5

قارن OmniHuman 1.5 مع نماذج الفيديو الأخرى - نفس مساحة العمل، بنقرة واحدة للتبديل.

OmniHuman 1.5 — حوّل صورة واحدة وصوتًا إلى صورة رمزية ناطقة نابضة بالحياة

يُشغّل برنامج OmniHuman 1.5 من ByteDance صورةً واحدةً من خلال الصوت: شفاه متزامنة، وتعبيرات طبيعية، وإيماءات جسدية كاملة تستجيب لإيقاع الصوت ومعناه - وليس مجرد حركة فم. حمّل صورة ومقطع فيديو، أو اكتب نصًا واختر صوتًا.

لقطة فيديو ثابتة بالذكاء الاصطناعي لظل راقصة على مسرح مدخّن تحت ضوء كهرماني

صورة واحدة + صوت يتحول إلى صورة رمزية ناطقة

أعطِ برنامج OmniHuman 1.5 صورةً واحدةً ومقطعًا صوتيًا، وسيقوم بتحريك الوجه ليُقدّم أداءً صوتيًا واقعيًا مع مزامنة دقيقة لحركة الشفاه، مع الحفاظ على هوية الشخص وبنية وجهه وإضاءته. لا حاجة إلى هيكلة، ولا شاشة خضراء، ولا استوديو.

لقطة فيديو ثابتة بالذكاء الاصطناعي لرائد فضاء يسير في ممر سفينة فضائية متوهج

حركة الجسم بالكامل، وليس الشفاه فقط

بخلاف أدوات الرأس المتحدث الأساسية، يقرأ OmniHuman 1.5 الإيقاع والنبرة ومعنى الصوت لتحريك الرأس وتغييرات الوضعية وإيماءات اليد - بحيث يؤكد الصورة الرمزية ويتوقف ويتفاعل مثل مقدم حقيقي بدلاً من صورة ثابتة بفم متحرك.

لقطة فيديو ثابتة بالذكاء الاصطناعي لمطر ينساب على نافذة مقهى مع بوكيه دافئ

اكتب النص، واختر صوتًا - لا حاجة للتسجيل

لا يوجد صوت متاح؟ انتقل إلى وضع النص: اكتب ما يجب أن يقوله الرمز، واختر صوتًا من مكتبة تحويل النص إلى كلام المدمجة، وسيقوم OmniHuman 1.5 بإنشاء الأداء الصوتي نيابةً عنك. مثالي للمقدمين الذين يستخدمون نصوصًا مكتوبة، وللشرح، ولمقاطع الفيديو على مواقع التواصل الاجتماعي.

لقطة فيديو ثابتة بالذكاء الاصطناعي للأضواء الشمالية تتلوّى فوق كوخ مكسوّ بالثلج

السرد أو الحوار أو الغناء

يتكيف النموذج مع أنماط صوتية مختلفة - السرد الهادئ، والحوار المعبر، وحتى الغناء - ويمكنه اتباع إرشادات نصية اختيارية للكاميرا واتجاه الإيماءات، مما ينتج عنه نتائج مصقولة مناسبة للتسويق والتدريب والمحتوى الاجتماعي.

كيفية استخدام OmniHuman 1.5

ثلاث خطوات من مربع موجِّه فارغ إلى مقطع نهائي.

  1. 1

    اختر OmniHuman 1.5

    افتح منتقي النماذج واختر OmniHuman 1.5. تعرض اللوحة تكلفة الأرصدة وخيارات الدقة وحدود المدة قبل أن تنفق أي رصيد.

  2. 2

    صِف ما تريده

    اكتب الموضوع والحركة وكيف تتحرك الكاميرا. أرفق إطارًا أولًا إذا أردت أن يبدأ المقطع من صورة محددة.

  3. 3

    ولّد، ثم امضِ قدمًا

    نزّل المقطع أو مدّده أو أرسله لمزيد من التحرير. يبقى الموجِّه والنموذج والإعدادات مرفقة به في سجلّك.

أبعد من OmniHuman 1.5

حساب واحد، وسير العمل الكامل لتوليد الصور والفيديو.

أسعار OmniHuman 1.5 والأرصدة اليومية المجانية

شغّل OmniHuman 1.5 برصيد الخطة المجانية اليومي، أو رقِّ اشتراكك للحصول على نماذج متميزة وتوليد أسرع وإخراج 4K.

مجاني

$0

مثالي للبدء

  • 80 رصيد في اليوم، 400 في الشهر
  • مسوّدات Z Image Turbo بـ 0 رصيد
  • سرعة توليد قياسية
  • سجل التوليد مُضمّن
ابدأ

Premium

الأكثر شيوعًا
$29/month

يُحاسَب سنويًا · $240/year

  • 1,600 رصيد/يوم، 8,000 رصيد/شهر
  • جميع النماذج المتميزة — GPT Image 2 وNano Banana وSeedream وSeedance وVeo وKling
  • سرعة توليد 5 أضعاف، طابور أولوية
  • تحسين الموجِّهات بالذكاء الاصطناعي
الترقية إلى Premium

Ultimate

$49/month

يُحاسَب سنويًا · $300/year

  • 4,000 رصيد/يوم، 18,000 رصيد/شهر
  • توليد عالي الدقة حتى دقة 4K
  • دعم ذو أولوية
  • أسرع طابور ووصول مبكر للنماذج الجديدة
الترقية إلى Ultimate

OmniHuman 1.5 — الأسئلة الشائعة

1

ما هو OmniHuman 1.5؟

OmniHuman 1.5 هو نموذج الصورة الرمزية الذي يعتمد على الصوت من ByteDance: فهو يحول صورة واحدة بالإضافة إلى مسار صوتي إلى فيديو ناطق واقعي مع شفاه وتعبيرات وإيماءات متزامنة.

2

ما الذي أحتاج إلى تقديمه؟

صورة شخصية واضحة لشخص واحد، بالإضافة إلى مقطع صوتي (mp3/wav) أو - في وضع النص - النص الذي تريد نطقه وصوت يتم اختياره من المكتبة المدمجة، والذي يتم تركيبه في الصوت الرئيسي.

3

ما هو الحد الأقصى لطول مقطع الفيديو الخاص بالصورة الرمزية؟

يُسمح بتسجيل ما يصل إلى 35 ثانية من الصوت لكل عملية إنتاج. يُفضّل تقسيم النصوص الطويلة إلى مقاطع متعددة. يتم احتساب التكلفة بالثانية، مع تقريب النتيجة إلى أقرب عدد صحيح.

4

هل يتحرك أكثر من الفم؟

نعم. يقوم OmniHuman 1.5 بتوليد حركة الرأس والوضعية وإيماءات اليد التي تستجيب لإيقاع الصوت ومعناه، لذلك يقوم الأفاتار بالأداء بدلاً من مجرد مزامنة الشفاه.

5

ما الذي يجعل الصورة المصدرية جيدة؟

صورة لشخص واحد واضح المعالم، يواجه الكاميرا من الأمام، بإضاءة جيدة ووجه غير محجوب. الصور الجماعية، أو الوجوه الصغيرة، أو الوجوه المحجوبة بشكل كبير، تقلل من جودة الصورة أو قد لا تظهر.

6

كيف يتم تسعير OmniHuman 1.5؟

لكل ثانية من الصوت المُولّد. يتم عرض تكلفة الرصيد الدقيقة قبل بدء عملية الإنشاء، ويتم استرداد قيمة المحاولات الفاشلة تلقائيًا.

أضف الحيوية إلى صورتك مع OmniHuman 1.5

ابدأ توليد مقاطع الفيديو

ما الجديدOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.