OmniHuman 1.5 AI बोलता अवतार जेनरेटर

OmniHuman 1.5 को एक पोर्ट्रेट और एक आवाज़ ट्रैक दीजिए, और यह उस व्यक्ति का आपके ठीक उन्हीं शब्दों को बोलता हुआ वीडियो लौटाता है — होंठ, भाव और हाव-भाव आवाज़ के पीछे चलते हैं।

0 / 2,000
130 cr/s · ≤35s

ओम्नीह्यूमन 1.5 क्या है?

OmniHuman 1.5, ByteDance का ऑडियो-चालित अवतार मॉडल है: इसे एक पोर्ट्रेट और एक आवाज़ ट्रैक दीजिए, और यह उस व्यक्ति का आपका ऑडियो बोलता हुआ वीडियो लौटाता है — होंठ, भाव, सिर की हरकत और हाव-भाव, सब आवाज़ से चलते हैं। प्रॉम्प्ट-चालित वीडियो मॉडलों के उलट, ठीक-ठीक शब्द आप देते हैं। शोध पत्र एक बहुविध भाषा मॉडल को एक डिफ़्यूज़न ट्रांसफ़ॉर्मर के साथ जोड़ता है, इसलिए अभिनय सिर्फ़ मुँह का पीछा करने के बजाय इस पर प्रतिक्रिया देता है कि कहा क्या जा रहा है।

ईमानदार हिस्सा: इसे सामने से लिया गया पोर्ट्रेट चाहिए। नीचे हमारा तीन-चौथाई प्रोफ़ाइल वाला टेस्ट ऐसे होंठ दिखाता है जो मुश्किल से हिलते हैं और एक सिर जो दूर खिसकता जाता है। हर रन में ऑडियो 35 सेकंड तक सीमित है, इसलिए लंबी स्क्रिप्ट का मतलब है काटना और जोड़ना, और कई लोगों का संवाद — जो शोध पत्र की एक बड़ी खूबी है — यहाँ उपलब्ध नहीं है। यह भाषण वीडियो है, दृश्य वीडियो नहीं: कैमरे की हरकत या क्रिया के लिए Seedance 2.5 या Kling 3.0 Turbo इस्तेमाल कीजिए।

आर्किटेक्चर, स्थिति और उपयोगकर्ता-अध्ययन के आँकड़े ByteDance के शोध पत्र से हैं: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

परीक्षक क्या कहते हैं

संस्करण 1.5 कठिन इनपुट के लिए बेहतर मज़बूती दिखाता है।
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
कमर तक का ऐसा पोर्ट्रेट जिसमें हाथ, कंधे साफ़ दिखें और रोशनी स्वाभाविक हो, आम तौर पर शरीर की बेहतर हरकत देता है।
Z.Tools — OmniHuman-1.5 deep dive
गहरी छायाएँ, धूप के चश्मे, अजीब रुकावटें और बहुत छोटे चेहरे काम को कठिन बना देते हैं।
Z.Tools — OmniHuman-1.5 deep dive

OmniHuman 1.5 को CreateVision AI पर क्यों चलाएँ?

मॉडल ByteDance का है; इसे यहाँ इस्तेमाल करने की वजह यह है कि बाकी दोनों इनपुट — चेहरा और आवाज़ — उसी वर्कस्पेस से आते हैं।

OmniHuman 1.5 अवतार क्लिप के इनपुट चेहरे के रूप में इस्तेमाल किया गया GPT Image 2 का पोर्ट्रेट

पूरी इनपुट शृंखला एक ही पेज पर रहती है

बोलते अवतार वाले क्लिप के लिए तीन चीज़ें चाहिए: एक चेहरा, एक आवाज़, और मॉडल। यहाँ तीनों एक ही वर्कस्पेस से आते हैं — GPT Image 2 या Seedream से पोर्ट्रेट जनरेट कीजिए, स्क्रिप्ट टाइप करके उसे 60 अंतर्निहित आवाज़ों में से एक से संश्लेषित कीजिए, फिर दोनों सीधे OmniHuman 1.5 में डाल दीजिए। इस पेज का हर क्लिप ठीक इसी तरह, शुरू से आख़िर तक बना है, बिना एक सेकंड ऑडियो रिकॉर्ड किए और बिना किसी असली व्यक्ति की एक भी तस्वीर अपलोड किए।

मैंडरिन बोलने वाले OmniHuman 1.5 चाय-दुकान मामले का इनपुट पोर्ट्रेट

रिकॉर्डिंग बूथ की जगह एक आवाज़ लाइब्रेरी

टेक्स्ट मोड कोई बाद की सोच नहीं है: अंग्रेज़ी, चीनी, जापानी, कोरियाई, फ़्रेंच, जर्मन, स्पेनिश, इतालवी, रूसी और पुर्तगाली में 60 आवाज़ें, हर एक के साथ एक प्रीव्यू जिसे आप कुछ भी खर्च करने से पहले सुन सकते हैं। 600 अक्षरों तक टाइप कीजिए, एक आवाज़ चुनिए, और प्लेटफ़ॉर्म एक ही रन में भाषण संश्लेषित करके उससे अवतार को चलाता है। ऊपर का मैंडरिन चाय-दुकान क्लिप ठीक यही रास्ता है — कोई माइक्रोफ़ोन शामिल नहीं।

न्यूज़ एंकर वाले OmniHuman 1.5 मामले का इनपुट पोर्ट्रेट

एक सब्सक्रिप्शन, और लागत पहले ही दिख जाती है

OmniHuman 1.5 ऑडियो के प्रति सेकंड बिल करता है — 130 क्रेडिट प्रति सेकंड, ऊपर की ओर पूर्णांकित — और वर्कस्पेस जनरेट दबाने से पहले आपके क्लिप की सटीक लागत दिखा देता है। वही प्लान GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling और Veo को भी कवर करता है, इसलिए समझदारी भरा वर्कफ़्लो सस्ता है: पोर्ट्रेट कुछ ही क्रेडिट में ड्राफ़्ट कीजिए, स्क्रिप्ट पक्की कीजिए, और उसके बाद ही अवतार के सेकंड पर खर्च कीजिए। अपने ऑडियो से खामोशी काट दीजिए — आप उसके हर सेकंड का भुगतान कर रहे हैं।

OmniHuman 1.5 के तनाव-परीक्षण में इस्तेमाल किया गया तीन-चौथाई प्रोफ़ाइल इनपुट पोर्ट्रेट

मापी हुई, वादा की हुई नहीं — विफलता समेत

हमारा सात-क्लिप वाला टेस्ट सेट 19 अगस्त 2026 को बना — एक प्रोडक्ट पिच, एक न्यूज़ ब्रीफ़, एक जिम का जोश भरा भाषण, एक मैंडरिन चाय-दुकान स्वागत, एक कहानी-किताब का किरदार, एक जानबूझकर की गई तीन-चौथाई प्रोफ़ाइल विफलता, और एक चौड़ा मंच शॉट। हर स्वीकार किया गया काम पहले ही टेक में सफल रहा, करीब दस सेकंड के ऑडियो के लिए 3m 20s से 4m 42s में। हम यह भी छापते हैं कि क्या गड़बड़ हुआ: एक व्यस्त मंगलवार शाम को अपस्ट्रीम ने हमारे 20 में से 13 सबमिशन स्वीकार करने से पहले क्षमता-त्रुटियों के साथ अस्वीकार किए (अस्वीकार हुए रन अपने-आप वापस हो जाते हैं), एक स्वीकार किया गया काम 14 मिनट कतार में रहा, और इस पेज का प्रोफ़ाइल क्लिप ठीक-ठीक दिखाता है कि सामने से पोर्ट्रेट वाली सलाह अनदेखी करने पर क्या होता है।

इस वर्कस्पेस से असली OmniHuman 1.5 क्लिप

नीचे के सभी 7 क्लिप यहीं 19 अगस्त 2026 को जनरेट हुए — हर एक अपने इनपुट से बना पहला ही रेंडर है, कोई दोबारा टेक नहीं और कोई छँटाई नहीं। पोर्ट्रेट GPT Image 2 के आउटपुट हैं; हर आवाज़ टेक्स्ट के रूप में टाइप की गई और अंतर्निहित लाइब्रेरी से संश्लेषित की गई। स्वीकार किए गए काम करीब 10 सेकंड के ऑडियो के लिए 3m 20s से 4m 42s में लौटे (एक अपवाद 14 मिनट कतार में रहा); एक व्यस्त शाम को अपस्ट्रीम ने स्वीकार करने से पहले कई सबमिशन क्षमता-त्रुटियों के साथ अस्वीकार किए — अस्वीकार हुए रन वापस कर दिए जाते हैं। आवाज़ चालू रखिए।

प्रॉम्प्ट9.2 s ऑडियो · Trustworthy Man आवाज़ · 1,300 क्रेडिट · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

प्रॉम्प्ट10.2 s ऑडियो · News Anchor आवाज़ · 1,430 क्रेडिट · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

प्रॉम्प्ट10.7 s ऑडियो · Energetic Guy आवाज़ · 1,430 क्रेडिट · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

प्रॉम्प्ट11.8 s ऑडियो · Mandarin Sweet Girl आवाज़ · 1,560 क्रेडिट · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

प्रॉम्प्ट9.7 s ऑडियो · Sweet Girl आवाज़ · 1,300 क्रेडिट · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

प्रॉम्प्ट8.6 s ऑडियो · Wise Lady आवाज़ · 1,170 क्रेडिट · इस कोण पर लिप-सिंक साफ़ दिखते हुए बिगड़ता है

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

प्रॉम्प्ट5.4 s ऑडियो · Movie Narrator आवाज़ · 780 क्रेडिट · यही फ़्रेम इस पेज का बैकड्रॉप है

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 असल में किसके लिए है

इनमें से हर एक ऊपर दिखाए गए किसी क्लिप से जुड़ता है — यह कोई इच्छा-सूची नहीं है।

  • कोर्स बनाने वाले और एक्सप्लेनर

    कथन टाइप कीजिए और स्क्रीन पर एक प्रस्तुतकर्ता पाइए — न कैमरा, न रोशनी, न दोबारा शूट। प्रति क्लिप 35 सेकंड की सीमा एक क्लिप में एक अवधारणा पर ठीक बैठती है, और ज़्यादातर कोर्स एडिटर वैसे भी इसी तरह काटते हैं।

  • UGC और प्रोडक्ट मार्केटर

    ऊपर का स्पीकर-पिच वाला मामला पूरा वर्कफ़्लो है: अपने प्रोडक्ट को पकड़े क्रिएटर-शैली का पोर्ट्रेट जनरेट कीजिए, पिच टाइप कीजिए, एक आवाज़ चुनिए। न कलाकार की फ़ीस, और न पीछा करने के लिए कोई छवि-अनुमति — वह चेहरा कभी था ही नहीं।

  • स्थानीयकरण टीमें

    वही चेहरा वही संदेश दस भाषाओं में दे सकता है: पोर्ट्रेट वही रखिए, आवाज़ बदल दीजिए। लिप-सिंक उसी ऑडियो के पीछे चलता है जो आप देते हैं — ऊपर का मैंडरिन मामला इसका सबूत है।

  • बिना चेहरे वाले चैनल और वर्चुअल होस्ट

    जो व्यक्तित्व आप जनरेट करते हैं वही आपका होता है। चेहरा एक बार डिज़ाइन कीजिए, उसे लाइब्रेरी की एक स्थिर आवाज़ दीजिए, और वह हर एपिसोड की अगुवाई कर सकता है — ऊपर का चित्रित कहानी-किताब किरदार दिखाता है कि उसे फ़ोटोरियल होना भी ज़रूरी नहीं।

  • पॉडकास्टर और ऑडियो-पहले क्रिएटर

    कठिन हिस्सा आपके पास पहले से है: ऑडियो। किसी झलक को 35 सेकंड तक काटिए, एक पोर्ट्रेट जोड़िए, और बिना कोई एडिटर खोले सोशल के लिए एक विज़ुअल क्लिप तैयार है।

OmniHuman 1.5 बनाम Seedance 2.5 बनाम Veo 3.1 Pro बनाम Kling 3.0 Turbo

भाषण वीडियो बनाम दृश्य वीडियो — इस वर्कस्पेस में हर मॉडल आपसे क्या माँगता है, और बदले में क्या देता है।

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
आप क्या देते हैं1 पोर्ट्रेट फ़ोटो + आपका ऑडियो, या टाइप किया टेक्स्ट और लाइब्रेरी की एक आवाज़एक प्रॉम्प्ट, और वैकल्पिक रूप से इमेज, वीडियो व ऑडियो रेफ़रेंसएक प्रॉम्प्ट, और वैकल्पिक रूप से एक रेफ़रेंस इमेजएक प्रॉम्प्ट या एक शुरुआती इमेज
शब्द कौन बोलता हैआप — अवतार आपके ठीक उसी साउंडट्रैक से लिप-सिंक करता हैमॉडल प्रॉम्प्ट से आवाज़ें बनाता हैमॉडल प्रॉम्प्ट से आवाज़ें बनाता हैऑडियो क्लिप के साथ ही बनता है
यहाँ क्लिप की लंबाईआपके ऑडियो की लंबाई, 35 s तक4–30 s4–8 s3–15 s
क्रेडिटप्रति ऑडियो सेकंड 130480p पर 110/s · 720p पर 230/sप्रति क्लिप 320–1,920 (4–8 s · 720p–4K · ± ऑडियो)720p पर 55/s · 1080p पर 70/s
यहाँ मापा गया~10 s ऑडियो के लिए ~4 मिनट (7 क्लिप, अगस्त 2026)इस काम पर नहीं मापा गयाइस काम पर नहीं मापा गयाइस काम पर नहीं मापा गया

क्रेडिट, अवधि और इनपुट के विकल्प 19 अगस्त 2026 को इसी वर्कस्पेस की अपनी मॉडल रजिस्ट्री से पढ़े गए हैं — ये बताते हैं कि आपको यहाँ क्या मिलता है, न कि वेंडर के प्रकाशित स्पेसिफ़िकेशन। समय ऊपर दिखाए गए क्लिप पर हमारे अपने माप हैं; हमने वही स्क्रिप्ट बाकी तीन मॉडलों से नहीं गुज़ारीं, इसलिए वे खाने अंदाज़ा लगाने के बजाय यही कहते हैं।

OmniHuman 1.5 जैसे और वीडियो मॉडल

OmniHuman 1.5 की तुलना अन्य वीडियो मॉडलों से करें — समान कार्यक्षेत्र, बस एक क्लिक में स्विच करें।

CreateVision AI पर OmniHuman 1.5 के स्पेक्स

मॉडलomnihuman-1.5, ByteDance द्वारा (शोध पत्र अगस्त 2025 में प्रकाशित)
मोडबोलता अवतार: एक फ़ोटो + एक ऑडियो ट्रैक → बोलता हुआ वीडियो, इस पेज के अवतार वर्कस्पेस में
इनपुटठीक 1 पोर्ट्रेट इमेज, और साथ में 35 सेकंड तक का ऑडियो (mp3/wav अपलोड) — या 600 अक्षरों तक टाइप किया टेक्स्ट, जिसे भाषण में संश्लेषित किया जाता है
आवाज़ों की लाइब्रेरी10 भाषाओं में 60 अंतर्निहित आवाज़ें: अंग्रेज़ी, चीनी, जापानी, कोरियाई, फ़्रेंच, जर्मन, स्पेनिश, इतालवी, रूसी, पुर्तगाली
वैकल्पिक मार्गदर्शनक्रिया, भाव और कैमरे के लिए एक छोटा अभिनय-नोट — काम का, पर कभी ज़रूरी नहीं
आउटपुटएक लगातार शॉट जो आपकी फ़ोटो की फ़्रेमिंग रखता है; क्लिप की लंबाई ऑडियो की लंबाई के बराबर होती है। मापा गया आउटपुट: 2:3 फ़ोटो से 1248×1664, 16:9 से 1920×1088, 25 fps, मोनो AAC ऑडियो के साथ H.264
क्रेडिटऑडियो के प्रति सेकंड 130, ऊपर की ओर पूर्णांकित — न्यूनतम 130, पूरे 35 सेकंड पर 4,550; सटीक लागत जनरेट करने से पहले दिखाई जाती है
मापी गई स्पीडहमारे 7-क्लिप टेस्ट में ~10 s ऑडियो के लिए हर स्वीकार किए गए काम पर 3m 20s–4m 42s; एक अपवाद 14 मिनट कतार में रहा (अगस्त 2026, एक व्यस्त मंगलवार शाम)

एक फ़ोटो से बोलता अवतार कैसे बनाएँ

वीडियो जेनरेट करना शुरू करें
  1. चेहरा जोड़िए

    साफ़, सामने से लिया, कमर तक का पोर्ट्रेट अपलोड कीजिए — या इसी वर्कस्पेस में GPT Image 2 या Seedream से एक जनरेट कीजिए, जैसे इस पेज का हर चेहरा बना है। एक फ़ोटो में एक ही व्यक्ति; चेहरा बड़ा और बिना रुकावट रखिए।

  2. इसे एक आवाज़ दीजिए

    एक ऑडियो क्लिप अपलोड कीजिए (mp3 या wav, 35 सेकंड तक), या टेक्स्ट मोड पर जाइए: 600 अक्षरों तक टाइप कीजिए और 10 भाषाओं की 60 आवाज़ों में से एक चुनिए, हर एक के साथ एक प्रीव्यू जिसे आप पहले सुन सकते हैं।

  3. चाहें तो अभिनय निर्देशित कीजिए

    "शांत, हल्की सिर हिलाहट, हल्की मुस्कान" जैसा एक छोटा नोट हाव-भाव और भाव को दिशा देता है। इसे खाली छोड़ दीजिए और मॉडल ऑडियो की लय और अर्थ खुद पढ़ लेता है।

  4. जनरेट कीजिए और सिंक जाँचिए

    सटीक क्रेडिट लागत रन से पहले दिखती है — यह ऑडियो की लंबाई के साथ बढ़ती है। जनरेशन असिंक्रोनस है; क्लिप हर इनपुट के साथ आपके इतिहास में आ जाता है, इसलिए एक कारगर सेटअप अगले हफ़्ते भी दोहराया जा सकता है।

OmniHuman 1.5 से आगे

एक खाता, पूर्ण इमेज और वीडियो जेनरेशन वर्कफ़्लो।

संबंधित लेख

OmniHuman 1.5 की कीमत और रोज़ाना मुफ़्त क्रेडिट

OmniHuman 1.5 को फ्री टियर के रोज़ाना क्रेडिट पर चलाएँ, या प्रीमियम मॉडल, तेज़ जेनरेशन और 4K आउटपुट के लिए अपग्रेड करें।

निःशुल्क

$0

शुरुआत करने के लिए एकदम सही

  • 200 वेलकम क्रेडिट, प्रतिदिन अधिकतम 80
  • Z Image Turbo 0 क्रेडिट पर ड्राफ्ट करता है
  • स्टैंडर्ड जेनरेशन स्पीड
  • जेनरेशन हिस्ट्री शामिल है
शुरू करें

Premium

सबसे लोकप्रिय
$29/month

वार्षिक रूप से बिल किया गया · $240/वर्ष

  • प्रति माह 8,000 क्रेडिट, कोई दैनिक सीमा नहीं
  • सभी प्रीमियम मॉडल — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x जेनरेशन स्पीड, प्राथमिकता कतार
  • AI प्रॉम्प्ट एन्हांसमेंट
Premium में अपग्रेड करें

Ultimate

$49/month

वार्षिक रूप से बिल किया गया · $380/वर्ष

  • प्रति माह 18,000 क्रेडिट, कोई दैनिक सीमा नहीं
  • 4K रेज़ोल्यूशन तक HD जेनरेशन
  • प्राथमिकता सपोर्ट
  • सबसे तेज़ कतार और नए मॉडल्स तक जल्दी पहुँच
Ultimate में अपग्रेड करें

OmniHuman 1.5 — अक्सर पूछे जाने वाले सवाल

1

ओम्नीह्यूमन 1.5 क्या है?

ByteDance का ऑडियो-चालित अवतार मॉडल। यह एक पोर्ट्रेट फ़ोटो और एक ऑडियो ट्रैक लेता है और उस व्यक्ति का वही ऑडियो बोलता हुआ वीडियो लौटाता है — होंठ, भाव, सिर की हरकत और हाथों के हाव-भाव, सब आवाज़ के पीछे चलते हैं। इसके पीछे का शोध पत्र अगस्त 2025 में प्रकाशित हुआ था।

2

क्या अवतार मेरे ठीक-ठीक शब्द बोल सकता है?

हाँ — प्रॉम्प्ट-चालित वीडियो मॉडलों से यही अंतर है। साउंडट्रैक आप देते हैं, या तो mp3/wav अपलोड के रूप में या स्क्रिप्ट टाइप करके और एक अंतर्निहित आवाज़ चुनकर, और अवतार उससे शब्द-दर-शब्द लिप-सिंक करता है। प्रॉम्प्ट-चालित मॉडल अपनी आवाज़ें खुद बनाते हैं और शायद ही कभी ठीक वही कहते हैं जो आपने लिखा था।

3

क्या OmniHuman 1.5 मुफ़्त है?

नहीं — यह ऑडियो के प्रति सेकंड 130 क्रेडिट बिल करता है, ऊपर की ओर पूर्णांकित, इसलिए 10 सेकंड का क्लिप 1,300 क्रेडिट का है। सटीक लागत जनरेट करने से पहले दिखाई जाती है, और विफल रन अपने-आप वापस कर दिए जाते हैं। स्क्रिप्ट कसी रखिए और खामोशी काट दीजिए: ऑडियो का हर सेकंड वह सेकंड है जिसका आप भुगतान करते हैं।

4

एक अच्छी स्रोत तस्वीर में क्या खूबियां होनी चाहिए?

सामने से, कमर तक, एक ही व्यक्ति, चेहरा बड़ा, एकसमान रोशनी में और बिना रुकावट — समीक्षक और हमारे अपने टेस्ट दोनों यही कहते हैं। ऊपर हमारा जानबूझकर किया गया तीन-चौथाई प्रोफ़ाइल टेस्ट दिखाता है कि वरना क्या होता है: होंठ मुश्किल से हिलते हैं, मॉडल धीरे-धीरे सिर को और दूर घुमाता जाता है, और मेज़ पर ऐसी चीज़ें आ जाती हैं जो फ़ोटो में थीं ही नहीं। जनरेट किए गए पोर्ट्रेट कैमरे की तस्वीरों जितना ही अच्छा काम करते हैं।

5

क्या यह चित्रों या ऐनिमे किरदारों के साथ काम करता है?

हाँ — ऊपर का हमारा कहानी-किताब टेस्ट एक सपाट 2D चित्र है, और OmniHuman 1.5 ने उसे कला-शैली बनाए रखते हुए विश्वसनीय ढंग से हरकत दी: आँखें, भौंहें और मुँह किसी हाथ से बने एनिमेशन किरदार की तरह हिलते हैं। एक अजीब बात जो हमने देखी: जब मुँह चौड़ा खुलता है, तो मॉडल एक सपाट चित्र के लिहाज़ से हैरान करने वाले यथार्थवादी दाँत बना देता है। ByteDance का शोध पत्र गैर-मानव विषयों का भी दावा करता है; हमने सिर्फ़ इसी चित्रित किरदार को परखा है।

6

क्लिप कितना लंबा हो सकता है, और जनरेशन में कितना समय लगता है?

इस प्लेटफ़ॉर्म पर प्रति क्लिप 35 सेकंड तक ऑडियो — लंबी स्क्रिप्ट को काटकर जोड़ना पड़ता है। अगस्त 2026 के हमारे टेस्ट में, स्वीकार किए गए काम करीब 10 सेकंड के ऑडियो के लिए 3m 20s से 4m 42s में लौटे। उसी शाम से एक चेतावनी: भारी लोड में अपस्ट्रीम ने काम स्वीकार करने से पहले कई सबमिशन क्षमता-त्रुटियों के साथ अस्वीकार किए। अस्वीकार हुए रन की कोई कीमत नहीं लगती, पर व्यस्त घंटों में पाँच मिनट बाद की डेडलाइन के बजाय दोबारा कोशिशों की गुंजाइश रखिए।

7

OmniHuman 1.5 किस चीज़ में खराब है?

सबसे बढ़कर, ऐसे चेहरे जो सामने से न हों: हमारा तीन-चौथाई प्रोफ़ाइल टेस्ट लगभग स्थिर होंठ, कैमरे से दूर खिसकता सिर, और मेज़ पर ऐसी चीज़ें दिखाता है जो फ़ोटो में थीं ही नहीं। पहचान के छोटे ब्योरे क्लिप के बीच भटक सकते हैं — उसी टेस्ट में एक बाली का आकार बदल गया, और दो अन्य में होंठों का रंग इनपुट से थोड़ा गाढ़ा दिखा। कई लोगों का संवाद यहाँ उपलब्ध नहीं है, आउटपुट रेज़ॉल्यूशन मामूली है (हमारे पोर्ट्रेट टेस्ट में 1248×1664 — कोई 4K नहीं), और यह सिर्फ़ भाषण वीडियो बनाता है: क्रिया, कैमरे की हरकत या दृश्य बदलाव के लिए Seedance 2.5 या Kling 3.0 Turbo इस्तेमाल कीजिए।

8

क्या मैं वीडियो व्यावसायिक रूप से इस्तेमाल कर सकता हूँ — और किसका चेहरा इस्तेमाल कर सकता हूँ?

आपके जनरेट किए वीडियो हमारी सेवा शर्तों के तहत निजी और व्यावसायिक परियोजनाओं में इस्तेमाल किए जा सकते हैं। चेहरा वह हिस्सा है जिसे गंभीरता से लेना चाहिए: किसी असली व्यक्ति की फ़ोटो को उसकी सहमति के बिना हरकत देना छवि और प्रचार-अधिकारों का उल्लंघन कर सकता है, और कई क्षेत्राधिकार अब कृत्रिम प्रस्तुतकर्ताओं की घोषणा अनिवार्य करते हैं। जनरेट किए गए चेहरे — जैसे इस पेज का हर चेहरा — सहमति की समस्या पूरी तरह टाल देते हैं।

एक फ़ोटो को कहने के लिए कुछ दीजिए

वीडियो जेनरेट करना शुरू करें

मूल्य और एक्सेस — तथ्यOmniHuman 1.5

मॉडल
OmniHuman 1.5
डेवलपर
ByteDance
एक्सेस
CreateVision AI वर्कस्पेस में API के ज़रिए चलता है — साइन इन करें और जनरेट करें। कोई API कुंजी नहीं, कोई क्लाउड प्रोजेक्ट नहीं, कोई इंस्टॉल नहीं।
प्रति जनरेशन मूल्य
Premium प्लान पर 5-सेकंड क्लिप के लिए 650 क्रेडिट से ≈ $2.36 ($29/माह में 8,000 क्रेडिट)। फ्री प्लान में हर दिन 80 क्रेडिट शामिल हैं।
गोपनीयता
डिफ़ॉल्ट रूप से निजी — किसी भी प्लान पर कोई अन्य उपयोगकर्ता आपकी जनरेशन नहीं देख सकता। हम सदस्य डेटा न बेचते हैं, न उसका दुरुपयोग करते हैं। गोपनीयता नीति

नया क्या हैOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.