OmniHuman 1.5 AI টকিং অবতার জেনারেটর

OmniHuman 1.5-কে একটি পোর্ট্রেট আর একটি ভয়েস ট্র্যাক দিন, আর এটি আপনার হুবহু শব্দগুলো বলতে থাকা ওই মানুষের একটি ভিডিও ফেরত দেবে — ঠোঁট, অভিব্যক্তি আর অঙ্গভঙ্গি শব্দ অনুসরণ করে।

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5 বলতে কী বোঝায়?

OmniHuman 1.5 হলো ByteDance-এর অডিও-চালিত অবতার মডেল: একে একটি পোর্ট্রেট আর একটি ভয়েস ট্র্যাক দিন, আর এটি আপনার অডিওটি বলতে থাকা ওই মানুষের একটি ভিডিও ফেরত দেবে — ঠোঁট, অভিব্যক্তি, মাথার নড়াচড়া আর অঙ্গভঙ্গি সবই শব্দ দিয়ে চালিত। প্রম্পট-চালিত ভিডিও মডেলের মতো নয়, এখানে হুবহু শব্দগুলো আপনিই দেন। গবেষণাপত্রটি একটি মাল্টিমোডাল ভাষা মডেলকে একটি ডিফিউশন ট্রান্সফরমারের সঙ্গে জোড়ে, তাই পারফরম্যান্সটা নিছক মুখ অনুসরণ না করে কী বলা হচ্ছে তার সঙ্গে সাড়া দেয়।

সৎ অংশটি: এর একটি সামনাসামনি পোর্ট্রেট দরকার। নিচের আমাদের থ্রি-কোয়ার্টার-প্রোফাইলের পরীক্ষায় দেখা যায় ঠোঁট প্রায় নড়েই না আর মাথা সরে যায়। প্রতি রানে অডিওর সীমা 35 সেকেন্ড, তাই লম্বা স্ক্রিপ্ট মানে ভাগ করে জোড়া লাগানো, আর গবেষণাপত্রের একটি প্রধান ফিচার — বহু-ব্যক্তির সংলাপ — এখানে পাওয়া যায় না। এটি কথা বলার ভিডিও, দৃশ্যের ভিডিও নয়: ক্যামেরার নড়াচড়া বা অ্যাকশনের জন্য Seedance 2.5 বা Kling 3.0 Turbo ব্যবহার করুন।

আর্কিটেকচার, অবস্থান আর ব্যবহারকারী-সমীক্ষার সংখ্যা ByteDance-এর গবেষণাপত্র থেকে নেওয়া: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

পরীক্ষকরা কী বলেন

সংস্করণ 1.5 কঠিন ইনপুটের ক্ষেত্রে উন্নত দৃঢ়তা দেখায়।
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
স্পষ্ট হাত, কাঁধ আর স্বাভাবিক আলোসহ কোমর পর্যন্ত একটি পোর্ট্রেট সাধারণত শরীরের নড়াচড়া ভালো দেয়।
Z.Tools — OmniHuman-1.5 deep dive
গাঢ় ছায়া, রোদচশমা, অদ্ভুত আড়াল আর ছোট মুখ কাজটাকে কঠিন করে তোলে।
Z.Tools — OmniHuman-1.5 deep dive

CreateVision AI-তে OmniHuman 1.5 কেন চালাবেন?

মডেলটি ByteDance-এর; এখানে সেটি ব্যবহার করার কারণ হলো বাকি দুটি ইনপুট — মুখ আর কণ্ঠ — একই ওয়ার্কস্পেস থেকেই আসে।

একটি OmniHuman 1.5 অবতার ক্লিপের ইনপুট মুখ হিসেবে ব্যবহৃত GPT Image 2 পোর্ট্রেট

গোটা ইনপুট শৃঙ্খলটা একটি পাতাতেই থাকে

একটি টকিং-অবতার ক্লিপের জন্য তিনটি জিনিস লাগে: একটি মুখ, একটি কণ্ঠ, আর মডেলটি। এখানে তিনটিই একই ওয়ার্কস্পেস থেকে আসে — GPT Image 2 বা Seedream দিয়ে পোর্ট্রেটটি জেনারেট করুন, স্ক্রিপ্ট টাইপ করে অন্তর্নির্মিত 60টি কণ্ঠের একটি দিয়ে সেটি তৈরি করুন, তারপর দুটোই সরাসরি OmniHuman 1.5-এ দিন। এই পাতার প্রতিটি ক্লিপ ঠিক এভাবেই বানানো, শুরু থেকে শেষ, এক সেকেন্ড অডিও রেকর্ড না করে আর কোনো সত্যিকারের মানুষের একটি ছবিও আপলোড না করে।

ম্যান্ডারিনে কথা বলা OmniHuman 1.5 চায়ের দোকানের কেসের ইনপুট পোর্ট্রেট

রেকর্ডিং বুথের বদলে একটি কণ্ঠের লাইব্রেরি

টেক্সট মোডটি পরে ভেবে জোড়া দেওয়া কিছু নয়: ইংরেজি, চীনা, জাপানি, কোরিয়ান, ফরাসি, জার্মান, স্প্যানিশ, ইতালীয়, রুশ আর পর্তুগিজ জুড়ে 60টি কণ্ঠ, প্রতিটির একটি প্রিভিউ আছে যা কিছু খরচ করার আগেই শুনে নেওয়া যায়। সর্বোচ্চ 600 অক্ষর টাইপ করুন, একটি কণ্ঠ বাছুন, আর প্ল্যাটফর্ম একটি রানেই কথাটা তৈরি করে সেটি দিয়ে অবতারটিকে চালায়। ওপরের ম্যান্ডারিন চায়ের-দোকানের ক্লিপটি ঠিক এই পথেই বানানো — কোনো মাইক্রোফোন জড়িত নেই।

সংবাদ উপস্থাপকের OmniHuman 1.5 কেসের ইনপুট পোর্ট্রেট

একটিই সাবস্ক্রিপশন, আর খরচ আগেই চোখে পড়ে

OmniHuman 1.5 বিল করে অডিওর প্রতি সেকেন্ডে — প্রতি সেকেন্ডে 130 ক্রেডিট, ঊর্ধ্বমুখী পূর্ণসংখ্যা করে — আর আপনি জেনারেট বোতাম চাপার আগেই ওয়ার্কস্পেস আপনার ক্লিপের হুবহু খরচ দেখায়। একই প্ল্যানে থাকে GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling আর Veo, তাই বুদ্ধিমানের কর্মপ্রবাহটা সস্তা: গুটিকয় ক্রেডিটে পোর্ট্রেটের খসড়া করুন, স্ক্রিপ্ট পাকা করুন, আর তারপরই কেবল অবতারের সেকেন্ডের পেছনে খরচ করুন। আপনার অডিও থেকে নীরবতাটুকু ছেঁটে ফেলুন — তার প্রতিটি সেকেন্ডের জন্য আপনি টাকা দিচ্ছেন।

OmniHuman 1.5-এর স্ট্রেস টেস্টে ব্যবহৃত থ্রি-কোয়ার্টার প্রোফাইল ইনপুট পোর্ট্রেট

প্রতিশ্রুত নয়, মাপা — ব্যর্থতাটিসহ

আমাদের সাত-ক্লিপের পরীক্ষার সেট জেনারেট করা হয়েছে 19 আগস্ট 2026-এ — একটি পণ্যের পিচ, একটি সংবাদ সংক্ষেপ, জিমের একটি উৎসাহ-বক্তৃতা, ম্যান্ডারিনে একটি চায়ের-দোকানের অভ্যর্থনা, একটি গল্পের বইয়ের চরিত্র, ইচ্ছাকৃত একটি থ্রি-কোয়ার্টার-প্রোফাইলের ব্যর্থতা, আর একটি চওড়া মঞ্চের শট। গৃহীত প্রতিটি কাজই প্রথম টেকে সফলভাবে রেন্ডার হয়েছে, প্রায় দশ সেকেন্ডের অডিওর জন্য 3m 20s থেকে 4m 42s-এ। কী ভুল হয়েছে তাও আমরা প্রকাশ করি: এক ব্যস্ত মঙ্গলবার সন্ধ্যায় আপস্ট্রিম আমাদের 20টি সাবমিশনের 13টিই গ্রহণ করার আগে ক্যাপাসিটি ত্রুটি দেখিয়ে প্রত্যাখ্যান করেছিল (প্রত্যাখ্যাত রানের টাকা আপনাআপনি ফেরত আসে), গৃহীত একটি কাজ 14 মিনিট কিউতে ছিল, আর এই পাতার প্রোফাইল ক্লিপটি হুবহু দেখায় সামনাসামনি-পোর্ট্রেটের পরামর্শ উপেক্ষা করলে কী হয়।

এই ওয়ার্কস্পেসের সত্যিকারের OmniHuman 1.5 ক্লিপ

নিচের 7টি ক্লিপই এখানে 19 আগস্ট 2026-এ জেনারেট করা — প্রতিটিই তার ইনপুট থেকে পাওয়া প্রথম রেন্ডার, কোনো রি-টেক নেই আর বেছে নেওয়া নেই। পোর্ট্রেটগুলো GPT Image 2-র আউটপুট; প্রতিটি কণ্ঠ টেক্সট হিসেবে টাইপ করে অন্তর্নির্মিত লাইব্রেরি দিয়ে তৈরি করা। গৃহীত কাজগুলো প্রায় 10 সেকেন্ডের অডিওর জন্য ফিরেছে 3m 20s থেকে 4m 42s-এ (একটি ব্যতিক্রম 14 মিনিট কিউতে ছিল); ব্যস্ত এক সন্ধ্যায় আপস্ট্রিম গ্রহণ করার আগে ক্যাপাসিটি ত্রুটি দেখিয়ে কয়েকটি সাবমিশন প্রত্যাখ্যান করেছিল — প্রত্যাখ্যাত রানের টাকা ফেরত দেওয়া হয়। শব্দ চালু করুন।

প্রম্পট9.2 s অডিও · Trustworthy Man কণ্ঠ · 1,300 ক্রেডিট · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

প্রম্পট10.2 s অডিও · News Anchor কণ্ঠ · 1,430 ক্রেডিট · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

প্রম্পট10.7 s অডিও · Energetic Guy কণ্ঠ · 1,430 ক্রেডিট · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

প্রম্পট11.8 s অডিও · Mandarin Sweet Girl কণ্ঠ · 1,560 ক্রেডিট · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

প্রম্পট9.7 s অডিও · Sweet Girl কণ্ঠ · 1,300 ক্রেডিট · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

প্রম্পট8.6 s অডিও · Wise Lady কণ্ঠ · 1,170 ক্রেডিট · এই কোণে লিপ-সিঙ্ক স্পষ্টভাবেই ভেঙে পড়ে

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

প্রম্পট5.4 s অডিও · Movie Narrator কণ্ঠ · 780 ক্রেডিট · এই ফ্রেমটিই পাতার পটভূমি

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 আসলে কাদের জন্য

এর প্রতিটি বিষয় ওপরে দেখানো কোনো না কোনো ক্লিপের সঙ্গে মেলে — কোনো ইচ্ছেতালিকার সঙ্গে নয়।

  • কোর্স নির্মাতা ও এক্সপ্লেইনার

    বর্ণনাটা টাইপ করুন আর পর্দায় একজন উপস্থাপক পান — কোনো ক্যামেরা, আলো বা আবার শুট করা নেই। প্রতি ক্লিপে 35-সেকেন্ডের সীমা প্রতি ক্লিপে একটি ধারণার সঙ্গে চমৎকারভাবে মেলে, আর বেশিরভাগ কোর্স এডিটর তো এভাবেই কাটেন।

  • UGC ও পণ্য মার্কেটার

    ওপরের স্পিকার-পিচের কেসটিই গোটা কর্মপ্রবাহ: আপনার পণ্য হাতে নির্মাতা-ধাঁচের একটি পোর্ট্রেট জেনারেট করুন, পিচটা টাইপ করুন, একটি কণ্ঠ বাছুন। কোনো তারকার পারিশ্রমিক নেই, আর ব্যক্তিরূপের ছাড়পত্রের পেছনে ছোটাছুটি নেই — মুখটির কোনো অস্তিত্বই ছিল না।

  • স্থানীয়করণের টিম

    একই মুখ একই বার্তা দশটি ভাষায় পৌঁছে দিতে পারে: পোর্ট্রেটটি রাখুন, কণ্ঠটি বদলান। আপনি যে অডিওই দিন লিপ-সিঙ্ক তা-ই অনুসরণ করে — ওপরের ম্যান্ডারিন কেসটিই তার প্রমাণ।

  • মুখহীন চ্যানেল আর ভার্চুয়াল উপস্থাপক

    আপনার জেনারেট করা একটি পরিচয় আপনারই মালিকানার পরিচয়। মুখটি একবার নকশা করুন, তাকে একটি সামঞ্জস্যপূর্ণ লাইব্রেরির কণ্ঠ দিন, আর সে প্রতিটি পর্বের সামনে থাকতে পারে — ওপরের ইলাস্ট্রেটেড গল্পের বইয়ের চরিত্রটি দেখায় যে তাকে ফটোরিয়াল হতেও হয় না।

  • পডকাস্টার ও অডিও-প্রথম নির্মাতা

    কঠিন অংশটা তো আপনার হাতেই আছে: অডিও। একটি হাইলাইট 35 সেকেন্ডে ছেঁটে নিন, একটি পোর্ট্রেট যোগ করুন, আর কোনো এডিটর না খুলেই সোশ্যালের জন্য একটি ভিজ্যুয়াল ক্লিপ পেয়ে যান।

OmniHuman 1.5 বনাম Seedance 2.5 বনাম Veo 3.1 Pro বনাম Kling 3.0 Turbo

কথা বলার ভিডিও বনাম দৃশ্যের ভিডিও — প্রতিটি মডেল আপনার কাছে কী চায়, আর এই ওয়ার্কস্পেসে কী ফেরত দেয়।

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
আপনি কী দেন1টি পোর্ট্রেট ছবি + আপনার অডিও, নয়তো টাইপ করা লেখা আর লাইব্রেরির একটি কণ্ঠএকটি প্রম্পট, সঙ্গে ঐচ্ছিক ছবি, ভিডিও আর অডিও রেফারেন্সএকটি প্রম্পট, সঙ্গে একটি ঐচ্ছিক রেফারেন্স ছবিএকটি প্রম্পট বা একটি শুরুর ছবি
শব্দগুলো কে বলেআপনি — অবতারটি আপনার হুবহু সাউন্ডট্র্যাকের সঙ্গে ঠোঁট মেলায়মডেলটি প্রম্পট থেকে কণ্ঠ তৈরি করেমডেলটি প্রম্পট থেকে কণ্ঠ তৈরি করেঅডিও ক্লিপের সঙ্গেই তৈরি হয়
এখানে ক্লিপের দৈর্ঘ্যআপনার অডিওর দৈর্ঘ্য, সর্বোচ্চ 35 s4–30 s4–8 s3–15 s
ক্রেডিটঅডিওর প্রতি সেকেন্ডে 130480p-তে 110/s · 720p-তে 230/sপ্রতি ক্লিপে 320–1,920 (4–8 s · 720p–4K · ± অডিও)720p-তে 55/s · 1080p-তে 70/s
এখানে মাপা~10 s অডিওর জন্য ~4 মিনিট (7টি ক্লিপ, আগস্ট 2026)এই কাজে মাপা হয়নিএই কাজে মাপা হয়নিএই কাজে মাপা হয়নি

ক্রেডিট, দৈর্ঘ্য আর ইনপুটের অপশন 19 আগস্ট 2026-এ এই ওয়ার্কস্পেসের নিজস্ব মডেল রেজিস্ট্রি থেকে পড়া — এগুলো বলে এখানে আপনি কী পাচ্ছেন, ভেন্ডরদের প্রকাশিত স্পেসিফিকেশন নয়। সময়গুলো ওপরে দেখানো ক্লিপগুলোতে আমাদের নিজেদের মাপা; একই স্ক্রিপ্ট আমরা বাকি তিনটি মডেলে চালাইনি, তাই ওই ঘরগুলো আন্দাজ না করে তা-ই বলে।

OmniHuman 1.5-এর মতো আরও ভিডিও মডেল

অন্যান্য ভিডিও মডেলের সাথে OmniHuman 1.5-এর তুলনা করুন — একই ওয়ার্কস্পেস, এক ক্লিকেই পরিবর্তনযোগ্য।

CreateVision AI-তে OmniHuman 1.5-এর স্পেসিফিকেশন

মডেলomnihuman-1.5, ByteDance-এর (গবেষণাপত্র প্রকাশিত আগস্ট 2025)
মোডটকিং অবতার: একটি ছবি + একটি অডিও ট্র্যাক → কথা বলা ভিডিও, এই পাতার অবতার ওয়ার্কস্পেসে
ইনপুটঠিক 1টি পোর্ট্রেট ছবি, সঙ্গে সর্বোচ্চ 35 সেকেন্ডের অডিও (mp3/wav আপলোড) — নয়তো সর্বোচ্চ 600 অক্ষরের টাইপ করা লেখা, যা কথায় রূপান্তরিত হয়
ভয়েস লাইব্রেরি10টি ভাষায় 60টি অন্তর্নির্মিত কণ্ঠ: ইংরেজি, চীনা, জাপানি, কোরিয়ান, ফরাসি, জার্মান, স্প্যানিশ, ইতালীয়, রুশ, পর্তুগিজ
ঐচ্ছিক নির্দেশনাঅ্যাকশন, আবেগ আর ক্যামেরার জন্য একটি ছোট পারফরম্যান্স নোট — কাজে লাগে, কখনও বাধ্যতামূলক নয়
আউটপুটএকটি অবিচ্ছিন্ন শট যা আপনার ছবির ফ্রেমিং ধরে রাখে; ক্লিপের দৈর্ঘ্য অডিওর দৈর্ঘ্যের সমান। মাপা আউটপুট: একটি 2:3 ছবি থেকে 1248×1664, 16:9 থেকে 1920×1088, 25 fps, মনো AAC অডিওসহ H.264
ক্রেডিটঅডিওর প্রতি সেকেন্ডে 130, ঊর্ধ্বমুখী পূর্ণসংখ্যা করে — সর্বনিম্ন 130, পুরো 35 সেকেন্ডে 4,550; জেনারেট করার আগেই হুবহু খরচ দেখানো হয়
পরিমাপ করা গতিআমাদের 7-ক্লিপের পরীক্ষায় ~10 s অডিওর জন্য গৃহীত প্রতি কাজে 3m 20s–4m 42s; একটি ব্যতিক্রম 14 মিনিট কিউতে ছিল (আগস্ট 2026, ব্যস্ত এক মঙ্গলবার সন্ধ্যা)

একটি ছবি থেকে কীভাবে টকিং অবতার বানাবেন

ভিডিও তৈরি করা শুরু করুন
  1. মুখটি যোগ করুন

    একটি পরিষ্কার, সামনাসামনি, কোমর পর্যন্ত পোর্ট্রেট আপলোড করুন — নয়তো এই একই ওয়ার্কস্পেসে GPT Image 2 বা Seedream দিয়ে একটি জেনারেট করুন, এই পাতার প্রতিটি মুখ এভাবেই বানানো। প্রতি ছবিতে একজন মানুষ; মুখটি বড় আর আড়ালমুক্ত রাখুন।

  2. একে একটি কণ্ঠ দিন

    একটি অডিও ক্লিপ আপলোড করুন (mp3 বা wav, সর্বোচ্চ 35 সেকেন্ড), নয়তো টেক্সট মোডে যান: সর্বোচ্চ 600 অক্ষর টাইপ করুন আর 10টি ভাষার 60টি কণ্ঠের একটি বাছুন, প্রতিটির একটি প্রিভিউ আছে যা আগে শুনে নেওয়া যায়।

  3. চাইলে পারফরম্যান্সটি পরিচালনা করুন

    "শান্ত, ছোট ছোট মাথা নাড়া, মৃদু হাসি"-র মতো একটি ছোট নোট অঙ্গভঙ্গি আর আবেগ চালিত করে। ফাঁকা রেখে দিন, আর মডেলটি নিজেই অডিওর ছন্দ আর অর্থ পড়ে নেবে।

  4. জেনারেট করুন আর সিঙ্কটা দেখে নিন

    রান করার আগেই হুবহু ক্রেডিট খরচ দেখা যায় — এটি অডিওর দৈর্ঘ্যের সঙ্গে বাড়ে। জেনারেশন অ্যাসিনক্রোনাস; ক্লিপটি প্রতিটি ইনপুটসহ আপনার হিস্ট্রিতে গিয়ে জমা হয়, তাই কার্যকর একটি সেটআপ পরের সপ্তাহেও আবার চালানো যায়।

OmniHuman 1.5 ছাড়িয়ে

একটি অ্যাকাউন্ট, সম্পূর্ণ ইমেজ এবং ভিডিও জেনারেশন ওয়ার্কফ্লো।

সম্পর্কিত লেখা

OmniHuman 1.5-এর দাম ও প্রতিদিনের ফ্রি ক্রেডিট

ফ্রি টিয়ারের প্রতিদিনের ক্রেডিট দিয়েই OmniHuman 1.5 চালান, অথবা প্রিমিয়াম মডেল, দ্রুততর জেনারেশন এবং 4K আউটপুটের জন্য আপগ্রেড করুন।

ফ্রি

$0

শুরু করার জন্য আদর্শ

  • ২০০ ওয়েলকাম ক্রেডিট, দিনে সর্বোচ্চ ৮০
  • Z Image Turbo 0 ক্রেডিটে ড্রাফট তৈরি করে
  • স্ট্যান্ডার্ড জেনারেশন গতি
  • জেনারেশন হিস্টোরি অন্তর্ভুক্ত
শুরু করুন

Premium

সবচেয়ে জনপ্রিয়
$29/month

বার্ষিক বিল করা হয় · $240/বছর

  • মাসে ৮,০০০ ক্রেডিট, কোনো দৈনিক সীমা নেই
  • সব প্রিমিয়াম মডেল — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5গুণ দ্রুত জেনারেশন গতি, অগ্রাধিকার সারি
  • AI প্রম্পট উন্নতিকরণ
Premium-এ আপগ্রেড করুন

Ultimate

$49/month

বার্ষিক বিল করা হয় · $380/বছর

  • মাসে ১৮,০০০ ক্রেডিট, কোনো দৈনিক সীমা নেই
  • 4K রেজোলিউশন পর্যন্ত HD জেনারেশন
  • অগ্রাধিকার সহায়তা
  • দ্রুততম কিউ এবং নতুন মডেলে আগাম অ্যাক্সেস
Ultimate-এ আপগ্রেড করুন

OmniHuman 1.5 — সাধারণ প্রশ্নোত্তর

1

OmniHuman 1.5 বলতে কী বোঝায়?

ByteDance-এর অডিও-চালিত অবতার মডেল। এটি একটি পোর্ট্রেট ছবি আর একটি অডিও ট্র্যাক নেয় আর ওই অডিওটি বলতে থাকা সেই মানুষের একটি ভিডিও ফেরত দেয় — ঠোঁট, অভিব্যক্তি, মাথার নড়াচড়া আর হাতের অঙ্গভঙ্গি সবই শব্দ অনুসরণ করে। এর পেছনের গবেষণাপত্রটি প্রকাশিত হয়েছে আগস্ট 2025-এ।

2

অবতারটি কি আমার হুবহু শব্দগুলো বলতে পারে?

হ্যাঁ — প্রম্পট-চালিত ভিডিও মডেলের সঙ্গে পার্থক্যটা এখানেই। সাউন্ডট্র্যাকটা আপনি দেন, হয় একটি mp3/wav আপলোড করে নয়তো স্ক্রিপ্টটা টাইপ করে আর একটি অন্তর্নির্মিত কণ্ঠ বেছে, আর অবতারটি শব্দে শব্দে তার সঙ্গে ঠোঁট মেলায়। প্রম্পট-চালিত মডেল নিজেরাই কণ্ঠ তৈরি করে আর আপনি ঠিক যা লিখেছেন তা খুব কমই বলে।

3

OmniHuman 1.5 কি বিনামূল্যে ব্যবহার করা যায়?

না — এটি অডিওর প্রতি সেকেন্ডে 130 ক্রেডিট বিল করে, ঊর্ধ্বমুখী পূর্ণসংখ্যা করে, তাই 10 সেকেন্ডের একটি ক্লিপে 1,300 ক্রেডিট। জেনারেট করার আগেই হুবহু খরচ দেখানো হয়, আর ব্যর্থ রানের টাকা আপনাআপনি ফেরত আসে। স্ক্রিপ্ট আঁটসাঁট রাখুন আর নীরবতা ছেঁটে ফেলুন: অডিওর প্রতিটি সেকেন্ডই এমন এক সেকেন্ড যার জন্য আপনি টাকা দিচ্ছেন।

4

একটি ভালো উৎস ছবির বৈশিষ্ট্য কী?

সামনাসামনি, কোমর পর্যন্ত, একজন মানুষ, মুখটি বড়, সমানভাবে আলোকিত আর আড়ালমুক্ত — রিভিউয়াররা আর আমাদের নিজেদের পরীক্ষা একমত। ওপরের আমাদের ইচ্ছাকৃত থ্রি-কোয়ার্টার-প্রোফাইলের পরীক্ষা দেখায় নইলে কী হয়: ঠোঁট প্রায় নড়েই না, মডেল ধীরে ধীরে মাথাটা আরও দূরে ঘুরিয়ে দেয়, আর ডেস্কে এমন জিনিস দেখা দেয় যা ছবিতে কখনও ছিল না। জেনারেট করা পোর্ট্রেট ক্যামেরার ছবির মতোই ভালো কাজ করে।

5

এটি কি ইলাস্ট্রেশন বা অ্যানিমে চরিত্রের সঙ্গে কাজ করে?

হ্যাঁ — ওপরের আমাদের গল্পের বইয়ের পরীক্ষাটি একটি সমতল 2D ইলাস্ট্রেশন, আর OmniHuman 1.5 আর্ট স্টাইল ধরে রেখেই সেটিকে বিশ্বাসযোগ্যভাবে অ্যানিমেট করেছে: চোখ, ভুরু আর মুখ হাতে আঁকা কোনো চরিত্রের মতোই নড়ে। আমাদের চোখে পড়া একটি খটকা: মুখ যখন বড় করে খোলে, তখন একটি সমতল ইলাস্ট্রেশনের জন্য মডেলটি অবাক করার মতো বাস্তবসম্মত দাঁত আঁকে। ByteDance-এর গবেষণাপত্র অমানুষ সাবজেক্টের দাবিও করে; আমরা কেবল এই ইলাস্ট্রেটেড চরিত্রটিই পরীক্ষা করেছি।

6

একটি ক্লিপ কত লম্বা হতে পারে, আর জেনারেট হতে কত সময় লাগে?

এই প্ল্যাটফর্মে প্রতি ক্লিপে সর্বোচ্চ 35 সেকেন্ডের অডিও — লম্বা স্ক্রিপ্ট ভাগ করে জোড়া লাগাতে হয়। আমাদের আগস্ট 2026-এর পরীক্ষায় গৃহীত কাজগুলো প্রায় 10 সেকেন্ডের অডিওর জন্য ফিরেছে 3m 20s থেকে 4m 42s-এ। একই সন্ধ্যার একটি সতর্কতা: বেশি চাপের সময় আপস্ট্রিম কাজটি গ্রহণ করার আগে ক্যাপাসিটি ত্রুটি দেখিয়ে কয়েকটি সাবমিশন প্রত্যাখ্যান করেছিল। প্রত্যাখ্যাত রানে কোনো খরচ নেই, তবে পাঁচ মিনিট পরের ডেডলাইন নয়, ব্যস্ত সময়ে আবার চেষ্টা করার কথা ভেবেই পরিকল্পনা করুন।

7

OmniHuman 1.5 কোন কাজে খারাপ?

সবচেয়ে আগে, সামনাসামনি নয় এমন মুখ: আমাদের থ্রি-কোয়ার্টার-প্রোফাইলের পরীক্ষা দেখায় প্রায় স্থির ঠোঁট, ক্যামেরা থেকে আরও দূরে সরে যাওয়া মাথা, আর ডেস্কে এমন জিনিস যা ছবিতে কখনও ছিল না। পরিচয়ের ছোট খুঁটিনাটি ক্লিপের মাঝখানে সরে যেতে পারে — ওই পরীক্ষায় একটি কানের দুলের আকার বদলে গিয়েছিল, আর অন্য দুটিতে ঠোঁটের রং ইনপুটের চেয়ে একটু গাঢ় লাগে। বহু-ব্যক্তির সংলাপ এখানে পাওয়া যায় না, আউটপুটের রেজোলিউশন মাঝারি (আমাদের পোর্ট্রেট পরীক্ষায় 1248×1664 — কোনো 4K নেই), আর এটি কেবল কথা বলার ভিডিওই বানায়: অ্যাকশন, ক্যামেরার নড়াচড়া বা দৃশ্য বদলের জন্য Seedance 2.5 বা Kling 3.0 Turbo ব্যবহার করুন।

8

ভিডিওগুলো কি আমি বাণিজ্যিকভাবে ব্যবহার করতে পারি — আর কার মুখ ব্যবহার করতে পারি?

আপনার জেনারেট করা ভিডিও আমাদের সেবার শর্ত অনুযায়ী ব্যক্তিগত আর বাণিজ্যিক প্রকল্পে ব্যবহার করা যায়। গুরুত্ব দিয়ে ভাবার অংশটি মুখ: সম্মতি ছাড়া কোনো সত্যিকারের মানুষের ছবি অ্যানিমেট করলে তা ব্যক্তিরূপ আর প্রচারের অধিকার লঙ্ঘন করতে পারে, আর এখন কয়েকটি বিচারব্যবস্থা কৃত্রিম উপস্থাপকের কথা প্রকাশ করা বাধ্যতামূলক করেছে। জেনারেট করা মুখ — এই পাতার প্রতিটি মুখের মতো — সম্মতির সমস্যাটা পুরোপুরি এড়িয়ে যায়।

একটি ছবিকে বলার মতো কিছু দিন

ভিডিও তৈরি করা শুরু করুন

মূল্য ও অ্যাক্সেস — তথ্যOmniHuman 1.5

মডেল
OmniHuman 1.5
ডেভেলপার
ByteDance
অ্যাক্সেস
CreateVision AI ওয়ার্কস্পেসে API-এর মাধ্যমে চলে — সাইন ইন করুন আর তৈরি করুন। কোনো API কী, ক্লাউড প্রজেক্ট বা ইনস্টলেশন লাগে না।
প্রতি জেনারেশনের মূল্য
Premium প্ল্যানে 5-সেকেন্ড ক্লিপে 650 ক্রেডিট থেকে ≈ $2.36 ($29/মাসে 8,000 ক্রেডিট)। ফ্রি প্ল্যানে প্রতিদিন 80 ক্রেডিট অন্তর্ভুক্ত।
গোপনীয়তা
ডিফল্টভাবে ব্যক্তিগত — কোনো প্ল্যানেই অন্য কোনো ব্যবহারকারী আপনার তৈরি কনটেন্ট দেখতে পারে না। আমরা সদস্যদের ডেটা বিক্রি বা অপব্যবহার করি না। গোপনীয়তা নীতি

নতুন কী আছেOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.