AI টকিং ফটো

একটি প্রতিকৃতি ও একটি অডিও ট্র্যাক আপলোড করুন (সর্বোচ্চ 35s), অথবা একটি স্ক্রিপ্ট টাইপ করে একটি ভয়েস বেছে নিন, আর OmniHuman 1.5 ছবিটিকে সিঙ্ক করা ঠোঁট ও স্বাভাবিক নড়াচড়াসহ একটি কথা বলা ভিডিওতে রূপান্তর করবে। নিজেই এতে অভিনয় করতে আপনার নিজের ছবি ব্যবহার করুন।

0 / 2,000
130 cr/s · ≤35s

একটি ছবি থেকে কথা বলা ভিডিওতে

একটি প্রতিকৃতি ও একটি স্ক্রিপ্ট মিলে জীবন্ত মুখপাত্র — ঠোঁট, অভিব্যক্তি ও অঙ্গভঙ্গি সিঙ্ক করা। ক্যামেরা নেই, স্টুডিও নেই।

মূল ছবিOriginal portrait photo of a beauty creator holding a skincare product
স্ক্রিপ্ট

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AI অবতার ভিডিও

আপনার নিজেরটাসহ যেকোনো ফটোকে কথা বলান

একটি সম্পূর্ণ AI টকিং ফটো (ডিজিটাল হিউম্যান) জেনারেটর: একটি পোর্ট্রেট ও একটি অডিও ক্লিপ আপলোড করুন, অথবা একটি স্ক্রিপ্ট টাইপ করে একটি ভয়েস বেছে নিন, আর পেয়ে যান সিঙ্ক করা ঠোঁট, স্বাভাবিক অভিব্যক্তি ও ভঙ্গিসহ প্রাণবন্ত টকিং ভিডিও। উপস্থাপক হতে নিজের একটি ফটো ব্যবহার করুন। ByteDance OmniHuman 1.5 দ্বারা চালিত, কোনো ক্যামেরা, অভিনেতা বা স্টুডিও লাগবে না।

একই নারীর কথা বলা AI অবতারে রূপ নিচ্ছে একটি ফ্রেম করা পোর্ট্রেট ফটো, মাঝখানে একটি অডিও ওয়েভফর্ম

নিজেই এতে অভিনয় করুন, অথবা একটি ডিজিটাল মুখপাত্র তৈরি করুন

কোনো শুটিং নেই, কোনো অভিনেতা নেই, কোনো গ্রিন স্ক্রিন নেই। নিজের একটি পরিষ্কার ফটো আপলোড করুন, আর আপনিই হয়ে যাবেন উপস্থাপক যে আপনার স্ক্রিপ্ট পড়বে—নিজের ভয়েসে বা লাইব্রেরি ভয়েসে। অথবা অনুমতি দেওয়া কোনো ব্যক্তির ফটো ব্যবহার করে প্রোডাক্ট এক্সপ্লেইনার, কোর্স ইন্ট্রো, ঘোষণা ও বিজ্ঞাপনের জন্য পুনর্ব্যবহারযোগ্য ডিজিটাল হোস্ট বানান। রিশুট ছাড়াই যেকোনো সময় নতুন লাইন রিজেনারেট করুন।

AI টকিং ফটোর দুটি ইনপুট: একটি আপলোড করা অডিও ওয়েভফর্ম এবং ভয়েস পিকারসহ টাইপ করা স্ক্রিপ্ট

প্রবেশের দুটি উপায়: অডিও আপলোড করুন অথবা স্ক্রিপ্ট টাইপ করুন।

আপনার কাছে কি আগে থেকেই কোনো ভয়েস রেকর্ডিং আছে? সেটি আপলোড করুন এবং অ্যাভাটারটি তার সাথে ঠোঁট মেলাবে। কোনো অডিও নেই? টেক্সট মোডে চলে যান — অ্যাভাটারটি কী বলবে তা টাইপ করুন, বিল্ট-ইন টেক্সট-টু-স্পিচ লাইব্রেরি থেকে একটি ভয়েস বেছে নিন, এবং স্ক্রিপ্টটি আপনার জন্য ড্রাইভিং অডিওতে সংশ্লেষিত হয়ে যাবে। জেনারেট করার আগে আনুমানিক দৈর্ঘ্য এবং ক্রেডিট খরচ দেখানো হয়।

ক্যামেরার দিকে কথা বলছেন এমন এক নারীর AI টকিং ফটো স্টিল, স্বাভাবিক হাতের ভঙ্গিসহ

জীবন্তের মতো — শুধু নড়াচড়া করা মুখ নয়

OmniHuman 1.5 অডিওর ছন্দ, স্বরভঙ্গি এবং অর্থ অনুধাবন করে সঠিক লিপ-সিঙ্কের পাশাপাশি মাথার নড়াচড়া, অঙ্গভঙ্গি এবং হাতের ইশারা নিয়ন্ত্রণ করে, এবং একই সাথে ব্যক্তির পরিচয় ও আলোর বিন্যাস অক্ষুণ্ণ রাখে। এর ফলে, এটি অ্যানিমেটেড মুখসহ একটি স্থির প্রতিকৃতির মতো না হয়ে, একজন সত্যিকারের উপস্থাপকের মতো কাজ করে।

লিভিং রুমে বসে একটি ছোট সোশ্যাল ক্লিপ দিচ্ছেন AI টকিং ফটো উপস্থাপক

মার্কেটিং, প্রশিক্ষণ এবং সামাজিক মাধ্যমের জন্য নির্মিত

বিজ্ঞাপন এবং ল্যান্ডিং পেজের জন্য মুখপাত্রের ক্লিপ, প্রশিক্ষণের জন্য বর্ণনাসহ পাঠ ও অনবোর্ডিং, সোশ্যাল মিডিয়ার জন্য টকিং-হেড পোস্ট, অথবা একই বার্তার বহুভাষিক সংস্করণ তৈরি করুন। প্রতিটি প্রজন্ম তার ইনপুটসহ ইতিহাসে সংরক্ষিত থাকে, ফলে আপনি দ্রুত পুনরাবৃত্তি করতে এবং বিভিন্ন সংস্করণ তৈরি করতে পারেন।

AI টকিং ফটোর জন্য প্রস্তুত পোর্ট্রেট

CreateVision AI-তে তৈরি উপস্থাপক-ধাঁচের পোর্ট্রেট — অডিও যোগ করলেই এদের যেকোনো একটি কথা বলা অবতার ভিডিও চালাতে পারে।

একজন সৌন্দর্য নির্মাতার এআই অবতার একটি স্কিনকেয়ার সিরাম উপস্থাপন করছে।
একজন প্রযুক্তি পর্যালোচকের এআই অবতার একটি স্মার্টফোন উপস্থাপন করছে
কফির কাপ হাতে একজন লাইফস্টাইল নির্মাতার এআই অবতার
একজন স্নিকার পর্যালোচকের এআই অবতার একটি জুতা উপস্থাপন করছে।
হ্যান্ডব্যাগ হাতে একজন ফ্যাশন নির্মাতার এআই অবতার
একজন সুস্থতা নির্মাতার এআই অবতার সাপ্লিমেন্ট উপস্থাপন করছে
পারফিউমের বোতল হাতে একজন সৌন্দর্য নির্মাতার এআই অবতার
রান্নাঘরের গ্যাজেটসহ একজন ঘরোয়া রান্না নির্মাতার এআই অবতার

এই AI টকিং ফটো জেনারেটরের পেছনের মডেল

এই পাতায় lip sync, অভিব্যক্তি ও শরীরের নড়াচড়া চালায় OmniHuman 1.5।

AI টকিং ফটো স্পেসিফিকেশন

ইনপুটএকটি পোর্ট্রেট ছবি, সঙ্গে হয় আপলোড করা অডিও ফাইল নয়তো টাইপ করা স্ক্রিপ্ট।
কার ফটোআপনার নিজের, অথবা এমন কোনো ব্যক্তির যিনি আপনাকে অনুমতি দিয়েছেন। ব্যবহারের জন্য ফটো ও ভয়েস দুটোই আপনার হতে হবে।
পোর্ট্রেট নিয়ে পরামর্শসামনের দিকে মুখ, ভালো আলো, পুরো মুখ দৃশ্যমান ও ফোকাসে। সানগ্লাস আর গাঢ় ছায়া lip sync-এর নির্ভুলতা কমায়।
অডিওর দৈর্ঘ্যপ্রতি জেনারেশনে 35 সেকেন্ড পর্যন্ত — মোটামুটি 85টি বলা শব্দ।
ভয়েস লাইব্রেরি10টি ভাষায় 60টি বিল্ট-ইন ভয়েস, জেনারেট করার আগে প্রিভিউ শোনা যায়।
মডেলOmniHuman 1.5, যা lip sync, মুখের অভিব্যক্তি এবং মাথা ও শরীরের স্বাভাবিক নড়াচড়া চালায়।
খরচঅন্যান্য ভিডিও জেনারেশনের মতোই আউটপুটের প্রতি সেকেন্ড হিসেবে বিল হয়; জেনারেট করার আগেই দেখানো হয়।
আউটপুটডাউনলোডযোগ্য একটি ক্লিপ, সোর্স পোর্ট্রেট ও স্ক্রিপ্টসহ আপনার হিস্ট্রিতে সেভ হয়।

নিজের AI টকিং ফটোতে কীভাবে অভিনয় করবেন

আপনার ফটো, আপনার কথা, একটি ক্লিপ।

  1. 1

    নিজের একটি ফটো আপলোড করুন

    পরিষ্কার, সামনের দিকে মুখ করা ফটো সবচেয়ে ভালো কাজ করে: ফোন সেলফি, হেডশট, বা ভিডিওর একটি ফ্রেম। এই এক ফ্রেম থেকেই টকিং ফটো AI আপনার মুখ পড়ে নেয়।

  2. 2

    আপনার ভয়েস যোগ করুন

    নিজেকে রেকর্ড করে অডিও আপলোড করুন, অথবা স্ক্রিপ্ট টাইপ করে 60টি বিল্ট-ইন ভয়েসের একটি বেছে নিন। অডিও সর্বোচ্চ 35 সেকেন্ড হতে পারে।

  3. 3

    জেনারেট করুন, তারপর নিজেকে পুনর্ব্যবহার করুন

    মডেলটি অডিওর সঙ্গে ঠোঁট, অভিব্যক্তি ও স্বাভাবিক মাথার নড়াচড়া সিঙ্ক করে। একই ফটো রেখে প্রয়োজনের সময় নতুন লাইন জেনারেট করুন, কোনো রিশুট ছাড়াই।

AI টকিং ফটোর জন্য স্ক্রিপ্ট কীভাবে লিখবেন

এখানে কোনো ইমেজ প্রম্পট নেই — কাজটা করে পোর্ট্রেট আর অডিও। আপনি যা লেখেন সেটাই স্ক্রিপ্ট, আর স্ক্রিপ্টের সিদ্ধান্তই ঠিক করে ফলাফল স্বাভাবিক দেখাবে কি না।

1

প্রথম লাইন

শুরুটা ছোট রাখুন। প্রথম সেকেন্ডেই lip sync সবচেয়ে বেশি চোখে পড়ে।

শুনুন — ছোট্ট একটা কথা।

2

বাক্যের দৈর্ঘ্য

বাক্য মোটামুটি 15 শব্দের নিচে রাখুন। লম্বা খণ্ডবাক্য অস্বাভাবিক বিরতি তৈরি করে।

এই সিরামে দুটো উপাদান আছে। পুরো ফর্মুলা এটুকুই।

3

যতিচিহ্ন

কমা আর দাঁড়ি নিঃশ্বাসে পরিণত হয়। যেখানে আপনি সত্যিই থামবেন, সেখানেই সেগুলো দিন।

এটা কাজ করে — আর সময় লাগে দশ সেকেন্ড।

4

দৈর্ঘ্যের বাজেট

সেকেন্ডে মোটামুটি 2.5 শব্দ। যত লম্বা ক্লিপ চান, ততটুকুই লিখুন।

35 সেকেন্ডের ক্লিপের জন্য ~85 শব্দ

অস্পষ্ট

আমাদের যুগান্তকারী পণ্যটি উৎকর্ষ অন্বেষণকারী বিচক্ষণ গ্রাহকদের জন্য অতুলনীয় ফলাফল প্রদানে অত্যাধুনিক প্রযুক্তি ব্যবহার করে।

সুনির্দিষ্ট

এই অংশটা নিয়েই লোকে সবসময় জিজ্ঞেস করে। দুটো উপাদান, কোনো ফিলার নেই। পার্থক্যটা সপ্তাহখানেকের মধ্যেই দেখতে পাবেন।

এটা কেন কাজ করে

প্রথমটি 19 শব্দের একটিমাত্র বাক্য, পুরোটাই বিমূর্ত — অ্যাভাটার এটি সমতল, দম না নেওয়া একঘেয়ে সুরে বলে, কারণ থামার কোনো জায়গাই নেই। দ্বিতীয়টি তিনটি ছোট বাক্য, যাতে স্বাভাবিক জোরের বিন্দু আছে, আর এটাই বলাটাকে মানুষের মতো শোনায়।

অস্পষ্ট

হ্যালো এবং আমাদের চ্যানেলে আপনাকে স্বাগতম যেখানে আজ আমরা স্কিনকেয়ার রুটিন সম্পর্কে আপনার জানা দরকার এমন পাঁচটি সবচেয়ে গুরুত্বপূর্ণ বিষয় নিয়ে আলোচনা করব।

সুনির্দিষ্ট

স্কিনকেয়ার নিয়ে পাঁচটি কথা। প্রথমটাতেই লোকে সবচেয়ে বেশি ভুল করে।

এটা কেন কাজ করে

লম্বা, না-থামা শুরুতেই lip sync সবচেয়ে বেশি এলোমেলো হয়, কারণ মডেলের ভর দেওয়ার মতো কোনো যতিচিহ্ন থাকে না। ছোট একটা হুক তাকে পরিষ্কার জোরের বিন্দু দেয় আর মনোযোগও ভালো ধরে রাখে।

ছেড়ে দেওয়ার মতো অভ্যাস

  • এমন পোর্ট্রেট ব্যবহার করা যেখানে মুখ ছোট, কোনাকুনি বা আংশিক ছায়ায়। lip sync কতটা নির্ভুল হবে তা সরাসরি নির্ভর করে সোর্স ফ্রেমে মুখটা কতটা স্পষ্ট দেখা যাচ্ছে তার ওপর।
  • অডিওর সীমা ছাড়িয়ে লিখে ফেলা। জেনারেশন 35 সেকেন্ড অডিওতে থেমে যায় — তার চেয়ে লম্বা স্ক্রিপ্ট কেটে যায়, তাই সেটাকে ভাগ করে নিন আর একই পোর্ট্রেট আবার ব্যবহার করুন।
  • ঠাসা কারিগরি শব্দ। সংখ্যা, সংক্ষিপ্ত রূপ আর দীর্ঘ পণ্যের নাম — এখানেই কৃত্রিম কণ্ঠ সবচেয়ে স্পষ্টভাবে কৃত্রিম শোনায়। মুখে যেভাবে বলবেন, সেভাবেই লিখুন।

AI অ্যাভাটার ভিডিও জেনারেটর ছাড়িয়ে

কথা বলা অ্যাভাটার একধরনের আউটপুট মাত্র। ইমেজ ও ভিডিও জেনারেশনও একই অ্যাকাউন্ট থেকেই চলে।

AI অ্যাভাটার ভিডিও নিয়ে কাজের রিসোর্স

AI টকিং ফটোর দাম ও ফ্রি ক্রেডিট

টকিং ফটো ভিডিও অন্যান্য ভিডিও আউটপুটের মতো প্রতি সেকেন্ডে বিল হয়। এটি চেষ্টা করে দেখতে নতুন অ্যাকাউন্টে 200টি ফ্রি ক্রেডিট পাওয়া যায়।

ফ্রি

$0

শুরু করার জন্য আদর্শ

  • 200 ওয়েলকাম ক্রেডিট, দিনে সর্বোচ্চ 80
  • Z Image Turbo 0 ক্রেডিটে ড্রাফট তৈরি করে
  • স্ট্যান্ডার্ড জেনারেশন গতি
  • জেনারেশন হিস্টোরি অন্তর্ভুক্ত
শুরু করুন

Premium

সবচেয়ে জনপ্রিয়
$29/month

বার্ষিক বিল করা হয় · $240/বছর

  • মাসে ৮,০০০ ক্রেডিট, কোনো দৈনিক সীমা নেই
  • সব প্রিমিয়াম মডেল — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5গুণ দ্রুত জেনারেশন গতি, অগ্রাধিকার সারি
  • AI প্রম্পট উন্নতিকরণ
Premium-এ আপগ্রেড করুন

Ultimate

$59/month

বার্ষিক বিল করা হয় · $468/বছর

  • মাসে ১৮,০০০ ক্রেডিট, কোনো দৈনিক সীমা নেই
  • 4K রেজোলিউশন পর্যন্ত HD জেনারেশন
  • অগ্রাধিকার সহায়তা
  • দ্রুততম কিউ এবং নতুন মডেলে আগাম অ্যাক্সেস
Ultimate-এ আপগ্রেড করুন

AI টকিং ফটো — সচরাচর জিজ্ঞাসিত প্রশ্ন

1

AI টকিং ফটো কী?

AI টকিং ফটো, যাকে AI অবতার বা ডিজিটাল হিউম্যানও বলা হয়, হলো একটি ফটো ও একটি ভয়েস থেকে তৈরি কোনো ব্যক্তির জেনারেট করা টকিং ভিডিও। শুটিংয়ের বদলে আপনি একটি পোর্ট্রেট ও অডিও (বা একটি স্ক্রিপ্ট + ভয়েস) দেন, আর মডেলটি প্রাণবন্ত কথা বলার পারফরম্যান্স অ্যানিমেট করে — ডিজিটাল উপস্থাপক, মুখপাত্র বা ধারাভাষ্যকার হিসেবে ব্যবহৃত হয়।

2

একটি তৈরি করতে আমার কী কী লাগবে?

একটি স্পষ্ট, সম্মুখভাগের পোর্ট্রেট ছবি, সাথে একটি অডিও ক্লিপ (mp3/wav) অথবা — টেক্সট মোডে — আপনার পছন্দের স্ক্রিপ্ট এবং বিল্ট-ইন লাইব্রেরি থেকে বেছে নেওয়া একটি কণ্ঠস্বর। একটি কথা বলা অ্যাভাটার ভিডিও তৈরি করার জন্য এটুকুই যথেষ্ট।

3

আমি কি আমার নিজের কণ্ঠস্বর ব্যবহার করতে পারি?

হ্যাঁ। আপনার নিজের অডিও রেকর্ডিং আপলোড করুন এবং অ্যাভাটারটি সেটির সাথে ঠোঁট মেলাবে। যদি আপনার কোনো রেকর্ডিং না থাকে, তবে টেক্সট মোডে যান এবং এর পরিবর্তে টেক্সট-টু-স্পিচ লাইব্রেরি থেকে একটি ভয়েস বেছে নিন।

4

অ্যাভাটার ভিডিওটি কত দীর্ঘ হতে পারে?

প্রতি জেনারেশনে সর্বোচ্চ 35 সেকেন্ডের অডিও। এর চেয়ে দীর্ঘ স্ক্রিপ্টের জন্য, সেগুলোকে একাধিক ক্লিপে ভাগ করুন। আপনি টাইপ করার সময় আনুমানিক সময়কাল দেখানো হবে এবং আপনাকে প্রতি সেকেন্ড অডিওর জন্য বিল করা হবে।

5

আমি এআই অ্যাভাটারগুলো কী কাজে ব্যবহার করতে পারি?

এর সাধারণ ব্যবহারগুলোর মধ্যে রয়েছে পণ্যের ব্যাখ্যা ও বিজ্ঞাপন, কোর্স ও অনবোর্ডিং-এর বর্ণনা, সোশ্যাল মিডিয়ায় প্রচারিত টকিং-হেড ক্লিপ, ঘোষণা, এবং কোনো বার্তার বহুভাষিক সংস্করণ — এমন সব জায়গা যেখানে সাধারণত একজন উপস্থাপকের ভিডিও ধারণ করার প্রয়োজন হয়।

6

কোন মডেলটি এআই অবতারকে শক্তি জোগায়?

CreateVision AI, ByteDance-এর OmniHuman 1.5 ব্যবহার করে, যা অডিও থেকে লিপ-সিঙ্ক, মাথার নড়াচড়া এবং অঙ্গভঙ্গি পরিচালনা করে। প্রযুক্তিগত বিবরণের জন্য OmniHuman 1.5 মডেলের পৃষ্ঠাটি দেখুন।

7

AI অ্যাভাটার ভিডিও জেনারেটরে কেমন ছবি সবচেয়ে ভালো চলে?

ভালো আলোয় সামনে থেকে তোলা পোর্ট্রেট, যেখানে পুরো মুখ দেখা যায় এবং ফোকাসে থাকে। সানগ্লাস, মুখের উপর গাঢ় ছায়া, খুব বাঁকা অ্যাঙ্গেল, বা ফ্রেমে খুব ছোট মুখ — সবই lip-sync-এর নির্ভুলতা কমিয়ে দেয়।

8

আমাকে কি নিজের কণ্ঠ রেকর্ড করতে হবে?

না। আপনি স্ক্রিপ্ট টাইপ করে বিল্ট-ইন লাইব্রেরি থেকে ভয়েস বেছে নিতে পারেন, যেখানে 10টি ভাষার 60টি ভয়েস আছে। নিজের রেকর্ডিং ব্যবহার করতে চাইলে সেটি আপলোড করারও সুযোগ আছে।

9

আমি কি ভিডিওতে নিজেই অভিনয় করতে পারি?

হ্যাঁ, এবং এটিই সবচেয়ে সাধারণ ব্যবহার। নিজের একটি ফটো আপলোড করুন, তারপর হয় নিজের ভয়েস রেকর্ড করুন অথবা একটি স্ক্রিপ্ট টাইপ করে লাইব্রেরি ভয়েস বেছে নিন। ফলাফল হলো আপনি, আপনার কথা বলছেন, কোনো ক্যামেরা সেটআপ ছাড়াই। অনেক ক্রিয়েটর একটি ভালো ফটো রেখে প্রতি সপ্তাহে সেটি থেকে নতুন ক্লিপ জেনারেট করেন।

10

আমি কি AI টকিং ফটো বাণিজ্যিকভাবে ব্যবহার করতে পারি?

হ্যাঁ। CreateVision AI পরিষেবার শর্তাবলী অনুযায়ী, আপনি যে কনটেন্ট তৈরি করেন তা ব্যক্তিগত ও বাণিজ্যিক উদ্দেশ্যে ব্যবহার করা যাবে, যেখানে উপযুক্ত সেখানে CreateVision AI-কে ক্রেডিট দিয়ে। আপনার আপলোড করা ছবি ও ভয়েসের অধিকার থাকার দায়িত্ব আপনার, এবং আপনি যে প্ল্যাটফর্মে প্রকাশ করেন সেখানকার AI-প্রকাশ নিয়মগুলোর দায়িত্বও আপনার।

11

আমি আগে Sora দিয়ে ভিডিওতে নিজেকে ঢোকাতাম। এটা কি সেই একই জিনিস?

লক্ষ্য একই, কৌশল ভিন্ন। এখানে আপনার ছবিই পরিচয় এবং আপনার অডিও বা স্ক্রিপ্ট বক্তৃতাটা চালায়, তাই আউটপুট হলো লিপ সিঙ্কসহ একটি টকিং-হেড ক্লিপ, এমন কোনো দৃশ্য নয় যেখানে আপনাকে ফেলে দেওয়া হয়। এটি যেকোনো একটি ছবি থেকে কাজ করে, কোনো ভিডিও এনরোলমেন্ট লাগে না, এবং অন্য কোনো অ্যাপ চালু থাকার ওপর নির্ভর করে না।

আপনার প্রথম AI টকিং ফটো তৈরি করুন

তৈরি করা শুরু করুন