টকিং ফটো AI

একটি পোর্ট্রেট ছবি এবং একটি অডিও ট্র্যাক (35 সেকেন্ড পর্যন্ত) আপলোড করুন, এবং OmniHuman 1.5 সিঙ্ক করা ঠোঁট ও স্বাভাবিক নড়াচড়াসহ একটি কথা বলা অ্যাভাটার ভিডিও তৈরি করবে।

ছবি + অডিওকথা বলা অবতারডিজিটাল মানব
0 / 2,000
130 cr/s · ≤35s

একটি ছবি থেকে কথা বলা ভিডিওতে

একটি প্রতিকৃতি ও একটি স্ক্রিপ্ট মিলে জীবন্ত মুখপাত্র — ঠোঁট, অভিব্যক্তি ও অঙ্গভঙ্গি সিঙ্ক করা। ক্যামেরা নেই, স্টুডিও নেই।

মূল ছবিOriginal portrait photo of a beauty creator holding a skincare product
স্ক্রিপ্ট

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AI অবতার ভিডিও

এই AI অ্যাভাটার ভিডিও জেনারেটরের পেছনের মডেল

এই পাতায় lip sync, অভিব্যক্তি ও শরীরের নড়াচড়া চালায় OmniHuman 1.5।

টকিং ফটো AI-এর জন্য প্রস্তুত পোর্ট্রেট

CreateVision AI-তে তৈরি উপস্থাপক-ধাঁচের পোর্ট্রেট — অডিও যোগ করলেই এদের যেকোনো একটি কথা বলা অবতার ভিডিও চালাতে পারে।

একজন সৌন্দর্য নির্মাতার এআই অবতার একটি স্কিনকেয়ার সিরাম উপস্থাপন করছে।
একজন প্রযুক্তি পর্যালোচকের এআই অবতার একটি স্মার্টফোন উপস্থাপন করছে
কফির কাপ হাতে একজন লাইফস্টাইল নির্মাতার এআই অবতার
একজন স্নিকার পর্যালোচকের এআই অবতার একটি জুতা উপস্থাপন করছে।
হ্যান্ডব্যাগ হাতে একজন ফ্যাশন নির্মাতার এআই অবতার
একজন সুস্থতা নির্মাতার এআই অবতার সাপ্লিমেন্ট উপস্থাপন করছে
পারফিউমের বোতল হাতে একজন সৌন্দর্য নির্মাতার এআই অবতার
রান্নাঘরের গ্যাজেটসহ একজন ঘরোয়া রান্না নির্মাতার এআই অবতার

একটি ছবি ও কণ্ঠস্বরকে একটি কথা বলা এআই অবতারে পরিণত করুন

একটি সম্পূর্ণ এআই অ্যাভাটার (ডিজিটাল হিউম্যান) জেনারেটর: একটি পোর্ট্রেট এবং একটি অডিও ক্লিপ আপলোড করুন — অথবা একটি স্ক্রিপ্ট টাইপ করে একটি কণ্ঠস্বর বেছে নিন — এবং সিঙ্ক করা ঠোঁট, স্বাভাবিক অভিব্যক্তি ও অঙ্গভঙ্গিসহ একটি জীবন্ত কথা বলা ভিডিও পান। এটি বাইটড্যান্স অমনিহিউম্যান 1.5 দ্বারা চালিত, কোনো ক্যামেরা, অভিনেতা বা স্টুডিওর প্রয়োজন নেই।

একটি আলোকিত মহাকাশযানের করিডোর দিয়ে হেঁটে যাওয়া একজন নভোচারীর AI ভিডিও স্টিল

একটিমাত্র প্রতিকৃতি থেকে একজন ডিজিটাল মুখপাত্র

কোনো চিত্রগ্রহণ, অভিনেতা বা গ্রিন স্ক্রিনের প্রয়োজন নেই। একজন ব্যক্তির একটি স্পষ্ট ছবি আপলোড করুন এবং তাকে এমন একজন উপস্থাপকে পরিণত করুন যিনি আপনার স্ক্রিপ্ট অনুযায়ী কথা বলবেন। পণ্যের ব্যাখ্যা, কোর্সের ভূমিকা, ঘোষণা এবং বিজ্ঞাপনের জন্য একটি পুনঃব্যবহারযোগ্য ডিজিটাল হোস্ট তৈরি করুন — এবং পুনরায় চিত্রগ্রহণ ছাড়াই যেকোনো সময় নতুন সংলাপ তৈরি করুন।

উষ্ণ বোকেহসহ একটি ক্যাফের জানালা বেয়ে নামা বৃষ্টির AI ভিডিও স্টিল

প্রবেশের দুটি উপায়: অডিও আপলোড করুন অথবা স্ক্রিপ্ট টাইপ করুন।

আপনার কাছে কি আগে থেকেই কোনো ভয়েস রেকর্ডিং আছে? সেটি আপলোড করুন এবং অ্যাভাটারটি তার সাথে ঠোঁট মেলাবে। কোনো অডিও নেই? টেক্সট মোডে চলে যান — অ্যাভাটারটি কী বলবে তা টাইপ করুন, বিল্ট-ইন টেক্সট-টু-স্পিচ লাইব্রেরি থেকে একটি ভয়েস বেছে নিন, এবং স্ক্রিপ্টটি আপনার জন্য ড্রাইভিং অডিওতে সংশ্লেষিত হয়ে যাবে। জেনারেট করার আগে আনুমানিক দৈর্ঘ্য এবং ক্রেডিট খরচ দেখানো হয়।

অ্যাম্বার আলোয় ধোঁয়াটে মঞ্চে একজন নৃত্যশিল্পীর সিলুয়েটের AI ভিডিও স্টিল

জীবন্তের মতো — শুধু নড়াচড়া করা মুখ নয়

OmniHuman 1.5 অডিওর ছন্দ, স্বরভঙ্গি এবং অর্থ অনুধাবন করে সঠিক লিপ-সিঙ্কের পাশাপাশি মাথার নড়াচড়া, অঙ্গভঙ্গি এবং হাতের ইশারা নিয়ন্ত্রণ করে, এবং একই সাথে ব্যক্তির পরিচয় ও আলোর বিন্যাস অক্ষুণ্ণ রাখে। এর ফলে, এটি অ্যানিমেটেড মুখসহ একটি স্থির প্রতিকৃতির মতো না হয়ে, একজন সত্যিকারের উপস্থাপকের মতো কাজ করে।

একটি তুষারাবৃত কেবিনের উপর ঘূর্ণায়মান অরোরার AI ভিডিও স্টিল

মার্কেটিং, প্রশিক্ষণ এবং সামাজিক মাধ্যমের জন্য নির্মিত

বিজ্ঞাপন এবং ল্যান্ডিং পেজের জন্য মুখপাত্রের ক্লিপ, প্রশিক্ষণের জন্য বর্ণনাসহ পাঠ ও অনবোর্ডিং, সোশ্যাল মিডিয়ার জন্য টকিং-হেড পোস্ট, অথবা একই বার্তার বহুভাষিক সংস্করণ তৈরি করুন। প্রতিটি প্রজন্ম তার ইনপুটসহ ইতিহাসে সংরক্ষিত থাকে, ফলে আপনি দ্রুত পুনরাবৃত্তি করতে এবং বিভিন্ন সংস্করণ তৈরি করতে পারেন।

AI অ্যাভাটার ভিডিও জেনারেটর স্পেসিফিকেশন

ইনপুটএকটি পোর্ট্রেট ছবি, সঙ্গে হয় আপলোড করা অডিও ফাইল নয়তো টাইপ করা স্ক্রিপ্ট।
পোর্ট্রেট নিয়ে পরামর্শসামনের দিকে মুখ, ভালো আলো, পুরো মুখ দৃশ্যমান ও ফোকাসে। সানগ্লাস আর গাঢ় ছায়া lip sync-এর নির্ভুলতা কমায়।
অডিওর দৈর্ঘ্যপ্রতি জেনারেশনে 35 সেকেন্ড পর্যন্ত — মোটামুটি 85টি বলা শব্দ।
ভয়েস লাইব্রেরি10টি ভাষায় 60টি বিল্ট-ইন ভয়েস, জেনারেট করার আগে প্রিভিউ শোনা যায়।
মডেলOmniHuman 1.5, যা lip sync, মুখের অভিব্যক্তি এবং মাথা ও শরীরের স্বাভাবিক নড়াচড়া চালায়।
খরচঅন্যান্য ভিডিও জেনারেশনের মতোই আউটপুটের প্রতি সেকেন্ড হিসেবে বিল হয়; জেনারেট করার আগেই দেখানো হয়।
আউটপুটডাউনলোডযোগ্য একটি ক্লিপ, সোর্স পোর্ট্রেট ও স্ক্রিপ্টসহ আপনার হিস্ট্রিতে সেভ হয়।

টকিং ফটো AI কীভাবে ব্যবহার করবেন

একটি পোর্ট্রেট, একটি ভয়েস ট্র্যাক, একটি ক্লিপ।

  1. 1

    একটি পোর্ট্রেট আপলোড করুন

    পরিষ্কার, সামনে থেকে তোলা ছবিই সবচেয়ে ভালো কাজ করে। AI অ্যাভাটার ভিডিও জেনারেটর এই একটি ফ্রেম থেকেই মুখ পড়ে নেয়।

  2. 2

    একটি ভয়েস যোগ করুন

    একটি অডিও ফাইল আপলোড করুন, কিংবা স্ক্রিপ্ট টাইপ করে বিল্ট-ইন ভয়েস লাইব্রেরি থেকে বেছে নিন। অডিও 35 সেকেন্ড পর্যন্ত চলতে পারে।

  3. 3

    অ্যাভাটার ভিডিও জেনারেট করুন

    মডেলটি ঠোঁট, অভিব্যক্তি আর মাথার স্বাভাবিক নড়াচড়াকে অডিওর সঙ্গে মিলিয়ে দেয়, আর এমন একটি ক্লিপ ফিরিয়ে দেয় যা আপনি ডাউনলোড বা এক্সটেন্ড করতে পারেন।

AI অ্যাভাটার ভিডিও জেনারেটরের জন্য স্ক্রিপ্ট কীভাবে লিখবেন

এখানে কোনো ইমেজ প্রম্পট নেই — কাজটা করে পোর্ট্রেট আর অডিও। আপনি যা লেখেন সেটাই স্ক্রিপ্ট, আর স্ক্রিপ্টের সিদ্ধান্তই ঠিক করে ফলাফল স্বাভাবিক দেখাবে কি না।

1

প্রথম লাইন

শুরুটা ছোট রাখুন। প্রথম সেকেন্ডেই lip sync সবচেয়ে বেশি চোখে পড়ে।

শুনুন — ছোট্ট একটা কথা।

2

বাক্যের দৈর্ঘ্য

বাক্য মোটামুটি 15 শব্দের নিচে রাখুন। লম্বা খণ্ডবাক্য অস্বাভাবিক বিরতি তৈরি করে।

এই সিরামে দুটো উপাদান আছে। পুরো ফর্মুলা এটুকুই।

3

যতিচিহ্ন

কমা আর দাঁড়ি নিঃশ্বাসে পরিণত হয়। যেখানে আপনি সত্যিই থামবেন, সেখানেই সেগুলো দিন।

এটা কাজ করে — আর সময় লাগে দশ সেকেন্ড।

4

দৈর্ঘ্যের বাজেট

সেকেন্ডে মোটামুটি 2.5 শব্দ। যত লম্বা ক্লিপ চান, ততটুকুই লিখুন।

35 সেকেন্ডের ক্লিপের জন্য ~85 শব্দ

অস্পষ্ট

আমাদের যুগান্তকারী পণ্যটি উৎকর্ষ অন্বেষণকারী বিচক্ষণ গ্রাহকদের জন্য অতুলনীয় ফলাফল প্রদানে অত্যাধুনিক প্রযুক্তি ব্যবহার করে।

সুনির্দিষ্ট

এই অংশটা নিয়েই লোকে সবসময় জিজ্ঞেস করে। দুটো উপাদান, কোনো ফিলার নেই। পার্থক্যটা সপ্তাহখানেকের মধ্যেই দেখতে পাবেন।

এটা কেন কাজ করে

প্রথমটি 19 শব্দের একটিমাত্র বাক্য, পুরোটাই বিমূর্ত — অ্যাভাটার এটি সমতল, দম না নেওয়া একঘেয়ে সুরে বলে, কারণ থামার কোনো জায়গাই নেই। দ্বিতীয়টি তিনটি ছোট বাক্য, যাতে স্বাভাবিক জোরের বিন্দু আছে, আর এটাই বলাটাকে মানুষের মতো শোনায়।

অস্পষ্ট

হ্যালো এবং আমাদের চ্যানেলে আপনাকে স্বাগতম যেখানে আজ আমরা স্কিনকেয়ার রুটিন সম্পর্কে আপনার জানা দরকার এমন পাঁচটি সবচেয়ে গুরুত্বপূর্ণ বিষয় নিয়ে আলোচনা করব।

সুনির্দিষ্ট

স্কিনকেয়ার নিয়ে পাঁচটি কথা। প্রথমটাতেই লোকে সবচেয়ে বেশি ভুল করে।

এটা কেন কাজ করে

লম্বা, না-থামা শুরুতেই lip sync সবচেয়ে বেশি এলোমেলো হয়, কারণ মডেলের ভর দেওয়ার মতো কোনো যতিচিহ্ন থাকে না। ছোট একটা হুক তাকে পরিষ্কার জোরের বিন্দু দেয় আর মনোযোগও ভালো ধরে রাখে।

ছেড়ে দেওয়ার মতো অভ্যাস

  • এমন পোর্ট্রেট ব্যবহার করা যেখানে মুখ ছোট, কোনাকুনি বা আংশিক ছায়ায়। lip sync কতটা নির্ভুল হবে তা সরাসরি নির্ভর করে সোর্স ফ্রেমে মুখটা কতটা স্পষ্ট দেখা যাচ্ছে তার ওপর।
  • অডিওর সীমা ছাড়িয়ে লিখে ফেলা। জেনারেশন 35 সেকেন্ড অডিওতে থেমে যায় — তার চেয়ে লম্বা স্ক্রিপ্ট কেটে যায়, তাই সেটাকে ভাগ করে নিন আর একই পোর্ট্রেট আবার ব্যবহার করুন।
  • ঠাসা কারিগরি শব্দ। সংখ্যা, সংক্ষিপ্ত রূপ আর দীর্ঘ পণ্যের নাম — এখানেই কৃত্রিম কণ্ঠ সবচেয়ে স্পষ্টভাবে কৃত্রিম শোনায়। মুখে যেভাবে বলবেন, সেভাবেই লিখুন।

AI অ্যাভাটার ভিডিও জেনারেটর ছাড়িয়ে

কথা বলা অ্যাভাটার একধরনের আউটপুট মাত্র। ইমেজ ও ভিডিও জেনারেশনও একই অ্যাকাউন্ট থেকেই চলে।

AI অ্যাভাটার ভিডিও নিয়ে কাজের রিসোর্স

AI অ্যাভাটার ভিডিও জেনারেটরের দাম ও ফ্রি দৈনিক credits

অন্য ভিডিও আউটপুটের মতোই অ্যাভাটার ভিডিওর বিল হয় প্রতি সেকেন্ড হিসেবে। ফ্রি অ্যাকাউন্ট এটি ব্যবহার করে দেখার জন্য দিনে 80 credits পায়।

ফ্রি

$0

শুরু করার জন্য আদর্শ

  • প্রতিদিন 80 ক্রেডিট, মাসে 400
  • Z Image Turbo 0 ক্রেডিটে ড্রাফট তৈরি করে
  • স্ট্যান্ডার্ড জেনারেশন গতি
  • জেনারেশন হিস্টোরি অন্তর্ভুক্ত
শুরু করুন

Premium

সবচেয়ে জনপ্রিয়
$29/month

বার্ষিক বিল করা হয় · $240/বছর

  • 1,600 ক্রেডিট/দিন, 8,000 ক্রেডিট/মাস
  • সব প্রিমিয়াম মডেল — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5গুণ দ্রুত জেনারেশন গতি, অগ্রাধিকার সারি
  • AI প্রম্পট উন্নতিকরণ
Premium-এ আপগ্রেড করুন

Ultimate

$49/month

বার্ষিক বিল করা হয় · $300/বছর

  • 4,000 ক্রেডিট/দিন, 18,000 ক্রেডিট/মাস
  • 4K রেজোলিউশন পর্যন্ত HD জেনারেশন
  • অগ্রাধিকার সহায়তা
  • দ্রুততম কিউ এবং নতুন মডেলে আগাম অ্যাক্সেস
Ultimate-এ আপগ্রেড করুন

AI অ্যাভাটার ভিডিও জেনারেটর — সাধারণ প্রশ্নোত্তর

1

এআই অবতার (ডিজিটাল মানব) বলতে কী বোঝায়?

এআই অ্যাভাটার হলো কোনো ব্যক্তির একটিমাত্র ছবি ও কণ্ঠস্বর থেকে তৈরি করা একটি কথা বলা ভিডিও। ভিডিও ধারণ করার পরিবর্তে, আপনি একটি প্রতিকৃতি ও অডিও (অথবা একটি স্ক্রিপ্ট ও কণ্ঠস্বর) প্রদান করেন এবং মডেলটি জীবন্তের মতো করে কথা বলার ভঙ্গি তৈরি করে — যা ডিজিটাল উপস্থাপক, মুখপাত্র বা কথক হিসেবে ব্যবহৃত হয়।

2

একটি তৈরি করতে আমার কী কী লাগবে?

একটি স্পষ্ট, সম্মুখভাগের পোর্ট্রেট ছবি, সাথে একটি অডিও ক্লিপ (mp3/wav) অথবা — টেক্সট মোডে — আপনার পছন্দের স্ক্রিপ্ট এবং বিল্ট-ইন লাইব্রেরি থেকে বেছে নেওয়া একটি কণ্ঠস্বর। একটি কথা বলা অ্যাভাটার ভিডিও তৈরি করার জন্য এটুকুই যথেষ্ট।

3

আমি কি আমার নিজের কণ্ঠস্বর ব্যবহার করতে পারি?

হ্যাঁ। আপনার নিজের অডিও রেকর্ডিং আপলোড করুন এবং অ্যাভাটারটি সেটির সাথে ঠোঁট মেলাবে। যদি আপনার কোনো রেকর্ডিং না থাকে, তবে টেক্সট মোডে যান এবং এর পরিবর্তে টেক্সট-টু-স্পিচ লাইব্রেরি থেকে একটি ভয়েস বেছে নিন।

4

অ্যাভাটার ভিডিওটি কত দীর্ঘ হতে পারে?

প্রতি জেনারেশনে সর্বোচ্চ 35 সেকেন্ডের অডিও। এর চেয়ে দীর্ঘ স্ক্রিপ্টের জন্য, সেগুলোকে একাধিক ক্লিপে ভাগ করুন। আপনি টাইপ করার সময় আনুমানিক সময়কাল দেখানো হবে এবং আপনাকে প্রতি সেকেন্ড অডিওর জন্য বিল করা হবে।

5

আমি এআই অ্যাভাটারগুলো কী কাজে ব্যবহার করতে পারি?

এর সাধারণ ব্যবহারগুলোর মধ্যে রয়েছে পণ্যের ব্যাখ্যা ও বিজ্ঞাপন, কোর্স ও অনবোর্ডিং-এর বর্ণনা, সোশ্যাল মিডিয়ায় প্রচারিত টকিং-হেড ক্লিপ, ঘোষণা, এবং কোনো বার্তার বহুভাষিক সংস্করণ — এমন সব জায়গা যেখানে সাধারণত একজন উপস্থাপকের ভিডিও ধারণ করার প্রয়োজন হয়।

6

কোন মডেলটি এআই অবতারকে শক্তি জোগায়?

CreateVision AI, ByteDance-এর OmniHuman 1.5 ব্যবহার করে, যা অডিও থেকে লিপ-সিঙ্ক, মাথার নড়াচড়া এবং অঙ্গভঙ্গি পরিচালনা করে। প্রযুক্তিগত বিবরণের জন্য OmniHuman 1.5 মডেলের পৃষ্ঠাটি দেখুন।

7

AI অ্যাভাটার ভিডিও জেনারেটরে কেমন ছবি সবচেয়ে ভালো চলে?

ভালো আলোয় সামনে থেকে তোলা পোর্ট্রেট, যেখানে পুরো মুখ দেখা যায় এবং ফোকাসে থাকে। সানগ্লাস, মুখের উপর গাঢ় ছায়া, খুব বাঁকা অ্যাঙ্গেল, বা ফ্রেমে খুব ছোট মুখ — সবই lip-sync-এর নির্ভুলতা কমিয়ে দেয়।

8

আমাকে কি নিজের কণ্ঠ রেকর্ড করতে হবে?

না। আপনি স্ক্রিপ্ট টাইপ করে বিল্ট-ইন লাইব্রেরি থেকে ভয়েস বেছে নিতে পারেন, যেখানে 10টি ভাষার 60টি ভয়েস আছে। নিজের রেকর্ডিং ব্যবহার করতে চাইলে সেটি আপলোড করারও সুযোগ আছে।

9

AI অ্যাভাটার ভিডিও কত লম্বা হতে পারে?

প্রতি জেনারেশনে 35 সেকেন্ড পর্যন্ত অডিও। দীর্ঘ উপস্থাপনার জন্য কয়েকটি অংশ বানিয়ে জুড়ে নিন — একই সোর্স পোর্ট্রেট রাখলে সব ক্লিপে উপস্থাপককে একরকম দেখায়।

আপনার প্রথম কথা বলা এআই অবতার তৈরি করুন

তৈরি করা শুরু করুন