OmniHuman 1.5 AI பேசும் அவதார் ஜெனரேட்டர்

OmniHuman 1.5-க்கு ஒரு உருவப்படத்தையும் ஒரு குரல் தடத்தையும் கொடுங்கள், உங்கள் சரியான வார்த்தைகளைப் பேசும் அந்த நபரின் வீடியோவை அது திருப்பித் தரும் — உதடுகள், முக பாவனைகள் மற்றும் சைகைகள் ஒலியைப் பின்தொடர்கின்றன.

0 / 2,000
130 cr/s · ≤35s

ஓம்னிஹியூமன் 1.5 என்பது என்ன?

OmniHuman 1.5 என்பது ByteDance-இன் ஒலி இயக்கும் அவதார் மாதிரி: ஒரு உருவப்படத்தையும் ஒரு குரல் தடத்தையும் கொடுங்கள், உங்கள் ஒலியைப் பேசும் அந்த நபரின் வீடியோவை அது திருப்பித் தரும் — உதடுகள், முக பாவனைகள், தலை அசைவு மற்றும் சைகைகள் அனைத்தும் அந்த ஒலியால் இயக்கப்படுகின்றன. ப்ராம்ப்ட் இயக்கும் வீடியோ மாதிரிகளைப் போலல்லாமல், சரியான வார்த்தைகளை நீங்களே வழங்குகிறீர்கள். ஆய்வுக் கட்டுரை ஒரு பன்முக மொழி மாதிரியை ஒரு டிஃப்யூஷன் டிரான்ஸ்ஃபார்மருடன் இணைக்கிறது, எனவே நடிப்பு வெறுமனே வாயைப் பின்தொடராமல், என்ன பேசப்படுகிறது என்பதற்கு எதிர்வினையாற்றுகிறது.

நேர்மையான பகுதி: இதற்கு ஒரு நேர்முக உருவப்படம் தேவை. கீழே உள்ள எங்கள் முக்கால்-பக்கவாட்டுச் சோதனை, அரிதாகவே அசையும் உதடுகளையும், விலகிச் செல்லும் தலையையும் காட்டுகிறது. ஒரு ஓட்டத்திற்கு ஒலி 35 வினாடிகளில் வரம்பிடப்பட்டுள்ளது, எனவே நீளமான ஸ்கிரிப்ட்கள் என்றால் பிரித்து ஒட்ட வேண்டும், மேலும் பல-நபர் உரையாடல் — கட்டுரையின் ஒரு முக்கிய அம்சம் — இங்கு கிடைக்கவில்லை. இது பேச்சு வீடியோ, காட்சி வீடியோ அல்ல: கேமரா அசைவுக்கோ அசைவுச் செயலுக்கோ, Seedance 2.5 அல்லது Kling 3.0 Turbo-வைப் பயன்படுத்துங்கள்.

கட்டமைப்பு, நிலைப்படுத்தல் மற்றும் பயனர் ஆய்வு எண்கள் ByteDance ஆய்வுக் கட்டுரையிலிருந்து: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

சோதனையாளர்கள் சொல்வது

சவாலான உள்ளீடுகளுக்கு 1.5 பதிப்பு மேம்பட்ட உறுதித்தன்மையை வெளிப்படுத்துகிறது.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
தெளிவான கைகள், தோள்கள் மற்றும் இயற்கையான ஒளியமைப்புடன் கூடிய இடுப்பு வரையிலான ஒரு உருவப்படம் பொதுவாகச் சிறந்த உடல் அசைவைத் தருகிறது.
Z.Tools — OmniHuman-1.5 deep dive
கடும் நிழல்கள், கண்ணாடிகள், விநோதமான மறைப்புகள் மற்றும் மிகச் சிறிய முகங்கள் வேலையை மேலும் கடினமாக்குகின்றன.
Z.Tools — OmniHuman-1.5 deep dive

OmniHuman 1.5-ஐ CreateVision AI-யில் ஏன் இயக்க வேண்டும்?

மாதிரி ByteDance-இனுடையது; அதை இங்கே பயன்படுத்துவதற்கான காரணம், மற்ற இரண்டு உள்ளீடுகளும் — முகமும் குரலும் — அதே பணியிடத்திலிருந்தே வருகின்றன என்பதுதான்.

ஒரு OmniHuman 1.5 அவதார் துணுக்குக்கான உள்ளீட்டு முகமாகப் பயன்படுத்தப்பட்ட GPT Image 2 உருவப்படம்

முழு உள்ளீட்டுச் சங்கிலியும் ஒரே பக்கத்தில் இருக்கிறது

ஒரு பேசும்-அவதார் துணுக்குக்கு மூன்று விஷயங்கள் தேவை: ஒரு முகம், ஒரு குரல், மற்றும் அந்த மாதிரி. இங்கு மூன்றுமே ஒரே பணியிடத்திலிருந்து வருகின்றன — GPT Image 2 அல்லது Seedream கொண்டு உருவப்படத்தை உருவாக்குங்கள், ஸ்கிரிப்ட்டைத் தட்டச்சு செய்து உள்ளமைந்த 60 குரல்களில் ஒன்றால் அதைத் தொகுங்கள், பிறகு இரண்டையும் நேராக OmniHuman 1.5-க்குள் அனுப்புங்கள். இந்தப் பக்கத்தில் உள்ள ஒவ்வொரு துணுக்கும் சரியாக அந்த வழியில், தொடக்கம் முதல் இறுதி வரை, ஒரு வினாடி ஒலியைக் கூடப் பதிவு செய்யாமல், ஒரு உண்மையான நபரின் ஒரு புகைப்படத்தைக் கூடப் பதிவேற்றாமல் உருவாக்கப்பட்டது.

மாண்டரின் பேசும் OmniHuman 1.5 தேநீர்க் கடை உதாரணத்திற்கான உள்ளீட்டு உருவப்படம்

ஒரு பதிவு அறைக்குப் பதிலாக ஒரு குரல் நூலகம்

உரை முறை ஒரு பிற்சேர்க்கை அல்ல: ஆங்கிலம், சீனம், ஜப்பானியம், கொரியம், பிரெஞ்சு, ஜெர்மன், ஸ்பானிஷ், இத்தாலியம், ரஷ்யன் மற்றும் போர்த்துகீசியம் ஆகியவற்றில் 60 குரல்கள், ஒவ்வொன்றுக்கும் நீங்கள் எதையும் செலவழிப்பதற்கு முன் இயக்கிப் பார்க்கக்கூடிய ஒரு மாதிரிக் காட்சி. 600 எழுத்துக்கள் வரை தட்டச்சு செய்யுங்கள், ஒரு குரலைத் தேர்ந்தெடுங்கள், தளம் அந்தப் பேச்சைத் தொகுத்து அதைக் கொண்டே ஒரே ஓட்டத்தில் அவதாரை இயக்கும். மேலே உள்ள மாண்டரின் தேநீர்க் கடைத் துணுக்கு சரியாக இந்தப் பாதைதான் — மைக்ரோஃபோன் எதுவும் சம்பந்தப்படவில்லை.

செய்தி வாசிப்பாளர் OmniHuman 1.5 உதாரணத்திற்கான உள்ளீட்டு உருவப்படம்

ஒரே சந்தா, மேலும் செலவு முன்கூட்டியே தெரியும்

OmniHuman 1.5 ஒலியின் ஒவ்வொரு வினாடிக்கும் கட்டணம் விதிக்கிறது — ஒரு வினாடிக்கு 130 கிரெடிட்கள், மேல்நோக்கி வட்டமிடப்படுகிறது — மேலும் நீங்கள் உருவாக்கு என்பதை அழுத்துவதற்கு முன் உங்கள் துணுக்கின் சரியான செலவை பணியிடம் காட்டுகிறது. அதே திட்டம் GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling மற்றும் Veo ஆகியவற்றையும் உள்ளடக்குகிறது, எனவே நியாயமான பணிப்பாய்வு மலிவானது: சில கிரெடிட்களுக்கு உருவப்படத்தை வரைவு செய்யுங்கள், ஸ்கிரிப்ட்டை உறுதி செய்யுங்கள், அதன் பிறகுதான் அவதார் வினாடிகளுக்குச் செலவிடுங்கள். உங்கள் ஒலியிலிருந்து அமைதியை வெட்டி விடுங்கள் — அதன் ஒவ்வொரு வினாடிக்கும் நீங்கள் பணம் செலுத்துகிறீர்கள்.

OmniHuman 1.5 அழுத்தச் சோதனைக்குப் பயன்படுத்தப்பட்ட முக்கால்-பக்கவாட்டு உள்ளீட்டு உருவப்படம்

வாக்குறுதி அல்ல, அளக்கப்பட்டது — அந்தத் தோல்வியும் சேர்த்து

எங்கள் ஏழு-துணுக்குச் சோதனைத் தொகுப்பு 2026 ஆகஸ்ட் 19 அன்று உருவாக்கப்பட்டது — ஒரு தயாரிப்பு அறிமுகம், ஒரு செய்திச் சுருக்கம், ஒரு உடற்பயிற்சிக்கூட ஊக்கவுரை, ஒரு மாண்டரின் தேநீர்க் கடை வரவேற்பு, ஒரு கதைப்புத்தகக் கதாபாத்திரம், வேண்டுமென்றே செய்யப்பட்ட ஒரு முக்கால்-பக்கவாட்டுத் தோல்வி, மற்றும் ஒரு அகன்ற மேடைக் காட்சி. ஏற்கப்பட்ட ஒவ்வொரு பணியும் சுமார் பத்து வினாடி ஒலிக்கு 3m 20s முதல் 4m 42s-ல் முதல் முயற்சியிலேயே வெற்றிகரமாக ரெண்டர் ஆனது. என்ன தவறாகப் போனது என்பதையும் நாங்கள் வெளியிடுகிறோம்: ஒரு பரபரப்பான செவ்வாய் மாலையில், எங்கள் 20 சமர்ப்பிப்புகளில் 13-ஐ, ஏற்றுக்கொள்வதற்கு முன், மேல்நிலை கொள்ளளவுப் பிழைகளுடன் நிராகரித்தது (நிராகரிக்கப்பட்ட ஓட்டங்களுக்குத் தானாகவே பணம் திரும்ப வழங்கப்படுகிறது), ஏற்கப்பட்ட ஒரு பணி 14 நிமிடங்கள் வரிசையில் நின்றது, மேலும் இந்தப் பக்கத்தில் உள்ள பக்கவாட்டுத் துணுக்கு, நேர்முக-உருவப்பட ஆலோசனையைப் புறக்கணித்தால் என்ன நடக்கும் என்பதைச் சரியாகக் காட்டுகிறது.

இந்தப் பணியிடத்திலிருந்து உண்மையான OmniHuman 1.5 துணுக்குகள்

கீழே உள்ள 7 துணுக்குகளும் 2026 ஆகஸ்ட் 19 அன்று இங்கே உருவாக்கப்பட்டவை — ஒவ்வொன்றும் அதன் உள்ளீடுகள் உருவாக்கிய முதல் ரெண்டர், மறுமுயற்சிகள் இல்லை, தேர்ந்தெடுத்துக் காட்டுவதும் இல்லை. உருவப்படங்கள் GPT Image 2 வெளியீடுகள்; ஒவ்வொரு குரலும் உரையாகத் தட்டச்சு செய்யப்பட்டு உள்ளமைந்த நூலகத்தால் தொகுக்கப்பட்டது. ஏற்கப்பட்ட பணிகள் சுமார் 10 வினாடி ஒலிக்கு 3m 20s முதல் 4m 42s-ல் திரும்பி வந்தன (ஒரு விதிவிலக்கு 14 நிமிடங்கள் வரிசையில் நின்றது); ஒரு பரபரப்பான மாலையில், ஏற்றுக்கொள்வதற்கு முன் மேல்நிலை பல சமர்ப்பிப்புகளைக் கொள்ளளவுப் பிழைகளுடன் நிராகரித்தது — நிராகரிக்கப்பட்ட ஓட்டங்களுக்குப் பணம் திரும்ப வழங்கப்படுகிறது. ஒலியை இயக்குங்கள்.

ப்ராம்ப்ட்9.2 வி ஒலி · Trustworthy Man குரல் · 1,300 கிரெடிட்கள் · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

ப்ராம்ப்ட்10.2 வி ஒலி · News Anchor குரல் · 1,430 கிரெடிட்கள் · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

ப்ராம்ப்ட்10.7 வி ஒலி · Energetic Guy குரல் · 1,430 கிரெடிட்கள் · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

ப்ராம்ப்ட்11.8 வி ஒலி · Mandarin Sweet Girl குரல் · 1,560 கிரெடிட்கள் · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

ப்ராம்ப்ட்9.7 வி ஒலி · Sweet Girl குரல் · 1,300 கிரெடிட்கள் · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

ப்ராம்ப்ட்8.6 வி ஒலி · Wise Lady குரல் · 1,170 கிரெடிட்கள் · இந்தக் கோணத்தில் உதட்டசைவு கண்ணுக்குத் தெரியும்படி மோசமாகிறது

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

ப்ராம்ப்ட்5.4 வி ஒலி · Movie Narrator குரல் · 780 கிரெடிட்கள் · இந்தச் சட்டகம்தான் இந்தப் பக்கத்தின் பின்னணி

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 உண்மையில் யாருக்கானது

இவை ஒவ்வொன்றும் மேலே காட்டப்பட்ட ஒரு துணுக்குடன் பொருந்துகிறது — ஒரு விருப்பப் பட்டியல் அல்ல.

  • பாட உருவாக்குநர்களும் விளக்குபவர்களும்

    விவரணையைத் தட்டச்சு செய்யுங்கள், திரையில் ஒரு தொகுப்பாளரைப் பெறுங்கள் — கேமரா, ஒளியமைப்பு அல்லது மறுபடப்பிடிப்பு இல்லை. ஒரு துணுக்குக்கு 35 வினாடி வரம்பு, ஒரு துணுக்குக்கு ஒரு கருத்து என்ற முறையில் நேர்த்தியாகப் பொருந்துகிறது, பெரும்பாலான பாட எடிட்டர்கள் எப்படியும் அப்படித்தான் வெட்டுகிறார்கள்.

  • UGC மற்றும் தயாரிப்பு சந்தைப்படுத்துபவர்கள்

    மேலே உள்ள ஒலிபெருக்கி அறிமுக உதாரணம்தான் முழுப் பணிப்பாய்வு: உங்கள் தயாரிப்பை ஏந்தியிருக்கும் ஒரு உருவாக்குநர் பாணி உருவப்படத்தை உருவாக்குங்கள், அறிமுகத்தைத் தட்டச்சு செய்யுங்கள், ஒரு குரலைத் தேர்ந்தெடுங்கள். நடிகர் கட்டணங்கள் இல்லை, தோற்ற ஒப்புதலைத் தேடி அலைய வேண்டியதும் இல்லை — அந்த முகம் ஒருபோதும் இருந்ததில்லை.

  • உள்ளூர்மயமாக்கல் குழுக்கள்

    அதே முகம் அதே செய்தியைப் பத்து மொழிகளில் வழங்க முடியும்: உருவப்படத்தை வைத்திருங்கள், குரலை மாற்றுங்கள். நீங்கள் வழங்கும் எந்த ஒலியையும் உதட்டசைவு பின்தொடர்கிறது — மேலே உள்ள மாண்டரின் உதாரணமே அதற்குச் சான்று.

  • முகமில்லாத சேனல்களும் மெய்நிகர் தொகுப்பாளர்களும்

    நீங்கள் உருவாக்கும் ஒரு ஆளுமை நீங்கள் சொந்தமாகக் கொண்ட ஆளுமை. முகத்தை ஒரு முறை வடிவமைத்து, அதற்கு ஒரு நிலையான நூலகக் குரலைக் கொடுங்கள், அது ஒவ்வொரு அத்தியாயத்தையும் முன்னின்று நடத்த முடியும் — மேலே உள்ள ஓவியமான கதைப்புத்தகக் கதாபாத்திரம், அது ஒளிப்படயதார்த்தமாகக் கூட இருக்க வேண்டியதில்லை என்பதைக் காட்டுகிறது.

  • பாட்காஸ்டர்களும் ஒலி-முதன்மை உருவாக்குநர்களும்

    கடினமான பகுதி ஏற்கனவே உங்களிடம் இருக்கிறது: ஒலி. ஒரு சிறப்புப் பகுதியை 35 வினாடிகளுக்கு வெட்டுங்கள், ஒரு உருவப்படத்தைச் சேருங்கள், ஒரு எடிட்டரைத் திறக்காமலேயே சமூக ஊடகத்திற்கான ஒரு காட்சித் துணுக்கு உங்களிடம் இருக்கும்.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

பேச்சு வீடியோவுக்கும் காட்சி வீடியோவுக்கும் இடையிலான வேறுபாடு — ஒவ்வொரு மாதிரிக்கும் உங்களிடமிருந்து என்ன தேவை, இந்தப் பணியிடத்தில் ஒவ்வொன்றும் என்ன திருப்பித் தருகிறது.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
நீங்கள் வழங்குவது1 உருவப் புகைப்படம் + உங்கள் ஒலி, அல்லது தட்டச்சு செய்யப்பட்ட உரையும் ஒரு நூலகக் குரலும்ஒரு ப்ராம்ப்ட், மேலும் விருப்பத்தேர்வான பட, வீடியோ மற்றும் ஒலிக் குறிப்புகள்ஒரு ப்ராம்ப்ட், மேலும் ஒரு விருப்பத்தேர்வான குறிப்புப் படம்ஒரு ப்ராம்ப்ட் அல்லது ஒரு தொடக்கப் படம்
வார்த்தைகளைப் பேசுவது யார்நீங்கள்தான் — உங்கள் சரியான ஒலிப்பதிவுக்கு அவதார் உதட்டசைவு செய்கிறதுப்ராம்ப்ட்டிலிருந்து மாதிரியே குரல்களை உருவாக்குகிறதுப்ராம்ப்ட்டிலிருந்து மாதிரியே குரல்களை உருவாக்குகிறதுதுணுக்குடன் சேர்ந்து ஒலி உருவாக்கப்படுகிறது
இங்கு துணுக்கு நீளம்உங்கள் ஒலியின் நீளம், 35 வி வரை4–30 s4–8 s3–15 s
கிரெடிட்கள்ஒரு ஒலி வினாடிக்கு 130480p-ல் 110/s · 720p-ல் 230/sஒரு துணுக்குக்கு 320–1,920 (4–8 வி · 720p–4K · ± ஒலி)720p-ல் 55/s · 1080p-ல் 70/s
இங்கு அளக்கப்பட்டதுசுமார் 10 வி ஒலிக்கு ~4 நிமிடங்கள் (7 துணுக்குகள், 2026 ஆகஸ்ட்)இந்தப் பணியில் அளக்கப்படவில்லைஇந்தப் பணியில் அளக்கப்படவில்லைஇந்தப் பணியில் அளக்கப்படவில்லை

கிரெடிட்கள், கால அளவு மற்றும் உள்ளீட்டு விருப்பங்கள் 2026 ஆகஸ்ட் 19 அன்று இந்தப் பணியிடத்தின் சொந்த மாதிரிப் பதிவேட்டிலிருந்து படிக்கப்பட்டவை — விற்பனையாளர்களின் வெளியிடப்பட்ட விவரக்குறிப்புகளை அல்ல, இங்கு உங்களுக்குக் கிடைப்பதை அவை விவரிக்கின்றன. நேரங்கள் மேலே காட்டப்பட்டுள்ள துணுக்குகளில் எங்கள் சொந்த அளவீடுகள்; அதே ஸ்கிரிப்ட்களை மற்ற மூன்று மாதிரிகள் வழியாக நாங்கள் இயக்கவில்லை, எனவே அந்தக் கட்டங்கள் ஊகிக்காமல் அதைச் சொல்கின்றன.

OmniHuman 1.5 போன்ற மேலும் video மாதிரிகள்

OmniHuman 1.5-ஐ மற்ற வீடியோ மாடல்களுடன் ஒப்பிடுக — ஒரே பணிச்சூழல், ஒரே கிளிக்கில் மாற்றிக்கொள்ளலாம்.

CreateVision AI-யில் OmniHuman 1.5 விவரக்குறிப்புகள்

மாடல்omnihuman-1.5, ByteDance-இடமிருந்து (ஆய்வுக் கட்டுரை 2025 ஆகஸ்டில் வெளியிடப்பட்டது)
முறைபேசும் அவதார்: ஒரு புகைப்படம் + ஒரு ஒலித் தடம் → பேசும் வீடியோ, இந்தப் பக்கத்தில் உள்ள அவதார் பணியிடத்தில்
உள்ளீடுகள்சரியாக 1 உருவப் படம், மேலும் 35 வினாடிகள் வரை ஒலி (mp3/wav பதிவேற்றம்) — அல்லது 600 எழுத்துக்கள் வரை தட்டச்சு செய்யப்பட்ட உரை, பேச்சாகத் தொகுக்கப்படுகிறது
குரல் நூலகம்10 மொழிகளில் உள்ளமைந்த 60 குரல்கள்: ஆங்கிலம், சீனம், ஜப்பானியம், கொரியம், பிரெஞ்சு, ஜெர்மன், ஸ்பானிஷ், இத்தாலியம், ரஷ்யன், போர்த்துகீசியம்
விருப்பத்தேர்வான வழிகாட்டல்செயல்கள், உணர்ச்சி மற்றும் கேமராவுக்கான ஒரு சுருக்கமான நடிப்புக் குறிப்பு — பயனுள்ளது, ஒருபோதும் கட்டாயம் அல்ல
வெளியீடுஉங்கள் புகைப்படத்தின் சட்டகக் கட்டமைப்பைத் தக்கவைக்கும் ஒரு தொடர்ச்சியான படப்பிடிப்பு; துணுக்கு நீளம் ஒலி நீளத்திற்குச் சமம். அளக்கப்பட்ட வெளியீடு: ஒரு 2:3 புகைப்படத்திலிருந்து 1248×1664, 16:9-லிருந்து 1920×1088, 25 fps, மோனோ AAC ஒலியுடன் H.264
கிரெடிட்கள்ஒரு ஒலி வினாடிக்கு 130, மேல்நோக்கி வட்டமிடப்படுகிறது — குறைந்தபட்சம் 130, முழு 35 வினாடிகளில் 4,550; நீங்கள் உருவாக்குவதற்கு முன் சரியான செலவு காட்டப்படுகிறது
அளவிடப்பட்ட வேகம்எங்கள் 7-துணுக்குச் சோதனையில் சுமார் 10 வி ஒலிக்கு ஏற்கப்பட்ட ஒரு பணிக்கு 3m 20s–4m 42s; ஒரு விதிவிலக்கு 14 நிமிடங்கள் வரிசையில் நின்றது (2026 ஆகஸ்ட், ஒரு பரபரப்பான செவ்வாய் மாலை)

ஒரு புகைப்படத்திலிருந்து ஒரு பேசும் அவதாரை எப்படி உருவாக்குவது

வீடியோக்களை உருவாக்கத் தொடங்குங்கள்
  1. முகத்தைச் சேருங்கள்

    தெளிவான, நேர்முகமான, இடுப்பு வரையிலான ஒரு உருவப்படத்தைப் பதிவேற்றுங்கள் — அல்லது இதே பணியிடத்தில் GPT Image 2 அல்லது Seedream கொண்டு ஒன்றை உருவாக்குங்கள், இந்தப் பக்கத்தில் உள்ள ஒவ்வொரு முகமும் அப்படித்தான் உருவாக்கப்பட்டது. ஒரு புகைப்படத்திற்கு ஒரு நபர்; முகத்தைப் பெரிதாகவும் மறைக்கப்படாமலும் வையுங்கள்.

  2. அதற்கு ஒரு குரலைக் கொடுங்கள்

    ஒரு ஒலித் துணுக்கைப் பதிவேற்றுங்கள் (mp3 அல்லது wav, 35 வினாடிகள் வரை), அல்லது உரை முறைக்கு மாறுங்கள்: 600 எழுத்துக்கள் வரை தட்டச்சு செய்து, 10 மொழிகளில் உள்ள 60 குரல்களில் ஒன்றைத் தேர்ந்தெடுங்கள், ஒவ்வொன்றுக்கும் நீங்கள் முதலில் இயக்கிப் பார்க்கக்கூடிய ஒரு மாதிரிக் காட்சி உள்ளது.

  3. விரும்பினால் நடிப்பை இயக்குங்கள்

    "அமைதியாக, சிறிய தலையசைப்புகள், நுட்பமான புன்னகை" போன்ற ஒரு சுருக்கமான குறிப்பு சைகையையும் உணர்ச்சியையும் வழிநடத்துகிறது. அதைக் காலியாக விட்டுவிட்டால், ஒலியின் தாளத்தையும் பொருளையும் மாதிரி தானாகவே படிக்கும்.

  4. உருவாக்கி ஒத்திசைவைச் சரிபாருங்கள்

    நீங்கள் இயக்குவதற்கு முன் சரியான கிரெடிட் செலவு தோன்றும் — அது ஒலி நீளத்திற்கு ஏற்ப அளவிடப்படுகிறது. உருவாக்கம் ஒத்திசைவற்றது; ஒவ்வொரு உள்ளீடும் இணைக்கப்பட்டு துணுக்கு உங்கள் வரலாற்றில் வந்து சேரும், எனவே வேலை செய்யும் ஒரு அமைப்பை அடுத்த வாரம் மீண்டும் உருவாக்க முடியும்.

OmniHuman 1.5-க்கு அப்பால்

ஒரு கணக்கு, முழுமையான பட மற்றும் வீடியோ உருவாக்க பணிப்பாய்வு.

தொடர்புடைய கட்டுரைகள்

AI வீடியோ உருவாக்க மாதிரிகளின் ஒப்பீடு

Seedance, Veo, Kling மற்றும் Hailuo ஆகியவற்றுக்கு நடுவே OmniHuman எங்கே அமர்கிறது — மேலும் ஒரு பேசும் தலை b-roll-ஐ எப்போது மிஞ்சுகிறது.

AI ஹெட்ஷாட் ஜெனரேட்டர்: முழுமையான வழிகாட்டி

உள்ளீட்டு உருவப்படத்தை எப்படி உருவாக்குவது — சுத்தமான, நேர்முக முகம் ஒரு நல்ல அவதார் துணுக்கின் பாதி.

2026-இன் சிறந்த மலிவான AI வீடியோ ஜெனரேட்டர்கள்

உங்களுக்குப் பேச்சு அல்ல, அசைவு தேவைப்பட்டால், இவை ஒரு வினாடிக்கு ஒரு பகுதி விலையே ஆகும்.

AI அனிமே அவதார்: முழுமையான வழிகாட்டி

பாணிப்படுத்தப்பட்ட கதாபாத்திரங்களும் பேச முடியும் — என்ன எதிர்பார்க்கலாம் என்பதற்கு மேலே உள்ள ஓவியமான கதைப்புத்தக உதாரணத்தைப் பாருங்கள்.

OmniHuman 1.5 விலை மற்றும் தினசரி இலவச credit-கள்

இலவச நிலையின் தினசரி credit-களில் OmniHuman 1.5-ஐ இயக்குங்கள், அல்லது premium மாதிரிகள், வேகமான உருவாக்கம், 4K வெளியீட்டுக்காக மேம்படுத்துங்கள்.

Free

$0

தொடங்குவதற்கு சரியானது

  • 200 வரவேற்பு கிரெடிட்கள், நாளொன்றுக்கு அதிகபட்சம் 80
  • Z Image Turbo 0 கிரெடிட்களில் வரைவு செய்கிறது
  • நிலையான உருவாக்க வேகம்
  • உருவாக்க வரலாறு உள்ளடக்கப்பட்டுள்ளது
தொடங்குங்கள்

Premium

மிகவும் பிரபலமானது
$29/month

ஆண்டுதோறும் கட்டணம் · $240/ஆண்டு

  • மாதம் 8,000 கிரெடிட்கள், தினசரி வரம்பு இல்லை
  • அனைத்து பிரீமியம் மாடல்களும் — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x உருவாக்க வேகம், முன்னுரிமை வரிசை
  • AI ப்ராம்ட் மேம்படுத்தல்
Premium க்கு மேம்படுத்து

Ultimate

$49/month

ஆண்டுதோறும் கட்டணம் · $380/ஆண்டு

  • மாதம் 18,000 கிரெடிட்கள், தினசரி வரம்பு இல்லை
  • 4K தெளிவுத்திறன் வரை HD உருவாக்கம்
  • முன்னுரிமை ஆதரவு
  • வேகமான வரிசை மற்றும் புதிய மாடல்களுக்கு முன்கூட்டிய அணுகல்
Ultimate க்கு மேம்படுத்து

OmniHuman 1.5 — அடிக்கடி கேட்கப்படும் கேள்விகள்

1

ஓம்னிஹியூமன் 1.5 என்பது என்ன?

ByteDance-இன் ஒலி இயக்கும் அவதார் மாதிரி. இது ஒரு உருவப் புகைப்படத்தையும் ஒரு ஒலித் தடத்தையும் எடுத்துக்கொண்டு, அந்த ஒலியைப் பேசும் அந்த நபரின் வீடியோவைத் திருப்பித் தருகிறது — உதடுகள், முக பாவனைகள், தலை அசைவு மற்றும் கை சைகைகள் அனைத்தும் ஒலியைப் பின்தொடர்கின்றன. அதற்குப் பின்னால் உள்ள ஆய்வுக் கட்டுரை 2025 ஆகஸ்டில் வெளியிடப்பட்டது.

2

அவதார் என் சரியான வார்த்தைகளைப் பேச முடியுமா?

ஆம் — ப்ராம்ப்ட் இயக்கும் வீடியோ மாதிரிகளிலிருந்து அதுதான் வேறுபாடு. ஒலிப்பதிவை நீங்கள் வழங்குகிறீர்கள், ஒரு mp3/wav பதிவேற்றமாகவோ, ஸ்கிரிப்ட்டைத் தட்டச்சு செய்து ஒரு உள்ளமைந்த குரலைத் தேர்ந்தெடுத்தோ, மேலும் அவதார் அதற்கு வார்த்தைக்கு வார்த்தை உதட்டசைவு செய்கிறது. ப்ராம்ப்ட் இயக்கும் மாதிரிகள் தங்கள் சொந்தக் குரல்களை உருவாக்குகின்றன, நீங்கள் எழுதியதை அவை அரிதாகவே அப்படியே பேசுகின்றன.

3

OmniHuman 1.5 பயன்படுத்த இலவசமா?

இல்லை — இது ஒலியின் ஒரு வினாடிக்கு 130 கிரெடிட்கள் என்று கட்டணம் விதிக்கிறது, மேல்நோக்கி வட்டமிடப்படுகிறது, எனவே ஒரு 10-வினாடித் துணுக்கு 1,300 கிரெடிட்கள். நீங்கள் உருவாக்குவதற்கு முன் சரியான செலவு காட்டப்படுகிறது, மேலும் தோல்வியடைந்த ஓட்டங்களுக்குத் தானாகவே பணம் திரும்ப வழங்கப்படுகிறது. ஸ்கிரிப்ட்களை இறுக்கமாக வையுங்கள், அமைதியை வெட்டுங்கள்: ஒலியின் ஒவ்வொரு வினாடியும் நீங்கள் பணம் செலுத்தும் ஒரு வினாடி.

4

ஒரு நல்ல மூலப் புகைப்படத்தின் அம்சங்கள் யாவை?

நேர்முகமாக, இடுப்பு வரை, ஒரே ஒரு நபர், முகம் பெரிதாக, சீரான ஒளியில், மறைக்கப்படாமல் — மதிப்பாய்வாளர்களும் எங்கள் சொந்தச் சோதனைகளும் இதில் உடன்படுகின்றன. மேலே உள்ள எங்கள் வேண்டுமென்றே செய்யப்பட்ட முக்கால்-பக்கவாட்டுச் சோதனை இல்லையேல் என்ன நடக்கும் என்பதைக் காட்டுகிறது: உதடுகள் அரிதாகவே அசைகின்றன, மாதிரி மெதுவாகத் தலையை மேலும் விலக்கித் திருப்புகிறது, மேலும் புகைப்படத்தில் ஒருபோதும் இல்லாத பொருட்கள் மேசையில் தோன்றுகின்றன. உருவாக்கப்பட்ட உருவப்படங்கள் கேமரா புகைப்படங்களைப் போலவே சரியாக வேலை செய்கின்றன.

5

இது ஓவியங்களுடனோ அனிமே கதாபாத்திரங்களுடனோ வேலை செய்யுமா?

ஆம் — மேலே உள்ள எங்கள் கதைப்புத்தகச் சோதனை ஒரு தட்டையான 2D ஓவியம், மேலும் OmniHuman 1.5 கலைப் பாணியைத் தக்கவைத்தபடியே அதை நம்பும்படி அசைவூட்டியது: கண்கள், புருவங்கள் மற்றும் வாய் கையால் அசைவூட்டப்பட்ட ஒரு கதாபாத்திரம் போல அசைகின்றன. நாங்கள் கவனித்த ஒரு வினோதம்: வாய் அகலமாகத் திறக்கும்போது, ஒரு தட்டையான ஓவியத்திற்கு ஆச்சரியப்படும் அளவுக்கு யதார்த்தமான பற்களை மாதிரி வரைகிறது. ByteDance-இன் கட்டுரை மனிதர் அல்லாத பொருள்களையும் உரிமைகோருகிறது; நாங்கள் இந்த ஓவியக் கதாபாத்திரத்தை மட்டுமே சோதித்துள்ளோம்.

6

ஒரு துணுக்கு எவ்வளவு நீளமாக இருக்கலாம், உருவாக்கம் எவ்வளவு நேரம் எடுக்கும்?

இந்தத் தளத்தில் ஒரு துணுக்குக்கு 35 வினாடிகள் வரை ஒலி — நீளமான ஸ்கிரிப்ட்களைப் பிரித்து ஒட்ட வேண்டும். எங்கள் 2026 ஆகஸ்ட் சோதனையில், ஏற்கப்பட்ட பணிகள் சுமார் 10 வினாடி ஒலிக்கு 3m 20s முதல் 4m 42s-ல் திரும்பி வந்தன. அதே மாலையிலிருந்து ஒரு எச்சரிக்கை: அதிக சுமையின் கீழ், பணியை ஏற்றுக்கொள்வதற்கு முன் மேல்நிலை பல சமர்ப்பிப்புகளைக் கொள்ளளவுப் பிழைகளுடன் நிராகரித்தது. நிராகரிக்கப்பட்ட ஓட்டங்களுக்கு எதுவும் செலவாகாது, ஆனால் ஐந்து நிமிடங்களில் முடிய வேண்டிய ஒரு காலக்கெடுவை அல்ல, உச்ச நேரங்களில் மறுமுயற்சிகளைத் திட்டமிடுங்கள்.

7

OmniHuman 1.5 எதில் மோசமானது?

எல்லாவற்றுக்கும் மேலாக, நேர்முகம் அல்லாத முகங்கள்: எங்கள் முக்கால்-பக்கவாட்டுச் சோதனை கிட்டத்தட்ட அசையாத உதடுகளையும், கேமராவிலிருந்து மேலும் விலகிச் செல்லும் தலையையும், புகைப்படத்தில் ஒருபோதும் இல்லாத மேசைப் பொருட்களையும் காட்டுகிறது. சிறிய அடையாள விவரங்கள் துணுக்கின் நடுவில் மாறலாம் — அந்தச் சோதனையில் ஒரு காதணி வடிவம் மாறியது, மேலும் இரண்டு துணுக்குகளில் உதட்டு நிறம் உள்ளீட்டை விடச் சற்று அடர்த்தியாகத் தெரிகிறது. பல-நபர் உரையாடல் இங்கு கிடைக்கவில்லை, வெளியீட்டுத் தெளிவுத்திறன் சாதாரணமானது (எங்கள் உருவப்படச் சோதனைகளில் 1248×1664 — 4K இல்லை), மேலும் இது பேச்சு வீடியோவை மட்டுமே உருவாக்குகிறது: அசைவுச் செயலுக்கோ, கேமரா அசைவுக்கோ, காட்சி மாற்றங்களுக்கோ, Seedance 2.5 அல்லது Kling 3.0 Turbo-வைப் பயன்படுத்துங்கள்.

8

வீடியோக்களை வணிக ரீதியாகப் பயன்படுத்தலாமா — மேலும் யாருடைய முகத்தை நான் பயன்படுத்தலாம்?

நீங்கள் உருவாக்கும் வீடியோக்களை எங்கள் சேவை விதிமுறைகளின் கீழ் தனிப்பட்ட மற்றும் வணிகத் திட்டங்களில் பயன்படுத்தலாம். முகம்தான் தீவிரமாக எடுத்துக்கொள்ள வேண்டிய பகுதி: ஒரு உண்மையான நபரின் புகைப்படத்தை அவரது ஒப்புதலின்றி அசைவூட்டுவது தோற்ற மற்றும் விளம்பர உரிமைகளை மீறலாம், மேலும் பல அதிகார எல்லைகள் இப்போது செயற்கைத் தொகுப்பாளர்களை வெளிப்படுத்துமாறு கோருகின்றன. உருவாக்கப்பட்ட முகங்கள் — இந்தப் பக்கத்தில் உள்ள ஒவ்வொரு முகத்தையும் போல — ஒப்புதல் பிரச்சினையை முற்றிலும் தவிர்க்கின்றன.

ஒரு புகைப்படத்திற்குப் பேச ஏதாவது கொடுங்கள்

வீடியோக்களை உருவாக்கத் தொடங்குங்கள்

விலை & அணுகல் — உண்மைகள்OmniHuman 1.5

மாடல்
OmniHuman 1.5
உருவாக்குநர்
ByteDance
அணுகல்
CreateVision AI பணியிடத்தில் API வழியாக இயங்குகிறது — உள்நுழைந்து உருவாக்குங்கள். API key தேவையில்லை, cloud project தேவையில்லை, நிறுவல் தேவையில்லை.
ஒரு உருவாக்கத்திற்கான விலை
Premium திட்டத்தில் 5-வினாடி கிளிப்பிற்கு 650 கிரெடிட்கள் முதல் ≈ $2.36 ($29/மாதம், 8,000 கிரெடிட்கள்). இலவசத் திட்டத்தில் தினமும் 80 கிரெடிட்கள் உள்ளன.
தனியுரிமை
இயல்பாகவே தனிப்பட்டது — எந்தத் திட்டத்திலும் மற்ற பயனர்கள் உங்கள் உருவாக்கங்களைப் பார்க்க முடியாது. உறுப்பினர் தரவை நாங்கள் விற்பதோ தவறாகப் பயன்படுத்துவதோ இல்லை. தனியுரிமைக் கொள்கை

புதியவைOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.