เครื่องสร้างอวตาร AI พูดได้ OmniHuman 1.5

ให้ภาพพอร์เทรตหนึ่งภาพกับแทร็กเสียงหนึ่งแทร็กแก่ OmniHuman 1.5 แล้วมันคืนวิดีโอของคนคนนั้นพูดถ้อยคำของคุณเป๊ะ — ริมฝีปาก สีหน้า และท่าทางตามเสียง

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5 คืออะไร?

OmniHuman 1.5 คือโมเดลอวตารที่ขับด้วยเสียงของ ByteDance: ให้ภาพพอร์เทรตหนึ่งภาพกับแทร็กเสียงหนึ่งแทร็ก แล้วมันคืนวิดีโอของคนคนนั้นพูดเสียงของคุณ — ริมฝีปาก สีหน้า การขยับศีรษะ และท่าทาง ทั้งหมดขับเคลื่อนด้วยเสียง ต่างจากโมเดลวิดีโอที่ขับด้วยพรอมต์ ตรงที่คุณเป็นคนกำหนดถ้อยคำที่แน่นอน งานวิจัยของมันจับคู่โมเดลภาษาแบบหลายโหมดเข้ากับ diffusion transformer การแสดงจึงตอบสนองต่อสิ่งที่กำลังถูกพูด แทนที่จะแค่ตามการขยับปาก

ส่วนที่ตรงไปตรงมา: มันต้องการภาพพอร์เทรตหน้าตรง การทดสอบมุมสามส่วนสี่ของเราด้านล่างแสดงริมฝีปากที่แทบไม่ขยับและศีรษะที่ค่อยๆ เบือนออกไป เสียงจำกัดที่ 35 วินาทีต่อรอบ สคริปต์ยาวๆ จึงต้องแบ่งแล้วเย็บต่อ และบทสนทนาหลายคน — ซึ่งเป็นฟีเจอร์เด่นของงานวิจัย — ไม่มีให้ใช้ที่นี่ มันคือวิดีโอคำพูด ไม่ใช่วิดีโอฉาก: สำหรับการเคลื่อนกล้องหรือแอ็กชัน ให้ใช้ Seedance 2.5 หรือ Kling 3.0 Turbo

สถาปัตยกรรม การวางตำแหน่ง และตัวเลขจากการศึกษาผู้ใช้ มาจากงานวิจัยของ ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

ผู้ทดสอบว่าอย่างไร

เวอร์ชัน 1.5 แสดงให้เห็นความทนทานที่ดีขึ้นกับอินพุตที่ยาก
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
ภาพพอร์เทรตครึ่งตัวที่เห็นมือ ไหล่ และแสงธรรมชาติชัดเจน มักให้การเคลื่อนไหวของร่างกายที่ดีกว่า
Z.Tools — OmniHuman-1.5 deep dive
เงาหนัก แว่นกันแดด สิ่งบดบังแปลกๆ และใบหน้าเล็กจิ๋ว ทำให้งานยากขึ้น
Z.Tools — OmniHuman-1.5 deep dive

ทำไมต้องรัน OmniHuman 1.5 บน CreateVision AI?

ตัวโมเดลเป็นของ ByteDance; เหตุผลที่จะใช้มันที่นี่คืออินพุตอีกสองอย่าง — ใบหน้าและเสียง — มาจากพื้นที่ทำงานเดียวกัน

ภาพพอร์เทรตจาก GPT Image 2 ที่ใช้เป็นใบหน้าอินพุตของคลิปอวตาร OmniHuman 1.5

ห่วงโซ่อินพุตทั้งหมดอยู่ในหน้าเดียว

คลิปอวตารพูดได้ต้องการสามอย่าง: ใบหน้า เสียง และโมเดล ที่นี่ทั้งสามอย่างมาจากพื้นที่ทำงานเดียวกัน — สร้างภาพพอร์เทรตด้วย GPT Image 2 หรือ Seedream พิมพ์สคริปต์แล้วสังเคราะห์ด้วยหนึ่งใน 60 เสียงในตัว จากนั้นป้อนทั้งสองอย่างเข้า OmniHuman 1.5 ตรงๆ ทุกคลิปในหน้านี้ทำแบบนั้นเป๊ะ ตั้งแต่ต้นจนจบ โดยไม่ได้อัดเสียงแม้แต่วินาทีเดียวและไม่ได้อัปโหลดรูปคนจริงแม้แต่รูปเดียว

ภาพพอร์เทรตอินพุตสำหรับเคสร้านชา OmniHuman 1.5 ที่พูดภาษาจีนกลาง

คลังเสียงแทนห้องอัด

โหมดข้อความไม่ใช่ของแถม: 60 เสียงครอบคลุมภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี ฝรั่งเศส เยอรมัน สเปน อิตาลี รัสเซีย และโปรตุเกส แต่ละเสียงมีตัวอย่างให้ฟังก่อนจ่ายอะไร พิมพ์ได้ถึง 600 ตัวอักษร เลือกเสียง แล้วแพลตฟอร์มจะสังเคราะห์คำพูดและขับเคลื่อนอวตารด้วยมันในรอบเดียว คลิปร้านชาภาษาจีนกลางด้านบนคือเส้นทางนี้เป๊ะ — ไม่มีไมโครโฟนเข้ามาเกี่ยว

ภาพพอร์เทรตอินพุตสำหรับเคสผู้ประกาศข่าว OmniHuman 1.5

ซับสคริปชันเดียว และเห็นต้นทุนล่วงหน้า

OmniHuman 1.5 คิดเงินต่อวินาทีของเสียง — 130 เครดิตต่อวินาที ปัดขึ้น — และพื้นที่ทำงานแสดงต้นทุนที่แน่นอนของคลิปคุณก่อนกดสร้าง แพลนเดียวกันครอบคลุม GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling และ Veo เวิร์กโฟลว์ที่สมเหตุสมผลจึงถูก: ร่างภาพพอร์เทรตด้วยเครดิตไม่กี่หน่วย ล็อกสคริปต์ แล้วค่อยจ่ายไปกับวินาทีของอวตาร ตัดความเงียบออกจากเสียงของคุณ — คุณจ่ายทุกวินาทีของมัน

ภาพพอร์เทรตอินพุตมุมสามส่วนสี่ที่ใช้ในการทดสอบความทนทานของ OmniHuman 1.5

วัดจริง ไม่ใช่สัญญา — รวมถึงความล้มเหลว

ชุดทดสอบเจ็ดคลิปของเราสร้างขึ้นเมื่อ 19 สิงหาคม 2026 — การนำเสนอสินค้า สรุปข่าว การปลุกใจในยิม การต้อนรับในร้านชาภาษาจีนกลาง ตัวละครจากหนังสือนิทาน ความล้มเหลวจากมุมสามส่วนสี่ที่เราตั้งใจทำ และภาพเวทีมุมกว้าง งานที่ถูกรับเข้าทุกงานเรนเดอร์สำเร็จตั้งแต่เทคแรก ใน 3m 20s ถึง 4m 42s สำหรับเสียงราวสิบวินาที เรายังเผยแพร่สิ่งที่ผิดพลาดด้วย: ในเย็นวันอังคารที่คนใช้เยอะ ต้นทางปฏิเสธการส่งงานของเรา 13 จาก 20 ครั้งด้วยข้อผิดพลาดเรื่องความจุก่อนจะรับเข้า (รอบที่ถูกปฏิเสธได้เงินคืนอัตโนมัติ) งานหนึ่งที่ถูกรับเข้ารอคิว 14 นาที และคลิปมุมข้างในหน้านี้แสดงให้เห็นชัดว่าเกิดอะไรขึ้นเมื่อคุณเพิกเฉยต่อคำแนะนำเรื่องภาพพอร์เทรตหน้าตรง

คลิป OmniHuman 1.5 จริงจากพื้นที่ทำงานนี้

คลิปทั้ง 7 คลิปด้านล่างสร้างที่นี่เมื่อ 19 สิงหาคม 2026 — แต่ละคลิปคือการเรนเดอร์ครั้งแรกที่อินพุตของมันให้มา ไม่มีการถ่ายซ้ำและไม่มีการคัดภาพ ภาพพอร์เทรตเป็นเอาต์พุตของ GPT Image 2; ทุกเสียงถูกพิมพ์เป็นข้อความและสังเคราะห์ด้วยคลังเสียงในตัว งานที่ถูกรับเข้าคืนผลใน 3m 20s ถึง 4m 42s สำหรับเสียงราว 10 วินาที (มีค่าผิดปกติหนึ่งงานที่รอคิว 14 นาที); ในเย็นวันที่คนใช้เยอะ ต้นทางปฏิเสธการส่งงานหลายครั้งด้วยข้อผิดพลาดเรื่องความจุก่อนจะรับเข้า — รอบที่ถูกปฏิเสธได้เงินคืน เปิดเสียงด้วย

พรอมต์เสียง 9.2 วินาที · เสียง Trustworthy Man · 1,300 เครดิต · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

พรอมต์เสียง 10.2 วินาที · เสียง News Anchor · 1,430 เครดิต · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

พรอมต์เสียง 10.7 วินาที · เสียง Energetic Guy · 1,430 เครดิต · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

พรอมต์เสียง 11.8 วินาที · เสียง Mandarin Sweet Girl · 1,560 เครดิต · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

พรอมต์เสียง 9.7 วินาที · เสียง Sweet Girl · 1,300 เครดิต · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

พรอมต์เสียง 8.6 วินาที · เสียง Wise Lady · 1,170 เครดิต · การซิงก์ปากเสื่อมลงอย่างเห็นได้ชัดที่มุมนี้

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

พรอมต์เสียง 5.4 วินาที · เสียง Movie Narrator · 780 เครดิต · เฟรมนี้คือภาพพื้นหลังของหน้านี้

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 เหมาะกับใครจริงๆ

แต่ละข้อโยงไปหาคลิปที่สาธิตไว้ด้านบน — ไม่ใช่รายการความอยาก

  • ผู้สร้างคอร์สและสื่ออธิบาย

    พิมพ์คำบรรยายแล้วได้ผู้นำเสนอบนจอ — ไม่ต้องมีกล้อง ไฟ หรือการถ่ายซ้ำ เพดาน 35 วินาทีต่อคลิปเข้ากันพอดีกับหนึ่งแนวคิดต่อหนึ่งคลิป ซึ่งเป็นวิธีที่คนตัดต่อคอร์สส่วนใหญ่ตัดอยู่แล้ว

  • นักการตลาด UGC และสินค้า

    เคสนำเสนอลำโพงด้านบนคือเวิร์กโฟลว์ทั้งหมด: สร้างภาพพอร์เทรตสไตล์ครีเอเตอร์ถือสินค้าของคุณ พิมพ์บทนำเสนอ เลือกเสียง ไม่มีค่าตัวนักแสดง และไม่ต้องตามหาหนังสือยินยอมเรื่องภาพลักษณ์ — ใบหน้านั้นไม่เคยมีอยู่จริง

  • ทีมแปลและปรับให้เข้ากับท้องถิ่น

    ใบหน้าเดียวกันส่งสารเดียวกันได้ในสิบภาษา: เก็บภาพพอร์เทรตไว้ เปลี่ยนแค่เสียง การซิงก์ปากตามเสียงที่คุณให้มา — เคสภาษาจีนกลางด้านบนคือหลักฐาน

  • ช่องที่ไม่เปิดหน้าและพิธีกรเสมือน

    เพอร์โซนาที่คุณสร้างคือเพอร์โซนาที่คุณเป็นเจ้าของ ออกแบบใบหน้าครั้งเดียว ให้เสียงจากคลังที่คงเส้นคงวา แล้วมันก็เป็นหน้าตาของทุกตอนได้ — ตัวละครจากหนังสือนิทานที่มีภาพประกอบด้านบนแสดงว่ามันไม่จำเป็นต้องเสมือนจริงด้วยซ้ำ

  • พอดแคสเตอร์และครีเอเตอร์ที่เน้นเสียงเป็นหลัก

    คุณมีส่วนที่ยากอยู่แล้ว: เสียง ตัดไฮไลต์ให้เหลือ 35 วินาที เติมภาพพอร์เทรต แล้วคุณก็ได้คลิปภาพสำหรับโซเชียลโดยไม่ต้องเปิดโปรแกรมตัดต่อ

OmniHuman 1.5 เทียบกับ Seedance 2.5 เทียบกับ Veo 3.1 Pro เทียบกับ Kling 3.0 Turbo

วิดีโอคำพูดเทียบกับวิดีโอฉาก — แต่ละโมเดลต้องการอะไรจากคุณ และคืนอะไรให้ในพื้นที่ทำงานนี้

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
สิ่งที่คุณให้ภาพพอร์เทรต 1 ภาพ + เสียงของคุณ หรือข้อความที่พิมพ์กับเสียงจากคลังพรอมต์ บวกภาพ วิดีโอ และเสียงอ้างอิงที่จะใส่หรือไม่ก็ได้พรอมต์ บวกภาพอ้างอิงที่จะใส่หรือไม่ก็ได้พรอมต์หรือภาพเริ่มต้น
ใครเป็นคนพูดถ้อยคำคุณ — อวตารซิงก์ปากตามซาวด์แทร็กที่คุณให้เป๊ะโมเดลสร้างเสียงขึ้นจากพรอมต์โมเดลสร้างเสียงขึ้นจากพรอมต์เสียงถูกสร้างพร้อมคลิป
ความยาวคลิปที่นี่ความยาวของเสียงคุณ ได้ถึง 35 วินาที4–30 s4–8 s3–15 s
เครดิต130 ต่อวินาทีของเสียง110/วินาที ที่ 480p · 230/วินาที ที่ 720p320–1,920 ต่อคลิป (4–8 วินาที · 720p–4K · มีหรือไม่มีเสียง)55/วินาที ที่ 720p · 70/วินาที ที่ 1080p
วัดที่นี่~4 นาที สำหรับเสียงราว 10 วินาที (7 คลิป สิงหาคม 2026)เราไม่ได้วัดกับงานแบบนี้เราไม่ได้วัดกับงานแบบนี้เราไม่ได้วัดกับงานแบบนี้

เครดิต ความยาว และตัวเลือกอินพุต อ่านมาจากรีจิสทรีโมเดลของพื้นที่ทำงานนี้เองเมื่อ 19 สิงหาคม 2026 — มันบรรยายสิ่งที่คุณได้ที่นี่ ไม่ใช่สเปกที่ผู้ให้บริการประกาศ เวลาคือการวัดของเราเองบนคลิปที่แสดงด้านบน; เราไม่ได้รันสคริปต์ชุดเดียวกันผ่านอีกสามโมเดล ช่องเหล่านั้นจึงบอกไว้ตรงๆ แทนที่จะเดา

โมเดลวิดีโออื่นที่คล้าย OmniHuman 1.5

เปรียบเทียบ OmniHuman 1.5 กับโมเดลวิดีโออื่นๆ — พื้นที่ทำงานเดียวกัน เพียงคลิกเดียวก็สลับได้

สเปก OmniHuman 1.5 บน CreateVision AI

โมเดลomnihuman-1.5 โดย ByteDance (งานวิจัยเผยแพร่เมื่อสิงหาคม 2025)
โหมดอวตารพูดได้: ภาพถ่าย 1 ภาพ + แทร็กเสียง 1 แทร็ก → วิดีโอคนพูด ในพื้นที่ทำงานอวตารบนหน้านี้
อินพุตภาพพอร์เทรต 1 ภาพพอดี บวกเสียงยาวได้ถึง 35 วินาที (อัปโหลด mp3/wav) — หรือข้อความที่พิมพ์ได้ถึง 600 ตัวอักษร แล้วสังเคราะห์เป็นคำพูด
คลังเสียง60 เสียงในตัวครอบคลุม 10 ภาษา: อังกฤษ จีน ญี่ปุ่น เกาหลี ฝรั่งเศส เยอรมัน สเปน อิตาลี รัสเซีย โปรตุเกส
คำกำกับที่จะใส่หรือไม่ก็ได้บันทึกสั้นๆ เรื่องการแสดงสำหรับการกระทำ อารมณ์ และกล้อง — มีประโยชน์ แต่ไม่จำเป็นเลย
เอาต์พุตช็อตเดียวต่อเนื่องที่คงการจัดเฟรมของภาพคุณ; ความยาวคลิปเท่ากับความยาวเสียง เอาต์พุตที่วัดได้: 1248×1664 จากภาพ 2:3, 1920×1088 จาก 16:9, 25 fps, H.264 พร้อมเสียง AAC โมโน
เครดิต130 ต่อวินาทีของเสียง ปัดขึ้น — ขั้นต่ำ 130, 4,550 ที่ความยาวเต็ม 35 วินาที; ต้นทุนที่แน่นอนแสดงก่อนคุณสร้าง
ความเร็วที่วัดจริง3m 20s–4m 42s ต่องานที่ถูกรับเข้า สำหรับเสียงราว 10 วินาที ในการทดสอบ 7 คลิปของเรา; มีค่าผิดปกติหนึ่งงานที่รอคิว 14 นาที (สิงหาคม 2026 เย็นวันอังคารที่คนใช้เยอะ)

วิธีทำอวตารพูดได้จากภาพถ่าย

เริ่มสร้างวิดีโอ
  1. ใส่ใบหน้า

    อัปโหลดภาพพอร์เทรตครึ่งตัวที่ชัด หน้าตรง — หรือสร้างขึ้นด้วย GPT Image 2 หรือ Seedream ในพื้นที่ทำงานเดียวกันนี้ ซึ่งเป็นวิธีที่ทุกใบหน้าในหน้านี้ถูกสร้างขึ้น หนึ่งคนต่อหนึ่งภาพ; ให้ใบหน้าใหญ่และไม่มีอะไรบัง

  2. ให้เสียงกับมัน

    อัปโหลดคลิปเสียง (mp3 หรือ wav ยาวได้ถึง 35 วินาที) หรือสลับไปโหมดข้อความ: พิมพ์ได้ถึง 600 ตัวอักษรแล้วเลือกหนึ่งใน 60 เสียงใน 10 ภาษา แต่ละเสียงมีตัวอย่างให้ฟังก่อน

  3. จะกำกับการแสดงด้วยก็ได้

    บันทึกสั้นๆ อย่าง "สงบ พยักหน้าเบาๆ ยิ้มบางๆ" จะบังคับทิศทางท่าทางและอารมณ์ ปล่อยว่างไว้แล้วโมเดลจะอ่านจังหวะและความหมายของเสียงเอง

  4. สร้างแล้วตรวจการซิงก์

    ค่าเครดิตที่แน่นอนปรากฏก่อนคุณรัน — มันแปรผันตามความยาวเสียง การสร้างเป็นแบบอะซิงโครนัส; คลิปจะตกลงในประวัติของคุณพร้อมอินพุตทุกอย่างที่แนบไว้ เซตอัพที่ใช้ได้ผลจึงทำซ้ำได้ในสัปดาห์หน้า

มากกว่า OmniHuman 1.5

บัญชีเดียว ครบทั้งเวิร์กโฟลว์การสร้างภาพและวิดีโอ

บทความที่เกี่ยวข้อง

ราคาและเครดิตฟรีรายวันของ OmniHuman 1.5

ใช้ OmniHuman 1.5 ด้วยเครดิตรายวันของแพ็กเกจฟรี หรืออัปเกรดเพื่อใช้โมเดลพรีเมียม สร้างงานเร็วขึ้น และเอาต์พุตระดับ 4K

Free

$0

เหมาะสำหรับการเริ่มต้น

  • เครดิตต้อนรับ 200 ใช้ได้สูงสุด 80 ต่อวัน
  • Z Image Turbo ร่างภาพที่ 0 เครดิต
  • ความเร็วในการสร้างมาตรฐาน
  • รวมประวัติการสร้างภาพ
เริ่มต้นใช้งาน

Premium

ยอดนิยมที่สุด
$29/month

เรียกเก็บเงินรายปี · $240/ปี

  • 8,000 เครดิต/เดือน ไม่มีขีดจำกัดรายวัน
  • โมเดลพรีเมียมทั้งหมด — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • ความเร็วในการสร้างเร็วขึ้น 5 เท่า พร้อมคิวลำดับความสำคัญ
  • การปรับปรุงพรอมต์ด้วย AI
อัปเกรดเป็น Premium

Ultimate

$49/month

เรียกเก็บเงินรายปี · $380/ปี

  • 18,000 เครดิต/เดือน ไม่มีขีดจำกัดรายวัน
  • การสร้างภาพความละเอียดสูงสูงสุดถึง 4K
  • การซัพพอร์ตแบบเร่งด่วน
  • คิวที่เร็วที่สุดและสิทธิ์เข้าถึงโมเดลใหม่ก่อนใคร
อัปเกรดเป็น Ultimate

OmniHuman 1.5 — คำถามที่พบบ่อย

1

OmniHuman 1.5 คืออะไร?

โมเดลอวตารที่ขับด้วยเสียงของ ByteDance มันรับภาพพอร์เทรตหนึ่งภาพและแทร็กเสียงหนึ่งแทร็ก แล้วคืนวิดีโอของคนคนนั้นพูดเสียงนั้น — ริมฝีปาก สีหน้า การขยับศีรษะ และท่าทางมือ ทั้งหมดตามเสียง งานวิจัยที่อยู่เบื้องหลังเผยแพร่เมื่อสิงหาคม 2025

2

อวตารพูดถ้อยคำของฉันเป๊ะๆ ได้ไหม?

ได้ — นั่นคือความต่างจากโมเดลวิดีโอที่ขับด้วยพรอมต์ คุณเป็นคนให้ซาวด์แทร็ก ไม่ว่าจะอัปโหลด mp3/wav หรือพิมพ์สคริปต์แล้วเลือกเสียงในตัว แล้วอวตารจะซิงก์ปากตามมันคำต่อคำ โมเดลที่ขับด้วยพรอมต์จะสร้างเสียงของตัวเองและแทบไม่เคยพูดตรงตามที่คุณเขียน

3

OmniHuman 1.5 ใช้ฟรีไหม?

ไม่ — มันคิดเงิน 130 เครดิตต่อวินาทีของเสียง ปัดขึ้น คลิป 10 วินาทีจึงเป็น 1,300 เครดิต ต้นทุนที่แน่นอนแสดงก่อนคุณสร้าง และรอบที่ล้มเหลวได้เงินคืนอัตโนมัติ เขียนสคริปต์ให้กระชับและตัดความเงียบออก: ทุกวินาทีของเสียงคือวินาทีที่คุณจ่าย

4

อะไรคือคุณสมบัติของภาพต้นฉบับที่ดี?

หน้าตรง ครึ่งตัว หนึ่งคน โดยให้ใบหน้าใหญ่ แสงสม่ำเสมอ และไม่มีอะไรบัง — นักรีวิวและการทดสอบของเราเองเห็นตรงกัน การทดสอบมุมสามส่วนสี่ที่เราตั้งใจทำด้านบนแสดงให้เห็นว่าถ้าไม่ทำตามจะเกิดอะไรขึ้น: ริมฝีปากแทบไม่ขยับ โมเดลค่อยๆ หมุนศีรษะให้เบือนออกไปไกลขึ้น และมีวัตถุโผล่บนโต๊ะที่ไม่เคยมีในภาพ ภาพพอร์เทรตที่สร้างขึ้นใช้ได้ดีเท่ากับภาพถ่ายจากกล้องเป๊ะ

5

มันใช้ได้กับภาพประกอบหรือตัวละครอนิเมะไหม?

ได้ — การทดสอบหนังสือนิทานของเราด้านบนเป็นภาพประกอบ 2D แบน และ OmniHuman 1.5 ทำให้มันเคลื่อนไหวได้อย่างน่าเชื่อโดยยังคงสไตล์ภาพไว้: ดวงตา คิ้ว และปาก ขยับเหมือนตัวละครที่วาดแอนิเมชันด้วยมือ ความแปลกหนึ่งอย่างที่เราสังเกตเห็น: เมื่อปากอ้ากว้าง โมเดลวาดฟันที่สมจริงอย่างน่าประหลาดใจสำหรับภาพประกอบแบน งานวิจัยของ ByteDance ยังอ้างถึงตัวแบบที่ไม่ใช่มนุษย์ด้วย; เราทดสอบแค่ตัวละครที่มีภาพประกอบตัวนี้เท่านั้น

6

คลิปยาวได้เท่าไร และการสร้างใช้เวลานานแค่ไหน?

เสียงได้ถึง 35 วินาทีต่อคลิปบนแพลตฟอร์มนี้ — สคริปต์ที่ยาวกว่านั้นต้องแบ่งแล้วเย็บต่อ ในการทดสอบเดือนสิงหาคม 2026 ของเรา งานที่ถูกรับเข้าคืนผลใน 3m 20s ถึง 4m 42s สำหรับเสียงราว 10 วินาที ข้อควรระวังหนึ่งข้อจากเย็นวันเดียวกัน: ภายใต้โหลดหนัก ต้นทางปฏิเสธการส่งงานหลายครั้งด้วยข้อผิดพลาดเรื่องความจุก่อนจะรับงานเข้า รอบที่ถูกปฏิเสธไม่มีค่าใช้จ่าย แต่ให้เผื่อเวลาสำหรับการลองใหม่ในช่วงเวลาที่คนใช้เยอะ แทนที่จะไปตั้งเดดไลน์ห้านาทีข้างหน้า

7

OmniHuman 1.5 ไม่เก่งเรื่องอะไร?

ใบหน้าที่ไม่ได้หันตรงเป็นอันดับแรก: การทดสอบมุมสามส่วนสี่ของเราแสดงริมฝีปากที่แทบไม่ขยับ ศีรษะที่ค่อยๆ เบือนห่างจากกล้อง และวัตถุบนโต๊ะที่ไม่เคยมีในภาพ รายละเอียดเล็กๆ ของอัตลักษณ์อาจเลื่อนไหลกลางคลิป — ต่างหูเปลี่ยนรูปทรงในการทดสอบนั้น และสีปากอ่านออกว่าเข้มกว่าอินพุตเล็กน้อยในอีกสองคลิป บทสนทนาหลายคนไม่มีให้ใช้ที่นี่ ความละเอียดเอาต์พุตอยู่ในระดับปานกลาง (1248×1664 ในการทดสอบภาพพอร์เทรตของเรา — ไม่มี 4K) และมันทำได้แค่วิดีโอคำพูด: สำหรับแอ็กชัน การเคลื่อนกล้อง หรือการเปลี่ยนฉาก ให้ใช้ Seedance 2.5 หรือ Kling 3.0 Turbo

8

ใช้วิดีโอในเชิงพาณิชย์ได้ไหม — และใช้ใบหน้าของใครได้บ้าง?

วิดีโอที่คุณสร้างสามารถใช้ในโปรเจกต์ส่วนตัวและเชิงพาณิชย์ได้ภายใต้ข้อกำหนดการให้บริการของเรา ส่วนใบหน้าคือเรื่องที่ต้องจริงจัง: การทำให้ภาพถ่ายของคนจริงเคลื่อนไหวโดยไม่ได้รับความยินยอมอาจละเมิดสิทธิ์ในภาพลักษณ์และสิทธิ์ในการเผยแพร่ และหลายเขตอำนาจศาลตอนนี้กำหนดให้ต้องเปิดเผยว่าผู้นำเสนอเป็นภาพสังเคราะห์ ใบหน้าที่สร้างขึ้น — อย่างทุกใบหน้าในหน้านี้ — เลี่ยงปัญหาเรื่องความยินยอมได้ทั้งหมด

ให้ภาพถ่ายมีอะไรจะพูด

เริ่มสร้างวิดีโอ

ราคาและการเข้าถึง — ข้อเท็จจริงOmniHuman 1.5

โมเดล
OmniHuman 1.5
ผู้พัฒนา
ByteDance
การเข้าถึง
ทำงานในเวิร์กสเปซของ CreateVision AI ผ่าน API — เข้าสู่ระบบแล้วสร้างได้ทันที ไม่ต้องใช้คีย์ API ไม่ต้องมีโปรเจกต์คลาวด์ ไม่ต้องติดตั้งโปรแกรม
ราคาต่อการสร้างหนึ่งครั้ง
เริ่มต้น 650 เครดิต ≈ $2.36 ต่อคลิป 5 วินาที ในแผน Premium ($29/เดือน ได้ 8,000 เครดิต) แผนฟรีมี 80 เครดิตให้ทุกวัน
ความเป็นส่วนตัว
เป็นส่วนตัวโดยค่าเริ่มต้น — ผู้ใช้คนอื่นไม่สามารถเห็นผลงานของคุณได้ในทุกแผน เราไม่ขายหรือใช้ข้อมูลสมาชิกในทางที่ผิด นโยบายความเป็นส่วนตัว

มีอะไรใหม่OmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.