OmniHuman 1.5 — מחולל אווטאר מדבר AI

תנו ל-OmniHuman 1.5 פורטרט אחד וערוץ קול, והוא מחזיר סרטון של אותו אדם שאומר את המילים המדויקות שלכם — שפתיים, הבעות ומחוות עוקבים אחרי הצליל.

0 / 2,000
130 cr/s · ≤35s

מה זה OmniHuman 1.5?

OmniHuman 1.5 הוא מודל האווטאר מונע-האודיו של ByteDance: תנו לו פורטרט אחד וערוץ קול, והוא מחזיר סרטון של אותו אדם שאומר את האודיו שלכם — שפתיים, הבעות, תנועת ראש ומחוות, כולם מונעים מהצליל. בשונה ממודלי וידאו שמונעי פרומפט, אתם מספקים את המילים המדויקות. מאמר המחקר משלב מודל שפה רב-מודלי עם טרנספורמר דיפוזיה, כך שהביצוע מגיב למה שנאמר ולא רק עוקב אחרי הפה.

החלק הכן: הוא צריך פורטרט חזיתי. מבחן פרופיל שלושת-הרבעים שלנו למטה מראה שפתיים שכמעט לא מתנסחות וראש שנסחף הצידה. האודיו מוגבל ל-35 שניות בכל הרצה, אז תסריטים ארוכים יותר אומרים פיצול ותפירה, ודיאלוג מרובה משתתפים — תכונה מובילה במאמר — אינו זמין כאן. זה וידאו של דיבור, לא וידאו של סצנה: לתנועת מצלמה או לפעולה, השתמשו ב-Seedance 2.5 או ב-Kling 3.0 Turbo.

הארכיטקטורה, המיצוב ונתוני מחקר המשתמשים לקוחים ממאמר המחקר של ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

מה בודקים אומרים

גרסה 1.5 מדגימה עמידות משופרת לקלטים מאתגרים.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
פורטרט עד המותניים עם ידיים, כתפיים ותאורה טבעית ברורות בדרך כלל נותן תנועת גוף טובה יותר.
Z.Tools — OmniHuman-1.5 deep dive
צללים כבדים, משקפי שמש, הסתרות מוזרות ופנים זעירות מקשים על העבודה.
Z.Tools — OmniHuman-1.5 deep dive

למה להריץ את OmniHuman 1.5 ב-CreateVision AI?

המודל הוא של ByteDance; הסיבה להשתמש בו כאן היא ששני הקלטים האחרים — הפנים והקול — מגיעים מאותו מרחב עבודה.

פורטרט של GPT Image 2 ששימש כפנים הקלט לקליפ אווטאר של OmniHuman 1.5

כל שרשרת הקלט חיה בעמוד אחד

קליפ אווטאר מדבר צריך שלושה דברים: פנים, קול והמודל. כאן כל השלושה מגיעים מאותו מרחב עבודה — צרו את הפורטרט עם GPT Image 2 או עם Seedream, הקלידו את התסריט וסנתזו אותו עם אחד מ-60 הקולות המובנים, ואז הזינו את שניהם ישר ל-OmniHuman 1.5. כל קליפ בעמוד הזה נעשה בדיוק כך, מקצה לקצה, בלי להקליט שנייה אחת של אודיו ובלי להעלות תמונה אחת של אדם אמיתי.

פורטרט הקלט למקרה חנות התה במנדרינית של OmniHuman 1.5

ספריית קולות במקום תא הקלטה

מצב הטקסט אינו מחשבה שנייה: 60 קולות באנגלית, סינית, יפנית, קוריאנית, צרפתית, גרמנית, ספרדית, איטלקית, רוסית ופורטוגזית, לכל אחד תצוגה מקדימה שאפשר להשמיע לפני שמוציאים משהו. הקלידו עד 600 תווים, בחרו קול, והפלטפורמה מסנתזת את הדיבור ומניעה איתו את האווטאר בהרצה אחת. קליפ חנות התה במנדרינית שלמעלה הוא בדיוק המסלול הזה — בלי מיקרופון.

פורטרט הקלט למקרה קריין החדשות של OmniHuman 1.5

מנוי אחד, והעלות גלויה מראש

OmniHuman 1.5 מחייב לפי שנייה של אודיו — 130 קרדיטים לשנייה, מעוגל כלפי מעלה — ומרחב העבודה מציג את העלות המדויקת של הקליפ שלכם לפני שאתם לוחצים על יצירה. אותה תוכנית מכסה את GPT Image 2, את Nano Banana Pro, את Seedream, את Seedance, את Kling ואת Veo, אז זרימת העבודה ההגיונית זולה: עשו טיוטה של הפורטרט בכמה קרדיטים, סגרו את התסריט, ורק אז הוציאו על שניות אווטאר. קצצו את השתיקות מהאודיו שלכם — אתם משלמים על כל שנייה שלו.

פורטרט קלט בפרופיל שלושת-רבעים ששימש למבחן העומס של OmniHuman 1.5

נמדד, לא מובטח — כולל הכישלון

סט המבחן שלנו עם שבעה קליפים נוצר ב-19 באוגוסט 2026 — מצגת מוצר, תדריך חדשות, נאום עידוד בחדר כושר, ברכת חנות תה במנדרינית, דמות מספר ילדים, כישלון מכוון בפרופיל שלושת-רבעים, וצילום במה רחב. כל משימה שהתקבלה רונדרה בהצלחה בניסיון הראשון שלה, תוך 3 דק' 20 שנ' עד 4 דק' 42 שנ' עבור בערך עשר שניות של אודיו. אנחנו גם מפרסמים מה השתבש: בערב שלישי עמוס ספק המקור דחה 13 מתוך 20 ההגשות שלנו עם שגיאות קיבולת לפני שקיבל אותן (הרצות שנדחו מזוכות אוטומטית), משימה אחת שהתקבלה עמדה בתור 14 דקות, וקליפ הפרופיל בעמוד הזה מראה בדיוק מה קורה כשמתעלמים מההמלצה על פורטרט חזיתי.

קליפי OmniHuman 1.5 אמיתיים ממרחב העבודה הזה

כל 7 הקליפים למטה נוצרו כאן ב-19 באוגוסט 2026 — כל אחד הוא הרינדור הראשון שהקלטים שלו הפיקו, בלי צילומים חוזרים ובלי בחירה סלקטיבית. הפורטרטים הם פלטים של GPT Image 2; כל קול הוקלד כטקסט וסונתז עם הספרייה המובנית. משימות שהתקבלו חזרו תוך 3 דק' 20 שנ' עד 4 דק' 42 שנ' עבור בערך 10 שניות של אודיו (חריג אחד עמד בתור 14 דקות); בערב עמוס ספק המקור דחה כמה הגשות עם שגיאות קיבולת לפני שקיבל — הרצות שנדחו מזוכות. עם סאונד.

פרומפט9.2 שנ' אודיו · קול Trustworthy Man · 1,300 קרדיטים · 4 דק' 42 שנ'

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

פרומפט10.2 שנ' אודיו · קול News Anchor · 1,430 קרדיטים · 4 דק' 09 שנ'

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

פרומפט10.7 שנ' אודיו · קול Energetic Guy · 1,430 קרדיטים · 4 דק' 00 שנ'

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

פרומפט11.8 שנ' אודיו · קול Mandarin Sweet Girl · 1,560 קרדיטים · 4 דק' 19 שנ'

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

פרומפט9.7 שנ' אודיו · קול Sweet Girl · 1,300 קרדיטים · 4 דק' 01 שנ'

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

פרומפט8.6 שנ' אודיו · קול Wise Lady · 1,170 קרדיטים · סנכרון השפתיים מידרדר בבירור בזווית הזו

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

פרומפט5.4 שנ' אודיו · קול Movie Narrator · 780 קרדיטים · הפריים הזה הוא רקע העמוד

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

למי OmniHuman 1.5 באמת מיועד

כל אחד מאלה מתמפה לקליפ שהודגם למעלה — לא לרשימת משאלות.

  • יוצרי קורסים והסברונים

    הקלידו את הקריינות וקבלו מגיש על המסך — בלי מצלמה, בלי תאורה ובלי צילומים חוזרים. מגבלת 35 השניות לקליפ מתמפה יפה לרעיון אחד לכל קליפ, וכך רוב עורכי הקורסים חותכים ממילא.

  • משווקי UGC ומוצר

    מקרה מצגת הרמקול שלמעלה הוא כל זרימת העבודה: צרו פורטרט בסגנון יוצר שמחזיק את המוצר שלכם, הקלידו את המצגת, בחרו קול. בלי דמי טאלנט, ובלי לרדוף אחרי אישור שימוש בדמות — הפנים מעולם לא היו קיימים.

  • צוותי לוקליזציה

    אותם פנים יכולים למסור את אותו מסר בעשר שפות: שמרו את הפורטרט, החליפו את הקול. סנכרון השפתיים עוקב אחרי כל אודיו שאתם מספקים — מקרה המנדרינית שלמעלה הוא ההוכחה.

  • ערוצים ללא פנים ומנחים וירטואליים

    פרסונה שאתם יוצרים היא פרסונה שאתם מחזיקים. עצבו את הפנים פעם אחת, תנו להם קול עקבי מהספרייה, והם יכולים להוביל כל פרק — דמות ספר הילדים המאוירת שלמעלה מראה שהם אפילו לא חייבים להיות פוטוריאליסטיים.

  • פודקאסטרים ויוצרים שאודיו-קודם

    כבר יש לכם את החלק הקשה: האודיו. קצצו קטע מרכזי ל-35 שניות, הוסיפו פורטרט, ויש לכם קליפ ויזואלי לרשתות בלי לפתוח עורך.

OmniHuman 1.5 מול Seedance 2.5 מול Veo 3.1 Pro מול Kling 3.0 Turbo

וידאו של דיבור מול וידאו של סצנה — מה כל מודל צריך מכם, ומה הוא מחזיר במרחב העבודה הזה.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
מה אתם מספקיםתמונת פורטרט אחת + האודיו שלכם, או טקסט מוקלד וקול מהספרייהפרומפט, בתוספת תמונות, סרטונים ואודיו ייחוס אופציונלייםפרומפט, בתוספת תמונת ייחוס אופציונליתפרומפט או תמונת פתיחה
מי אומר את המיליםאתם — האווטאר מסנכרן שפתיים לפסקול המדויק שלכםהמודל מייצר קולות מהפרומפטהמודל מייצר קולות מהפרומפטהאודיו נוצר עם הקליפ
אורך הקליפ כאןאורך האודיו שלכם, עד 35 שנ'4–30 s4–8 s3–15 s
קרדיטים130 לכל שניית אודיו110/שנ' ב-480p · 230/שנ' ב-720p320–1,920 לקליפ (4–8 שנ' · 720p–4K · ± אודיו)55/שנ' ב-720p · 70/שנ' ב-1080p
נמדד כאן‏~4 דק' עבור ~10 שנ' של אודיו (7 קליפים, אוגוסט 2026)לא נמדד במשימה הזולא נמדד במשימה הזולא נמדד במשימה הזו

הקרדיטים, המשך ואפשרויות הקלט נקראים מרישום המודלים של מרחב העבודה הזה ב-19 באוגוסט 2026 — הם מתארים מה אתם מקבלים כאן, לא את המפרטים שהספקים מפרסמים. הזמנים הם מדידות שלנו על הקליפים שמוצגים למעלה; לא הרצנו את אותם תסריטים דרך שלושת המודלים האחרים, אז התאים האלה אומרים זאת במקום לנחש.

עוד מודלי וידאו כמו OmniHuman 1.5

השווה את OmniHuman 1.5 עם דגמי וידאו אחרים - אותה סביבת עבודה, לחיצה אחת למעבר.

מפרט OmniHuman 1.5 ב-CreateVision AI

מודלomnihuman-1.5, מבית ByteDance (מאמר מחקר שפורסם באוגוסט 2025)
מצבאווטאר מדבר: תמונה אחת + ערוץ אודיו אחד ← סרטון מדבר, במרחב העבודה של האווטארים בעמוד הזה
קלטיםבדיוק תמונת פורטרט אחת, בתוספת אודיו עד 35 שניות (העלאת mp3/wav) — או טקסט מוקלד עד 600 תווים, שמסונתז לדיבור
ספריית הקולות60 קולות מובנים ב-10 שפות: אנגלית, סינית, יפנית, קוריאנית, צרפתית, גרמנית, ספרדית, איטלקית, רוסית, פורטוגזית
הנחיה אופציונליתהערת ביצוע קצרה לפעולות, לרגש ולמצלמה — שימושית, אף פעם לא חובה
פלטצילום רצוף אחד ששומר על המסגור של התמונה שלכם; אורך הקליפ שווה לאורך האודיו. פלט שנמדד: 1248×1664 מתמונה 2:3, 1920×1088 מ-16:9, 25 fps, H.264 עם אודיו AAC מונו
קרדיטים130 לכל שנייה של אודיו, מעוגל כלפי מעלה — 130 מינימום, 4,550 ב-35 השניות המלאות; העלות המדויקת מוצגת לפני היצירה
מהירות מדודה3 דק' 20 שנ'–4 דק' 42 שנ' לכל משימה שהתקבלה עבור ~10 שנ' של אודיו במבחן שבעת הקליפים שלנו; חריג אחד עמד בתור 14 דקות (אוגוסט 2026, ערב שלישי עמוס)

איך להכין אווטאר מדבר מתמונה

התחילו ליצור סרטונים
  1. הוסיפו את הפנים

    העלו פורטרט ברור, חזיתי, עד המותניים — או צרו אחד עם GPT Image 2 או עם Seedream באותו מרחב עבודה, וכך נעשו כל הפנים בעמוד הזה. אדם אחד לתמונה; שמרו על הפנים גדולים ולא מוסתרים.

  2. תנו לו קול

    העלו קטע אודיו (mp3 או wav, עד 35 שניות), או עברו למצב טקסט: הקלידו עד 600 תווים ובחרו אחד מ-60 קולות ב-10 שפות, לכל אחד תצוגה מקדימה שאפשר להשמיע קודם.

  3. ביימו את הביצוע, אם תרצו

    הערה קצרה כמו "רגוע, הנהונים קטנים, חיוך עדין" מנווטת מחוות ורגש. השאירו אותה ריקה והמודל יקרא את הקצב ואת המשמעות של האודיו בעצמו.

  4. צרו ובדקו את הסנכרון

    עלות הקרדיטים המדויקת מופיעה לפני ההרצה — היא מתכווננת לאורך האודיו. היצירה אסינכרונית; הקליפ נוחת בהיסטוריה שלכם עם כל הקלטים מצורפים, כך שהגדרה שעובדת ניתנת לשחזור בשבוע הבא.

מעבר ל-OmniHuman 1.5

חשבון אחד, תהליך העבודה המלא של יצירת תמונות ווידאו.

קריאה נוספת

תמחור OmniHuman 1.5 וקרדיטים יומיים בחינם

הריצו את OmniHuman 1.5 עם הקרדיטים היומיים של המסלול החינמי, או שדרגו למודלי פרימיום, יצירה מהירה יותר ופלט 4K.

חינם

$0

מושלם להתחלה

  • 200 קרדיטים של ברוכים הבאים, עד 80 ביום
  • Z Image Turbo יוצר טיוטות ב-0 קרדיטים
  • מהירות יצירה רגילה
  • היסטוריית יצירה כלולה
התחל

Premium

הכי פופולרי
$29/month

חיוב שנתי · $240/שנה

  • 8,000 קרדיטים/חודש, ללא מגבלות יומיות
  • כל מודלי הפרימיום — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • מהירות יצירה פי 5, תור עדיפות
  • שיפור פרומפט באמצעות AI
שדרג ל-Premium

Ultimate

$49/month

חיוב שנתי · $380/שנה

  • 18,000 קרדיטים/חודש, ללא מגבלות יומיות
  • יצירת HD עד רזולוציית 4K
  • תמיכה בעדיפות
  • התור המהיר ביותר וגישה מוקדמת למודלים חדשים
שדרג ל-Ultimate

OmniHuman 1.5 — שאלות נפוצות

1

מה זה OmniHuman 1.5?

מודל האווטאר מונע-האודיו של ByteDance. הוא לוקח תמונת פורטרט אחת וערוץ אודיו אחד ומחזיר סרטון של אותו אדם שאומר את האודיו — שפתיים, הבעות, תנועת ראש ומחוות ידיים, כולם עוקבים אחרי הצליל. מאמר המחקר שמאחוריו פורסם באוגוסט 2025.

2

האם האווטאר יכול להגיד את המילים המדויקות שלי?

כן — זה ההבדל ממודלי וידאו שמונעי פרומפט. אתם מספקים את הפסקול, או כהעלאת mp3/wav או על ידי הקלדת התסריט ובחירת קול מובנה, והאווטאר מסנכרן אליו שפתיים מילה במילה. מודלים שמונעי פרומפט מייצרים קולות משלהם ולעתים רחוקות אומרים בדיוק את מה שכתבתם.

3

האם OmniHuman 1.5 חינמי לשימוש?

לא — הוא מחייב 130 קרדיטים לכל שנייה של אודיו, מעוגל כלפי מעלה, כך שקליפ בן 10 שניות הוא 1,300 קרדיטים. העלות המדויקת מוצגת לפני היצירה, והרצות שנכשלו מזוכות אוטומטית. שמרו על תסריטים הדוקים וקצצו שתיקות: כל שנייה של אודיו היא שנייה שאתם משלמים עליה.

4

מה הופך תמונה מקורית לטובה?

חזיתי, עד המותניים, אדם אחד, עם פנים גדולים, מוארים באחידות ולא מוסתרים — מבקרים והבדיקות שלנו מסכימים. מבחן פרופיל שלושת-הרבעים המכוון שלנו למעלה מראה מה קורה אחרת: השפתיים כמעט לא מתנסחות, המודל מסובב את הראש לאט הלאה, ועצמים מופיעים על השולחן שמעולם לא היו בתמונה. פורטרטים שנוצרו עובדים בדיוק כמו צילומי מצלמה.

5

האם זה עובד עם איורים או דמויות אנימה?

כן — מבחן ספר הילדים שלנו למעלה הוא איור דו-ממדי שטוח, ו-OmniHuman 1.5 הנפיש אותו באופן משכנע תוך שמירה על סגנון האמנות: העיניים, הגבות והפה זזים כמו דמות שהונפשה ביד. מוזרות אחת שראינו: כשהפה נפתח לרווחה, המודל מצייר שיניים ריאליסטיות באופן מפתיע עבור איור שטוח. המאמר של ByteDance טוען גם לנושאים לא-אנושיים; אנחנו בדקנו רק את הדמות המאוירת הזו.

6

כמה ארוך קליפ יכול להיות, וכמה זמן לוקחת היצירה?

עד 35 שניות של אודיו לקליפ בפלטפורמה הזו — תסריטים ארוכים יותר צריכים להיות מפוצלים ונתפרים. במבחן שלנו מאוגוסט 2026, משימות שהתקבלו חזרו תוך 3 דק' 20 שנ' עד 4 דק' 42 שנ' עבור בערך 10 שניות של אודיו. הסתייגות אחת מאותו ערב: תחת עומס כבד ספק המקור דחה כמה הגשות עם שגיאות קיבולת לפני שקיבל את המשימה. הרצות שנדחו לא עולות כלום, אבל תכננו ניסיונות חוזרים בשעות השיא ולא דדליין בעוד חמש דקות.

7

במה OmniHuman 1.5 גרוע?

פנים לא חזיתיים, מעל הכול: מבחן פרופיל שלושת-הרבעים שלנו מראה שפתיים כמעט סטטיות, ראש שנסחף רחוק יותר מהמצלמה, ועצמים על השולחן שמעולם לא היו בתמונה. פרטי זהות קטנים יכולים לנדוד באמצע הקליפ — עגיל שינה צורה במבחן ההוא, וצבע השפתיים נקרא מעט חזק יותר מהקלט בשניים אחרים. דיאלוג מרובה משתתפים אינו זמין כאן, רזולוציית הפלט צנועה (1248×1664 במבחני הפורטרט שלנו — בלי 4K), והוא עושה רק וידאו של דיבור: לפעולה, לתנועת מצלמה או לשינויי סצנה, השתמשו ב-Seedance 2.5 או ב-Kling 3.0 Turbo.

8

האם אפשר להשתמש בסרטונים מסחרית — ובפנים של מי מותר להשתמש?

בסרטונים שאתם יוצרים אפשר להשתמש בפרויקטים אישיים ומסחריים בכפוף לתנאי השימוש שלנו. הפנים הם החלק שצריך לקחת ברצינות: הנפשת תמונה של אדם אמיתי בלי הסכמתו יכולה להפר זכויות דמות ופרסום, וכמה מדינות דורשות היום גילוי של מגישים סינתטיים. פנים שנוצרו — כמו כל פנים בעמוד הזה — מונעים את בעיית ההסכמה לגמרי.

תנו לתמונה משהו להגיד

התחילו ליצור סרטונים

מחירים וגישה — העובדותOmniHuman 1.5

מודל
OmniHuman 1.5
מפתח
ByteDance
גישה
פועל בסביבת העבודה של CreateVision AI דרך API — מתחברים ויוצרים. בלי מפתח API, בלי פרויקט ענן, בלי התקנה.
מחיר לכל יצירה
החל מ-650 קרדיטים ≈ $2.36 לקליפ של 5 שניות במסלול Premium ‏($29/חודש עבור 8,000 קרדיטים). המסלול החינמי כולל 80 קרדיטים בכל יום.
פרטיות
פרטי כברירת מחדל — אף משתמש אחר לא יכול לראות את היצירות שלך, בשום מסלול. איננו מוכרים או עושים שימוש לרעה בנתוני חברים. מדיניות פרטיות

מה חדשOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.