OmniHuman 1.5 AI トーキングアバター・ジェネレーター

OmniHuman 1.5 にポートレート1枚と音声トラックを渡すと、その人物があなたの言葉をそのまま喋る動画が返ってくる — 唇、表情、身振りが音に従う。

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5とは何ですか?

OmniHuman 1.5 は ByteDance の音声駆動アバターモデルだ。ポートレート1枚と音声トラックを渡すと、その人物があなたの音声を喋る動画を返す — 唇、表情、頭の動き、身振りがすべて音に駆動される。プロンプト駆動の動画モデルと違い、正確な言葉はあなたが与える。研究論文ではマルチモーダルの言語モデルと拡散トランスフォーマーを組み合わせているので、演技は口の動きを追うだけでなく、何が語られているかに反応する。

正直な部分。正面のポートレートが必要だ。下の斜め45度のプロファイルのテストでは、唇はほとんど動かず、頭はカメラから離れていく。音声は1回の実行につき35秒が上限なので、長い台本は分割して繋ぐことになるし、論文の目玉機能である複数人の対話はここでは使えない。これはシーンの動画ではなく発話の動画だ。カメラの動きやアクションには Seedance 2.5 か Kling 3.0 Turbo を使うこと。

アーキテクチャ、位置づけ、ユーザー調査の数字は ByteDance の研究論文による: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

テスターの評価

バージョン 1.5 は、難しい入力に対する頑健性の向上を示している。
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
手、肩がはっきり写り、照明が自然な上半身のポートレートのほうが、たいてい体の動きが良くなる。
Z.Tools — OmniHuman-1.5 deep dive
濃い影、サングラス、変わった遮蔽物、小さすぎる顔は、この仕事を難しくする。
Z.Tools — OmniHuman-1.5 deep dive

なぜ CreateVision AI で OmniHuman 1.5 を回すのか

モデルは ByteDance のものだ。ここで使う理由は、残り2つの入力 — 顔と声 — が同じ作業環境から来ることにある。

OmniHuman 1.5 のアバター用の入力顔として使った GPT Image 2 のポートレート

入力の連鎖が1ページに収まっている

トーキングアバターのクリップには3つ必要だ。顔、声、そしてモデル。ここではその3つが同じ作業環境から来る。GPT Image 2 か Seedream でポートレートを生成し、台本を打ち込んで60種の内蔵音声のどれかで合成し、その両方をそのまま OmniHuman 1.5 に渡す。このページのクリップはすべて、まさにその手順で、1秒も録音せず、実在の人物の写真を1枚もアップロードせずに作った。

標準中国語を話す OmniHuman 1.5 の茶葉店の事例の入力ポートレート

録音ブースの代わりに音声ライブラリ

テキストモードは付け足しではない。英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、イタリア語、ロシア語、ポルトガル語にまたがる60種の声があり、それぞれ支払う前に再生できるプレビューが付いている。600文字まで打ち込み、声を選ぶと、プラットフォームが音声を合成し、それでアバターを1回の実行で駆動する。上の標準中国語の茶葉店のクリップがまさにこの道筋で、マイクは一切関わっていない。

ニュースキャスターの OmniHuman 1.5 の事例の入力ポートレート

サブスクリプション1つで、費用は先に見える

OmniHuman 1.5 は音声の秒単位で課金する — 1秒あたり130クレジット、切り上げ — そして作業環境は、生成ボタンを押す前にクリップの正確な費用を表示する。同じプランが GPT Image 2、Nano Banana Pro、Seedream、Seedance、Kling、Veo をカバーするので、賢いやり方は安く済む。ポートレートを数クレジットで下描きし、台本を固め、それからアバターの秒数にお金を使うこと。音声の無音部分は切り詰めること — その1秒1秒に払っている。

OmniHuman 1.5 のストレステストに使った斜め45度のプロファイルの入力ポートレート

約束ではなく計測 — 失敗も含めて

7本のテストセットは2026年8月19日に生成した — 製品の売り込み、ニュース速報、ジムの激励、標準中国語の茶葉店の挨拶、絵本のキャラクター、意図的な斜め45度の失敗、そして引きの舞台カットだ。受理されたジョブはすべて一発目で描画に成功し、およそ10秒の音声に対して3分20秒から4分42秒だった。うまくいかなかったことも公開する。混み合った火曜の夜、上流は20件の送信のうち13件を、受理する前に容量エラーで拒否した(拒否された実行は自動で返金される)。受理された1件は14分待ち行列に入った。そしてこのページのプロファイルのクリップは、正面のポートレートという助言を無視するとどうなるかをそのまま示している。

この作業環境で作った本物の OmniHuman 1.5 のクリップ

以下の7本はすべて2026年8月19日にここで生成した — どれもその入力が最初に生んだ描画で、撮り直しも選り抜きもしていない。ポートレートは GPT Image 2 の出力で、どの声もテキストで打ち込んで内蔵のライブラリで合成した。受理されたジョブは、およそ10秒の音声に対して3分20秒から4分42秒で返ってきた(1件だけ14分待ち行列に入った外れ値がある)。混み合った夜には、受理される前に上流が容量エラーで何度か送信を拒否した — 拒否された実行は返金される。音を出して見てほしい。

プロンプト音声9.2秒 · Trustworthy Man の声 · 1,300クレジット · 4分42秒

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

プロンプト音声10.2秒 · News Anchor の声 · 1,430クレジット · 4分09秒

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

プロンプト音声10.7秒 · Energetic Guy の声 · 1,430クレジット · 4分00秒

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

プロンプト音声11.8秒 · Mandarin Sweet Girl の声 · 1,560クレジット · 4分19秒

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

プロンプト音声9.7秒 · Sweet Girl の声 · 1,300クレジット · 4分01秒

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

プロンプト音声8.6秒 · Wise Lady の声 · 1,170クレジット · この角度ではリップシンクが目に見えて劣化する

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

プロンプト音声5.4秒 · Movie Narrator の声 · 780クレジット · このコマがこのページの背景になっている

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 は実際には誰向けか

以下はどれも上で実証したクリップに対応している — 願望リストではない。

  • 講座の作り手と解説動画

    ナレーションを打ち込めば、画面にプレゼンターが現れる — カメラも照明も撮り直しもいらない。1本あたり35秒の上限は1本1概念にきれいに対応するし、たいていの講座編集者はもともとそう切っている。

  • UGC と製品のマーケター

    上のスピーカーの売り込みの事例が、ワークフローのすべてだ。製品を持ったクリエイター風のポートレートを生成し、売り込みを打ち込み、声を選ぶ。タレント費用もなければ、追いかける肖像権の許諾もない — その顔は存在したことがないのだから。

  • ローカライズのチーム

    同じ顔が同じメッセージを10言語で伝えられる。ポートレートは保ったまま、声を差し替えるだけだ。リップシンクは渡した音声に従う — 上の標準中国語の事例がその証拠になる。

  • 顔出しなしのチャンネルとバーチャルホスト

    自分で生成したペルソナは、自分が所有するペルソナだ。顔を一度設計し、一貫したライブラリの声を与えれば、毎回の配信の顔役になれる — 上の絵本のキャラクターは、それがフォトリアルである必要すらないことを示している。

  • ポッドキャスターと音声中心の作り手

    難しいほうはもう持っている。音声だ。ハイライトを35秒に切り詰め、ポートレートを足せば、編集ソフトを開かずに SNS 用のビジュアルクリップができる。

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

発話の動画とシーンの動画 — この作業環境で、それぞれが何を求め、何を返すか。

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
あなたが渡すものポートレート写真1枚+あなたの音声、または打ち込んだテキストとライブラリの声プロンプト、加えて任意で画像・動画・音声の参照プロンプト、加えて任意の参照画像1枚プロンプト、または開始画像
言葉を喋るのは誰かあなただ — アバターはあなたのサウンドトラックそのものに口を合わせるモデルがプロンプトから声を生成するモデルがプロンプトから声を生成する音声はクリップと一緒に生成される
ここでのクリップの長さあなたの音声の長さ、最大35秒4–30 s4–8 s3–15 s
クレジット音声1秒あたり130480pで110/秒 · 720pで230/秒クリップあたり320〜1,920(4〜8秒 · 720p〜4K · 音声のあり・なし)720pで55/秒 · 1080pで70/秒
ここでの計測値音声およそ10秒に対しておよそ4分(クリップ7本、2026年8月)このタスクでは計測していないこのタスクでは計測していないこのタスクでは計測していない

クレジット、長さ、入力の選択肢は、2026年8月19日にこの作業環境自身のモデルレジストリから読み取ったものだ — ベンダーが公表している仕様ではなく、ここで得られるものを表している。時間は上のクリップに対する自前の計測値だ。同じ台本を他の3モデルに通してはいないので、それらのセルは推測せずにその旨を書いている。

OmniHuman 1.5 に近い、ほかの動画モデル

OmniHuman 1.5を他のビデオモデルと比較してみてください。同じワークスペースで、ワンクリックで切り替えられます。

CreateVision AI での OmniHuman 1.5 の仕様

モデルomnihuman-1.5、ByteDance 製(研究論文は2025年8月公開)
モードトーキングアバター:写真1枚+音声トラック1本 → 喋る動画。このページのアバターの作業環境で
入力ポートレート画像ちょうど1枚、加えて最大35秒の音声(mp3/wav のアップロード) — または最大600文字の打ち込みテキストを音声合成
ボイスライブラリ10言語にまたがる60種の内蔵音声:英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、イタリア語、ロシア語、ポルトガル語
任意のガイダンス動作、感情、カメラについての短い演技メモ — 役に立つが、必須ではない
出力写真のフレーミングを保つ、途切れない1カット。クリップの長さは音声の長さと等しい。実測の出力:2:3 の写真から 1248×1664、16:9 から 1920×1088、25 fps、H.264、モノラルの AAC 音声
クレジット音声1秒あたり130、切り上げ — 最低130、35秒フルで4,550。正確な費用は生成前に表示される
実測スピード7本のテストでは、受理されたジョブ1件につき、およそ10秒の音声に対して3分20秒〜4分42秒。1件だけ14分待ち行列に入った外れ値がある(2026年8月、混み合った火曜の夜)

写真からトーキングアバターを作る手順

動画の生成を始める
  1. 顔を足す

    はっきりした正面向きの上半身のポートレートをアップロードする — あるいは同じ作業環境で GPT Image 2 か Seedream で1枚生成する。このページの顔はすべてそうやって作った。写真1枚につき1人。顔は大きく、遮るものがないようにすること。

  2. 声を与える

    音声クリップ(mp3 か wav、最大35秒)をアップロードするか、テキストモードに切り替える。600文字まで打ち込み、10言語60種の声から1つ選ぶ。どれも先に再生できるプレビューが付いている。

  3. 必要なら演技を演出する

    「落ち着いて、小さくうなずき、かすかに微笑む」といった短いメモが、身振りと感情を導く。空欄のままにすれば、モデルが音声のリズムと意味を自分で読み取る。

  4. 生成して同期を確認する

    正確なクレジット消費は実行前に表示される — 音声の長さに比例する。生成は非同期で、クリップはすべての入力を添えて履歴に入るので、うまくいった設定は来週も再現できる。

OmniHuman 1.5 の、その先へ

一つのアカウントで、画像・動画生成ワークフローのすべてを。

関連記事

OmniHuman 1.5 の料金と毎日の無料クレジット

無料プランの毎日のクレジットで OmniHuman 1.5 を使えます。プレミアムモデル、より速い生成、4K出力にはアップグレードを。

無料

$0

始めるのに最適

  • 200 ウェルカムクレジット、1日最大 80 まで
  • Z Image Turboは0クレジットで下書き
  • 標準の生成速度
  • 生成履歴を含む
始める

プレミアム

一番人気
$29/month

年額請求 · $240/年

  • 月間 8,000 クレジット、1日の上限なし
  • すべてのプレミアムモデル――GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5倍の生成速度、優先キュー
  • AIプロンプト強化
プレミアム にアップグレード

Ultimate

$49/month

年額請求 · $380/年

  • 月間 18,000 クレジット、1日の上限なし
  • 最大4K解像度のHD生成
  • 優先サポート
  • 最速のキューと新モデルへの早期アクセス
Ultimate にアップグレード

OmniHuman 1.5 — よくある質問

1

OmniHuman 1.5とは何ですか?

ByteDance の音声駆動アバターモデル。ポートレート写真1枚と音声トラック1本を取り、その人物がその音声を喋る動画を返す — 唇、表情、頭の動き、手の身振りがすべて音に従う。その背後にある研究論文は2025年8月に公開された。

2

アバターに自分の言葉をそのまま喋らせられる?

できる — そこがプロンプト駆動の動画モデルとの違いだ。サウンドトラックはあなたが渡す。mp3/wav のアップロードでも、台本を打ち込んで内蔵の声を選ぶ形でもいい。アバターはそれに一語一語口を合わせる。プロンプト駆動のモデルは自分で声を生成するので、書いたとおりに喋ることはめったにない。

3

OmniHuman 1.5 は無料で使える?

無料ではない — 音声1秒あたり130クレジット、切り上げで課金されるので、10秒のクリップは1,300クレジットになる。正確な費用は生成前に表示され、失敗した実行は自動で返金される。台本は締めて、無音は切り詰めること。音声の1秒1秒が、支払う1秒だ。

4

良い素材写真とはどのようなものか?

正面向き、上半身、1人だけ、顔は大きく、均一に照らされ、遮るものがないこと — レビュアーも私たち自身のテストも一致している。上の意図的な斜め45度のプロファイルのテストが、そうでないときに何が起きるかを示している。唇はほとんど動かず、モデルは頭をゆっくりさらに背けていき、写真になかった物が机の上に現れる。生成したポートレートも、カメラで撮った写真とまったく同じようにうまく動く。

5

イラストやアニメのキャラクターでも動く?

動く — 上の絵本のテストは平面の2Dイラストで、OmniHuman 1.5 は絵柄を保ったまま説得力をもって動かした。目、眉、口が手描きアニメのキャラクターのように動く。観察した癖が1つ。口が大きく開くと、平面のイラストにしては驚くほど写実的な歯を描く。ByteDance の論文は人間以外の被写体も主張しているが、私たちが試したのはこのイラストのキャラクターだけだ。

6

クリップはどれくらい長くできる? 生成にはどれくらいかかる?

このプラットフォームでは1本につき音声35秒まで — それより長い台本は分割して繋ぐ必要がある。2026年8月のテストでは、受理されたジョブがおよそ10秒の音声に対して3分20秒から4分42秒で返ってきた。同じ夜からの注意点が1つ。負荷が高いとき、上流はジョブを受理する前に容量エラーで何度か送信を拒否した。拒否された実行に費用はかからないが、5分後が締め切りという状況ではなく、ピーク時には再試行を織り込んでおくこと。

7

OmniHuman 1.5 が苦手なことは?

何よりもまず正面でない顔だ。斜め45度のプロファイルのテストでは、唇はほぼ静止し、頭はカメラからさらに離れていき、写真になかった机の上の物が現れる。同一性の細部がクリップの途中でぶれることもある — そのテストではイヤリングの形が変わったし、別の2本では唇の色が入力よりやや強く出た。複数人の対話はここでは使えず、出力解像度も控えめで(ポートレートのテストでは 1248×1664 — 4K はない)、作れるのは発話の動画だけだ。アクション、カメラの動き、シーンの変化には Seedance 2.5 か Kling 3.0 Turbo を使うこと。

8

動画は商用利用できる? そして誰の顔なら使える?

生成した動画は当社の利用規約のもとで個人利用にも商用プロジェクトにも使える。真剣に扱うべきなのは顔のほうだ。実在の人物の写真を本人の同意なく動かすことは、肖像権やパブリシティ権の侵害になりうるし、いくつかの法域では合成のプレゼンターであることの開示を義務づけるようになっている。生成した顔 — このページのすべての顔がそうだ — なら、同意の問題を完全に避けられる。

写真に語ることを与える

動画の生成を始める

料金とアクセス — 基本情報OmniHuman 1.5

モデル
OmniHuman 1.5
開発元
ByteDance
アクセス方法
CreateVision AI のワークスペース内で API 経由で動作します。ログインするだけで生成でき、API キーもクラウド設定もインストールも不要です。
1 回あたりの料金
5 秒クリップあたり 650 クレジット〜 ≈ $2.36(Premium プラン換算:月額 $29 で 8,000 クレジット)。 無料プランには毎日 80 クレジットが含まれます。
プライバシー
デフォルトで非公開 — どのプランでも、他のユーザーがあなたの生成物を見ることはありません。会員データを販売・悪用することはありません。 プライバシーポリシー

最新アップデートOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.