
入力の連鎖が1ページに収まっている
トーキングアバターのクリップには3つ必要だ。顔、声、そしてモデル。ここではその3つが同じ作業環境から来る。GPT Image 2 か Seedream でポートレートを生成し、台本を打ち込んで60種の内蔵音声のどれかで合成し、その両方をそのまま OmniHuman 1.5 に渡す。このページのクリップはすべて、まさにその手順で、1秒も録音せず、実在の人物の写真を1枚もアップロードせずに作った。
OmniHuman 1.5 にポートレート1枚と音声トラックを渡すと、その人物があなたの言葉をそのまま喋る動画が返ってくる — 唇、表情、身振りが音に従う。
OmniHuman 1.5 は ByteDance の音声駆動アバターモデルだ。ポートレート1枚と音声トラックを渡すと、その人物があなたの音声を喋る動画を返す — 唇、表情、頭の動き、身振りがすべて音に駆動される。プロンプト駆動の動画モデルと違い、正確な言葉はあなたが与える。研究論文ではマルチモーダルの言語モデルと拡散トランスフォーマーを組み合わせているので、演技は口の動きを追うだけでなく、何が語られているかに反応する。
正直な部分。正面のポートレートが必要だ。下の斜め45度のプロファイルのテストでは、唇はほとんど動かず、頭はカメラから離れていく。音声は1回の実行につき35秒が上限なので、長い台本は分割して繋ぐことになるし、論文の目玉機能である複数人の対話はここでは使えない。これはシーンの動画ではなく発話の動画だ。カメラの動きやアクションには Seedance 2.5 か Kling 3.0 Turbo を使うこと。
アーキテクチャ、位置づけ、ユーザー調査の数字は ByteDance の研究論文による: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)
“バージョン 1.5 は、難しい入力に対する頑健性の向上を示している。”
“手、肩がはっきり写り、照明が自然な上半身のポートレートのほうが、たいてい体の動きが良くなる。”
“濃い影、サングラス、変わった遮蔽物、小さすぎる顔は、この仕事を難しくする。”
モデルは ByteDance のものだ。ここで使う理由は、残り2つの入力 — 顔と声 — が同じ作業環境から来ることにある。

トーキングアバターのクリップには3つ必要だ。顔、声、そしてモデル。ここではその3つが同じ作業環境から来る。GPT Image 2 か Seedream でポートレートを生成し、台本を打ち込んで60種の内蔵音声のどれかで合成し、その両方をそのまま OmniHuman 1.5 に渡す。このページのクリップはすべて、まさにその手順で、1秒も録音せず、実在の人物の写真を1枚もアップロードせずに作った。

テキストモードは付け足しではない。英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、イタリア語、ロシア語、ポルトガル語にまたがる60種の声があり、それぞれ支払う前に再生できるプレビューが付いている。600文字まで打ち込み、声を選ぶと、プラットフォームが音声を合成し、それでアバターを1回の実行で駆動する。上の標準中国語の茶葉店のクリップがまさにこの道筋で、マイクは一切関わっていない。

OmniHuman 1.5 は音声の秒単位で課金する — 1秒あたり130クレジット、切り上げ — そして作業環境は、生成ボタンを押す前にクリップの正確な費用を表示する。同じプランが GPT Image 2、Nano Banana Pro、Seedream、Seedance、Kling、Veo をカバーするので、賢いやり方は安く済む。ポートレートを数クレジットで下描きし、台本を固め、それからアバターの秒数にお金を使うこと。音声の無音部分は切り詰めること — その1秒1秒に払っている。

7本のテストセットは2026年8月19日に生成した — 製品の売り込み、ニュース速報、ジムの激励、標準中国語の茶葉店の挨拶、絵本のキャラクター、意図的な斜め45度の失敗、そして引きの舞台カットだ。受理されたジョブはすべて一発目で描画に成功し、およそ10秒の音声に対して3分20秒から4分42秒だった。うまくいかなかったことも公開する。混み合った火曜の夜、上流は20件の送信のうち13件を、受理する前に容量エラーで拒否した(拒否された実行は自動で返金される)。受理された1件は14分待ち行列に入った。そしてこのページのプロファイルのクリップは、正面のポートレートという助言を無視するとどうなるかをそのまま示している。
以下の7本はすべて2026年8月19日にここで生成した — どれもその入力が最初に生んだ描画で、撮り直しも選り抜きもしていない。ポートレートは GPT Image 2 の出力で、どの声もテキストで打ち込んで内蔵のライブラリで合成した。受理されたジョブは、およそ10秒の音声に対して3分20秒から4分42秒で返ってきた(1件だけ14分待ち行列に入った外れ値がある)。混み合った夜には、受理される前に上流が容量エラーで何度か送信を拒否した — 拒否された実行は返金される。音を出して見てほしい。
Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."
Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."
Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"
Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"
Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"
Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."
Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."
以下はどれも上で実証したクリップに対応している — 願望リストではない。
ナレーションを打ち込めば、画面にプレゼンターが現れる — カメラも照明も撮り直しもいらない。1本あたり35秒の上限は1本1概念にきれいに対応するし、たいていの講座編集者はもともとそう切っている。
上のスピーカーの売り込みの事例が、ワークフローのすべてだ。製品を持ったクリエイター風のポートレートを生成し、売り込みを打ち込み、声を選ぶ。タレント費用もなければ、追いかける肖像権の許諾もない — その顔は存在したことがないのだから。
同じ顔が同じメッセージを10言語で伝えられる。ポートレートは保ったまま、声を差し替えるだけだ。リップシンクは渡した音声に従う — 上の標準中国語の事例がその証拠になる。
自分で生成したペルソナは、自分が所有するペルソナだ。顔を一度設計し、一貫したライブラリの声を与えれば、毎回の配信の顔役になれる — 上の絵本のキャラクターは、それがフォトリアルである必要すらないことを示している。
難しいほうはもう持っている。音声だ。ハイライトを35秒に切り詰め、ポートレートを足せば、編集ソフトを開かずに SNS 用のビジュアルクリップができる。
発話の動画とシーンの動画 — この作業環境で、それぞれが何を求め、何を返すか。
| OmniHuman 1.5 | Seedance 2.5 | Veo 3.1 Pro | Kling 3.0 Turbo | |
|---|---|---|---|---|
| あなたが渡すもの | ポートレート写真1枚+あなたの音声、または打ち込んだテキストとライブラリの声 | プロンプト、加えて任意で画像・動画・音声の参照 | プロンプト、加えて任意の参照画像1枚 | プロンプト、または開始画像 |
| 言葉を喋るのは誰か | あなただ — アバターはあなたのサウンドトラックそのものに口を合わせる | モデルがプロンプトから声を生成する | モデルがプロンプトから声を生成する | 音声はクリップと一緒に生成される |
| ここでのクリップの長さ | あなたの音声の長さ、最大35秒 | 4–30 s | 4–8 s | 3–15 s |
| クレジット | 音声1秒あたり130 | 480pで110/秒 · 720pで230/秒 | クリップあたり320〜1,920(4〜8秒 · 720p〜4K · 音声のあり・なし) | 720pで55/秒 · 1080pで70/秒 |
| ここでの計測値 | 音声およそ10秒に対しておよそ4分(クリップ7本、2026年8月) | このタスクでは計測していない | このタスクでは計測していない | このタスクでは計測していない |
クレジット、長さ、入力の選択肢は、2026年8月19日にこの作業環境自身のモデルレジストリから読み取ったものだ — ベンダーが公表している仕様ではなく、ここで得られるものを表している。時間は上のクリップに対する自前の計測値だ。同じ台本を他の3モデルに通してはいないので、それらのセルは推測せずにその旨を書いている。
OmniHuman 1.5を他のビデオモデルと比較してみてください。同じワークスペースで、ワンクリックで切り替えられます。
| モデル | omnihuman-1.5、ByteDance 製(研究論文は2025年8月公開) |
|---|---|
| モード | トーキングアバター:写真1枚+音声トラック1本 → 喋る動画。このページのアバターの作業環境で |
| 入力 | ポートレート画像ちょうど1枚、加えて最大35秒の音声(mp3/wav のアップロード) — または最大600文字の打ち込みテキストを音声合成 |
| ボイスライブラリ | 10言語にまたがる60種の内蔵音声:英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、イタリア語、ロシア語、ポルトガル語 |
| 任意のガイダンス | 動作、感情、カメラについての短い演技メモ — 役に立つが、必須ではない |
| 出力 | 写真のフレーミングを保つ、途切れない1カット。クリップの長さは音声の長さと等しい。実測の出力:2:3 の写真から 1248×1664、16:9 から 1920×1088、25 fps、H.264、モノラルの AAC 音声 |
| クレジット | 音声1秒あたり130、切り上げ — 最低130、35秒フルで4,550。正確な費用は生成前に表示される |
| 実測スピード | 7本のテストでは、受理されたジョブ1件につき、およそ10秒の音声に対して3分20秒〜4分42秒。1件だけ14分待ち行列に入った外れ値がある(2026年8月、混み合った火曜の夜) |
はっきりした正面向きの上半身のポートレートをアップロードする — あるいは同じ作業環境で GPT Image 2 か Seedream で1枚生成する。このページの顔はすべてそうやって作った。写真1枚につき1人。顔は大きく、遮るものがないようにすること。
音声クリップ(mp3 か wav、最大35秒)をアップロードするか、テキストモードに切り替える。600文字まで打ち込み、10言語60種の声から1つ選ぶ。どれも先に再生できるプレビューが付いている。
「落ち着いて、小さくうなずき、かすかに微笑む」といった短いメモが、身振りと感情を導く。空欄のままにすれば、モデルが音声のリズムと意味を自分で読み取る。
正確なクレジット消費は実行前に表示される — 音声の長さに比例する。生成は非同期で、クリップはすべての入力を添えて履歴に入るので、うまくいった設定は来週も再現できる。
一つのアカウントで、画像・動画生成ワークフローのすべてを。
無料プランの毎日のクレジットで OmniHuman 1.5 を使えます。プレミアムモデル、より速い生成、4K出力にはアップグレードを。
年額請求 · $240/年
年額請求 · $380/年
ByteDance の音声駆動アバターモデル。ポートレート写真1枚と音声トラック1本を取り、その人物がその音声を喋る動画を返す — 唇、表情、頭の動き、手の身振りがすべて音に従う。その背後にある研究論文は2025年8月に公開された。
できる — そこがプロンプト駆動の動画モデルとの違いだ。サウンドトラックはあなたが渡す。mp3/wav のアップロードでも、台本を打ち込んで内蔵の声を選ぶ形でもいい。アバターはそれに一語一語口を合わせる。プロンプト駆動のモデルは自分で声を生成するので、書いたとおりに喋ることはめったにない。
無料ではない — 音声1秒あたり130クレジット、切り上げで課金されるので、10秒のクリップは1,300クレジットになる。正確な費用は生成前に表示され、失敗した実行は自動で返金される。台本は締めて、無音は切り詰めること。音声の1秒1秒が、支払う1秒だ。
正面向き、上半身、1人だけ、顔は大きく、均一に照らされ、遮るものがないこと — レビュアーも私たち自身のテストも一致している。上の意図的な斜め45度のプロファイルのテストが、そうでないときに何が起きるかを示している。唇はほとんど動かず、モデルは頭をゆっくりさらに背けていき、写真になかった物が机の上に現れる。生成したポートレートも、カメラで撮った写真とまったく同じようにうまく動く。
動く — 上の絵本のテストは平面の2Dイラストで、OmniHuman 1.5 は絵柄を保ったまま説得力をもって動かした。目、眉、口が手描きアニメのキャラクターのように動く。観察した癖が1つ。口が大きく開くと、平面のイラストにしては驚くほど写実的な歯を描く。ByteDance の論文は人間以外の被写体も主張しているが、私たちが試したのはこのイラストのキャラクターだけだ。
このプラットフォームでは1本につき音声35秒まで — それより長い台本は分割して繋ぐ必要がある。2026年8月のテストでは、受理されたジョブがおよそ10秒の音声に対して3分20秒から4分42秒で返ってきた。同じ夜からの注意点が1つ。負荷が高いとき、上流はジョブを受理する前に容量エラーで何度か送信を拒否した。拒否された実行に費用はかからないが、5分後が締め切りという状況ではなく、ピーク時には再試行を織り込んでおくこと。
何よりもまず正面でない顔だ。斜め45度のプロファイルのテストでは、唇はほぼ静止し、頭はカメラからさらに離れていき、写真になかった机の上の物が現れる。同一性の細部がクリップの途中でぶれることもある — そのテストではイヤリングの形が変わったし、別の2本では唇の色が入力よりやや強く出た。複数人の対話はここでは使えず、出力解像度も控えめで(ポートレートのテストでは 1248×1664 — 4K はない)、作れるのは発話の動画だけだ。アクション、カメラの動き、シーンの変化には Seedance 2.5 か Kling 3.0 Turbo を使うこと。
生成した動画は当社の利用規約のもとで個人利用にも商用プロジェクトにも使える。真剣に扱うべきなのは顔のほうだ。実在の人物の写真を本人の同意なく動かすことは、肖像権やパブリシティ権の侵害になりうるし、いくつかの法域では合成のプレゼンターであることの開示を義務づけるようになっている。生成した顔 — このページのすべての顔がそうだ — なら、同意の問題を完全に避けられる。
OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.