しゃべる写真 AI

ポートレート写真と音声トラック(最大35秒)をアップロードすると、OmniHuman 1.5が口の動きと自然な動きが同期した、話すアバター動画を生成します。

0 / 2,000
130 cr/s · ≤35s

1枚の写真から話す動画へ

1枚のポートレートと台本が、リアルな話し手に——口元・表情・ジェスチャーが同期。カメラもスタジオも不要。

元の画像Original portrait photo of a beauty creator holding a skincare product
スクリプト

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AIアバター動画

写真1枚と音声から、話すAIアバターを作成する

完全なAIアバター(デジタルヒューマン)ジェネレーター:ポートレートと音声クリップをアップロードするか、スクリプトを入力して声を選択するだけで、唇の動きが同期し、自然な表情とジェスチャーを備えた、まるで生きているかのような動画を作成できます。ByteDance OmniHuman 1.5を搭載しており、カメラ、俳優、スタジオは不要です。

光り輝く宇宙船の通路を歩く宇宙飛行士のAI動画の一場面

一枚の肖像画から生まれたデジタル広報担当者

撮影不要、俳優不要、グリーンスクリーン不要。人物の鮮明な写真を1枚アップロードするだけで、スクリプトを読み上げるプレゼンターが完成します。製品説明、コース紹介、告知、広告などに使える、再利用可能なデジタルホストを作成でき、撮り直しなしでいつでも新しいセリフを生成できます。

温かなボケを背に、カフェの窓を流れ落ちる雨のAI動画の一場面

参加方法は2つ:音声ファイルをアップロードするか、スクリプトを入力する。

既に音声録音をお持ちですか?それをアップロードすれば、アバターがそれに合わせて口パクします。音声がない場合は、テキストモードに切り替えて、アバターに言わせたいセリフを入力し、内蔵のテキスト読み上げライブラリから音声を選択すれば、スクリプトが音声に変換されます。生成前に、推定される長さとクレジット費用が表示されます。

琥珀色の光に照らされた煙る舞台上のダンサーのシルエットのAI動画の一場面

まるで生きているかのよう――ただ口が動くだけではない

OmniHuman 1.5は、音声のリズム、韻律、意味を読み取り、正確なリップシンクに加え、頭の動き、姿勢、手のジェスチャーを制御します。同時に、人物の個性や照明も維持します。その結果、口元が動くだけの静止画ではなく、まるで本物のプレゼンターのようなパフォーマンスを実現します。

雪の山小屋の上空で渦巻くオーロラのAI動画の一場面

マーケティング、トレーニング、ソーシャル用途向けに構築されています

広告やランディングページ用のスポークスパーソンクリップ、トレーニング用のナレーション付きレッスンやオンボーディング、ソーシャルメディア用のトークヘッド投稿、あるいは同じメッセージの多言語版などをすぐに作成できます。各生成データは入力内容とともに履歴に保存されるため、反復作業やバリエーションの作成を迅速に行うことができます。

しゃべる写真AIに向いたポートレート

CreateVision AI で生成したプレゼンター風のポートレートです——音声を足せば、どれでも話すアバター動画を動かせます。

美容クリエイターのAIアバターがスキンケア美容液を紹介している
スマートフォンを紹介するテクノロジー評論家のAIアバター
コーヒーカップを持ったライフスタイルクリエイターのAIアバター
スニーカーレビュー担当者のAIアバターが靴を紹介している
ハンドバッグを持ったファッションクリエイターのAIアバター
健康食品メーカーのAIアバターがサプリメントを紹介している
香水瓶を持った美容クリエイターのAIアバター
キッチン用品を持った家庭料理クリエイターのAIアバター

このAIアバター動画ジェネレーターを支えるモデル

このページのリップシンク、表情、体の動きはOmniHuman 1.5が担っています。

AIアバター動画ジェネレーターの仕様

入力ポートレート写真1枚と、アップロードした音声ファイルまたは入力した台本のどちらか。
ポートレートの条件正面向き、十分な明るさ、顔全体が写っていてピントが合っていること。サングラスや強い影はリップシンクの精度を下げます。
音声の長さ1回の生成につき最大 35 秒——話し言葉でおよそ 85 語です。
ボイスライブラリ10 言語にわたる 60 種類の内蔵ボイス。生成前に試聴できます。
モデルOmniHuman 1.5。リップシンク、表情、そして自然な頭と体の動きを担います。
コスト他の動画生成と同じく出力秒数での課金。生成前に表示されます。
出力ダウンロードできるクリップ。元のポートレートと台本を添えて履歴に保存されます。

しゃべる写真AIの使い方

1枚のポートレート、1本の音声、1本のクリップ。

  1. 1

    ポートレートをアップロード

    正面を向いた鮮明な写真が最適です。AIアバター動画ジェネレーターは、この1枚から顔を読み取ります。

  2. 2

    音声を追加

    音声ファイルをアップロードするか、台本を入力して内蔵の音声ライブラリから選んでください。音声は最長35秒まで使えます。

  3. 3

    アバター動画を生成

    モデルは口の動き、表情、自然な頭の揺れを音声に同期させ、ダウンロードや延長ができるクリップを返します。

AIアバター動画ジェネレーター向け台本の書き方

ここに画像プロンプトはありません——働くのはポートレートと音声です。あなたが書くのは台本で、その選び方が仕上がりの自然さを決めます。

1

書き出しの一言

短い一言から始めましょう。リップシンクが最も目立つのは最初の1秒です。

ねえ、ちょっとだけいい?

2

文の長さ

1文はおよそ15語以内に。長い節は不自然な間を生みます。

この美容液の成分は2つ。これが処方のすべてです。

3

句読点

読点と句点は息継ぎになります。実際に間を置く場所に打ってください。

効きます——しかも10秒で終わります。

4

文字数の目安

おおよそ1秒あたり2.5語。狙うクリップの長さに合わせて書きましょう。

35秒のクリップでおよそ85語

曖昧な例

当社の革新的な製品は最先端のテクノロジーを活用し、卓越性を求める目の肥えたお客様に比類なき成果をお届けします。

具体的な例

これがいつも聞かれる部分です。成分は2つ、余計なものはなし。1週間ほどで違いが分かります。

なぜうまくいくのか

1つ目は抽象語だけでできた19語の一文で、アバターは平板で息継ぎのない一本調子で読み上げます。間を置ける場所がどこにもないからです。2つ目は自然なアクセントを持つ短い3文で、これが読みを人間らしく聞こえさせます。

曖昧な例

皆さんこんにちは、私たちのチャンネルへようこそ。本日はスキンケアのルーティンについて知っておくべき最も重要な5つのことについてお話ししていきたいと思います。

具体的な例

スキンケアについて5つ。1つ目は、みんなが間違えているところです。

なぜうまくいくのか

だらだら続く長い書き出しは、リップシンクが最もズレる場所です。モデルが拠り所にできる句読点がないからです。短いつかみなら明確なアクセントができ、視聴者も離れにくくなります。

やめるべき癖

  • 顔が小さい、角度がついている、または一部が影になっているポートレートを使うこと。リップシンクの精度は、元のフレームで口がどれだけはっきり見えているかにそのまま比例します。
  • 音声の上限を超えて書くこと。生成は音声 35 秒で打ち切られます——長い台本は切られるので、区切って分割し、同じポートレートを使い回しましょう。
  • 専門用語の詰め込み。数字、略語、長い製品名は、合成音声がいちばん機械的に聞こえる箇所です。声に出して読むとおりに書きましょう。

AIアバター動画ジェネレーターの先へ

話すアバターは出力のひとつにすぎません。画像生成も動画生成も同じアカウントで動きます。

AIアバター動画に役立つ資料

AIアバター動画ジェネレーターの料金と毎日の無料クレジット

アバター動画も他の動画と同じく秒単位の課金です。無料アカウントには毎日80クレジットが付くので、まず試せます。

無料

$0

始めるのに最適

  • 200 ウェルカムクレジット、1日最大 80 まで
  • Z Image Turboは0クレジットで下書き
  • 標準の生成速度
  • 生成履歴を含む
始める

プレミアム

一番人気
$29/month

年額請求 · $240/年

  • 月間 8,000 クレジット、1日の上限なし
  • すべてのプレミアムモデル――GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5倍の生成速度、優先キュー
  • AIプロンプト強化
プレミアム にアップグレード

Ultimate

$49/month

年額請求 · $380/年

  • 月間 18,000 クレジット、1日の上限なし
  • 最大4K解像度のHD生成
  • 優先サポート
  • 最速のキューと新モデルへの早期アクセス
Ultimate にアップグレード

AIアバター動画ジェネレーター — よくある質問

1

AIアバター(デジタルヒューマン)とは何ですか?

AIアバターとは、一枚の写真と音声から生成される、人物のしゃべる動画のことです。撮影する代わりに、人物の肖像と音声(または台本と音声)を提供するだけで、モデルがまるで生きているかのような話し方をアニメーション化します。デジタルプレゼンター、広報担当者、ナレーターなどとして活用できます。

2

作成するには何が必要ですか?

鮮明な正面向きのポートレート写真と、音声クリップ(mp3/wav形式)、またはテキストモードの場合は読み上げたいスクリプトと内蔵ライブラリから選択した音声。これだけで、しゃべるアバター動画を作成できます。

3

自分の声を使ってもいいですか?

はい。ご自身の音声録音をアップロードすると、アバターがそれに合わせて口パクします。録音がない場合は、テキストモードに切り替えて、テキスト読み上げライブラリから音声を選択してください。

4

アバター動画の長さはどれくらいまで可能ですか?

1世代あたり最大35秒の音声。長いスクリプトの場合は、複数のクリップに分割してください。入力すると推定再生時間が表示され、音声1秒単位で課金されます。

5

AIアバターはどのような用途に使えますか?

一般的な用途としては、製品説明や広告、コースやオンボーディングのナレーション、ソーシャルメディアでの発言動画、告知、メッセージの多言語版など、プレゼンターを撮影する必要があるあらゆる場面が挙げられます。

6

AIアバターはどのモデルで動いているのですか?

CreateVision AIは、ByteDanceのOmniHuman 1.5を使用しており、音声からリップシンク、頭の動き、ジェスチャーを自動で処理します。技術的な詳細については、OmniHuman 1.5のモデルページをご覧ください。

7

AIアバター動画ジェネレーターには、どんな写真が向いていますか?

光が十分に当たり、顔全体がはっきり写った正面向きのポートレート。サングラス、顔にかかる濃い影、極端なアングル、画面内で顔が小さすぎる——いずれもリップシンクの精度を下げます。

8

自分の声を録音する必要がありますか?

いいえ。台本を入力し、内蔵ライブラリから声を選べます。ライブラリには10言語・60種類の音声が揃っています。自分の録音を使いたい場合はアップロードにも対応しています。

9

AIアバター動画はどのくらいの長さまで作れる?

1回の生成につき音声は最長35秒です。もっと長いプレゼンなら、いくつかのセグメントに分けて生成し、つなげてください——同じ元ポートレートを使えば、クリップをまたいでも話し手の見た目が揃います。

初めてのしゃべるAIアバターを作成しよう

制作を始めましょう