AI トーキングフォト

ポートレートと音声トラック(最大 35s)をアップロードするか、スクリプトを入力してボイスを選ぶと、OmniHuman 1.5 が写真を、同期した唇と自然な動きのあるトーキング動画に変換します。自分の写真を使って自分自身で出演できます。

0 / 2,000
130 cr/s · ≤35s

1枚の写真から話す動画へ

1枚のポートレートと台本が、リアルな話し手に——口元・表情・ジェスチャーが同期。カメラもスタジオも不要。

元の画像Original portrait photo of a beauty creator holding a skincare product
スクリプト

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AIアバター動画

自分の写真も含め、どんな写真でも話させることができます

完全なAIトーキングフォト(デジタルヒューマン)生成ツール:ポートレートと音声クリップをアップロードするか、スクリプトを入力して声を選ぶだけで、唇の動きが同期し、自然な表情とジェスチャーを備えたリアルなトーキング動画が生成されます。自分の写真を使ってプレゼンターになることもできます。ByteDance OmniHuman 1.5を搭載。カメラも俳優もスタジオも不要です。

額縁入りのポートレート写真が、同じ女性の話すAIアバターに変わり、その間に音声波形が表示されている

自分で出演するか、デジタルスポークスパーソンを作る

撮影も俳優もグリーンスクリーンも不要。自分の鮮明な写真を1枚アップロードするだけで、自分の声でもライブラリの声でも、スクリプトを読み上げるプレゼンターになれます。あるいは、許可を得た人物の写真を使って、製品説明、コース紹介、お知らせ、広告向けの再利用可能なデジタルホストを構築できます。再撮影なしで、いつでも新しいセリフを再生成できます。

AIトーキングフォトへの2つの入力:アップロードされた音声波形と、声の選択機能付きの入力済みスクリプト

参加方法は2つ:音声ファイルをアップロードするか、スクリプトを入力する。

既に音声録音をお持ちですか?それをアップロードすれば、アバターがそれに合わせて口パクします。音声がない場合は、テキストモードに切り替えて、アバターに言わせたいセリフを入力し、内蔵のテキスト読み上げライブラリから音声を選択すれば、スクリプトが音声に変換されます。生成前に、推定される長さとクレジット費用が表示されます。

自然なハンドジェスチャーでカメラに向かって話す女性のAIトーキングフォトの静止画

まるで生きているかのよう――ただ口が動くだけではない

OmniHuman 1.5は、音声のリズム、韻律、意味を読み取り、正確なリップシンクに加え、頭の動き、姿勢、手のジェスチャーを制御します。同時に、人物の個性や照明も維持します。その結果、口元が動くだけの静止画ではなく、まるで本物のプレゼンターのようなパフォーマンスを実現します。

リビングルームで短いソーシャルクリップを届けるAIトーキングフォトのプレゼンター

マーケティング、トレーニング、ソーシャル用途向けに構築されています

広告やランディングページ用のスポークスパーソンクリップ、トレーニング用のナレーション付きレッスンやオンボーディング、ソーシャルメディア用のトークヘッド投稿、あるいは同じメッセージの多言語版などをすぐに作成できます。各生成データは入力内容とともに履歴に保存されるため、反復作業やバリエーションの作成を迅速に行うことができます。

AIトーキングフォトに使えるポートレート

CreateVision AI で生成したプレゼンター風のポートレートです——音声を足せば、どれでも話すアバター動画を動かせます。

美容クリエイターのAIアバターがスキンケア美容液を紹介している
スマートフォンを紹介するテクノロジー評論家のAIアバター
コーヒーカップを持ったライフスタイルクリエイターのAIアバター
スニーカーレビュー担当者のAIアバターが靴を紹介している
ハンドバッグを持ったファッションクリエイターのAIアバター
健康食品メーカーのAIアバターがサプリメントを紹介している
香水瓶を持った美容クリエイターのAIアバター
キッチン用品を持った家庭料理クリエイターのAIアバター

このAIトーキングフォト生成ツールを支えるモデル

このページのリップシンク、表情、体の動きはOmniHuman 1.5が担っています。

AIトーキングフォトの仕様

入力ポートレート写真1枚と、アップロードした音声ファイルまたは入力した台本のどちらか。
誰の写真自分自身、またはあなたに許可を与えた人物の写真。写真と声の両方が、あなたが使用できるものである必要があります。
ポートレートの条件正面向き、十分な明るさ、顔全体が写っていてピントが合っていること。サングラスや強い影はリップシンクの精度を下げます。
音声の長さ1回の生成につき最大 35 秒——話し言葉でおよそ 85 語です。
ボイスライブラリ10 言語にわたる 60 種類の内蔵ボイス。生成前に試聴できます。
モデルOmniHuman 1.5。リップシンク、表情、そして自然な頭と体の動きを担います。
コスト他の動画生成と同じく出力秒数での課金。生成前に表示されます。
出力ダウンロードできるクリップ。元のポートレートと台本を添えて履歴に保存されます。

自分のAIトーキングフォトに出演する方法

あなたの写真、あなたの言葉、1つのクリップ。

  1. 1

    自分の写真をアップロード

    鮮明な正面からの写真が最適です:スマホの自撮り、ヘッドショット、または動画からの1フレーム。トーキングフォトAIはこの1枚のフレームからあなたの顔を読み取ります。

  2. 2

    声を追加

    自分で録音して音声をアップロードするか、スクリプトを入力して60種類の内蔵ボイスから1つを選びます。音声は最長35秒です。

  3. 3

    生成して、自分を再利用

    モデルは唇、表情、自然な頭の動きを音声に同期させます。同じ写真をそのまま使い、必要なときにいつでも新しいセリフを再撮影なしで生成できます。

AIトーキングフォト用のスクリプトの書き方

ここに画像プロンプトはありません——働くのはポートレートと音声です。あなたが書くのは台本で、その選び方が仕上がりの自然さを決めます。

1

書き出しの一言

短い一言から始めましょう。リップシンクが最も目立つのは最初の1秒です。

ねえ、ちょっとだけいい?

2

文の長さ

1文はおよそ15語以内に。長い節は不自然な間を生みます。

この美容液の成分は2つ。これが処方のすべてです。

3

句読点

読点と句点は息継ぎになります。実際に間を置く場所に打ってください。

効きます——しかも10秒で終わります。

4

文字数の目安

おおよそ1秒あたり2.5語。狙うクリップの長さに合わせて書きましょう。

35秒のクリップでおよそ85語

曖昧な例

当社の革新的な製品は最先端のテクノロジーを活用し、卓越性を求める目の肥えたお客様に比類なき成果をお届けします。

具体的な例

これがいつも聞かれる部分です。成分は2つ、余計なものはなし。1週間ほどで違いが分かります。

なぜうまくいくのか

1つ目は抽象語だけでできた19語の一文で、アバターは平板で息継ぎのない一本調子で読み上げます。間を置ける場所がどこにもないからです。2つ目は自然なアクセントを持つ短い3文で、これが読みを人間らしく聞こえさせます。

曖昧な例

皆さんこんにちは、私たちのチャンネルへようこそ。本日はスキンケアのルーティンについて知っておくべき最も重要な5つのことについてお話ししていきたいと思います。

具体的な例

スキンケアについて5つ。1つ目は、みんなが間違えているところです。

なぜうまくいくのか

だらだら続く長い書き出しは、リップシンクが最もズレる場所です。モデルが拠り所にできる句読点がないからです。短いつかみなら明確なアクセントができ、視聴者も離れにくくなります。

やめるべき癖

  • 顔が小さい、角度がついている、または一部が影になっているポートレートを使うこと。リップシンクの精度は、元のフレームで口がどれだけはっきり見えているかにそのまま比例します。
  • 音声の上限を超えて書くこと。生成は音声 35 秒で打ち切られます——長い台本は切られるので、区切って分割し、同じポートレートを使い回しましょう。
  • 専門用語の詰め込み。数字、略語、長い製品名は、合成音声がいちばん機械的に聞こえる箇所です。声に出して読むとおりに書きましょう。

AIアバター動画ジェネレーターの先へ

話すアバターは出力のひとつにすぎません。画像生成も動画生成も同じアカウントで動きます。

AIアバター動画に役立つ資料

AIトーキングフォトの料金と無料クレジット

トーキングフォト動画は他の動画出力と同様に秒単位で課金されます。新規アカウントには200の無料クレジットが付与され、試すことができます。

無料

$0

始めるのに最適

  • 200 ウェルカムクレジット、1日最大 80 まで
  • Z Image Turboは0クレジットで下書き
  • 標準の生成速度
  • 生成履歴を含む
始める

プレミアム

一番人気
$29/month

年額請求 · $240/年

  • 月間 8,000 クレジット、1日の上限なし
  • すべてのプレミアムモデル――GPT Image 2、Nano Banana、Seedream、Seedance、Veo、Kling
  • 5倍の生成速度、優先キュー
  • AIプロンプト強化
プレミアム にアップグレード

Ultimate

$59/month

年額請求 · $468/年

  • 月間 18,000 クレジット、1日の上限なし
  • 最大4K解像度のHD生成
  • 優先サポート
  • 最速のキューと新モデルへの早期アクセス
Ultimate にアップグレード

AIトーキングフォト — よくある質問

1

AIトーキングフォトとは?

AIトーキングフォト(AIアバターまたはデジタルヒューマンとも呼ばれる)は、1枚の写真と音声から生成される、人物のトーキング動画です。撮影の代わりに、ポートレートと音声(またはスクリプト+声)を用意するだけで、モデルがリアルな話し方のパフォーマンスをアニメーション化します — デジタルプレゼンター、スポークスパーソン、ナレーターとして使用されます。

2

作成するには何が必要ですか?

鮮明な正面向きのポートレート写真と、音声クリップ(mp3/wav形式)、またはテキストモードの場合は読み上げたいスクリプトと内蔵ライブラリから選択した音声。これだけで、しゃべるアバター動画を作成できます。

3

自分の声を使ってもいいですか?

はい。ご自身の音声録音をアップロードすると、アバターがそれに合わせて口パクします。録音がない場合は、テキストモードに切り替えて、テキスト読み上げライブラリから音声を選択してください。

4

アバター動画の長さはどれくらいまで可能ですか?

1世代あたり最大35秒の音声。長いスクリプトの場合は、複数のクリップに分割してください。入力すると推定再生時間が表示され、音声1秒単位で課金されます。

5

AIアバターはどのような用途に使えますか?

一般的な用途としては、製品説明や広告、コースやオンボーディングのナレーション、ソーシャルメディアでの発言動画、告知、メッセージの多言語版など、プレゼンターを撮影する必要があるあらゆる場面が挙げられます。

6

AIアバターはどのモデルで動いているのですか?

CreateVision AIは、ByteDanceのOmniHuman 1.5を使用しており、音声からリップシンク、頭の動き、ジェスチャーを自動で処理します。技術的な詳細については、OmniHuman 1.5のモデルページをご覧ください。

7

AIアバター動画ジェネレーターには、どんな写真が向いていますか?

光が十分に当たり、顔全体がはっきり写った正面向きのポートレート。サングラス、顔にかかる濃い影、極端なアングル、画面内で顔が小さすぎる——いずれもリップシンクの精度を下げます。

8

自分の声を録音する必要がありますか?

いいえ。台本を入力し、内蔵ライブラリから声を選べます。ライブラリには10言語・60種類の音声が揃っています。自分の録音を使いたい場合はアップロードにも対応しています。

9

自分で動画に出演できますか?

はい。最も一般的な使い方です。自分の写真をアップロードし、自分の声を録音するか、スクリプトを入力してライブラリの声を選びます。カメラのセットアップなしで、あなた自身があなたの言葉を話す動画が完成します。多くのクリエイターは良い写真を1枚用意して、毎週そこから新しいクリップを生成しています。

10

AIトーキングフォトを商用利用できますか?

はい。CreateVision AI の利用規約に基づき、生成したコンテンツは個人目的および商用目的で使用でき、適切な場合には CreateVision AI への帰属表示を行います。アップロードする写真と音声の権利を有していること、および公開先プラットフォームの AI 開示ルールへの対応は、お客様の責任となります。

11

以前は Sora で自分を動画に登場させていました。これと同じものですか?

目的は同じで、仕組みが違います。ここでは写真がアイデンティティとなり、音声またはスクリプトが発話を駆動するため、出力はあなたが放り込まれるシーンではなく、リップシンク付きのトーキングヘッドクリップになります。任意の1枚の写真から動作し、動画のエンロールは不要で、別のアプリが利用可能であり続けることにも依存しません。

初めての AI トーキングフォトを作成

制作を始めましょう