一枚の肖像画から生まれたデジタル広報担当者
撮影不要、俳優不要、グリーンスクリーン不要。人物の鮮明な写真を1枚アップロードするだけで、スクリプトを読み上げるプレゼンターが完成します。製品説明、コース紹介、告知、広告などに使える、再利用可能なデジタルホストを作成でき、撮り直しなしでいつでも新しいセリフを生成できます。
ポートレート写真と音声トラック(最大35秒)をアップロードすると、OmniHuman 1.5が口の動きと自然な動きが同期した、話すアバター動画を生成します。
1枚のポートレートと台本が、リアルな話し手に——口元・表情・ジェスチャーが同期。カメラもスタジオも不要。
Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.
完全なAIアバター(デジタルヒューマン)ジェネレーター:ポートレートと音声クリップをアップロードするか、スクリプトを入力して声を選択するだけで、唇の動きが同期し、自然な表情とジェスチャーを備えた、まるで生きているかのような動画を作成できます。ByteDance OmniHuman 1.5を搭載しており、カメラ、俳優、スタジオは不要です。
撮影不要、俳優不要、グリーンスクリーン不要。人物の鮮明な写真を1枚アップロードするだけで、スクリプトを読み上げるプレゼンターが完成します。製品説明、コース紹介、告知、広告などに使える、再利用可能なデジタルホストを作成でき、撮り直しなしでいつでも新しいセリフを生成できます。
既に音声録音をお持ちですか?それをアップロードすれば、アバターがそれに合わせて口パクします。音声がない場合は、テキストモードに切り替えて、アバターに言わせたいセリフを入力し、内蔵のテキスト読み上げライブラリから音声を選択すれば、スクリプトが音声に変換されます。生成前に、推定される長さとクレジット費用が表示されます。
OmniHuman 1.5は、音声のリズム、韻律、意味を読み取り、正確なリップシンクに加え、頭の動き、姿勢、手のジェスチャーを制御します。同時に、人物の個性や照明も維持します。その結果、口元が動くだけの静止画ではなく、まるで本物のプレゼンターのようなパフォーマンスを実現します。
広告やランディングページ用のスポークスパーソンクリップ、トレーニング用のナレーション付きレッスンやオンボーディング、ソーシャルメディア用のトークヘッド投稿、あるいは同じメッセージの多言語版などをすぐに作成できます。各生成データは入力内容とともに履歴に保存されるため、反復作業やバリエーションの作成を迅速に行うことができます。
CreateVision AI で生成したプレゼンター風のポートレートです——音声を足せば、どれでも話すアバター動画を動かせます。
このページのリップシンク、表情、体の動きはOmniHuman 1.5が担っています。
| 入力 | ポートレート写真1枚と、アップロードした音声ファイルまたは入力した台本のどちらか。 |
|---|---|
| ポートレートの条件 | 正面向き、十分な明るさ、顔全体が写っていてピントが合っていること。サングラスや強い影はリップシンクの精度を下げます。 |
| 音声の長さ | 1回の生成につき最大 35 秒——話し言葉でおよそ 85 語です。 |
| ボイスライブラリ | 10 言語にわたる 60 種類の内蔵ボイス。生成前に試聴できます。 |
| モデル | OmniHuman 1.5。リップシンク、表情、そして自然な頭と体の動きを担います。 |
| コスト | 他の動画生成と同じく出力秒数での課金。生成前に表示されます。 |
| 出力 | ダウンロードできるクリップ。元のポートレートと台本を添えて履歴に保存されます。 |
1枚のポートレート、1本の音声、1本のクリップ。
正面を向いた鮮明な写真が最適です。AIアバター動画ジェネレーターは、この1枚から顔を読み取ります。
音声ファイルをアップロードするか、台本を入力して内蔵の音声ライブラリから選んでください。音声は最長35秒まで使えます。
モデルは口の動き、表情、自然な頭の揺れを音声に同期させ、ダウンロードや延長ができるクリップを返します。
ここに画像プロンプトはありません——働くのはポートレートと音声です。あなたが書くのは台本で、その選び方が仕上がりの自然さを決めます。
短い一言から始めましょう。リップシンクが最も目立つのは最初の1秒です。
ねえ、ちょっとだけいい?
1文はおよそ15語以内に。長い節は不自然な間を生みます。
この美容液の成分は2つ。これが処方のすべてです。
読点と句点は息継ぎになります。実際に間を置く場所に打ってください。
効きます——しかも10秒で終わります。
おおよそ1秒あたり2.5語。狙うクリップの長さに合わせて書きましょう。
35秒のクリップでおよそ85語
当社の革新的な製品は最先端のテクノロジーを活用し、卓越性を求める目の肥えたお客様に比類なき成果をお届けします。
これがいつも聞かれる部分です。成分は2つ、余計なものはなし。1週間ほどで違いが分かります。
1つ目は抽象語だけでできた19語の一文で、アバターは平板で息継ぎのない一本調子で読み上げます。間を置ける場所がどこにもないからです。2つ目は自然なアクセントを持つ短い3文で、これが読みを人間らしく聞こえさせます。
皆さんこんにちは、私たちのチャンネルへようこそ。本日はスキンケアのルーティンについて知っておくべき最も重要な5つのことについてお話ししていきたいと思います。
スキンケアについて5つ。1つ目は、みんなが間違えているところです。
だらだら続く長い書き出しは、リップシンクが最もズレる場所です。モデルが拠り所にできる句読点がないからです。短いつかみなら明確なアクセントができ、視聴者も離れにくくなります。
話すアバターは出力のひとつにすぎません。画像生成も動画生成も同じアカウントで動きます。
アバター動画も他の動画と同じく秒単位の課金です。無料アカウントには毎日80クレジットが付くので、まず試せます。
年額請求 · $240/年
年額請求 · $380/年
AIアバターとは、一枚の写真と音声から生成される、人物のしゃべる動画のことです。撮影する代わりに、人物の肖像と音声(または台本と音声)を提供するだけで、モデルがまるで生きているかのような話し方をアニメーション化します。デジタルプレゼンター、広報担当者、ナレーターなどとして活用できます。
鮮明な正面向きのポートレート写真と、音声クリップ(mp3/wav形式)、またはテキストモードの場合は読み上げたいスクリプトと内蔵ライブラリから選択した音声。これだけで、しゃべるアバター動画を作成できます。
はい。ご自身の音声録音をアップロードすると、アバターがそれに合わせて口パクします。録音がない場合は、テキストモードに切り替えて、テキスト読み上げライブラリから音声を選択してください。
1世代あたり最大35秒の音声。長いスクリプトの場合は、複数のクリップに分割してください。入力すると推定再生時間が表示され、音声1秒単位で課金されます。
一般的な用途としては、製品説明や広告、コースやオンボーディングのナレーション、ソーシャルメディアでの発言動画、告知、メッセージの多言語版など、プレゼンターを撮影する必要があるあらゆる場面が挙げられます。
CreateVision AIは、ByteDanceのOmniHuman 1.5を使用しており、音声からリップシンク、頭の動き、ジェスチャーを自動で処理します。技術的な詳細については、OmniHuman 1.5のモデルページをご覧ください。
光が十分に当たり、顔全体がはっきり写った正面向きのポートレート。サングラス、顔にかかる濃い影、極端なアングル、画面内で顔が小さすぎる——いずれもリップシンクの精度を下げます。
いいえ。台本を入力し、内蔵ライブラリから声を選べます。ライブラリには10言語・60種類の音声が揃っています。自分の録音を使いたい場合はアップロードにも対応しています。
1回の生成につき音声は最長35秒です。もっと長いプレゼンなら、いくつかのセグメントに分けて生成し、つなげてください——同じ元ポートレートを使えば、クリップをまたいでも話し手の見た目が揃います。