OmniHuman 1.5 — ИИ-генератор говорящих аватаров

Дайте OmniHuman 1.5 один портрет и голосовую дорожку, и он вернёт видео, где этот человек произносит ваши точные слова: губы, мимика и жесты следуют за звуком.

0 / 2,000
130 cr/s · ≤35s

Что такое OmniHuman 1.5?

OmniHuman 1.5 — аватарная модель ByteDance, ведомая звуком: дайте ей один портрет и голосовую дорожку, и она вернёт видео, где этот человек произносит ваше аудио — губы, мимика, движение головы и жесты ведутся звуком. В отличие от видеомоделей, ведомых промптом, точные слова задаёте вы. В исследовательской статье мультимодальная языковая модель соединена с диффузионным трансформером, поэтому исполнение реагирует на то, что говорится, а не просто отслеживает рот.

Честная часть: ей нужен фронтальный портрет. Наш тест с профилем в три четверти ниже показывает губы, которые почти не артикулируют, и голову, которая уплывает. Аудио ограничено 35 секундами на запуск, поэтому длинные сценарии придётся резать и сшивать, а диалог нескольких человек — главная функция статьи — здесь недоступен. Это видео речи, а не видео сцены: для движения камеры или действия берите Seedance 2.5 или Kling 3.0 Turbo.

Архитектура, позиционирование и цифры пользовательского исследования — из исследовательской статьи ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Что говорят тестировщики

Версия 1.5 демонстрирует повышенную устойчивость к сложным входным данным.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Портрет по пояс с ясно видимыми руками, плечами и естественным освещением обычно даёт лучшее движение тела.
Z.Tools — OmniHuman-1.5 deep dive
Плотные тени, солнцезащитные очки, странные перекрытия и крошечные лица усложняют задачу.
Z.Tools — OmniHuman-1.5 deep dive

Зачем запускать OmniHuman 1.5 на CreateVision AI?

Модель принадлежит ByteDance; причина использовать её здесь в том, что два других входа — лицо и голос — приходят из того же рабочего места.

Портрет от GPT Image 2, использованный как входное лицо для клипа-аватара OmniHuman 1.5

Вся входная цепочка живёт на одной странице

Клипу с говорящим аватаром нужны три вещи: лицо, голос и модель. Здесь все три приходят из одного рабочего места: сгенерируйте портрет с помощью GPT Image 2 или Seedream, наберите сценарий и синтезируйте его одним из 60 встроенных голосов, затем подайте оба прямо в OmniHuman 1.5. Каждый клип на этой странице сделан ровно так, от начала до конца, без записи хотя бы секунды аудио и без загрузки хотя бы одной фотографии реального человека.

Входной портрет для кейса OmniHuman 1.5 с чайной лавкой на мандаринском

Библиотека голосов вместо студии звукозаписи

Текстовый режим здесь не приделан сбоку: 60 голосов на английском, китайском, японском, корейском, французском, немецком, испанском, итальянском, русском и португальском, у каждого есть превью, которое можно послушать до того, как что-то тратить. Наберите до 600 символов, выберите голос, и платформа синтезирует речь и ведёт ею аватар за один запуск. Клип с чайной лавкой на мандаринском выше — ровно этот путь, без всякого микрофона.

Входной портрет для кейса OmniHuman 1.5 с ведущим новостей

Одна подписка, и стоимость видна заранее

OmniHuman 1.5 тарифицируется за каждую секунду аудио — 130 кредитов за секунду с округлением вверх, — и рабочее место показывает точную стоимость вашего клипа до нажатия на генерацию. Тот же тариф покрывает GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling и Veo, поэтому разумный порядок работы дёшев: сделайте черновик портрета за горстку кредитов, зафиксируйте сценарий и только затем тратьтесь на секунды аватара. Обрежьте тишину в своём аудио — вы платите за каждую его секунду.

Входной портрет в профиль в три четверти, использованный для стресс-теста OmniHuman 1.5

Измерено, а не обещано — включая провал

Наш тестовый набор из семи клипов сгенерирован 19 августа 2026 года: питч продукта, новостная сводка, мотивационная речь в зале, приветствие в чайной лавке на мандаринском, персонаж из книжки с картинками, намеренный провал с профилем в три четверти и общий план сцены. Каждая принятая задача отрендерилась успешно с первого дубля, за 3 мин 20 с — 4 мин 42 с примерно на десять секунд аудио. Мы публикуем и то, что пошло не так: в загруженный вторник вечером вышестоящий провайдер отклонил 13 из наших 20 отправок с ошибками нехватки мощностей, прежде чем их принять (за отклонённые запуски средства возвращаются автоматически), одна принятая задача простояла в очереди 14 минут, а клип с профилем на этой странице показывает ровно то, что происходит, когда игнорируешь совет про фронтальный портрет.

Настоящие клипы OmniHuman 1.5 из этого рабочего места

Все 7 клипов ниже сгенерированы здесь 19 августа 2026 года — каждый является первым рендером, который дали его входные данные, без повторов и без отбора удачных. Портреты — результаты GPT Image 2; каждый голос набирался текстом и синтезировался встроенной библиотекой. Принятые задачи возвращались за 3 мин 20 с — 4 мин 42 с примерно на 10 секунд аудио (один выброс простоял в очереди 14 минут); в загруженный вечер вышестоящий провайдер отклонил несколько отправок с ошибками нехватки мощностей, прежде чем принять, — за отклонённые запуски возвращаются средства. Со звуком.

Промпт9,2 с аудио · голос Trustworthy Man · 1 300 кредитов · 4 мин 42 с

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

Промпт10,2 с аудио · голос News Anchor · 1 430 кредитов · 4 мин 09 с

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

Промпт10,7 с аудио · голос Energetic Guy · 1 430 кредитов · 4 мин 00 с

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

Промпт11,8 с аудио · голос Mandarin Sweet Girl · 1 560 кредитов · 4 мин 19 с

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

Промпт9,7 с аудио · голос Sweet Girl · 1 300 кредитов · 4 мин 01 с

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

Промпт8,6 с аудио · голос Wise Lady · 1 170 кредитов · синхронизация губ заметно деградирует под этим углом

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

Промпт5,4 с аудио · голос Movie Narrator · 780 кредитов · этот кадр является фоном страницы

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

Кому на самом деле подойдёт OmniHuman 1.5

Каждый из этих пунктов опирается на клип, показанный выше, — это не список пожеланий.

  • Авторы курсов и объясняющих роликов

    Наберите закадровый текст и получите ведущего на экране — без камеры, света и пересъёмок. Ограничение в 35 секунд на клип аккуратно ложится на одну идею на клип, а именно так большинство монтажёров курсов и режет.

  • UGC- и продуктовые маркетологи

    Кейс с питчем колонки выше — это весь рабочий процесс: сгенерируйте портрет в стиле автора, держащего ваш продукт, наберите питч, выберите голос. Никаких гонораров и никакого разрешения на использование образа — этого лица никогда не существовало.

  • Команды локализации

    Одно и то же лицо может произнести одно и то же сообщение на десяти языках: оставьте портрет, поменяйте голос. Синхронизация губ следует за любым аудио, которое вы предоставите, — кейс с мандаринским выше это доказывает.

  • Безликие каналы и виртуальные ведущие

    Персона, которую вы сгенерировали, — это персона, которой вы владеете. Спроектируйте лицо один раз, дайте ему постоянный голос из библиотеки, и оно сможет вести каждый выпуск — иллюстрированный персонаж из книжки выше показывает, что он даже не обязан быть фотореалистичным.

  • Подкастеры и авторы, работающие в первую очередь со звуком

    Самое трудное у вас уже есть: аудио. Обрежьте яркий фрагмент до 35 секунд, добавьте портрет — и у вас есть визуальный клип для соцсетей, не открывая монтажную программу.

OmniHuman 1.5 против Seedance 2.5, Veo 3.1 Pro и Kling 3.0 Turbo

Видео речи против видео сцены — что каждая модель требует от вас и что отдаёт в этом рабочем месте.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Что предоставляете вы1 портретная фотография + ваше аудио либо набранный текст и голос из библиотекиПромпт плюс необязательные референсы из изображений, видео и аудиоПромпт плюс необязательное референсное изображениеПромпт или стартовое изображение
Кто произносит словаВы — аватар синхронизирует губы под вашу точную звуковую дорожкуМодель генерирует голоса по промптуМодель генерирует голоса по промптуЗвук генерируется вместе с клипом
Длина клипа здесьДлина вашего аудио, до 35 с4–30 s4–8 s3–15 s
Кредиты130 за секунду аудио110/с при 480p · 230/с при 720p320–1 920 за клип (4–8 с · 720p–4K · со звуком или без)55/с при 720p · 70/с при 1080p
Измерено здесь~4 мин на ~10 с аудио (7 клипов, август 2026 года)Не измеряли на этой задачеНе измеряли на этой задачеНе измеряли на этой задаче

Кредиты, длительность и варианты входа считаны из собственного реестра моделей этого рабочего места 19 августа 2026 года — они описывают то, что вы получаете здесь, а не опубликованные вендорами спецификации. Тайминги — наши собственные измерения на показанных выше клипах; мы не прогоняли те же сценарии через три остальные модели, поэтому те ячейки так и говорят, а не гадают.

Другие видеомодели, похожие на OmniHuman 1.5

Сравните OmniHuman 1.5 с другими видеомоделями — то же рабочее пространство, переключение одним щелчком.

Характеристики OmniHuman 1.5 на CreateVision AI

Модельomnihuman-1.5, от ByteDance (исследовательская статья опубликована в августе 2025 года)
РежимГоворящий аватар: одна фотография + одна аудиодорожка → говорящее видео, в аватарном рабочем месте на этой странице
ВходыРовно 1 портретное изображение плюс аудио до 35 секунд (загрузка mp3/wav) — либо набранный текст до 600 символов, синтезируемый в речь
Библиотека голосов60 встроенных голосов на 10 языках: английский, китайский, японский, корейский, французский, немецкий, испанский, итальянский, русский, португальский
Необязательные указанияКороткая заметка о подаче для действий, эмоции и камеры — полезна, но никогда не обязательна
РезультатОдин непрерывный план, сохраняющий кадрирование вашей фотографии; длина клипа равна длине аудио. Измеренный вывод: 1248×1664 из фотографии 2:3, 1920×1088 из 16:9, 25 кадров/с, H.264 с моно-аудио AAC
Кредиты130 за каждую секунду аудио с округлением вверх — минимум 130, 4 550 на полных 35 секундах; точная стоимость показывается перед генерацией
Замеренная скорость3 мин 20 с — 4 мин 42 с на принятую задачу примерно на 10 с аудио в нашем тесте из 7 клипов; один выброс простоял в очереди 14 минут (август 2026 года, загруженный вечер вторника)

Как сделать говорящий аватар из фотографии

Начать генерировать видео
  1. Добавьте лицо

    Загрузите чёткий фронтальный портрет по пояс — или сгенерируйте его с помощью GPT Image 2 или Seedream в этом же рабочем месте, именно так сделано каждое лицо на этой странице. Один человек на фотографию; держите лицо крупным и ничем не закрытым.

  2. Дайте ему голос

    Загрузите аудиоклип (mp3 или wav, до 35 секунд) либо переключитесь в текстовый режим: наберите до 600 символов и выберите один из 60 голосов на 10 языках, у каждого есть превью, которое можно послушать заранее.

  3. При желании задайте подачу

    Короткая заметка вроде «спокойно, небольшие кивки, лёгкая улыбка» направляет жест и эмоцию. Оставьте её пустой, и модель сама прочтёт ритм и смысл аудио.

  4. Сгенерируйте и проверьте синхронизацию

    Точная стоимость в кредитах появляется перед запуском — она растёт с длиной аудио. Генерация асинхронная; клип попадает в вашу историю со всеми приложенными входами, поэтому рабочую настройку можно повторить и через неделю.

Не только OmniHuman 1.5

Один аккаунт — полный рабочий процесс генерации изображений и видео.

Материалы по теме

OmniHuman 1.5: цены и бесплатные ежедневные кредиты

Запускайте OmniHuman 1.5 на ежедневных кредитах бесплатного тарифа или перейдите на платный ради премиум-моделей, более быстрой генерации и вывода в 4K.

Бесплатно

$0

Идеально для начала

  • 200 приветственных кредитов, до 80 в день
  • Z Image Turbo создаёт черновики за 0 кредитов
  • Стандартная скорость генерации
  • История генераций включена
Начать

Premium

Самый популярный
$29/month

Оплата раз в год · $240/год

  • 8 000 кредитов/мес, без дневных лимитов
  • Все премиум-модели — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5-кратная скорость генерации, приоритетная очередь
  • ИИ-улучшение промптов
Перейти на Premium

Ultimate

$49/month

Оплата раз в год · $380/год

  • 18 000 кредитов/мес, без дневных лимитов
  • HD-генерация вплоть до разрешения 4K
  • Приоритетная поддержка
  • Самая быстрая очередь и ранний доступ к новым моделям
Перейти на Ultimate

OmniHuman 1.5 — часто задаваемые вопросы

1

Что такое OmniHuman 1.5?

Аватарная модель ByteDance, ведомая звуком. Она берёт одну портретную фотографию и одну аудиодорожку и возвращает видео, где этот человек произносит это аудио: губы, мимика, движение головы и жесты рук следуют за звуком. Исследовательская статья за ней опубликована в августе 2025 года.

2

Может ли аватар произнести мои точные слова?

Да — в этом и отличие от видеомоделей, ведомых промптом. Звуковую дорожку предоставляете вы, загрузкой mp3/wav или набором сценария с выбором встроенного голоса, и аватар синхронизирует губы под неё слово в слово. Модели, ведомые промптом, генерируют собственные голоса и редко говорят ровно то, что вы написали.

3

OmniHuman 1.5 бесплатен?

Нет — он тарифицируется по 130 кредитов за каждую секунду аудио с округлением вверх, поэтому 10-секундный клип — это 1 300 кредитов. Точная стоимость показывается перед генерацией, а неудавшиеся запуски возвращаются автоматически. Держите сценарии плотными и обрезайте тишину: каждая секунда аудио — это секунда, за которую вы платите.

4

Что делает исходное фото хорошим?

Фронтально, по пояс, один человек, лицо крупное, равномерно освещённое и ничем не закрытое — обозреватели и наши собственные тесты сходятся. Наш намеренный тест с профилем в три четверти выше показывает, что бывает иначе: губы почти не артикулируют, модель медленно поворачивает голову ещё дальше, а на столе появляются предметы, которых на фотографии не было. Сгенерированные портреты работают ровно так же хорошо, как снимки с камеры.

5

Работает ли он с иллюстрациями или аниме-персонажами?

Да — наш тест с книжкой с картинками выше является плоской 2D-иллюстрацией, и OmniHuman 1.5 оживил её убедительно, сохранив стиль рисунка: глаза, брови и рот двигаются как у нарисованного вручную персонажа. Одна особенность, которую мы заметили: когда рот открывается широко, модель рисует на удивление реалистичные зубы для плоской иллюстрации. В статье ByteDance также заявлены нечеловеческие объекты; мы тестировали только этого иллюстрированного персонажа.

6

Какой длины может быть клип и сколько занимает генерация?

До 35 секунд аудио на клип на этой платформе — более длинные сценарии придётся резать и сшивать. В нашем тесте в августе 2026 года принятые задачи возвращались за 3 мин 20 с — 4 мин 42 с примерно на 10 секунд аудио. Одна оговорка из того же вечера: под высокой нагрузкой вышестоящий провайдер отклонил несколько отправок с ошибками нехватки мощностей, прежде чем принять задачу. Отклонённые запуски не стоят ничего, но в часы пик закладывайте повторы, а не дедлайн через пять минут.

7

В чём OmniHuman 1.5 плох?

Прежде всего — нефронтальные лица: наш тест с профилем в три четверти показывает почти неподвижные губы, голову, которая уплывает от камеры дальше, и предметы на столе, которых на фотографии не было. Мелкие детали внешности могут плыть посреди клипа — в том тесте серьга поменяла форму, а в двух других цвет губ читается чуть насыщеннее, чем на входе. Диалог нескольких человек здесь недоступен, разрешение вывода скромное (1248×1664 в наших портретных тестах — никакого 4K), и он делает только видео речи: для действия, движения камеры или смены сцены берите Seedance 2.5 или Kling 3.0 Turbo.

8

Можно ли использовать видео коммерчески — и чьё лицо можно брать?

Сгенерированные вами видео можно использовать в личных и коммерческих проектах согласно нашим условиям использования. Лицо — это та часть, к которой стоит отнестись серьёзно: оживление фотографии реального человека без его согласия может нарушать права на изображение и на публичность, а в ряде юрисдикций теперь требуется раскрывать, что ведущий синтетический. Сгенерированные лица — как каждое лицо на этой странице — полностью снимают проблему согласия.

Дайте фотографии что сказать

Начать генерировать видео

Цены и доступ — фактыOmniHuman 1.5

Модель
OmniHuman 1.5
Разработчик
ByteDance
Доступ
Работает в рабочем пространстве CreateVision AI через API — войдите и генерируйте. Без API-ключа, без облачного проекта, без установки.
Цена за генерацию
От 650 кредитов ≈ $2.36 за клип длиной 5 с на тарифе Premium ($29/мес за 8,000 кредитов). Бесплатный тариф включает 80 кредитов в день.
Конфиденциальность
Приватно по умолчанию — никакой другой пользователь не увидит ваши генерации ни на одном тарифе. Мы не продаём данные участников и не используем их не по назначению. Политика конфиденциальности

Что новогоOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.