OmniHuman 1.5 AI 토킹 아바타 생성기

OmniHuman 1.5에 인물 사진 한 장과 음성 트랙을 주면, 그 사람이 당신이 쓴 말 그대로를 말하는 영상을 돌려줍니다 — 입술, 표정, 제스처가 소리를 따릅니다.

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5란 무엇인가요?

OmniHuman 1.5는 ByteDance의 오디오 구동 아바타 모델입니다: 인물 사진 한 장과 음성 트랙을 주면, 그 사람이 당신의 오디오를 말하는 영상을 돌려줍니다 — 입술, 표정, 머리 움직임, 제스처가 모두 소리에 의해 움직입니다. 프롬프트로 움직이는 비디오 모델과 달리, 정확한 말은 당신이 제공합니다. 연구 논문은 멀티모달 언어 모델과 디퓨전 트랜스포머를 결합하므로, 연기가 단순히 입을 따라가는 것이 아니라 말하는 내용에 반응합니다.

솔직한 부분: 정면 인물 사진이 필요합니다. 아래 3/4 측면 테스트는 입술이 거의 움직이지 않고 머리가 옆으로 흘러가는 것을 보여줍니다. 오디오는 실행당 35초가 상한이라 긴 대본은 나눠서 이어 붙여야 하고, 논문의 대표 기능인 다인 대화는 여기서 쓸 수 없습니다. 장면 영상이 아니라 발화 영상입니다: 카메라 움직임이나 액션이 필요하면 Seedance 2.5나 Kling 3.0 Turbo를 쓰세요.

아키텍처, 포지셔닝, 사용자 연구 수치는 ByteDance 연구 논문에서 가져왔습니다: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

테스터들의 평가

1.5 버전은 까다로운 입력에 대해 개선된 견고성을 보여줍니다.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
손과 어깨가 뚜렷하고 조명이 자연스러운 상반신 인물 사진이 대개 더 나은 몸 동작을 만들어냅니다.
Z.Tools — OmniHuman-1.5 deep dive
짙은 그림자, 선글라스, 이상한 가림, 아주 작은 얼굴은 작업을 더 어렵게 만듭니다.
Z.Tools — OmniHuman-1.5 deep dive

OmniHuman 1.5를 CreateVision AI에서 돌릴 이유는?

모델은 ByteDance의 것입니다; 여기서 쓸 이유는 나머지 두 입력 — 얼굴과 목소리 — 이 같은 작업 공간에서 나온다는 점입니다.

OmniHuman 1.5 아바타 클립의 입력 얼굴로 쓰인 GPT Image 2 인물 사진

입력 사슬 전체가 한 페이지에 있습니다

토킹 아바타 클립에는 세 가지가 필요합니다: 얼굴, 목소리, 그리고 모델. 여기서는 셋 다 같은 작업 공간에서 나옵니다 — GPT Image 2나 Seedream으로 인물 사진을 만들고, 대본을 입력해 내장 음색 60개 중 하나로 합성한 다음, 둘을 곧장 OmniHuman 1.5에 넣으면 됩니다. 이 페이지의 모든 클립이 정확히 그렇게, 처음부터 끝까지 만들어졌고, 오디오를 1초도 녹음하지 않았으며 실존 인물의 사진도 한 장 올리지 않았습니다.

중국어를 말하는 OmniHuman 1.5 찻집 사례의 입력 인물 사진

녹음 부스 대신 음색 라이브러리

텍스트 모드는 곁다리가 아닙니다: 영어, 중국어, 일본어, 한국어, 프랑스어, 독일어, 스페인어, 이탈리아어, 러시아어, 포르투갈어에 걸쳐 60가지 음색이 있고, 각각 값을 쓰기 전에 들어볼 수 있는 미리듣기가 있습니다. 최대 600자를 입력하고 음색을 고르면, 플랫폼이 음성을 합성하고 그것으로 아바타를 한 번에 움직입니다. 위의 중국어 찻집 클립이 정확히 이 경로이고 — 마이크는 쓰지 않았습니다.

뉴스 앵커 OmniHuman 1.5 사례의 입력 인물 사진

구독 하나, 그리고 비용은 미리 보입니다

OmniHuman 1.5는 오디오 1초 단위로 과금하고 — 초당 130 크레딧, 올림 — 작업 공간이 생성 버튼을 누르기 전에 클립의 정확한 비용을 보여줍니다. 같은 요금제가 GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling, Veo를 함께 덮으므로, 합리적인 작업 순서는 값싼 쪽입니다: 인물 사진을 몇 크레딧으로 잡고, 대본을 확정하고, 그다음에야 아바타 초에 값을 쓰세요. 오디오의 침묵 구간은 잘라내세요 — 그 1초까지 값을 내고 있습니다.

OmniHuman 1.5 스트레스 테스트에 쓴 3/4 측면 입력 인물 사진

약속이 아니라 측정 — 실패까지 포함해서

저희 7클립 테스트 세트는 2026년 8월 19일에 생성했습니다 — 제품 소개, 뉴스 브리핑, 체육관 격려, 중국어 찻집 인사, 동화책 캐릭터, 일부러 실패시킨 3/4 측면, 그리고 넓은 무대 장면. 받아들여진 작업은 오디오 10초 안팎에 대해 3분 20초에서 4분 42초에, 모두 첫 시도로 성공했습니다. 무엇이 잘못됐는지도 함께 싣습니다: 바쁜 화요일 저녁에 업스트림이 저희 제출 20건 중 13건을 용량 오류로 거절한 뒤에야 받아들였고(거절된 실행은 자동 환불됩니다), 받아들여진 작업 하나는 14분 동안 대기했으며, 이 페이지의 측면 클립은 정면 인물 사진 권고를 무시하면 어떻게 되는지를 그대로 보여줍니다.

이 작업 공간에서 나온 실제 OmniHuman 1.5 클립

아래 7개 클립은 전부 2026년 8월 19일 여기서 생성했습니다 — 각각 그 입력이 만들어낸 첫 렌더링이고, 다시 찍지도 선별하지도 않았습니다. 인물 사진은 GPT Image 2 출력이고; 모든 목소리는 텍스트로 입력해 내장 라이브러리로 합성했습니다. 받아들여진 작업은 오디오 10초 안팎에 대해 3분 20초에서 4분 42초에 돌아왔습니다(하나는 14분 대기한 예외였습니다); 바쁜 저녁에는 업스트림이 받아들이기 전에 여러 제출을 용량 오류로 거절했습니다 — 거절된 실행은 환불됩니다. 소리를 켜고 보세요.

프롬프트오디오 9.2초 · Trustworthy Man 음색 · 1,300 크레딧 · 4분 42초

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

프롬프트오디오 10.2초 · News Anchor 음색 · 1,430 크레딧 · 4분 09초

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

프롬프트오디오 10.7초 · Energetic Guy 음색 · 1,430 크레딧 · 4분 00초

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

프롬프트오디오 11.8초 · Mandarin Sweet Girl 음색 · 1,560 크레딧 · 4분 19초

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

프롬프트오디오 9.7초 · Sweet Girl 음색 · 1,300 크레딧 · 4분 01초

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

프롬프트오디오 8.6초 · Wise Lady 음색 · 1,170 크레딧 · 이 각도에서는 립싱크가 눈에 띄게 무너집니다

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

프롬프트오디오 5.4초 · Movie Narrator 음색 · 780 크레딧 · 이 프레임이 이 페이지의 배경입니다

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5는 실제로 누구를 위한 모델인가

아래 항목은 각각 위에서 보여준 클립과 맞물립니다 — 희망 사항이 아닙니다.

  • 강의 제작자와 설명 콘텐츠 제작자

    내레이션을 입력하면 화면에 발표자가 나옵니다 — 카메라도, 조명도, 재촬영도 없이. 클립당 35초 상한은 클립 하나에 개념 하나라는 구성과 깔끔하게 맞아떨어지는데, 어차피 대부분의 강의 편집자가 그렇게 자릅니다.

  • UGC와 제품 마케터

    위의 스피커 소개 사례가 워크플로 전부입니다: 제품을 든 크리에이터 스타일 인물 사진을 만들고, 소개 문구를 입력하고, 음색을 고르세요. 출연료도 없고, 쫓아다닐 초상권 동의서도 없습니다 — 그 얼굴은 존재한 적이 없습니다.

  • 현지화 팀

    같은 얼굴이 같은 메시지를 열 개 언어로 전할 수 있습니다: 인물 사진은 두고 음색만 바꾸세요. 립싱크는 당신이 제공하는 오디오를 따라갑니다 — 위의 중국어 사례가 그 증거입니다.

  • 얼굴 없는 채널과 가상 진행자

    직접 만든 페르소나는 당신이 소유하는 페르소나입니다. 얼굴을 한 번 디자인하고 일관된 라이브러리 음색을 주면, 모든 회차의 얼굴이 될 수 있습니다 — 위의 삽화 동화책 캐릭터는 그것이 실사일 필요조차 없다는 것을 보여줍니다.

  • 팟캐스터와 오디오 우선 창작자

    어려운 부분은 이미 갖고 있습니다: 오디오입니다. 하이라이트를 35초로 다듬고 인물 사진을 더하면, 편집기를 열지 않고도 소셜용 영상 클립이 됩니다.

OmniHuman 1.5 vs Seedance 2.5 vs Veo 3.1 Pro vs Kling 3.0 Turbo

발화 영상과 장면 영상 — 각 모델이 당신에게서 무엇을 필요로 하고, 이 작업 공간에서 무엇을 돌려주는지.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
당신이 제공하는 것인물 사진 1장 + 당신의 오디오, 또는 입력한 텍스트와 라이브러리 음색프롬프트, 그리고 선택적으로 이미지·비디오·오디오 참조프롬프트, 그리고 선택적으로 참조 이미지 한 장프롬프트 또는 시작 이미지
말을 하는 주체당신입니다 — 아바타가 당신의 정확한 사운드트랙에 입을 맞춥니다모델이 프롬프트에서 목소리를 생성합니다모델이 프롬프트에서 목소리를 생성합니다오디오가 클립과 함께 생성됩니다
여기서의 클립 길이당신의 오디오 길이, 최대 35초4–30 s4–8 s3–15 s
크레딧오디오 1초당 130480p에서 110/초 · 720p에서 230/초클립당 320–1,920 (4–8초 · 720p–4K · 오디오 유무)720p에서 55/초 · 1080p에서 70/초
여기서 측정한 값오디오 약 10초에 약 4분 (클립 7개, 2026년 8월)이 작업에서는 측정하지 않음이 작업에서는 측정하지 않음이 작업에서는 측정하지 않음

크레딧, 길이, 입력 옵션은 2026년 8월 19일 이 작업 공간의 자체 모델 레지스트리에서 읽은 값입니다 — 벤더가 공개한 사양이 아니라 여기서 받게 되는 것을 설명합니다. 시간은 위에 실린 클립에서 저희가 직접 측정한 값입니다; 같은 대본을 나머지 세 모델에 돌려보지 않았으므로, 그 칸들은 추측하는 대신 그렇게 밝혀 둡니다.

OmniHuman 1.5 같은 다른 영상 모델

OmniHuman 1.5를 다른 비디오 모델과 비교해 보세요. 동일한 작업 공간에서 클릭 한 번으로 전환할 수 있습니다.

CreateVision AI의 OmniHuman 1.5 사양

모델omnihuman-1.5, ByteDance 개발 (연구 논문 2025년 8월 공개)
모드토킹 아바타: 사진 1장 + 오디오 트랙 1개 → 말하는 영상, 이 페이지의 아바타 작업 공간에서
입력인물 이미지 정확히 1장, 그리고 최대 35초의 오디오(mp3/wav 업로드) — 또는 최대 600자의 입력 텍스트를 음성으로 합성
보이스 라이브러리10개 언어에 걸친 내장 음색 60가지: 영어, 중국어, 일본어, 한국어, 프랑스어, 독일어, 스페인어, 이탈리아어, 러시아어, 포르투갈어
선택 가능한 연출 지시동작, 감정, 카메라에 대한 짧은 연기 메모 — 유용하지만 필수는 아닙니다
출력사진의 프레이밍을 유지하는 끊김 없는 한 컷; 클립 길이는 오디오 길이와 같습니다. 측정한 출력: 2:3 사진에서 1248×1664, 16:9에서 1920×1088, 25fps, 모노 AAC 오디오가 붙은 H.264
크레딧오디오 1초당 130, 올림 — 최소 130, 35초를 꽉 채우면 4,550; 정확한 비용은 생성 전에 표시됩니다
실측 속도저희 7클립 테스트에서 오디오 약 10초에 대해 받아들여진 작업당 3분 20초–4분 42초; 하나는 14분 대기한 예외였습니다 (2026년 8월, 바쁜 화요일 저녁)

사진으로 토킹 아바타 만드는 법

영상 생성 시작
  1. 얼굴을 넣으세요

    선명한 정면 상반신 인물 사진을 올리거나 — 같은 작업 공간에서 GPT Image 2나 Seedream으로 만드세요. 이 페이지의 모든 얼굴이 그렇게 만들어졌습니다. 사진 한 장에 한 사람만; 얼굴은 크고 가려지지 않게 두세요.

  2. 목소리를 주세요

    오디오 클립(mp3 또는 wav, 최대 35초)을 올리거나 텍스트 모드로 바꾸세요: 최대 600자를 입력하고 10개 언어의 음색 60가지 중 하나를 고르면 되며, 각각 먼저 들어볼 수 있는 미리듣기가 있습니다.

  3. 원한다면 연기를 연출하세요

    “차분하게, 작게 끄덕이며, 은은한 미소” 같은 짧은 메모가 제스처와 감정을 이끕니다. 비워두면 모델이 오디오의 리듬과 의미를 스스로 읽습니다.

  4. 생성하고 싱크를 확인하세요

    정확한 크레딧 비용이 실행 전에 나오고 — 오디오 길이에 비례합니다. 생성은 비동기이고; 클립은 모든 입력이 붙은 채 히스토리에 들어오므로, 잘 통한 설정은 다음 주에 그대로 재현할 수 있습니다.

OmniHuman 1.5 그 너머

계정 하나로, 이미지와 영상 생성 워크플로 전체를.

관련 읽을거리

OmniHuman 1.5 요금과 매일 무료 크레딧

무료 등급의 매일 크레딧으로 OmniHuman 1.5 모델을 쓰거나, 업그레이드해 프리미엄 모델과 더 빠른 생성, 4K 출력을 누리세요.

무료

$0

처음 시작하기에 딱 좋은

  • 200 웰컴 크레딧, 하루 최대 80 사용
  • Z Image Turbo는 0크레딧으로 초안 작업
  • 표준 생성 속도
  • 생성 기록 포함
시작하기

Premium

가장 인기
$29/month

연간 청구 · $240/year

  • 월 8,000 크레딧, 일일 한도 없음
  • 모든 프리미엄 모델 — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5배 빠른 생성 속도, 우선 대기열
  • AI 프롬프트 향상
Premium(으)로 업그레이드

Ultimate

$49/month

연간 청구 · $380/year

  • 월 18,000 크레딧, 일일 한도 없음
  • 최대 4K 해상도의 HD 생성
  • 우선 지원
  • 가장 빠른 대기열과 신규 모델 우선 이용
Ultimate(으)로 업그레이드

OmniHuman 1.5 — 자주 묻는 질문

1

OmniHuman 1.5란 무엇인가요?

ByteDance의 오디오 구동 아바타 모델. 인물 사진 한 장과 오디오 트랙 하나를 받아, 그 사람이 그 오디오를 말하는 영상을 돌려줍니다 — 입술, 표정, 머리 움직임, 손짓이 모두 소리를 따릅니다. 그 바탕이 된 연구 논문은 2025년 8월에 공개됐습니다.

2

아바타가 제가 쓴 그대로 말할 수 있나요?

예 — 그것이 프롬프트로 움직이는 비디오 모델과의 차이입니다. mp3/wav 업로드로든, 대본을 입력하고 내장 음색을 고르는 방식으로든 사운드트랙은 당신이 제공하고, 아바타가 거기에 한 단어씩 입을 맞춥니다. 프롬프트로 움직이는 모델은 자기 목소리를 만들어내고, 적은 그대로 말하는 일이 드뭅니다.

3

OmniHuman 1.5는 무료로 쓸 수 있나요?

아니요 — 오디오 1초당 130 크레딧, 올림으로 과금되므로 10초 클립은 1,300 크레딧입니다. 정확한 비용은 생성 전에 표시되고, 실패한 실행은 자동으로 환불됩니다. 대본은 짧게 유지하고 침묵은 잘라내세요: 오디오의 모든 1초가 값을 내는 1초입니다.

4

좋은 원본 사진이란 어떤 특징을 가지고 있을까요?

정면, 상반신, 한 사람, 얼굴은 크고 고르게 조명되고 가려지지 않게 — 리뷰어들과 저희 테스트의 결론이 같습니다. 위의 일부러 만든 3/4 측면 테스트는 그렇지 않을 때 무슨 일이 벌어지는지 보여줍니다: 입술이 거의 움직이지 않고, 모델이 머리를 점점 더 옆으로 돌리며, 사진에 없던 물건이 책상 위에 나타납니다. 생성한 인물 사진도 카메라로 찍은 사진과 똑같이 잘 작동합니다.

5

일러스트나 애니메 캐릭터로도 되나요?

예 — 위의 동화책 테스트는 평면 2D 일러스트인데, OmniHuman 1.5는 그림체를 유지하면서 설득력 있게 움직였습니다: 눈, 눈썹, 입이 손으로 그린 애니메이션 캐릭터처럼 움직입니다. 저희가 본 특이점 하나: 입을 크게 벌리면 평면 일러스트치고는 놀랄 만큼 사실적인 치아를 그립니다. ByteDance 논문은 사람이 아닌 피사체도 된다고 주장하지만; 저희는 이 삽화 캐릭터만 테스트했습니다.

6

클립은 얼마나 길 수 있고, 생성에는 얼마나 걸리나요?

이 플랫폼에서는 클립당 오디오 최대 35초입니다 — 더 긴 대본은 나눠서 이어 붙여야 합니다. 2026년 8월 테스트에서 받아들여진 작업은 오디오 약 10초에 대해 3분 20초에서 4분 42초에 돌아왔습니다. 같은 저녁에서 나온 단서 하나: 부하가 심할 때 업스트림이 작업을 받아들이기 전에 여러 제출을 용량 오류로 거절했습니다. 거절된 실행에는 값이 들지 않지만, 5분 뒤가 마감인 상황보다는 붐비는 시간대의 재시도를 감안해 계획하세요.

7

OmniHuman 1.5가 못하는 것은?

무엇보다 정면이 아닌 얼굴입니다: 저희 3/4 측면 테스트는 거의 움직이지 않는 입술, 카메라에서 점점 멀어지는 머리, 그리고 사진에 없던 책상 위 물건을 보여줍니다. 정체성의 작은 디테일이 클립 중간에 흔들릴 수 있습니다 — 그 테스트에서는 귀걸이 모양이 바뀌었고, 다른 두 건에서는 입술 색이 입력보다 조금 진하게 나왔습니다. 다인 대화는 여기서 쓸 수 없고, 출력 해상도는 소박하며(저희 인물 테스트에서 1248×1664 — 4K는 없습니다), 발화 영상만 만듭니다: 액션, 카메라 움직임, 장면 전환이 필요하면 Seedance 2.5나 Kling 3.0 Turbo를 쓰세요.

8

영상을 상업적으로 쓸 수 있나요 — 그리고 누구의 얼굴을 쓸 수 있나요?

생성한 영상은 저희 이용약관에 따라 개인 및 상업 프로젝트에 쓸 수 있습니다. 진지하게 다뤄야 할 부분은 얼굴입니다: 실존 인물의 사진을 동의 없이 움직이게 하면 초상권과 퍼블리시티권을 침해할 수 있고, 여러 관할권이 이제 합성 발표자의 고지를 요구합니다. 생성한 얼굴은 — 이 페이지의 모든 얼굴처럼 — 동의 문제를 아예 피해 갑니다.

사진에 할 말을 주세요

영상 생성 시작

요금 및 이용 방식 — 핵심 정보OmniHuman 1.5

모델
OmniHuman 1.5
개발사
ByteDance
이용 방식
CreateVision AI 워크스페이스에서 API로 바로 실행됩니다. 로그인만 하면 생성할 수 있으며 API 키, 클라우드 프로젝트, 설치가 필요 없습니다.
생성 1회당 가격
5초 클립당 650 크레딧부터 ≈ $2.36 (Premium 요금제 기준: 월 $29, 8,000 크레딧 포함). 무료 요금제에는 매일 80 크레딧이 포함됩니다.
개인정보 보호
기본적으로 비공개 — 어떤 요금제에서도 다른 사용자는 내 생성물을 볼 수 없습니다. 회원 데이터를 판매하거나 오용하지 않습니다. 개인정보 처리방침

최근 업데이트OmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.