OmniHuman 1.5 Trình tạo avatar biết nói AI

Đưa cho OmniHuman 1.5 một bức chân dung và một bản thu giọng nói, và nó trả về một video của người đó nói đúng từng chữ của bạn — môi, biểu cảm và cử chỉ bám theo âm thanh.

0 / 2,000
130 cr/s · ≤35s

OmniHuman 1.5 là gì?

OmniHuman 1.5 là mô hình avatar do âm thanh dẫn dắt của ByteDance: đưa cho nó một bức chân dung và một bản thu giọng nói, và nó trả về một video của người đó đang nói đoạn âm thanh của bạn — môi, biểu cảm, chuyển động đầu và cử chỉ đều do âm thanh dẫn dắt. Khác với các mô hình video lái bằng prompt, bạn cung cấp đúng từng chữ. Bài báo nghiên cứu ghép một mô hình ngôn ngữ đa phương thức với một diffusion transformer, nên màn trình diễn phản ứng theo nội dung đang được nói chứ không chỉ bám theo cái miệng.

Phần thành thật: nó cần một bức chân dung chính diện. Bài kiểm tra góc ba phần tư của chúng tôi bên dưới cho thấy đôi môi gần như không mấp máy và cái đầu trôi dần đi. Âm thanh bị chặn ở 35 giây mỗi lần chạy, nên kịch bản dài hơn thì phải cắt ra rồi ghép lại, và hội thoại nhiều người — một tính năng nổi bật của bài báo — thì không có ở đây. Nó là video lời nói, không phải video khung cảnh: muốn có chuyển động máy quay hay hành động, hãy dùng Seedance 2.5 hoặc Kling 3.0 Turbo.

Kiến trúc, định vị và các con số nghiên cứu người dùng lấy từ bài báo nghiên cứu của ByteDance: OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation (arXiv:2508.19209)

Người kiểm thử nói gì

Phiên bản 1.5 cho thấy độ bền bỉ tốt hơn với các đầu vào khó.
Brad Rose, fal — OmniHuman 1.5 vs OmniHuman
Một bức chân dung nửa người với bàn tay, vai rõ ràng và ánh sáng tự nhiên thường cho chuyển động cơ thể tốt hơn.
Z.Tools — OmniHuman-1.5 deep dive
Bóng đổ nặng, kính râm, các vật che lạ và khuôn mặt quá nhỏ khiến công việc khó hơn.
Z.Tools — OmniHuman-1.5 deep dive

Vì sao nên chạy OmniHuman 1.5 trên CreateVision AI?

Mô hình là của ByteDance; lý do để dùng nó ở đây là hai đầu vào còn lại — khuôn mặt và giọng nói — đều đến từ cùng một không gian làm việc.

Bức chân dung do GPT Image 2 tạo, dùng làm khuôn mặt đầu vào cho một đoạn phim avatar OmniHuman 1.5

Cả chuỗi đầu vào nằm trên một trang

Một đoạn phim avatar biết nói cần ba thứ: một khuôn mặt, một giọng nói, và mô hình. Ở đây cả ba đều đến từ cùng một không gian làm việc — tạo bức chân dung bằng GPT Image 2 hoặc Seedream, gõ kịch bản rồi tổng hợp nó bằng một trong 60 giọng có sẵn, rồi đưa thẳng cả hai vào OmniHuman 1.5. Mọi đoạn phim trên trang này đều được làm đúng theo cách đó, từ đầu đến cuối, mà không thu một giây âm thanh nào và không tải lên một tấm ảnh nào của người thật.

Bức chân dung đầu vào cho ví dụ tiệm trà nói tiếng Quan Thoại của OmniHuman 1.5

Một thư viện giọng nói thay cho một phòng thu

Chế độ chữ không phải thứ nghĩ ra sau: 60 giọng nói trải trên tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Ý, tiếng Nga và tiếng Bồ Đào Nha, mỗi giọng đều có bản nghe thử bạn có thể bật lên trước khi tiêu bất cứ thứ gì. Hãy gõ tối đa 600 ký tự, chọn một giọng, và nền tảng sẽ tổng hợp lời nói rồi dùng nó dẫn dắt avatar trong cùng một lần chạy. Đoạn phim tiệm trà tiếng Quan Thoại ở trên đi đúng con đường này — không có micro nào can dự.

Bức chân dung đầu vào cho ví dụ người dẫn bản tin của OmniHuman 1.5

Một gói đăng ký, và chi phí nhìn thấy được ngay từ đầu

OmniHuman 1.5 tính tiền theo mỗi giây âm thanh — 130 tín dụng mỗi giây, làm tròn lên — và không gian làm việc hiển thị chi phí chính xác của đoạn phim trước khi bạn bấm tạo. Cùng gói đó bao cả GPT Image 2, Nano Banana Pro, Seedream, Seedance, Kling và Veo, nên quy trình hợp lý thì rẻ: phác bức chân dung với vài tín dụng, chốt kịch bản, rồi mới tiêu cho các giây avatar. Hãy cắt bỏ phần im lặng trong âm thanh — bạn đang trả tiền cho từng giây của nó.

Bức chân dung đầu vào góc ba phần tư dùng cho bài kiểm tra áp lực của OmniHuman 1.5

Đo được, không phải hứa hẹn — kể cả lần thất bại

Bộ kiểm tra bảy đoạn phim của chúng tôi được tạo ngày 19 tháng 8 năm 2026 — một bài chào hàng sản phẩm, một bản tin ngắn, một bài động viên ở phòng tập, một lời chào ở tiệm trà bằng tiếng Quan Thoại, một nhân vật truyện tranh, một lần cố tình để thất bại với góc ba phần tư, và một cảnh sân khấu rộng. Mọi tác vụ được chấp nhận đều dựng thành công ngay lần đầu, trong 3m 20s đến 4m 42s cho khoảng mười giây âm thanh. Chúng tôi cũng công bố những gì đã trục trặc: vào một tối thứ Ba đông người, phía thượng nguồn từ chối 13 trong 20 lần gửi của chúng tôi với lỗi quá tải trước khi chấp nhận (các lần chạy bị từ chối được hoàn tín dụng tự động), một tác vụ được chấp nhận nằm hàng đợi 14 phút, và đoạn phim góc nghiêng trên trang này cho thấy chính xác điều gì xảy ra khi bạn phớt lờ lời khuyên dùng chân dung chính diện.

Các đoạn phim OmniHuman 1.5 thật từ không gian làm việc này

Cả 7 đoạn phim bên dưới đều được tạo tại đây ngày 19 tháng 8 năm 2026 — mỗi đoạn là bản dựng đầu tiên mà các đầu vào của nó tạo ra, không quay lại và không chọn lọc. Các bức chân dung là đầu ra của GPT Image 2; mọi giọng nói đều được gõ ra dưới dạng chữ và tổng hợp bằng thư viện tích hợp sẵn. Các tác vụ được chấp nhận trả về trong 3m 20s đến 4m 42s cho khoảng 10 giây âm thanh (một trường hợp ngoại lệ nằm hàng đợi 14 phút); vào một buổi tối đông người, phía thượng nguồn từ chối vài lần gửi với lỗi quá tải trước khi chấp nhận — các lần chạy bị từ chối đều được hoàn tín dụng. Hãy bật tiếng.

PromptÂm thanh 9,2 s · giọng Người đàn ông đáng tin · 1.300 tín dụng · 4m 42s

Input: GPT Image 2 portrait of a creator holding a portable speaker + the built-in Trustworthy Man voice. Script: "This little gadget honestly surprised me. One charge lasts the whole week, it pairs instantly, and the sound is way bigger than the size suggests. I've been using it every single day."

PromptÂm thanh 10,2 s · giọng Người dẫn bản tin · 1.430 tín dụng · 4m 09s

Input: GPT Image 2 portrait of an anchor at a news desk + the built-in News Anchor voice. Script: "Good evening, and welcome to the briefing. Tonight we look at how small studios are using digital presenters to publish in ten languages at once — without booking a single camera crew."

PromptÂm thanh 10,7 s · giọng Chàng trai đầy năng lượng · 1.430 tín dụng · 4m 00s

Input: GPT Image 2 waist-up photo of a coach mid-gesture + the built-in Energetic Guy voice. Script: "Alright team, listen up! Thirty seconds, that's all I'm asking for. Three rounds, full effort, no excuses. When that timer starts, you give me everything you've got. Let's go!"

PromptÂm thanh 11,8 s · giọng Cô gái ngọt ngào tiếng Quan Thoại · 1.560 tín dụng · 4m 19s

Input: GPT Image 2 portrait of a tea-shop owner + the built-in Mandarin Sweet Girl voice. Script: "大家好,欢迎来到我们的小店。这一款云雾绿茶是今年春天刚采的,用八十度的水慢慢泡,入口特别清甜。喜欢的话,记得点个关注哦。"

PromptÂm thanh 9,7 s · giọng Cô gái ngọt ngào · 1.300 tín dụng · 4m 01s

Input: GPT Image 2 storybook illustration of a character called Pip + the built-in Sweet Girl voice. Script: "Hi there! I'm Pip, and I live inside a storybook. Every page you turn is a brand new adventure — so, shall we see what's on the next one?"

PromptÂm thanh 8,6 s · giọng Người phụ nữ từng trải · 1.170 tín dụng · khớp môi xuống cấp thấy rõ ở góc này

Stress test — input deliberately breaks the guidance: a three-quarter profile turned well away from the camera, + the built-in Wise Lady voice. Script: "People ask why I still write my letters by hand. Because slowness is not a flaw. Some things are only worth saying at the speed of ink."

PromptÂm thanh 5,4 s · giọng Người thuyết minh phim · 780 tín dụng · khung hình này là ảnh nền của trang

Input: GPT Image 2 wide 16:9 shot — a small spotlit figure on a dark stage, testing how the model handles a face that is far from the camera. + the built-in Movie Narrator voice. Script: "Every story begins in the dark, long before the first spotlight finds it."

OmniHuman 1.5 thực sự dành cho ai

Mỗi mục dưới đây ứng với một đoạn phim đã được trình bày ở trên — không phải một danh sách mong ước.

  • Người làm khóa học và nội dung giải thích

    Hãy gõ phần thuyết minh và bạn có một người dẫn trên màn hình — không cần máy quay, ánh sáng hay quay lại. Trần 35 giây mỗi đoạn phim khớp gọn với một khái niệm mỗi đoạn, vốn cũng là cách phần lớn người dựng khóa học cắt phim.

  • Người làm marketing UGC và sản phẩm

    Ví dụ chào hàng chiếc loa ở trên chính là toàn bộ quy trình: tạo một bức chân dung kiểu người sáng tạo đang cầm sản phẩm của bạn, gõ lời chào hàng, chọn một giọng. Không phí thuê người, và không phải đi xin giấy đồng ý hình ảnh — khuôn mặt đó chưa bao giờ tồn tại.

  • Đội bản địa hóa

    Cùng một khuôn mặt có thể truyền đạt cùng một thông điệp bằng mười ngôn ngữ: giữ nguyên bức chân dung, đổi giọng nói. Khớp môi bám theo bất kỳ âm thanh nào bạn cung cấp — ví dụ tiếng Quan Thoại ở trên là bằng chứng.

  • Kênh giấu mặt và người dẫn ảo

    Một nhân vật bạn tạo ra là một nhân vật bạn sở hữu. Hãy thiết kế khuôn mặt một lần, cho nó một giọng nói nhất quán từ thư viện, và nó có thể đứng đầu mọi tập — nhân vật truyện tranh minh họa ở trên cho thấy nó thậm chí không cần phải là ảnh thực.

  • Người làm podcast và người sáng tạo ưu tiên âm thanh

    Bạn đã có phần khó rồi: âm thanh. Hãy cắt một đoạn hay xuống 35 giây, thêm một bức chân dung, và bạn có một đoạn phim để đăng lên mạng xã hội mà không cần mở phần mềm dựng.

OmniHuman 1.5 so với Seedance 2.5, Veo 3.1 Pro và Kling 3.0 Turbo

Video lời nói đối lại video khung cảnh — mỗi mô hình cần gì từ bạn, và trả lại gì trong không gian làm việc này.

OmniHuman 1.5Seedance 2.5Veo 3.1 ProKling 3.0 Turbo
Thứ bạn cung cấp1 ảnh chân dung + âm thanh của bạn, hoặc chữ gõ vào cùng một giọng từ thư việnMột prompt, cộng các tham chiếu ảnh, video và âm thanh tùy chọnMột prompt, cộng một ảnh tham chiếu tùy chọnMột prompt hoặc một ảnh khởi đầu
Ai nói ra những lời đóBạn — avatar khớp môi theo đúng bản âm thanh của bạnMô hình tự tạo giọng nói từ promptMô hình tự tạo giọng nói từ promptÂm thanh được tạo cùng đoạn phim
Độ dài đoạn phim ở đâyBằng độ dài âm thanh của bạn, tối đa 35 s4–30 s4–8 s3–15 s
Tín dụng130 mỗi giây âm thanh110/giây ở 480p · 230/giây ở 720p320–1.920 mỗi đoạn phim (4–8 s · 720p–4K · có/không âm thanh)55/giây ở 720p · 70/giây ở 1080p
Đo tại đây~4 phút cho ~10 s âm thanh (7 đoạn phim, tháng 8 năm 2026)Chúng tôi không đo với tác vụ nàyChúng tôi không đo với tác vụ nàyChúng tôi không đo với tác vụ này

Tín dụng, thời lượng và các tùy chọn đầu vào được đọc từ registry mô hình của chính không gian làm việc này ngày 19 tháng 8 năm 2026 — chúng mô tả thứ bạn nhận được ở đây, không phải các thông số mà nhà cung cấp công bố. Thời gian là số đo của chính chúng tôi trên các đoạn phim trình bày ở trên; chúng tôi chưa chạy cùng những kịch bản đó qua ba mô hình kia, nên các ô đó ghi thẳng ra chứ không phỏng đoán.

Các mô hình video khác giống OmniHuman 1.5

So sánh OmniHuman 1.5 với các mô hình video khác — cùng một không gian làm việc, chỉ cần một cú nhấp chuột để chuyển đổi.

Thông số OmniHuman 1.5 trên CreateVision AI

Mô hìnhomnihuman-1.5, của ByteDance (bài báo nghiên cứu công bố tháng 8 năm 2025)
Chế độAvatar biết nói: một tấm ảnh + một bản âm thanh → video biết nói, trong không gian làm việc avatar trên trang này
Đầu vàoĐúng 1 ảnh chân dung, cộng âm thanh tối đa 35 giây (tải lên mp3/wav) — hoặc chữ gõ vào tối đa 600 ký tự, được tổng hợp thành lời nói
Thư viện giọng đọc60 giọng có sẵn trên 10 ngôn ngữ: tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Ý, tiếng Nga, tiếng Bồ Đào Nha
Chỉ dẫn tùy chọnMột ghi chú ngắn về diễn xuất cho hành động, cảm xúc và máy quay — hữu ích, không bao giờ bắt buộc
Đầu raMột cảnh quay liên tục giữ nguyên khung hình của tấm ảnh của bạn; độ dài đoạn phim bằng độ dài âm thanh. Đầu ra đo được: 1248×1664 từ một ảnh 2:3, 1920×1088 từ ảnh 16:9, 25 fps, H.264 với âm thanh AAC đơn kênh
Tín dụng130 mỗi giây âm thanh, làm tròn lên — tối thiểu 130, 4.550 ở mức đủ 35 giây; chi phí chính xác hiển thị trước khi bạn tạo
Tốc độ đo thực tế3m 20s–4m 42s cho mỗi tác vụ được chấp nhận với ~10 s âm thanh trong bài kiểm tra 7 đoạn phim của chúng tôi; một trường hợp ngoại lệ nằm hàng đợi 14 phút (tháng 8 năm 2026, một tối thứ Ba đông người)

Cách làm một avatar biết nói từ một tấm ảnh

Bắt đầu tạo video
  1. Thêm khuôn mặt

    Hãy tải lên một bức chân dung nửa người, chính diện, rõ ràng — hoặc tạo một bức bằng GPT Image 2 hay Seedream ngay trong không gian làm việc này, vốn là cách mọi khuôn mặt trên trang này được làm ra. Mỗi ảnh một người; hãy để khuôn mặt lớn và không bị che.

  2. Cho nó một giọng nói

    Hãy tải lên một đoạn âm thanh (mp3 hoặc wav, tối đa 35 giây), hoặc chuyển sang chế độ chữ: gõ tối đa 600 ký tự và chọn một trong 60 giọng thuộc 10 ngôn ngữ, mỗi giọng đều có bản nghe thử bạn có thể bật lên trước.

  3. Tùy chọn: chỉ đạo phần diễn xuất

    Một ghi chú ngắn như "điềm tĩnh, gật đầu nhẹ, cười khẽ" sẽ lái cử chỉ và cảm xúc. Cứ để trống thì mô hình tự đọc nhịp điệu và ý nghĩa của đoạn âm thanh.

  4. Tạo rồi kiểm tra độ khớp

    Chi phí tín dụng chính xác xuất hiện trước khi bạn chạy — nó tỉ lệ với độ dài âm thanh. Việc tạo là bất đồng bộ; đoạn phim rơi vào lịch sử của bạn kèm mọi đầu vào đính kèm, nên một thiết lập chạy được có thể tái lập vào tuần sau.

Không chỉ là OmniHuman 1.5

Một tài khoản, trọn vẹn quy trình tạo ảnh và video.

Bài viết liên quan

Giá của OmniHuman 1.5 và credits miễn phí hằng ngày

Chạy OmniHuman 1.5 bằng credits hằng ngày của gói miễn phí, hoặc nâng cấp để dùng mô hình cao cấp, tạo nhanh hơn và đầu ra 4K.

Miễn phí

$0

Hoàn hảo để bắt đầu

  • 200 tín dụng chào mừng, tối đa 80/ngày
  • Bản nháp Z Image Turbo với 0 credits
  • Tốc độ tạo tiêu chuẩn
  • Bao gồm lịch sử tạo
Bắt đầu

Premium

Phổ biến nhất
$29/month

Thanh toán hằng năm · $240/năm

  • 8.000 tín dụng/tháng, không giới hạn ngày
  • Tất cả các mô hình cao cấp — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Tốc độ tạo nhanh gấp 5 lần, hàng đợi ưu tiên
  • Tăng cường prompt bằng AI
Nâng cấp lên Premium

Ultimate

$49/month

Thanh toán hằng năm · $380/năm

  • 18.000 tín dụng/tháng, không giới hạn ngày
  • Tạo ảnh HD lên đến độ phân giải 4K
  • Hỗ trợ ưu tiên
  • Hàng đợi nhanh nhất và truy cập sớm các mô hình mới
Nâng cấp lên Ultimate

OmniHuman 1.5 — Câu hỏi thường gặp

1

OmniHuman 1.5 là gì?

Mô hình avatar do âm thanh dẫn dắt của ByteDance. Nó nhận một ảnh chân dung và một bản âm thanh rồi trả về một video của người đó đang nói đoạn âm thanh ấy — môi, biểu cảm, chuyển động đầu và cử chỉ tay đều bám theo âm thanh. Bài báo nghiên cứu đứng sau nó được công bố tháng 8 năm 2025.

2

Avatar có nói đúng từng chữ của tôi không?

Có — đó chính là khác biệt so với các mô hình video lái bằng prompt. Bạn cung cấp bản âm thanh, hoặc bằng cách tải lên mp3/wav hoặc bằng cách gõ kịch bản rồi chọn một giọng có sẵn, và avatar khớp môi theo nó từng chữ. Các mô hình lái bằng prompt tự tạo giọng của chúng và hiếm khi nói đúng chính xác thứ bạn viết.

3

OmniHuman 1.5 có miễn phí không?

Không — nó tính 130 tín dụng cho mỗi giây âm thanh, làm tròn lên, nên một đoạn phim 10 giây là 1.300 tín dụng. Chi phí chính xác hiển thị trước khi bạn tạo, và các lần chạy thất bại được hoàn lại tự động. Hãy giữ kịch bản gọn và cắt bỏ phần im lặng: mỗi giây âm thanh là một giây bạn trả tiền.

4

Những yếu tố nào tạo nên một bức ảnh nguồn tốt?

Chính diện, nửa người, một người, với khuôn mặt lớn, được chiếu sáng đều và không bị che — giới đánh giá và chính các bài kiểm tra của chúng tôi đều đồng ý. Bài kiểm tra góc ba phần tư cố tình ở trên cho thấy điều gì xảy ra nếu làm khác: đôi môi gần như không mấp máy, mô hình từ từ xoay đầu ra xa hơn, và những đồ vật chưa từng có trong tấm ảnh lại hiện lên trên mặt bàn. Chân dung do máy tạo ra chạy tốt đúng như ảnh chụp bằng máy ảnh.

5

Nó có chạy được với hình minh họa hay nhân vật anime không?

Có — bài kiểm tra truyện tranh ở trên là một hình minh họa 2D phẳng, và OmniHuman 1.5 làm động nó một cách thuyết phục trong khi vẫn giữ phong cách vẽ: mắt, chân mày và miệng chuyển động như một nhân vật hoạt hình vẽ tay. Một điểm lạ chúng tôi quan sát được: khi miệng há to, mô hình vẽ ra hàm răng thật đến bất ngờ so với một hình minh họa phẳng. Bài báo của ByteDance cũng tuyên bố hỗ trợ các chủ thể phi người; chúng tôi mới chỉ thử nghiệm nhân vật minh họa này.

6

Một đoạn phim dài tối đa bao nhiêu, và việc tạo mất bao lâu?

Tối đa 35 giây âm thanh mỗi đoạn phim trên nền tảng này — kịch bản dài hơn thì phải cắt ra rồi ghép lại. Trong bài kiểm tra tháng 8 năm 2026 của chúng tôi, các tác vụ được chấp nhận trả về trong 3m 20s đến 4m 42s cho khoảng 10 giây âm thanh. Một lưu ý từ chính buổi tối đó: dưới tải nặng, phía thượng nguồn từ chối vài lần gửi với lỗi quá tải trước khi chấp nhận tác vụ. Các lần chạy bị từ chối không tốn gì, nhưng hãy tính trước việc phải thử lại vào giờ cao điểm chứ đừng đặt hạn chót cách đó năm phút.

7

OmniHuman 1.5 dở ở chỗ nào?

Trên hết là các khuôn mặt không chính diện: bài kiểm tra góc ba phần tư của chúng tôi cho thấy đôi môi gần như bất động, cái đầu trôi xa dần khỏi máy quay, và những đồ vật trên bàn chưa từng có trong tấm ảnh. Các chi tiết nhận dạng nhỏ có thể lang thang giữa chừng đoạn phim — một chiếc bông tai đổi hình dạng trong bài kiểm tra đó, và màu môi đọc lên đậm hơn ảnh đầu vào một chút ở hai đoạn khác. Hội thoại nhiều người không có ở đây, độ phân giải đầu ra khiêm tốn (1248×1664 trong các bài kiểm tra chân dung của chúng tôi — không có 4K), và nó chỉ làm video lời nói: muốn hành động, chuyển động máy quay hay đổi khung cảnh, hãy dùng Seedance 2.5 hoặc Kling 3.0 Turbo.

8

Tôi có được dùng các video này cho mục đích thương mại không — và tôi được dùng khuôn mặt của ai?

Video bạn tạo ra có thể dùng cho dự án cá nhân và thương mại theo điều khoản dịch vụ của chúng tôi. Khuôn mặt mới là phần cần xem trọng: làm động ảnh của một người thật mà không có sự đồng ý của họ có thể vi phạm quyền hình ảnh và quyền công khai, và một số nơi hiện đã yêu cầu phải công bố khi dùng người dẫn tổng hợp. Khuôn mặt do máy tạo ra — như mọi khuôn mặt trên trang này — né hoàn toàn được vấn đề đồng ý.

Hãy cho một tấm ảnh điều gì đó để nói

Bắt đầu tạo video

Giá và quyền truy cập — sự thậtOmniHuman 1.5

Mô hình
OmniHuman 1.5
Nhà phát triển
ByteDance
Cách sử dụng
Chạy trong không gian làm việc CreateVision AI qua API — đăng nhập là tạo được ngay. Không cần khóa API, không cần dự án đám mây, không cần cài đặt.
Giá mỗi lần tạo
Từ 650 tín dụng ≈ $2.36 mỗi clip 5 giây với gói Premium ($29/tháng cho 8,000 tín dụng). Gói miễn phí bao gồm 80 tín dụng mỗi ngày.
Quyền riêng tư
Riêng tư theo mặc định — không người dùng nào khác có thể xem nội dung bạn tạo, ở bất kỳ gói nào. Chúng tôi không bán hay lạm dụng dữ liệu thành viên. Chính sách quyền riêng tư

Có gì mớiOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.