Trình tạo hình đại diện AI OmniHuman 1.5

Biến một bức chân dung duy nhất trở nên sống động với OmniHuman 1.5 — tải lên một bức ảnh và một đoạn âm thanh (hoặc nhập văn bản và chọn giọng nói) để tạo ra một hình đại diện biết nói chân thực với chuyển động môi, biểu cảm và cử chỉ được đồng bộ hóa.

Ảnh + giọng nói → videoCử chỉ điều khiển bằng âm thanhThư viện giọng nói TTS
0 / 2,000
130 cr/s · ≤35s

Các mô hình video khác giống OmniHuman 1.5

So sánh OmniHuman 1.5 với các mô hình video khác — cùng một không gian làm việc, chỉ cần một cú nhấp chuột để chuyển đổi.

OmniHuman 1.5 — biến một bức ảnh và một giọng nói thành một hình đại diện biết nói sống động như thật

OmniHuman 1.5 của ByteDance tạo nên một bức chân dung duy nhất từ âm thanh: chuyển động môi đồng bộ, biểu cảm tự nhiên và cử chỉ toàn thân phản ánh nhịp điệu và ý nghĩa của giọng nói — chứ không chỉ đơn thuần là chuyển động miệng. Tải lên ảnh và đoạn âm thanh, hoặc nhập văn bản và chọn giọng nói.

Khung hình video AI về bóng một vũ công trên sân khấu khói dưới ánh sáng hổ phách

Một bức ảnh cộng với một giọng nói tạo nên một hình đại diện biết nói.

Chỉ cần cung cấp cho OmniHuman 1.5 một bức chân dung và một đoạn âm thanh, phần mềm sẽ biến khuôn mặt đó thành một màn trình diễn nói chuyện chân thực với khả năng đồng bộ môi chính xác, đồng thời vẫn giữ nguyên danh tính, cấu trúc khuôn mặt và ánh sáng của người đó. Không cần dàn dựng, không cần phông nền xanh, không cần studio.

Khung hình video AI về một phi hành gia bước đi trong hành lang tàu vũ trụ phát sáng

Chuyển động toàn thân, không chỉ riêng môi.

Không giống như các công cụ mô phỏng người nói cơ bản, OmniHuman 1.5 đọc nhịp điệu, ngữ điệu và ý nghĩa của âm thanh để điều khiển chuyển động đầu, thay đổi tư thế và cử chỉ tay — nhờ đó, hình đại diện nhấn mạnh, tạm dừng và phản ứng giống như một người dẫn chương trình thực thụ chứ không phải là một bức chân dung tĩnh với miệng chuyển động.

Khung hình video AI về mưa chảy xuống cửa kính quán cà phê với hiệu ứng bokeh ấm áp

Nhập văn bản, chọn giọng nói — không cần ghi âm.

Không có file âm thanh sẵn? Hãy chuyển sang chế độ văn bản: nhập nội dung mà avatar nên nói, chọn giọng nói từ thư viện chuyển văn bản thành giọng nói tích hợp sẵn, và OmniHuman 1.5 sẽ tự động tạo ra bản ghi âm cho bạn. Lý tưởng cho người thuyết trình có kịch bản, người giải thích và các video ngắn trên mạng xã hội.

Khung hình video AI về cực quang cuộn xoáy trên một căn nhà gỗ phủ tuyết

Lời dẫn chuyện, đối thoại hoặc ca hát

Mô hình này thích ứng với nhiều phong cách âm thanh khác nhau — từ lời kể trầm lắng, hội thoại biểu cảm, thậm chí cả hát — và có thể tuân theo hướng dẫn văn bản tùy chọn về hướng quay phim và cử chỉ, tạo ra kết quả hoàn chỉnh phù hợp cho tiếp thị, đào tạo và nội dung mạng xã hội.

Cách dùng OmniHuman 1.5

Ba bước từ ô prompt trống tới một clip hoàn chỉnh.

  1. 1

    Chọn OmniHuman 1.5

    Mở bộ chọn mô hình và chọn OmniHuman 1.5. Bảng thông tin hiển thị mức credits, các tùy chọn độ phân giải và giới hạn thời lượng trước khi bạn tiêu bất kỳ credits nào.

  2. 2

    Mô tả điều bạn muốn

    Viết chủ thể, hành động và cách máy quay chuyển động. Đính kèm khung hình đầu nếu bạn muốn clip bắt đầu từ một bức ảnh cụ thể.

  3. 3

    Tạo xong, rồi đi tiếp

    Tải clip về, kéo dài nó, hoặc đưa sang chỉnh sửa tiếp. Prompt, mô hình và thiết lập luôn đi kèm trong lịch sử của bạn.

Không chỉ là OmniHuman 1.5

Một tài khoản, trọn vẹn quy trình tạo ảnh và video.

Giá của OmniHuman 1.5 và credits miễn phí hằng ngày

Chạy OmniHuman 1.5 bằng credits hằng ngày của gói miễn phí, hoặc nâng cấp để dùng mô hình cao cấp, tạo nhanh hơn và đầu ra 4K.

Miễn phí

$0

Hoàn hảo để bắt đầu

  • 80 tín dụng mỗi ngày, 400 mỗi tháng
  • Bản nháp Z Image Turbo với 0 credits
  • Tốc độ tạo tiêu chuẩn
  • Bao gồm lịch sử tạo
Bắt đầu

Premium

Phổ biến nhất
$29/month

Thanh toán hằng năm · $240/năm

  • 1.600 tín dụng/ngày, 8.000 tín dụng/tháng
  • Tất cả các mô hình cao cấp — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • Tốc độ tạo nhanh gấp 5 lần, hàng đợi ưu tiên
  • Tăng cường prompt bằng AI
Nâng cấp lên Premium

Ultimate

$49/month

Thanh toán hằng năm · $300/năm

  • 4.000 tín dụng/ngày, 18.000 tín dụng/tháng
  • Tạo ảnh HD lên đến độ phân giải 4K
  • Hỗ trợ ưu tiên
  • Hàng đợi nhanh nhất và truy cập sớm các mô hình mới
Nâng cấp lên Ultimate

OmniHuman 1.5 — Câu hỏi thường gặp

1

OmniHuman 1.5 là gì?

OmniHuman 1.5 là mô hình avatar dựa trên âm thanh của ByteDance: nó biến một bức chân dung duy nhất cùng với một đoạn ghi âm giọng nói thành một video biết nói chân thực với chuyển động môi, biểu cảm và cử chỉ được đồng bộ hóa.

2

Tôi cần cung cấp những gì?

Một ảnh chân dung rõ nét của một người, kèm theo một đoạn âm thanh (mp3/wav) hoặc — ở chế độ văn bản — văn bản bạn muốn được đọc và một giọng nói được chọn từ thư viện tích hợp sẵn, được tổng hợp thành âm thanh lái xe.

3

Đoạn video giới thiệu avatar có thể dài tối đa bao nhiêu?

Tối đa 35 giây âm thanh cho mỗi lần tạo. Kịch bản dài hơn nên được chia thành nhiều đoạn nhỏ. Thanh toán được tính theo từng giây âm thanh, làm tròn lên.

4

Nó có cử động nhiều hơn miệng không?

Đúng vậy. OmniHuman 1.5 tạo ra chuyển động đầu, tư thế và cử chỉ tay phản ứng với nhịp điệu và ý nghĩa của âm thanh, vì vậy hình đại diện sẽ thực hiện hành động chứ không chỉ đơn thuần là khớp môi.

5

Những yếu tố nào tạo nên một bức ảnh nguồn tốt?

Ảnh chụp một người duy nhất, rõ nét, hướng mặt về phía trước, đủ ánh sáng và không bị che khuất. Ảnh chụp nhóm, khuôn mặt quá nhỏ hoặc bị che khuất nhiều sẽ làm giảm chất lượng hoặc có thể bị hỏng.

6

OmniHuman 1.5 có giá như thế nào?

Tính theo từng giây âm thanh được tạo ra. Chi phí tín dụng chính xác sẽ được hiển thị trước khi bạn tạo và các lần chạy thất bại sẽ được hoàn tiền tự động.

Biến bức ảnh của bạn trở nên sống động với OmniHuman 1.5

Bắt đầu tạo video

Có gì mớiOmniHuman 1.5

  1. New

    OmniHuman 1.5 avatar model integrated with a 60-voice TTS library (6 voice archetypes × 10 languages) and ready-made avatar gallery.