
Cả chuỗi đầu vào nằm trên một trang
Một đoạn phim avatar biết nói cần ba thứ: một khuôn mặt, một giọng nói, và mô hình. Ở đây cả ba đều đến từ cùng một không gian làm việc — tạo bức chân dung bằng GPT Image 2 hoặc Seedream, gõ kịch bản rồi tổng hợp nó bằng một trong 60 giọng có sẵn, rồi đưa thẳng cả hai vào OmniHuman 1.5. Mọi đoạn phim trên trang này đều được làm đúng theo cách đó, từ đầu đến cuối, mà không thu một giây âm thanh nào và không tải lên một tấm ảnh nào của người thật.











