Sprekende AI-foto

Upload een portret en een audiotrack (maximaal 35s), of typ een script en kies een stem, en OmniHuman 1.5 zet de foto om in een sprekende video met gesynchroniseerde lippen en natuurlijke beweging. Gebruik je eigen foto om zelf de hoofdrol te spelen.

0 / 2,000
130 cr/s · ≤35s

Van één foto naar een pratende video

Eén portret plus een script wordt een levensechte woordvoerder – gesynchroniseerde lippen, expressies en gebaren. Geen camera, geen studio.

Originele afbeeldingOriginal portrait photo of a beauty creator holding a skincare product
Script

Hey everyone! I am so excited to share my new favorite foundation. It blends in seamlessly for a flawless, natural finish, and it actually feels lightweight all day. A little goes a long way, so one bottle lasts for months.

AI-avatarvideo

Laat elke foto praten, ook die van jezelf

Een complete generator voor pratende foto's (digitale mensen) met AI: upload een portret en een audiofragment, of typ een script en kies een stem, en krijg een levensechte pratende video met gesynchroniseerde lippen, natuurlijke expressies en gebaren. Gebruik een foto van jezelf om de presentator te zijn. Mogelijk gemaakt door ByteDance OmniHuman 1.5, geen camera, acteur of studio nodig.

Een ingelijste portretfoto die verandert in een pratende AI-avatar van dezelfde vrouw, met een audiogolfvorm ertussen

Speel zelf de hoofdrol, of bouw een digitale woordvoerder

Geen filmopnamen, geen acteur, geen green screen. Upload één duidelijke foto van jezelf en jij wordt de presentator die jouw script voorleest, in je eigen stem of een bibliotheekstem. Of gebruik een foto van iemand die je toestemming heeft gegeven en bouw een herbruikbare digitale host voor productuitleg, cursusintroducties, aankondigingen en advertenties. Genereer op elk moment nieuwe regels zonder opnieuw te filmen.

Twee invoeren voor een pratende AI-foto: een geüploade audiogolfvorm en een getypt script met een stemkiezer

Er zijn twee manieren om mee te doen: audio uploaden of een script typen.

Heb je al een spraakopname? Upload deze en de avatar synchroniseert met de tekst. Geen audio? Schakel over naar de tekstmodus: typ wat de avatar moet zeggen, kies een stem uit de ingebouwde tekst-naar-spraakbibliotheek en het script wordt automatisch omgezet in de audio. De geschatte lengte en de kosten in credits worden weergegeven voordat je de animatie genereert.

Still van een pratende AI-foto van een vrouw die in de camera spreekt met natuurlijke handgebaren

Levensecht — niet zomaar een bewegende mond

OmniHuman 1.5 leest het ritme, de prosodie en de betekenis van de audio om hoofdbewegingen, houding en handgebaren aan te sturen, samen met nauwkeurige lipsynchronisatie, terwijl de identiteit en belichting van de persoon behouden blijven. Het resultaat is een presentatie die meer lijkt op die van een echte spreker dan op een statisch portret met een geanimeerde mond.

Pratende AI-fotopresentator in een woonkamer die een korte socialmediaclip presenteert

Ontwikkeld voor marketing, training en sociale media.

Maak videofragmenten met woordvoerders voor advertenties en landingspagina's, gesproken lessen en onboarding voor trainingen, berichten met sprekende hoofden voor sociale media, of meertalige versies van dezelfde boodschap. Elke generatie wordt samen met de input opgeslagen in de geschiedenis, zodat je snel kunt itereren en variaties kunt produceren.

Portretten klaar voor AI Talking Photo

Portretten in presentatorstijl, gegenereerd op CreateVision AI — elk ervan kan een pratende avatarvideo aandrijven zodra je audio toevoegt.

AI-avatar van een beauty-influencer die een huidverzorgingsserum presenteert.
AI-avatar van een techrecensent die een smartphone presenteert
AI-avatar van een lifestyle-creator met een koffiekopje.
AI-avatar van een sneakerrecensent die een schoen presenteert
AI-avatar van een modeontwerpster met een handtas
AI-avatar van een wellness-expert die supplementen presenteert.
AI-avatar van een schoonheidsspecialiste met een parfumflesje.
AI-avatar van een thuiskok met een keukengadget

Het model achter deze AI-tool voor pratende foto's

OmniHuman 1.5 stuurt de lipsynchronisatie, mimiek en lichaamsbeweging op deze pagina aan.

Specificaties van AI Talking Photo

InvoerEén portretfoto plus een geüpload audiobestand of een getypt script.
Wiens fotoDie van jezelf, of van iemand die je toestemming heeft gegeven. Zowel de foto als de stem moeten van jou zijn om te gebruiken.
Richtlijnen voor het portretRecht van voren, goed belicht, hele gezicht zichtbaar en scherp. Zonnebrillen en zware schaduw verlagen de nauwkeurigheid van de lipsync.
AudiolengteTot 35 seconden per generatie — ruwweg 85 gesproken woorden.
Stemmenbibliotheek60 ingebouwde stemmen in 10 talen, met previews voordat je genereert.
ModelOmniHuman 1.5, dat de lipsync, gezichtsuitdrukking en natuurlijke hoofd- en lichaamsbeweging aanstuurt.
KostenPer seconde output afgerekend, net als andere videogeneratie; zichtbaar voordat je genereert.
UitvoerEen clip om te downloaden, opgeslagen in je geschiedenis met het bronportret en het script erbij.

Hoe je zelf de hoofdrol speelt in je eigen pratende AI-foto

Jouw foto, jouw woorden, één clip.

  1. 1

    Upload een foto van jezelf

    Een duidelijke foto van voren werkt het beste: een selfies met je telefoon, een portretfoto of een frame uit een video. De AI voor pratende foto's leest je gezicht uit dit enkele frame.

  2. 2

    Voeg je stem toe

    Neem jezelf op en upload de audio, of typ je script en kies een van de 60 ingebouwde stemmen. Audio kan tot 35 seconden duren.

  3. 3

    Genereer en hergebruik jezelf daarna

    Het model synchroniseert lippen, expressie en natuurlijke hoofdbewegingen met de audio. Bewaar dezelfde foto en genereer nieuwe regels wanneer je ze nodig hebt, zonder opnieuw te filmen.

Hoe je een script schrijft voor een pratende AI-foto

Hier is geen beeldprompt — het portret en de audio doen het werk. Wat jij schrijft is het script, en de keuzes in dat script bepalen of het resultaat er natuurlijk uitziet.

1

Openingszin

Begin met iets korts. In de eerste seconde valt de lipsync het meest op.

Hé — heel even.

2

Zinslengte

Houd zinnen onder de ongeveer 15 woorden. Lange bijzinnen leveren onnatuurlijke pauzes op.

Dit serum heeft twee ingrediënten. Dat is de hele formule.

3

Interpunctie

Komma's en punten worden ademhalingen. Zet ze waar je echt een pauze zou nemen.

Het werkt — en het kost tien seconden.

4

Lengtebudget

Ruwweg 2,5 woorden per seconde. Schrijf naar de cliplengte die je wilt.

~85 woorden voor een clip van 35 seconden

Vaag

Ons revolutionaire product benut baanbrekende technologie om ongeëvenaarde resultaten te leveren aan veeleisende klanten die streven naar excellentie.

Specifiek

Dit is het deel waar mensen altijd naar vragen. Twee ingrediënten, geen vulmiddel. Je ziet het verschil na ongeveer een week.

Waarom het werkt

De eerste is één zin van 19 woorden vol abstracties — de avatar spreekt hem uit in een vlakke, ademloze monotoon, omdat er nergens ruimte is om te pauzeren. De tweede bestaat uit drie korte zinnen met natuurlijke klemtoonpunten, en dat is wat de voordracht menselijk laat klinken.

Vaag

Hallo en welkom op ons kanaal, waar we het vandaag gaan hebben over de vijf belangrijkste dingen die je moet weten over huidverzorgingsroutines.

Specifiek

Vijf dingen over huidverzorging. Nummer één doet bijna iedereen fout.

Waarom het werkt

Lange, aaneengeregen openingen zijn waar de lipsync het meest afdrijft, omdat het model geen leestekens heeft om zich aan vast te houden. Een korte hook geeft het schone klemtoonpunten en houdt de aandacht beter vast.

Gewoontes die je beter kunt loslaten

  • Een portret gebruiken waarop het gezicht klein, schuin of deels in de schaduw staat. De nauwkeurigheid van de lipsync hangt direct samen met hoe duidelijk de mond zichtbaar is in het bronbeeld.
  • Voorbij de audiolimiet schrijven. De generatie stopt bij 35 seconden audio — een langer script wordt afgekapt, dus knip het op in segmenten en gebruik hetzelfde portret opnieuw.
  • Dichtopeengepakt vakjargon. Getallen, afkortingen en lange productnamen zijn precies waar een synthetische stem het meest synthetisch klinkt. Schrijf ze zoals je ze hardop zou zeggen.

Verder dan de AI-avatarvideogenerator

Pratende avatars zijn één uitkomst. Beeld- en videogeneratie draaien vanuit hetzelfde account.

Nuttige bronnen over AI-avatarvideo

Prijzen van AI Talking Photo en gratis credits

Video's van pratende foto's worden per seconde gefactureerd, net als andere video-output. Nieuwe accounts krijgen 200 gratis credits om het uit te proberen.

Gratis

$0

Perfect om mee te beginnen

  • 200 welkomstcredits, maximaal 80/dag
  • Z Image Turbo-schetsen voor 0 credits
  • Standaard generatiesnelheid
  • Generatiegeschiedenis inbegrepen
Aan de slag

Premium

Populairst
$29/month

Jaarlijks gefactureerd · $240/jaar

  • 8.000 credits/maand, geen daglimieten
  • Alle premium modellen — GPT Image 2, Nano Banana, Seedream, Seedance, Veo, Kling
  • 5x generatiesnelheid, voorrangswachtrij
  • AI-promptverbetering
Upgraden naar Premium

Ultimate

$59/month

Jaarlijks gefactureerd · $468/jaar

  • 18.000 credits/maand, geen daglimieten
  • HD-generatie tot 4K-resolutie
  • Prioriteitssupport
  • Snelste wachtrij en vroege toegang tot nieuwe modellen
Upgraden naar Ultimate

AI Talking Photo — Veelgestelde vragen

1

Wat is een pratende AI-foto?

Een pratende AI-foto, ook wel AI-avatar of digitale mens genoemd, is een gegenereerde pratende video van een persoon, gebouwd uit één foto en een stem. In plaats van te filmen lever je een portret en audio (of een script + stem), en het model animeert een levensechte spreekprestatie — te gebruiken als digitale presentator, woordvoerder of verteller.

2

Wat heb ik nodig om er een te maken?

Een duidelijke portretfoto van voren, plus een audiofragment (mp3/wav) of – in tekstmodus – het script dat u wilt laten voorlezen en een stem uit de ingebouwde bibliotheek. Dat is voldoende om een sprekende avatarvideo te maken.

3

Mag ik mijn eigen stem gebruiken?

Ja. Upload je eigen audio-opname en de avatar synchroniseert de lippen ermee. Als je geen opname hebt, schakel dan over naar de tekstmodus en kies een stem uit de tekst-naar-spraakbibliotheek.

4

Hoe lang mag de avatarvideo zijn?

Maximaal 35 seconden audio per generatie. Voor langere scripts kunt u deze opsplitsen in meerdere fragmenten. De geschatte duur wordt weergegeven terwijl u typt en u wordt per seconde audio gefactureerd.

5

Waarvoor kan ik AI-avatars gebruiken?

Het wordt vaak gebruikt voor productuitleg en advertenties, gesproken tekst voor cursussen en introductieprogramma's, video's met een spreker op sociale media, aankondigingen en meertalige versies van berichten – eigenlijk overal waar je normaal gesproken een presentator zou moeten filmen.

6

Welk model vormt de basis van de AI-avatar?

CreateVision AI maakt gebruik van ByteDance's OmniHuman 1.5, dat lipsynchronisatie, hoofdbewegingen en gebaren aanstuurt op basis van audio. Zie de modelpagina van OmniHuman 1.5 voor de technische details.

7

Welke foto werkt het best in een AI-avatarvideogenerator?

Een goed belicht portret recht van voren waarop het hele gezicht zichtbaar en scherp is. Zonnebrillen, harde schaduwen over het gezicht, extreme hoeken of een heel klein gezicht in beeld verlagen allemaal de nauwkeurigheid van de lipsynchronisatie.

8

Moet ik mijn eigen stem opnemen?

Nee. Je kunt een script typen en een stem kiezen uit de ingebouwde bibliotheek, met 60 stemmen in 10 talen. Je eigen opname uploaden kan ook, als je die liever gebruikt.

9

Kan ik zelf in de video spelen?

Ja, en het is het meest voorkomende gebruik. Upload een foto van jezelf en neem daarna je eigen stem op, of typ een script en kies een bibliotheekstem. Het resultaat ben jij, die jouw woorden zegt, zonder cameraopstelling. Veel makers bewaren één goede foto en genereren er elke week nieuwe clips mee.

10

Kan ik een pratende AI-foto commercieel gebruiken?

Ja. Volgens de servicevoorwaarden van CreateVision AI mag content die je genereert voor persoonlijke en commerciële doeleinden worden gebruikt, met naamsvermelding van CreateVision AI waar dat passend is. Je bent zelf verantwoordelijk voor het hebben van de rechten op de foto en de stem die je uploadt, en voor eventuele regels voor AI-openbaarmaking op het platform waar je publiceert.

11

Vroeger zette ik mezelf met Sora in video's. Is dit hetzelfde?

Zelfde doel, andere werking. Hier is je foto de identiteit en stuurt je audio of script de spraak, dus de uitvoer is een talking-head-clip met lipsync in plaats van een scène waarin je wordt geplaatst. Het werkt vanaf elke enkele foto, vereist geen video-inschrijving en is niet afhankelijk van een andere app die beschikbaar blijft.

Maak je eerste sprekende AI-foto

Beginnen met creëren