Publicité IA

Avatar UGC par IA : le même visage et la même voix, de scène en scène

Le contenu façon « filmé par quelqu’un comme vous » est le format qui performe le mieux sur TikTok et Instagram. Le générer par IA est facile ; le générer avec une personne qui reste la même d’une vidéo à l’autre l’est beaucoup moins. Voici la méthode des trois verrous, démontrée sur une vraie série, avec ses prompts complets — et les règles à respecter pour rester honnête.

La rédaction ToolAcces8 octobre 2026Lecture ~15 min

Pourquoi l’UGC, et pourquoi elle s’effondre avec l’IA

L’UGC (« user-generated content », contenu créé par les utilisateurs) désigne ces vidéos filmées au téléphone, face caméra, dans une salle de bain, une voiture, une cuisine. Pas de studio, pas de lumière parfaite, pas de voix de publicité. C’est précisément ce qui les rend efficaces : elles ressemblent à ce que les gens regardent déjà entre deux vidéos d’amis, pas à une interruption publicitaire.

Produire ce format avec de vrais créateurs coûte cher et prend du temps : casting, envoi du produit, allers-retours sur le script, droits d’utilisation. L’IA promet de le faire en une après-midi. Et elle tient sa promesse… pour une vidéo.

Le problème arrive à la deuxième. Le visage dérive : la mâchoire s’arrondit, les cheveux changent de nuance, la chaîne en or disparaît. La voix dérive : l’accent bouge, le débit s’accélère, le timbre change. Or une série UGC repose entièrement sur l’idée qu’on retrouve la même personne. Quand elle change, le spectateur ne se dit pas « tiens, c’est une IA » ; il décroche, sans savoir pourquoi.

Une série UGC, c’est une personne qu’on reconnaît. Si elle change, tout s’écroule.

Le résultat qu’on vise

Voici une série produite dans le Studio ToolAcces : un seul personnage, six situations. Le décor, la lumière, l’objectif et le cadrage changent à chaque fois. Le visage, la barbe, les cheveux, le t-shirt et la chaîne ne changent pas.

Image de référence de l’avatar, fond grisRéférence
Terrasse
L’avatar sur un quai de métroMétro
Bureau
L’avatar sur un balcon haussmannienBalcon
L’avatar tenant un café glacéProduit
Six images du même avatar, générées séparément dans le Studio. Deux d’entre elles ont ensuite été animées.

Ce résultat ne dépend pas d’un modèle miracle. Il tient à une règle : ce qui définit la personne s’écrit une fois et ne bouge plus ; tout le reste change librement. La méthode tient en trois verrous.

Verrou 1 : le bloc d’identité

Le bloc d’identité est un paragraphe qui décrit la personne, et rien d’autre : âge, forme du visage, yeux, cheveux (couleur, coupe, tenue), peau et texture, bijoux, vêtement. Pas un mot de décor, de lumière ou de cadrage : ceux-là changent à chaque scène, lui jamais. Voici celui de notre avatar :

Le bloc d’identité de la série
A handsome man in his late twenties, editorial model features, strong jawline, dark brown wavy hair slightly tousled, light stubble, warm olive skin, brown eyes, athletic build, wearing a plain white fitted t-shirt and a thin gold chain necklace

Ce qu’il contient, et pourquoi

  • Des traits qui se voient de loin : mâchoire marquée, cheveux ondulés légèrement décoiffés, barbe de trois jours. Ce sont eux qui font reconnaître la personne sur un écran de téléphone.
  • Des signes distinctifs : la fine chaîne en or. Un détail récurrent est un ancrage puissant pour le modèle comme pour le spectateur.
  • Un vêtement simple et fixe : un t-shirt blanc ajusté. Plus le vêtement est chargé, plus il a de chances de varier.

Validez-le avant tout le reste

Le bloc va être recopié dans chaque prompt de la série. Une erreur ici (un « brown eyes » oublié, une coupe mal décrite) se paie donc autant de fois qu’il y a de scènes. Relisez-le, testez-le sur deux ou trois images, et ne le figez qu’ensuite.

L’ordre des blocs dans le prompt, qui décide du rendu

Un prompt d’avatar UGC s’assemble toujours dans le même ordre. Ce n’est pas une coquetterie : les premiers mots pèsent plus lourd que les derniers dans l’interprétation du modèle.

  1. Les descripteurs de beauté, en premier

    « Handsome », « editorial model features ». Ils fixent le registre de la personne avant tout le reste.

  2. La texture et le réalisme

    Pores visibles, barbe naturelle, cils un à un, légères variations de teint. C’est ce qui sépare une vraie peau d’un rendu plastique.

  3. La caméra et l’objectif

    28 mm, 35 mm, 50 mm selon la distance. Le grand angle donne la déformation naturelle d’un téléphone tenu à bout de bras.

  4. La lumière

    Celle du lieu, nommée précisément : néons du quai, soleil d’après-midi sous un store rouge, lampe de bureau la nuit.

  5. La composition

    Le cadrage (« from chest up ») et ce qu’on devine derrière, flou.

  6. « Shot on iPhone 17 Pro Max front camera »

    La ligne qui tire tout le rendu vers un selfie crédible plutôt qu’une photo de studio.

  7. Les négatifs

    Les habituels (cartoon, CGI, plastic skin, watermark), plus « ordinary-looking person » et « beauty filter ».

Pourquoi la beauté avant le réalisme

C’est la règle la plus contre-intuitive. Si les termes de texture passent en premier (« visible pores », « no retouching »), ils tirent tout le rendu vers le documentaire, et le modèle sort une personne quelconque photographiée de façon réaliste. Placés après les descripteurs de beauté, ils produisent l’inverse : un mannequin photographié de façon réaliste. C’est exactement ce que fait un bon créateur UGC.

Voici le prompt complet de la scène du métro. Repérez les blocs :

Prompt · scène métro
USE THE REFERENCE IMAGE FOR FACE IDENTITY ONLY. DO NOT REPLICATE THE BACKGROUND, FRAMING, LIGHTING, OR CAMERA ANGLE FROM THE REFERENCE.

A handsome man in his late twenties, editorial model features, strong jawline, dark brown wavy hair slightly tousled, light stubble, warm olive skin, brown eyes, athletic build, wearing a plain white fitted t-shirt and a thin gold chain necklace, relaxed confident expression, standing on a Paris metro platform, mouth closed.

ultra-realistic cinematic photography with natural imperfections
visible skin pores, natural stubble texture, individual eyelashes, slight skin tone variation
shot on a 28mm wide lens, natural smartphone perspective distortion
cool fluorescent platform lighting from above, realistic hard shadows
medium close-up from chest up, white tiled metro walls, RATP signage and a train softly blurred behind him

Shot on iPhone 17 Pro Max front camera

NEGATIVE: No cartoon, no CGI, no 3D render, no plastic skin, no beauty filter, no ordinary-looking person, no amateur styling, no text, no logo, no watermark
L’avatar sur un quai de métro parisien

Le réalisme se joue au millimètre

Le réalisme d’un visage IA se lit dans les détails qu’on regarde sans le savoir : un pore, un cil, une variation de teint au coin de l’œil. Les plans ci-dessous, générés dans le Studio en 4K, montrent le niveau de détail atteignable quand le bloc de réalisme est bien placé.

Visage
Œil
Sourcil
Peau, cils, sourcils : la texture naturelle est ce qui sépare une UGC crédible d’une image « trop parfaite ».

Verrou 2 : l’image de référence

Le bloc d’identité décrit ; l’image de référence montre. Les deux ensemble laissent très peu de place à l’interprétation. La référence est une image simple de votre personnage : de face, cadré épaules, sur fond neutre, sans décor qui distrait.

La ligne qui change tout

Joindre une référence a un effet pervers : le modèle a tendance à recopier toute l’image, fond gris et cadrage compris. Chaque prompt de scène commence donc par cette ligne, en capitales :

À placer en tête de chaque prompt de scène
USE THE REFERENCE IMAGE FOR FACE IDENTITY ONLY. DO NOT REPLICATE THE BACKGROUND, FRAMING, LIGHTING, OR CAMERA ANGLE FROM THE REFERENCE.

Sans référence : trouver le visage d’abord

Si vous partez de zéro, ne cherchez pas le visage parfait du premier coup. Générez un lot large, sans contrainte de décor, à partir du seul bloc d’identité. Gardez-en deux ou trois, pas un : un visage qui paraît idéal en image fixe s’effondre parfois une fois animé (expression figée, sourire qui déforme la mâchoire). Testez l’animation, puis choisissez.

Jamais le visage de quelqu’un d’autre. N’utilisez pas la photo d’une personne réelle sans son accord écrit, et ne cherchez pas à ressembler à une célébrité. Un avatar généré de toutes pièces vous appartient ; un visage emprunté vous expose.

Verrou 3 : le bloc voix

C’est la pièce que personne ne devine, et celle qui décide. Un spectateur pardonne un léger changement de lumière ; il ne pardonne pas une voix qui change. Le bloc voix est le jumeau sonore du bloc d’identité : écrit une fois, recopié mot pour mot dans chaque prompt vidéo parlé.

Exemple de bloc voix
VOICE: native French speaker from Paris, natural metropolitan French accent (not Canadian, not Belgian). Man in his late twenties, warm medium-low voice, slightly husky. Speaks at the pace of a voice note to a close friend: relaxed, small natural pauses, no rush. No vocal fry, no influencer cadence, no news-presenter voice, no radio announcer tone.

Ce qu’il doit nommer

  • La langue et la région précise. « Français » ne suffit pas : le modèle peut choisir un accent québécois ou belge. « Accent parisien métropolitain » ferme la porte.
  • L’âge et le timbre. Grave, médium, légèrement voilé.
  • Le débit, comparé à une situation réelle. « Comme un message vocal à un ami » est plus parlant pour le modèle que « vitesse moyenne ».
  • Les interdits. Pas de voix traînante en fin de phrase, pas de cadence d’influenceur, pas de voix de présentateur. C’est ce qui sépare une UGC d’une publicité radio.

La seule chose qui varie : l’acoustique

D’une scène à l’autre, on ajoute à la fin du bloc une seule phrase, celle du lieu. Une voix sans écho dans une salle de bain sonne faux ; une voix de studio dans une rue aussi.

Choisir les décors sans que la série se répète

Une fois la personne verrouillée, tout l’intérêt est de la promener. Les décors se choisissent par famille plutôt qu’un par un : ce qu’on décide vraiment, c’est un registre — intime, extérieur, voiture. Règle d’or : jamais deux scènes de la même famille d’affilée.

Intime / miroir
Intime / miroir

Salle de bain, selfie miroir, routine du matin. Le registre le plus proche.

Maison
Maison

Cuisine, canapé, chambre. Le produit dans la vraie vie.

Extérieur jour
Extérieur jour

Terrasse, rue, toit. De l’air et de la lumière naturelle.

Voiture
Voiture

Côté passager, garé. Le décor UGC par excellence.

Sport
Sport

Selfie après l’entraînement. Énergie et sincérité.

Sortie
Sortie

Café, restaurant, soirée. Le produit dans un moment social.

Faites aussi varier l’échelle : gros plan, buste, plan en pied. Le décor et le cadrage changent ; la personne, jamais.

Animer et faire parler l’avatar

Une image ne suffit pas : l’UGC vit en vidéo. Il y a deux façons de donner vie à l’avatar, qui répondent à deux besoins différents.

Un plan muet : un seul geste

Pour les plans sans parole, la règle est celle de toute animation : un seul geste, et ce qui ne bouge pas. Voici le prompt réel de la scène en terrasse.

Prompt d’animation · terrasse
A handsome man sits at a Parisian cafe terrace, marble bistro table in front of him. Slow gentle push-in camera movement toward him. He picks up the espresso cup from the table with one hand, brings it to his lips, and takes a slow unhurried sip while looking slightly off to the side, then lowers the cup back down onto the saucer with a soft clink. Natural relaxed body language, no rush. Warm late afternoon sunlight, dappled shade from the red awning, realistic soft shadows. Ultra-realistic, natural skin texture, real phone camera look, mild grain. Silent, no dialogue, no added music.

Un plan parlé : le bloc voix va dans le prompt vidéo

C’est l’erreur la plus fréquente : écrire la voix dans le prompt de l’image. L’image n’a pas de son ; le bloc voix appartient au prompt vidéo, avec la phrase à prononcer, entre guillemets, dans la langue voulue.

Exemple · scène parlée en voiture
Handheld selfie video, phone at arm's length, the man from the reference image sitting in the passenger seat of a parked car, holding an iced coffee can. He looks into the lens and says, in French: « Trois choses que j'aurais aimé savoir avant de faire mon café glacé maison. » Small natural head nods, one hand gesture.

VOICE: native French speaker from Paris, natural metropolitan French accent (not Canadian, not Belgian). Man in his late twenties, warm medium-low voice, slightly husky. Speaks at the pace of a voice note to a close friend: relaxed, small natural pauses, no rush. No vocal fry, no influencer cadence, no news-presenter voice, no radio announcer tone. Natural car interior acoustics, muffled street sounds outside.

No background music, no voice-over, no subtitles, no on-screen text.

Avec un avatar HeyGen, le verrou de voix prend une autre forme : on choisit une voix dans la bibliothèque (ou on importe son propre audio) et on garde exactement la même pour toute la série. Pour aller plus loin sur les voix, voir pourquoi une voix IA sonne robotique.

Construire une vidéo de 30 à 60 secondes

Une UGC longue n’est pas un plan de soixante secondes : c’est une suite de tranches, chacune avec son propre objectif. Sans ce découpage, on répète quatre fois la même structure accroche-démo-appel, et le spectateur part au milieu.

  1. L’accroche et le contexte

    Le moment le plus accrocheur, dès la première seconde. Le produit peut apparaître, mais pas de discours de vente.

  2. L’usage

    Le produit ouvert, appliqué, montré. On explique ce que c’est et à quoi ça sert.

  3. La preuve

    Un résultat crédible, une démonstration, une objection courante et sa réponse, une astuce.

  4. La conclusion et l’appel

    Le produit intégré au quotidien, puis une recommandation décontractée.

Chaque tranche se génère séparément, puis on monte bout à bout. Même personnage, même lieu, même lumière et même bloc voix dans toutes : c’est ce qui donne l’impression d’une seule prise filmée par la même personne. Pour le montage et les sous-titres, voir comment monter et sous-titrer une vidéo IA.

3verrous : identité, référence, voix
7blocs par prompt, beauté en premier
4tranches pour une vidéo longue
60 sde prise parlée d’un seul tenant avec HeyGen

Ce qui tue une UGC générée

  • L’éclairage de studio. Personne ne filme sa routine du matin sous trois softbox.
  • Une peau sans pores. Le filtre beauté est la signature d’une image générée sans soin.
  • Des mains impossibles, un produit qui flotte, une étiquette déformée.
  • Une musique de fond ou une voix off ajoutée par le modèle : précisez toujours « no background music, no voice-over ».
  • Du texte à l’écran généré dans l’image : les sous-titres s’ajoutent au montage, jamais dans le prompt.
  • Le langage d’influenceur. « Game changer », « je suis obsédée », « franchement incroyable » : le spectateur reconnaît ces tics en une seconde.
  • Un bloc d’identité réécrit en cours de route. Un adjectif de plus, et c’est quelqu’un d’autre.

Le cadre : un avatar n’est pas un client

C’est le point qu’on ne peut pas contourner. Une UGC classique tire sa force du fait qu’une vraie personne a vraiment utilisé le produit. Un avatar IA, par définition, ne l’a pas fait. Lui faire raconter une expérience vécue (« j’ai testé pendant un mois, ma peau a changé ») revient à fabriquer un faux témoignage.

En Europe, la réglementation sur les pratiques commerciales déloyales interdit de se faire passer pour un consommateur et de diffuser de faux avis. Aux États-Unis, la FTC interdit depuis 2024 les faux témoignages, y compris ceux générés par IA. L’AI Act impose en outre, depuis août 2026, de signaler certains contenus synthétiques représentant des personnes, et les plateformes publicitaires ont leurs propres règles d’étiquetage.

Ce qu’un avatar peut faire

  • Présenter le produit, comme le ferait un animateur.
  • Démontrer son usage, étape par étape.
  • Expliquer sa composition, son fonctionnement, ses limites.
  • Répondre aux questions fréquentes des clients.

Ce qu’il ne doit pas faire

  • Prétendre être un client, ou avoir utilisé le produit.
  • Annoncer un résultat personnel (« j’ai perdu », « ma peau a changé »).
  • Ressembler délibérément à une personne réelle.

Le détail des obligations est dans ce que l’AI Act change pour vos créations. Bonne nouvelle : le format « présentateur » fonctionne très bien, précisément parce qu’il garde le ton et le décor de l’UGC sans mentir sur qui parle.

Automatiser : l’avatar depuis votre assistant IA

Toute cette méthode est disponible dans le connecteur MCP de ToolAcces, sous la forme d’une commande : avatar-ugc. Vous décrivez le personnage en une phrase (« homme de 28 ans, brun, univers café ») ; l’assistant écrit le bloc d’identité et vous le soumet, puis le bloc voix, choisit des décors sans jamais répéter une famille, ordonne chaque prompt dans le bon sens, et annonce le coût avant de lancer.

Si vous avez une image de référence, il l’importe une fois et la joint à chaque génération, avec la ligne en capitales en tête de prompt. Tout est expliqué dans notre dossier sur le MCP, et la même logique de verrou appliquée aux produits est détaillée dans la campagne de douze visuels cohérents.

Questions fréquentes

Parce que chaque génération repart de zéro et réinterprète votre description. Si la description de la personne varie, même d'un mot, ou si elle est mêlée au décor, le modèle recompose un visage légèrement différent. Le bloc d'identité, recopié à l'identique, et l'image de référence jointe à chaque génération suppriment l'essentiel de cette dérive.

Avec un bloc voix recopié mot pour mot dans chaque prompt vidéo : langue et région, âge, timbre, débit, interdits. Seule l'acoustique du lieu change. Si vous passez par un avatar parlant avec une voix de synthèse, choisissez une voix une fois pour toutes et ne la changez plus.

Non. Faire passer un personnage généré pour un consommateur qui a réellement utilisé le produit est une pratique commerciale trompeuse, et les faux témoignages sont explicitement visés en Europe comme aux États-Unis. Un avatar IA peut présenter, démontrer, expliquer ; il ne doit pas inventer une expérience vécue.

Un modèle vidéo génère des plans de 5 à 10 secondes environ. Une vidéo de 30 à 60 secondes se construit en tranches montées bout à bout, chacune avec son objectif. Pour une prise parlée d'un seul tenant, l'avatar HeyGen du Studio va jusqu'à 60 secondes.

Non, et c'est même préférable de s'en passer : on génère d'abord un lot de visages, on en retient un, et c'est cette image qui sert de référence. N'utilisez jamais le visage d'une personne réelle sans son accord écrit, ni un visage qui ressemble délibérément à une célébrité.

Parce que l'UGC doit ressembler à ce que les gens filment eux-mêmes : objectif grand angle, légère déformation de perspective, cadrage à bout de bras. Cette mention tire le rendu vers un selfie crédible plutôt que vers une photo de studio, qui trahit immédiatement la publicité.

Pour aller plus loin