Tu te demandes comment faire des vidéos sans se filmer, et la bonne nouvelle, c'est que la caméra n'a jamais été l'outil le plus important.

Je m'appelle Jean-Charles Salvin, et je construis des automatisations IA pour des entrepreneurs qui veulent des résultats sans devenir des techniciens.

Pendant des années, produire une vidéo signifiait la même chose pour tout le monde : un studio, une caméra, un monteur et un budget.

La version moderne ressemble à un jeu de Lego numérique, où chaque brique IA remplace un poste de production entier.

Prends le cas de Baptiste et Chloé, un cabinet de gestion de patrimoine qui accompagne des expatriés francophones et anglophones.

Leur réalité ressemblait à celle de la plupart des cabinets : trop de travail, zéro studio, pas de caméra et une peur panique de l'accent en anglais.

Leur alternative classique consistait à payer 500 € par podcast sponsorisé, avec l'espoir que la crédibilité finisse par arriver.

Aujourd'hui, ils publient des vidéos courtes chaque semaine avec un pipeline 100 % IA, sans jamais allumer une caméra.

Dans cet article, je vais t'expliquer comment ils font, avec les contrastes qui changent tout.

Pourquoi la production vidéo classique bloque les cabinets comme le leur

La production classique commence par une liste d'achats qui ne finit jamais.

Un micro à 300 €, une caméra à 800 €, un éclairage, un fond, puis le temps de tout apprendre.

Le vrai problème ne vient pas du matériel, il vient du temps qu'il faut pour produire une seule vidéo.

Tourner, monter, sous-titrer, exporter, tout cela peut occuper une journée entière pour trente secondes de contenu.

Quand tu gères un cabinet de gestion de patrimoine, tu n'as pas une journée à sacrifier pour une vidéo.

Baptiste et Chloé ajoutaient à cela une barrière invisible, la peur de parler anglais avec un accent français.

Ils savaient que leur audience anglophone attendait du contenu, mais la perspective du tournage les paralysait.

Le résultat était prévisible, aucune publication régulière et une dépendance totale au bouche-à-oreille.

Le paradoxe est cruel, le contenu vidéo est le canal le plus puissant pour leur métier, et ils étaient bloqués avant même de commencer.

Qu'est-ce qui change quand on remplace le studio par un pipeline IA ?

La première différence tient dans la manière de penser la production.

Au lieu d'acheter du matériel, tu construis une chaîne d'outils qui produisent ensemble.

Au lieu de réserver une journée de tournage, tu lances un processus de 45 minutes.

Au lieu de prier pour que l'accent passe, tu utilises une voix clonée qui parle parfaitement les deux langues.

Le pipeline que j'ai installé chez Baptiste et Chloé tient en sept briques, chacune avec un rôle unique.

Le sourcing trouve les idées qui font débat chez les expatriés.

Le scripting transforme une idée en script de 20 à 30 secondes.

La voix clonée avec ElevenLabs parle dans les deux langues avec le timbre de Baptiste.

L'avatar HeyGen apparaît à l'écran en 9:16 et bouge de façon naturelle.

Le B-roll généré par SeaDream illustre chaque plan.

Le montage avec CapCut et Submagic assemble tout avec des sous-titres dynamiques.

La conversion avec ManyChat transforme chaque vue en prospect.

Chaque brique fait une seule chose, et l'ensemble tourne sans intervention humaine lourde.

C'est le contraste entre un studio à 10 000 € et un pipeline à quelques dizaines d'euros par mois.

D'où viennent les idées qui font décoller une chaîne vidéo sans caméra ?

La plupart des gens se trompent sur le point de départ, ils cherchent l'inspiration dans leur tête.

Moi, je cherche des concepts qui ont déjà déclenché des réactions sur les plateformes.

J'utilise Virlo pour repérer les tendances qui montent sur les réseaux, avant qu'elles ne soient saturées.

Pour un cabinet d'expatriés, les sujets qui marchent sont le doute fiscal, les comparaisons financières et l'actualité des visas.

Ensuite, je connecte Claude ou ChatGPT à un Google Drive ou à Supabase pour construire une librairie d'idées.

Chaque concept est prêt à devenir un script en quelques secondes, avec son angle et son titre.

La règle reste simple, une idée qui ne provoque pas de débat ne mérite pas de vidéo.

Le doute et la provocation légère sont les deux leviers qui arrêtent le pouce qui défile.

Baptiste et Chloé ne manquent plus jamais d'idées, ils ont désormais trop de concepts et pas assez de semaines.

Comment écrire un script de 30 secondes qui retient l'attention ?

Le script est le cœur de la vidéo, car rien ne peut sauver un contenu ennuyeux.

Un format court se joue en 5 à 8 lignes maximum, soit 20 à 30 secondes de lecture.

Je structure chaque script en trois moments, un hook clivant, de la valeur, puis un CTA mot-clé.

Le hook doit créer une tension immédiate, comme une question qui bouscule une certitude.

La valeur répond au problème que le spectateur reconnaît en quelques secondes.

Le CTA mot-clé prépare la conversion, par exemple le mot « EXPAT » à la fin de la vidéo.

Je fais découper le script par Claude en tranches de 3 à 4 secondes pour préparer le storyboard.

Chaque tranche devient un plan visuel précis, ce qui évite toute improvisation au montage.

Un script de 30 secondes demande plus de travail qu'un long format, car chaque mot doit mériter sa place.

Une voix qui ressemble à la vôtre, sans studio ni micro professionnel

La voix est ce qui crée la confiance, car le spectateur a besoin d'entendre une personne cohérente.

Je commence par enregistrer trois textes de 20 minutes chacun, riches en phonétique, sur Audacity.

Ces échantillons entraînent le modèle Multilingual v2 d'ElevenLabs à reproduire ta voix.

Le modèle apprend ton débit, ton timbre et tes intonations, puis il lit n'importe quel script à ta place.

L'export se fait en MP3 à 192 kbps, un bon compromis entre qualité et légèreté.

La magie apparaît quand Baptiste doit parler anglais, la voix clonée prononce parfaitement sans accent français.

Cette brique a levé le blocage le plus profond du cabinet, celui qui empêchait toute publication anglophone.

Tu enregistres une fois pour toujours, et chaque vidéo suivante réutilise la même voix.

Un avatar qui parle à votre place, sans jamais poser devant une caméra

L'avatar est le visage de la vidéo, celui qui regarde le spectateur à travers l'écran.

Je capture 30 secondes de webcam avec une gestuelle naturelle et des expressions variées.

HeyGen apprend ces mouvements et génère un avatar qui parle en format vertical 9:16.

La synchronisation avec la voix ElevenLabs se fait automatiquement, sans réglage manuel.

Baptiste et Chloé possèdent chacun leur avatar, un pour chaque marché linguistique.

L'avatar ne remplace pas leur présence en rendez-vous, il remplace uniquement l'étape de tournage.

La capture initiale prend une demi-heure, puis chaque vidéo réutilise l'avatar sans nouvelle prise.

C'est le contraste entre le tournage à répétition et la capture unique, tout le gain de temps se joue ici.

Le B-roll qui rend une vidéo vivante, sans tourner une seule image

Une vidéo avec un seul avatar qui parle devient vite monotone, même avec un bon script.

Le B-roll apporte les images qui illustrent le propos et rythment la vidéo.

SeaDream 5.0 génère les images à partir de prompts écrits automatiquement par l'IA.

SeaDream 2.5 anime ces images en plans de 4 secondes, parfaitement adaptés au format court.

Les prompts visuels naissent du script, donc je ne décris jamais les images à la main.

Pour un sujet de patrimoine, le B-roll montre des graphiques, des immeubles ou des drapeaux.

Le mélange entre l'avatar et le B-roll donne une vidéo professionnelle, loin d'un simple diaporama.

Le montage que personne ne remarque, parce qu'il est entièrement automatisé

Le montage est la brique qui effraie le plus les entrepreneurs, et c'est justement celle qu'on automatise.

J'utilise un layout écran splité, le B-roll en haut et l'avatar en bas.

Submagic génère des sous-titres dynamiques placés au centre de l'écran.

Les sous-titres captent les spectateurs qui regardent sans le son, majoritaires sur mobile.

La musique de fond, créée avec Suno ou Epidemic, est réglée à -20 dB pour ne pas couvrir la voix.

Le montage complet d'une vidéo de 30 secondes prend environ 8 minutes.

CapCut conserve les templates, donc chaque nouvelle vidéo se monte encore plus vite.

Tu n'as jamais besoin d'ouvrir une timeline complexe, l'outil fait le travail à ta place.

La conversion automatisée, du mot-clé dans la vidéo jusqu'à l'email dans la boîte

Une vidéo qui génère des vues mais pas de leads reste un divertissement, pas un actif commercial.

Le CTA mot-clé est intégré dans la vidéo, comme le mot « EXPAT » prononcé à la fin.

Quand un spectateur écrit ce mot en commentaire ou en message privé, ManyChat réagit automatiquement.

ManyChat envoie un message privé avec le lien vers un guide gratuit hébergé sur Gumroad.

Le guide capte l'adresse email du prospect, et le cabinet construit une liste de contacts qualifiés.

Si une vidéo performe bien, j'active une amplification à 10 € par jour pour accélérer la distribution.

Le contraste est saisissant, 500 € pour un podcast sans garantie contre 10 € par jour pour un levier mesurable.

Baptiste et Chloé ont transformé chaque vidéo en machine à collecter des emails.

👉 Rejoins la communauté JCBuildsAI — $37/mois

Voici comment faire des vidéos sans se filmer avec un simple ordinateur

La différence ne se joue pas sur la qualité, elle se joue sur la régularité et le coût.

Un studio classique te permet de produire une belle vidéo de temps en temps.

Un pipeline IA te permet de produire une bonne vidéo chaque semaine, sans y penser.

La régularité bat la perfection dans tous les algorithmes de recommandation.

Baptiste et Chloé publient désormais sur les deux marchés, sans barrière de langue ni blocage technique.

Le trafic organique s'installe progressivement, et les leads arrivent sans publicité permanente.

Le bouche-à-oreille cesse d'être le seul moteur de croissance du cabinet.

Le même pipeline fonctionne pour un coach, un avocat ou une agence, il suffit d'adapter les thématiques.

J'ai décrit chaque outil du processus, et tu peux reproduire le même système dès cette semaine.

👉 Rejoins la communauté JCBuildsAI — $37/mois

FAQ : les questions que l'on me pose sur les vidéos créées avec l'IA

Est-ce que les spectateurs remarquent qu'une vidéo est créée par IA ?

La plupart des spectateurs ne remarquent rien quand le pipeline est bien réglé.

L'avatar, la voix clonée et le B-roll forment un ensemble cohérent et naturel.

Ce qui compte vraiment, c'est la valeur du contenu, car un script utile retient l'attention.

Les clients de Baptiste et Chloé n'ont jamais remis en cause l'authenticité des vidéos.

Combien de temps faut-il pour produire une vidéo avec ce pipeline ?

Une fois le pipeline installé, chaque vidéo se produit en 45 minutes chronométrées.

La première mise en place demande environ deux jours pour les échantillons de voix et l'avatar.

Cette installation initiale se rentabilise dès la dixième vidéo publiée.

Faut-il des compétences techniques pour utiliser ElevenLabs et HeyGen ?

Non, les outils sont conçus pour des entrepreneurs sans compétences techniques.

On enregistre des échantillons, on valide des rendus et on laisse l'IA faire le reste.

La seule compétence nécessaire reste la capacité à choisir un bon sujet.

Le clone vocal fonctionne-t-il vraiment en anglais pour une audience anglophone ?

Oui, le modèle Multilingual v2 d'ElevenLabs prononce l'anglais avec le timbre de la voix originale.

C'est exactement le cas de Baptiste et Chloé qui publient pour des expatriés anglophones.

La peur de l'accent disparaît, et la crédibilité du cabinet reste intacte.

Combien coûte ce pipeline vidéo IA par mois ?

Le coût mensuel reste très inférieur à celui d'un studio ou d'un podcast sponsorisé.

Les abonnements ElevenLabs, HeyGen, SeaDream et CapCut représentent quelques dizaines d'euros.

L'amplification Ads à 10 € par jour ne s'active que lorsque la vidéo performe déjà.

Le contraste avec les 500 € d'un podcast classique parle de lui-même.

🤖 Vous préférez déléguer ? Mon agence Botlib installe des agents IA clé en main dans votre entreprise. → Découvrir Botlib

📞 Besoin d'aide pour mettre en place l'IA ? Réservez un appel gratuit 👉

👉 Rejoins la communauté JCBuildsAI — $37/mois

À propos de Jean-Charles

Je suis Jean-Charles Salvin — fondateur de JCBuildsAI, une communauté Skool dédiée à l'IA et l'automation (41+ membres). J'aide les entrepreneurs francophones à maîtriser l'IA pour automatiser leur business et générer des revenus.

  • Communauté active avec formations pas à pas
  • Accès à tous les outils et templates
  • Coaching et support quotidien
  • Mises à jour régulières

→ Rejoins la communauté JCBuildsAI

Aussi sur notre réseau

📺 Notes et ressources de la vidéo 👉

🆓 Formation IA gratuite + communauté 👉

Maintenant que tu sais comment faire des vidéos sans se filmer, il ne te reste plus qu'à lancer ta première vidéo cette semaine.