Créer une vidéo à partir d'une phrase : ce qui a changé en 2026
Il y a deux ans, générer une vidéo par intelligence artificielle donnait des résultats étranges : des mains à six doigts, des visages qui fondaient d'une image à l'autre, des mouvements de caméra impossibles. Les modèles de 2026 ont franchi un cap que l'on n'attendait pas si vite. Les personnages gardent leur apparence d'un plan à l'autre, la lumière se comporte comme dans le monde réel, l'eau, la fumée et les tissus bougent comme ils le devraient, et le son est généré en même temps que l'image : pas, vent, moteur, ambiance de ville.
Ce générateur s'appuie sur cinq de ces modèles de dernière génération : Seedance 1.0 Fast et Seedance 2.0 Fast de ByteDance, Grok Imagine, Wan 3.0 d'Alibaba et Kling 2.6, qui anime une image. Vous écrivez une phrase dans votre langue ; elle est traduite et enrichie de ce qu'un modèle vidéo attend (caméra, lumière, mouvement), puis envoyée au modèle choisi. Quelques minutes plus tard, vous téléchargez un MP4 en 720p, avec le son quand le modèle le produit, sans filigrane.
Ce guide explique comment fonctionne un modèle de vidéo, comment écrire une description qui donne le résultat que vous avez en tête, ce que valent les formats et les styles proposés, et comment fonctionnent les crédits des formules mensuelles.
Comment un modèle transforme du texte en vidéo
Un modèle de génération vidéo ne « filme » rien : il apprend, sur des millions de vidéos décrites, la relation entre des mots et des séquences d'images. Quand vous lui donnez une description, il part d'un bruit aléatoire et le débruite progressivement, image par image et surtout dans le temps, pour converger vers une séquence cohérente avec le texte. C'est le même principe que la génération d'images, avec une dimension de plus : la continuité entre les images successives.
Cette continuité temporelle est ce qui distingue un bon modèle d'un mauvais. Un modèle faible produit des images belles mais indépendantes, et la vidéo tremble ou change de sujet. Un modèle récent raisonne sur toute la séquence à la fois : le renard qui traverse la forêt reste le même renard, l'ombre suit la lumière, la caméra glisse sans à-coup. C'est pour cette raison que nous n'utilisons que des modèles du dernier trimestre, et que nous les remplacerons dès qu'un meilleur sortira.
Le son suit la même logique : le modèle génère une piste audio cohérente avec ce qu'il montre. Une vague produit un souffle, une rue de nuit un fond de circulation lointaine, un feu de cheminée son crépitement. Ce n'est pas une musique de bibliothèque ajoutée après coup, c'est une ambiance calculée pour la scène, ce qui donne aux clips un réalisme que l'image seule n'a pas.
Écrire une description qui fonctionne
La qualité de votre vidéo dépend d'abord de votre description. Le modèle est très bon pour inventer les détails que vous ne précisez pas, mais il ne peut pas deviner ce que vous avez en tête. Une phrase comme « un chat » donne un chat quelconque dans un décor quelconque ; « un chat roux endormi sur un rebord de fenêtre, rideau qui bouge avec le vent, lumière dorée de fin d'après-midi » donne exactement cette scène.
Pensez comme un réalisateur qui décrit un plan à son équipe. Il y a quatre éléments à couvrir : le sujet et ce qu'il fait, le décor, la lumière ou le moment de la journée, et le mouvement de caméra. Vous n'êtes pas obligé de tous les donner, mais chacun réduit l'aléa. Le mouvement de caméra est le plus souvent oublié, et c'est celui qui change le plus le rendu : « la caméra avance lentement », « vue de drone qui descend », « gros plan fixe », « travelling latéral ».
Évitez les listes de mots-clés à la mode des générateurs d'images de 2023 : « 8k, ultra détaillé, chef-d'œuvre » n'apporte rien à un modèle vidéo et occupe la place d'une vraie information. Évitez aussi de demander deux actions contradictoires en cinq secondes, ou une scène qui change de lieu : un clip court raconte un seul instant. Si vous avez une histoire en trois moments, faites trois vidéos.
Enfin, écrivez en français, naturellement. Notre serveur traduit votre description en anglais, la langue dans laquelle les modèles sont les plus précis, et y ajoute les indications de style que vous avez choisies. Vous n'avez rien à faire de plus, et vous pouvez relire le prompt utilisé sous chaque vidéo pour comprendre ce qui a fonctionné.
- Un sujet, une action : « une femme court sur une plage » plutôt que « une femme court puis nage puis rentre »
- Le décor et l'heure : « ruelle de Lisbonne, tôt le matin, sol encore mouillé »
- Le mouvement de caméra : « la caméra tourne lentement autour du sujet »
- L'ambiance : « brume légère, couleurs douces, silence »
- Ce qu'il ne faut pas : pas de texte à l'écran, pas de logo, pas de personne réelle nommée
Formats, durées et styles : que choisir
Le format dépend de l'endroit où la vidéo sera vue. Le paysage 16:9 est le format naturel de YouTube, d'un site web ou d'une présentation. Le portrait 9:16 est celui de TikTok, des Reels Instagram et des Shorts : si votre vidéo est destinée à un téléphone, choisissez-le d'emblée plutôt que de recadrer après, le modèle compose la scène pour le format demandé. Le carré 1:1 convient aux publications Instagram classiques, aux avatars animés et aux vignettes.
La durée standard est de cinq secondes, ce qui correspond à un plan de film ou à un clip de réseau social : assez long pour qu'une action se déroule, assez court pour rester net. La version dix secondes utilise deux fois plus de crédits et convient aux scènes où quelque chose doit se construire, comme un lever de soleil ou une caméra qui découvre progressivement un lieu. Pour un montage, cinq secondes par plan est le bon rythme.
Les styles sont des indications ajoutées à votre description. « Réaliste » vise le rendu d'une caméra de cinéma, « Cinéma » ajoute une image plus contrastée et des mouvements lents, « Anime » applique le trait et les couleurs de l'animation japonaise, « 3D » donne un rendu de film d'animation, « Drone » cadre en plan large aérien, « Vintage » ajoute le grain et les couleurs d'une pellicule d'époque. Vous pouvez ne rien choisir : le modèle interprète alors librement votre description.
Le modèle compte autant que le style. Seedance 1.0 Fast est le plus rapide et le moins cher, sans son, parfait pour essayer une idée. Grok Imagine donne des scènes vivantes et expressives, avec le son. Wan 3.0 suit de près les descriptions longues. Seedance 2.0 Fast est notre modèle le plus réaliste, pour les visages et les mouvements naturels. Kling 2.6 part de votre propre image, une photo ou un dessin, et lui donne vie : la vidéo prend le format de l'image.
Ce que vous pouvez faire de vos vidéos
Les vidéos générées vous appartiennent et sont livrées sans filigrane, en MP4 lisible partout. Vous pouvez les publier sur les réseaux sociaux, les intégrer à une présentation ou un site, les utiliser dans un montage ou une publicité. Les usages les plus fréquents chez nos utilisateurs : des fonds animés pour des vidéos TikTok ou YouTube, des visuels de produits pour une boutique en ligne, des illustrations animées pour un cours ou une formation, des plans d'ambiance pour un court-métrage, et des cadeaux personnalisés.
Chaque vidéo a une page de partage avec un lien court, un aperçu qui s'affiche correctement sur WhatsApp, Messenger, X ou Discord, et le prompt utilisé pour que ceux qui la reçoivent puissent créer la leur. Cette page n'est pas référencée par les moteurs : seules les personnes à qui vous envoyez le lien peuvent la voir.
Les fichiers sont conservés trente jours sur nos serveurs, le temps de les télécharger et de les utiliser, puis effacés : nous ne constituons pas de bibliothèque de vos créations. Téléchargez ce qui compte. Une vidéo effacée ne peut pas être régénérée à l'identique, chaque génération est unique.
Pourquoi des crédits, dans une formule mensuelle
Une vidéo coûte réellement de l'argent à produire : quelques dizaines de centimes de calcul sur des cartes graphiques spécialisées, cent fois plus qu'un message de chat. Une formule sans plafond à petit prix serait un mensonge, comme chez ceux qui la vendent en ralentissant la file d'attente dès que vous l'utilisez vraiment. Nous préférons un système simple et honnête : des crédits qui correspondent au coût réel de chaque vidéo, affichés sur chaque option avant que vous cliquiez.
Chaque formule comprend un nombre de crédits par mois : la première, 9,99 € par mois, donne 400 crédits ; celle de 1 000 crédits est la plus choisie par ceux qui publient chaque semaine ; celle de 2 000 crédits s'adresse aux projets et aux professionnels. Une vidéo de 5 secondes utilise de 11 à 70 crédits selon le modèle, affichés avant le clic, et dix secondes deux fois plus. Les crédits sont renouvelés à chaque prélèvement ; ceux que vous n'utilisez pas expirent à la fin du mois.
Sans engagement : vous changez de formule ou résiliez en un clic depuis « Mon compte », la résiliation prend effet à la fin du mois payé, et plus rien n'est prélevé. Vous pouvez tout regarder sans compte : les exemples, les prix, ce guide ; le compte gratuit n'intervient qu'au moment de créer ou de vous abonner.
Les limites, dites franchement
La génération vidéo en 2026 est impressionnante, pas parfaite. Les textes à l'écran sont souvent illisibles : si vous avez besoin d'un titre, ajoutez-le ensuite dans un logiciel de montage. Les mains restent le point faible de tous les modèles dans les scènes de gros plan. Les scènes très complexes, avec beaucoup de personnages qui interagissent, peuvent perdre en cohérence. Et le modèle interprète : deux générations de la même description donneront deux vidéos différentes, ce qui est aussi ce qui rend la chose amusante.
Certaines demandes sont refusées avant toute génération, sans consommer de crédit : contenus sexuels, violence explicite, personnes réelles identifiables, mineurs dans des situations inappropriées, incitation à la haine. Ce sont les règles des modèles que nous utilisons et les nôtres. Quand une description est refusée, le message vous le dit clairement et vous pouvez la reformuler.
Si une génération échoue pour une raison technique, le crédit est remboursé automatiquement et immédiatement ; vous n'avez rien à demander. Le temps de génération annoncé est une médiane réelle des dernières vidéos produites, pas une promesse commerciale : il varie selon la charge des serveurs, et nous préférons vous dire « environ 90 secondes » et tenir plutôt que « instantané » et décevoir.
Conseils pour aller plus loin
Travaillez par variations. Une première génération vous montre comment le modèle comprend votre description ; la seconde, avec un ou deux mots changés, est presque toujours meilleure. Votre description reste dans le champ après chaque vidéo : l'itération est immédiate. Les créateurs les plus efficaces produisent trois versions d'un plan et gardent la meilleure, plutôt que de chercher la description parfaite du premier coup.
Pour un montage, générez tous vos plans dans le même format et le même style, en décrivant la même lumière : le résultat aura une unité visuelle que les spectateurs sentent sans pouvoir l'expliquer. Alternez les valeurs de plan comme au cinéma, un plan large pour situer, un plan moyen pour l'action, un gros plan pour l'émotion.
Et regardez les exemples en haut de cette page avec leur description exacte : ce sont de vraies vidéos produites par ce générateur, sans sélection cosmétique. Cliquer sur l'une d'elles copie sa description dans le champ ; changez le sujet, gardez la structure, et vous avez un point de départ solide.