Crear un vídeo a partir de una frase: lo que cambió en 2026
Hace dos años, generar un vídeo con inteligencia artificial daba resultados extraños: manos de seis dedos, caras que se derretían de un fotograma a otro, movimientos de cámara imposibles. Los modelos de 2026 han dado un salto que nadie esperaba tan pronto. Los personajes conservan su aspecto de un plano a otro, la luz se comporta como en el mundo real, el agua, el humo y las telas se mueven como deben, y el sonido se genera a la vez que la imagen: pasos, viento, motores, ambiente de ciudad.
Este generador se basa en cinco de esos modelos de última generación: Seedance 1.0 Fast y Seedance 2.0 Fast de ByteDance, Grok Imagine, Wan 3.0 de Alibaba y Kling 2.6, que anima una imagen. Escribes una frase en tu idioma; se traduce y se enriquece con lo que un modelo de vídeo necesita (cámara, luz, movimiento) y se envía al modelo elegido. Unos minutos después, descargas un MP4 en 720p, con sonido cuando el modelo lo genera, sin marca de agua.
Esta guía explica cómo funciona un modelo de vídeo, cómo escribir una descripción que dé el resultado que tienes en mente, qué ofrecen los formatos y los estilos, y cómo funcionan los créditos de los planes mensuales.
Cómo un modelo convierte texto en vídeo
Un modelo de generación de vídeo no «filma» nada: aprende, a partir de millones de vídeos descritos, la relación entre las palabras y las secuencias de imágenes. Cuando le das una descripción, parte de un ruido aleatorio y lo va limpiando poco a poco, fotograma a fotograma y sobre todo en el tiempo, hasta converger en una secuencia coherente con el texto. Es el mismo principio que la generación de imágenes, con una dimensión más: la continuidad entre fotogramas sucesivos.
Esa continuidad temporal es lo que separa un buen modelo de uno malo. Un modelo débil produce imágenes bonitas pero independientes, y el vídeo tiembla o cambia de tema. Un modelo reciente razona sobre toda la secuencia a la vez: el zorro que cruza el bosque sigue siendo el mismo zorro, la sombra sigue a la luz, la cámara se desliza sin tirones. Por eso solo usamos modelos del último trimestre, y los sustituiremos en cuanto salga uno mejor.
El sonido sigue la misma lógica: el modelo genera una pista de audio coherente con lo que muestra. Una ola produce un rumor, una calle de noche un fondo de tráfico lejano, una chimenea su crepitar. No es música de biblioteca añadida después, es un ambiente calculado para la escena, lo que da a los clips un realismo que la imagen sola no tiene.
Escribir una descripción que funcione
La calidad de tu vídeo depende ante todo de tu descripción. El modelo es muy bueno inventando los detalles que no precisas, pero no puede adivinar lo que tienes en mente. Una frase como «un gato» da un gato cualquiera en un decorado cualquiera; «un gato pelirrojo dormido en el alféizar de una ventana, cortina que se mueve con el viento, luz dorada de media tarde» da exactamente esa escena.
Piensa como un director que describe un plano a su equipo. Hay cuatro elementos que cubrir: el sujeto y lo que hace, el decorado, la luz o el momento del día, y el movimiento de cámara. No tienes por qué darlos todos, pero cada uno reduce el azar. El movimiento de cámara es el que más se olvida, y el que más cambia el resultado: «la cámara avanza lentamente», «vista de dron que desciende», «primer plano fijo», «travelling lateral».
Evita las listas de palabras clave de moda en los generadores de imágenes de 2023: «8k, ultra detallado, obra maestra» no aporta nada a un modelo de vídeo y ocupa el lugar de información real. Evita también pedir dos acciones contradictorias en cinco segundos, o una escena que cambie de lugar: un clip corto cuenta un solo instante. Si tu historia tiene tres momentos, haz tres vídeos.
Por último, escribe con naturalidad, en tu idioma. Nuestro servidor traduce tu descripción al inglés, el idioma en el que los modelos son más precisos, y le añade las indicaciones de estilo que hayas elegido. No tienes que hacer nada más, y puedes releer el prompt usado bajo cada vídeo para entender qué funcionó.
- Un sujeto, una acción: «una mujer corre por una playa» mejor que «una mujer corre, luego nada y luego vuelve a casa»
- El decorado y la hora: «callejón de Lisboa, temprano por la mañana, suelo todavía mojado»
- El movimiento de cámara: «la cámara gira lentamente alrededor del sujeto»
- El ambiente: «bruma ligera, colores suaves, silencio»
- Lo que hay que evitar: nada de texto en pantalla, nada de logotipos, ninguna persona real con nombre
Formatos, duraciones y estilos: qué elegir
El formato depende de dónde se verá el vídeo. El horizontal 16:9 es el formato natural de YouTube, de una web o de una presentación. El vertical 9:16 es el de TikTok, los Reels de Instagram y los Shorts: si tu vídeo es para el móvil, elígelo desde el principio en lugar de recortar después, el modelo compone la escena para el formato pedido. El cuadrado 1:1 sirve para las publicaciones clásicas de Instagram, los avatares animados y las miniaturas.
La duración estándar es de cinco segundos, lo que corresponde a un plano de película o a un clip de redes sociales: lo bastante largo para que ocurra una acción, lo bastante corto para seguir siendo nítido. La versión de diez segundos usa el doble de créditos y sirve para escenas en las que algo tiene que construirse, como un amanecer o una cámara que descubre un lugar poco a poco. Para un montaje, cinco segundos por plano es el ritmo adecuado.
Los estilos son indicaciones añadidas a tu descripción. «Realista» busca el aspecto de una cámara de cine, «Cine» añade una imagen más contrastada y movimientos lentos, «Anime» aplica el trazo y los colores de la animación japonesa, «3D» da un acabado de película de animación, «Dron» encuadra un plano general aéreo, «Vintage» añade el grano y los colores de una película antigua. Puedes no elegir ninguno: el modelo interpreta entonces tu descripción libremente.
El modelo importa tanto como el estilo. Seedance 1.0 Fast es el más rápido y barato, sin sonido, perfecto para probar una idea. Grok Imagine da escenas vivas y expresivas, con sonido. Wan 3.0 sigue de cerca las descripciones largas. Seedance 2.0 Fast es nuestro modelo más realista, para caras y movimientos naturales. Kling 2.6 parte de tu propia imagen, una foto o un dibujo, y le da vida: el vídeo toma el formato de la imagen.
Lo que puedes hacer con tus vídeos
Los vídeos que generas son tuyos y se entregan sin marca de agua, en MP4 que se reproduce en todas partes. Puedes publicarlos en redes sociales, integrarlos en una presentación o una web, usarlos en un montaje o un anuncio. Los usos más frecuentes entre nuestros usuarios: fondos animados para vídeos de TikTok o YouTube, imágenes de producto para una tienda online, ilustraciones animadas para un curso o una formación, planos de ambiente para un cortometraje y regalos personalizados.
Cada vídeo tiene una página para compartir con un enlace corto, una vista previa que se muestra bien en WhatsApp, Messenger, X o Discord, y el prompt usado para que quien lo reciba pueda crear el suyo. Esta página no la indexan los buscadores: solo la ven las personas a las que envías el enlace.
Los archivos se guardan treinta días en nuestros servidores, el tiempo de descargarlos y usarlos, y luego se borran: no creamos una biblioteca con tus creaciones. Descarga lo que te importe. Un vídeo borrado no se puede volver a generar idéntico, cada generación es única.
Por qué créditos, en un plan mensual
Producir un vídeo cuesta dinero de verdad: unas decenas de céntimos de cálculo en tarjetas gráficas especializadas, cien veces más que un mensaje de chat. Un plan «ilimitado» a precio bajo sería una mentira, como la de quienes lo venden y ralentizan la cola en cuanto lo usas de verdad. Preferimos un sistema sencillo y honesto: créditos que corresponden al coste real de cada vídeo, indicados en cada opción antes de hacer clic.
Cada plan incluye un número de créditos al mes: el primero, 9,99 € al mes, da 400 créditos; el de 1000 créditos es el preferido de quienes publican cada semana; el de 2000 créditos está pensado para proyectos y profesionales. Un vídeo de 5 segundos usa de 11 a 70 créditos según el modelo, indicados antes de hacer clic, y diez segundos el doble. Los créditos se renuevan con cada pago; los que no uses caducan al final del mes.
Sin permanencia: cambias de plan o cancelas con un clic desde «Mi cuenta», la cancelación se aplica al final del mes pagado y no se cobra nada más. Puedes verlo todo sin cuenta: los ejemplos, los precios, esta guía; la cuenta gratuita solo entra en juego al crear o suscribirte.
Los límites, dichos con franqueza
La generación de vídeo en 2026 es impresionante, no perfecta. Los textos en pantalla suelen ser ilegibles: si necesitas un título, añádelo después en un programa de edición. Las manos siguen siendo el punto débil de todos los modelos en primeros planos. Las escenas muy complejas, con muchos personajes interactuando, pueden perder coherencia. Y el modelo interpreta: dos generaciones de la misma descripción darán dos vídeos distintos, que es también lo que lo hace divertido.
Algunas peticiones se rechazan antes de cualquier generación, sin gastar créditos: contenido sexual, violencia explícita, personas reales identificables, menores en situaciones inapropiadas, incitación al odio. Son las normas de los modelos que usamos y las nuestras. Cuando se rechaza una descripción, el mensaje te lo dice con claridad y puedes reformularla.
Si una generación falla por un motivo técnico, el crédito se devuelve automáticamente y al instante; no tienes que pedir nada. El tiempo de generación anunciado es una mediana real de los últimos vídeos producidos, no una promesa comercial: varía según la carga de los servidores, y preferimos decirte «unos 90 segundos» y cumplirlo que «instantáneo» y decepcionarte.
Consejos para ir más lejos
Trabaja por variaciones. Una primera generación te muestra cómo entiende el modelo tu descripción; la segunda, cambiando una o dos palabras, casi siempre es mejor. Tu descripción se queda en el campo después de cada vídeo, así que iterar es inmediato. Los creadores más eficaces producen tres versiones de un plano y se quedan con la mejor, en lugar de buscar la descripción perfecta a la primera.
Para un montaje, genera todos tus planos en el mismo formato y el mismo estilo, describiendo la misma luz: el resultado tendrá una unidad visual que el público siente sin poder explicarla. Alterna los tamaños de plano como en el cine: un plano general para situar, un plano medio para la acción, un primer plano para la emoción.
Y mira los ejemplos de arriba con su descripción exacta: son vídeos reales producidos por este generador, sin selección cosmética. Al hacer clic en uno, su descripción se copia en el campo; cambia el sujeto, mantén la estructura y tendrás un buen punto de partida.