Movimiento natural. Sonido en sintonía.
Kling 4.0 mejora la estabilidad de la acción y la cámara, la expresividad y la sincronización del sonido. El estéreo de dos canales y una sincronización labial más precisa dan vida a los diálogos y al canto.
De la presentación de un producto a una historia continua, descubre una nueva generación de vídeo con IA, movimiento, sonido y control creativo.
Kling 4.0 mejora la estabilidad de la acción y la cámara, la expresividad y la sincronización del sonido. El estéreo de dos canales y una sincronización labial más precisa dan vida a los diálogos y al canto.
Combina imágenes, vídeos y sujetos para orientar la identidad, la acción y la composición. El modelo también permite editar sujetos, fondos y estilos de vídeos existentes para desarrollar variaciones de una idea.
Utiliza hasta 10 imágenes clave para definir momentos importantes en un vídeo de 3–30 segundos. Guía la entrada de un personaje, un cambio de escena o la presentación de un producto.
Explora presentaciones y nuevos escenarios usando referencias para orientar la apariencia del producto.
Explora variaciones basadas en el ritmo y el lenguaje de cámara de un vídeo de referencia.
Explora escenas más largas con sujetos coherentes, momentos clave controlados e interpretaciones naturales.
Explora diálogos, acentos y texto legible en pantalla para públicos de distintos idiomas.
El modelo completo reúne texto a vídeo, imagen a vídeo, referencias multimodales, edición de vídeo y fotogramas clave flexibles.
3–30 segundos · 720p / 1080p / 4K
Flash prioriza la velocidad y la relación calidad-precio para explorar ideas y probar distintas propuestas creativas con frecuencia.
3–20 segundos · 720p · SDR de 8 bits
Kling 4.0 es la nueva generación de modelos de vídeo de Kling AI, centrada en la calidad audiovisual, las referencias multimodales y el control narrativo.
Explora anuncios de productos, vídeos sociales, historias de personajes y contenido multilingüe. Usa referencias para guiar la apariencia, fotogramas clave para definir cambios de escena y sonido sincronizado para enriquecer la historia.
El modelo completo admite texto, imágenes y hasta 15 referencias combinadas: hasta 10 imágenes, 5 vídeos con una duración total de 30 segundos y 7 sujetos, incluidos como máximo 3 basados en vídeo. También admite referencias de voz, respetando el límite total.
El modelo completo genera vídeos de 3–30 segundos en 720p, 1080p o 4K, con hasta 10 imágenes de fotogramas clave para orientar los momentos importantes.
Sí. Admite estéreo de dos canales, sincronización labial mejorada y diálogos multilingües para combinar movimiento, habla y canto con mayor naturalidad.
Flash se centra en la creación rápida y frecuente, con vídeos de 3–20 segundos en 720p y SDR de 8 bits. El modelo completo ofrece 3–30 segundos y hasta 4K para contenidos que necesitan más duración y detalle.
Hasta 30 segundos en 4K, con referencias multimodales, control de fotogramas clave y audio estéreo para dar vida a cada idea.