Movimento natural. Som que acompanha.
O Kling 4.0 aprimora a estabilidade dos movimentos e da câmera, a expressividade e a sincronização sonora. O estéreo de dois canais e a sincronização labial mais precisa dão vida a diálogos e cenas de canto.
Da apresentação de um produto a uma história contínua, explore uma nova geração de vídeo com IA, movimento, som e controle criativo.
O Kling 4.0 aprimora a estabilidade dos movimentos e da câmera, a expressividade e a sincronização sonora. O estéreo de dois canais e a sincronização labial mais precisa dão vida a diálogos e cenas de canto.
Combine imagens, vídeos e personagens para orientar identidade, ação e composição. O modelo também permite editar elementos, fundos e estilos visuais de vídeos existentes para explorar variações de uma ideia.
Use até 10 imagens de quadros-chave para definir momentos importantes em um vídeo de 3–30 segundos. Oriente a entrada de um personagem, uma mudança de cenário ou a apresentação de um produto.
Explore apresentações e novos cenários usando referências para orientar a aparência do produto.
Explore variações a partir do ritmo e da linguagem de câmera de um vídeo de referência.
Explore cenas mais longas, personagens consistentes, momentos controlados e atuações naturais.
Explore diálogos, sotaques e textos legíveis na tela para públicos de diferentes idiomas.
O modelo completo reúne texto para vídeo, imagem para vídeo, referências multimodais, edição de vídeo e quadros-chave flexíveis.
3–30 segundos · 720p / 1080p / 4K
O Flash prioriza velocidade e custo-benefício para explorar ideias e experimentar diferentes caminhos criativos com frequência.
3–20 segundos · 720p · SDR de 8 bits
O Kling 4.0 é a nova geração de modelos de vídeo da Kling AI, com foco em qualidade audiovisual, referências multimodais e controle narrativo.
Explore anúncios de produtos, vídeos para redes sociais, histórias com personagens e conteúdo multilíngue. Use referências para orientar a aparência, quadros-chave para definir mudanças de cena e som sincronizado para enriquecer a narrativa.
O modelo completo aceita texto, imagens e até 15 referências combinadas: até 10 imagens, 5 vídeos com duração total de 30 segundos e 7 sujeitos, dos quais até 3 baseados em vídeo. Também aceita referências de voz, respeitando o limite total.
O modelo completo gera vídeos de 3–30 segundos em 720p, 1080p ou 4K, com até 10 imagens de quadros-chave para orientar os momentos principais.
Sim. Oferece estéreo de dois canais, sincronização labial aprimorada e diálogos multilíngues, integrando movimentos, fala e canto de forma mais natural.
O Flash prioriza criação rápida e frequente, com vídeos de 3–20 segundos em 720p e SDR de 8 bits. O modelo completo oferece 3–30 segundos e até 4K para conteúdos que exigem mais duração e detalhes.
Até 30 segundos em 4K, com referências multimodais, controle de quadros-chave e áudio estéreo para dar vida a cada ideia.