动作更自然,声音更贴合。
Kling 4.0 着重提升动作与运镜的稳定性,让人物表演和声音更自然地同步。双通道立体声与更准确的口型匹配,让对白和歌唱场景更有表现力。
从商品亮相到连续叙事,探索新一代 AI 视频的自然运动、同步声音与更灵活的创作控制。
Kling 4.0 着重提升动作与运镜的稳定性,让人物表演和声音更自然地同步。双通道立体声与更准确的口型匹配,让对白和歌唱场景更有表现力。
组合图片、视频与主体参考,引导角色形象、动作和构图。模型也支持修改已有视频中的主体、背景与视觉风格,让同一个创意发展出更多变化。
在 3–30 秒视频中,用最多 10 张关键帧图片安排重要时刻。人物出场、场景变化、商品亮相,都有更清晰的视觉引导,也为故事展开留出空间。
借助参考素材引导商品外观,探索不同场景中的商品亮相与展示方式。
参考视频的节奏与镜头表达,为不同创意方向探索更多内容版本。
探索更长的场景,结合主体一致性、关键节点控制与自然的人物表演。
探索多语种对白、口音与清晰的画面文字,为不同语言的观众创作内容。
完整模型整合文生视频、图生视频、多模态参考、视频编辑与灵活关键帧能力。
3–30 秒 · 720p / 1080p / 4K
Flash 面向高频创意探索,侧重生成速度与性价比,适合快速尝试不同创作方向。
3–20 秒 · 720p · 8-bit SDR
Kling 4.0 是可灵新一代视频模型,重点提升视听品质、多模态参考与可控叙事。
适合商品广告、社媒短片、角色故事和多语言内容。可以用参考素材引导商品与人物形象,用关键帧安排场景变化,并通过同步声音丰富叙事。
支持文生视频、图生视频,以及最多 15 项组合参考素材:其中图片最多 10 张、视频最多 5 段且总时长不超过 30 秒、主体最多 7 个且视频主体最多 3 个。也支持音色参考,组合输入仍受总量上限约束。
完整模型支持生成 3–30 秒视频,分辨率包括 720p、1080p 和 4K,最多可输入 10 张关键帧图片来控制视频中的重要时刻。
支持双通道立体声、更准确的口型匹配与多语种对白,让人物动作、对话和歌唱更自然地结合。
Flash 面向更快、更高频的创作,支持 3–20 秒、720p、8-bit SDR;完整模型支持 3–30 秒、最高 4K,适合对时长与画面细节要求更高的内容。
最长 30 秒、最高 4K,融合多模态参考、关键帧控制与立体声音频,让每一个创意自然展开。