<aside> 🌊
这是 Kling / 可灵 的模型级知识库(人看的 Current Canon + 机器可查的分层结论)。当前阶段:Knowledge Accumulation,尚未建立 Kling Professional Skill。
与 Seedance 官方知识库 使用同一套 12 段模板。平台参数不进本页;本页只记模型能力、Prompt Grammar 与官方工作流。
</aside>
<aside> ⚖️
裁定顺序:能不能提交看平台 UI / MCP Connection 实际支持项;写法怎么生效看模型层官方正文。03 Prompt Grammar 与 07 Workflow / Agent Layer 严格隔离,互不回填。
</aside>
| 我要做什么 | 去哪一段 |
|---|---|
| 知道现在该用哪个模型、哪套写法 | 01 Current Canon |
| 查 3.0 到底支持什么能力 | 02 Model Capabilities |
| 查 VIDEO 3.0 Omni 与普通 3.0 的区别 | 02.2 Omni 能力表 ・ 10 Version Delta |
| 写单条 Prompt | 03 Prompt Grammar |
| 锁人物 / 物体 / 场景一致性 | 05 References / Elements |
| 处理配音、对白、方言 | 06 Audio |
| 用 MCP / Agent 批量生产 | 07 Workflow / Agent Layer |
| 查这些结论的官方出处 | 09 Source Ledger |
| 旧公式还能不能用 | 10 Version Delta ・ 12 Deprecated / Legacy |
| 项目 | 当前结论 |
|---|---|
| 当前主力模型 | Kling VIDEO 3.0(官方 Model User Guide,2026-02-06 发布) |
| VIDEO 3.0 Omni | ✅ 已核验(A1 官方正文,2026-09-03):Kling VIDEO O1 的升级型号,全模态输入+Native Audio+Elements 3.0(含视频角色 Element 与声音绑定)+Custom Multi-Shot,自由时长 3–15 秒。能力表单独记在 02.2,不与普通 VIDEO 3.0 混用 |
| 两者谱系关系 | VIDEO 2.6 → VIDEO 3.0;VIDEO O1 → VIDEO 3.0 Omni。同属 Kling 3.0 系列、同一统一多模态训练框架,但输入形态与 Element 绑定规则不同,不得互相套用 |
| 当前官方 Prompt 基础结构 | 基础 Canon(2026-08-07 Prompt Guide):Subject → Action → Setting / Scene → Camera → Lighting / Mood。最新实操增量(2026-09-07 VIDEO 3.0 Guide):Scene + Subject + Movement + Audio + Style / Emotion / Camera。两者不冲突:9/7 版本把 Native Audio 与 VIDEO 3.0 实际生产字段显式纳入,并进一步要求先写主体动作,再写 Camera movement / framing;T2V 负责建立完整场景,I2V 因参考图已提供大量外观与构图信息,应把文字重心转向 movement / camera / audio。 |
| 官方核心态度 | 强 Prompt 来自清晰的 Scene Direction,不是依赖某个“神秘固定公式” |
| 旧 Text-to-Video Formula | Legacy but Structurally Valid:结构仍可用,参数与能力框架已过时 |
| 时长 | Flexible Duration,3–15 秒 |
| 官方 Agent / MCP 工作流 | 已收录 3 篇(2026-08-27),一律归 WORKFLOW_LAYER |
| Professional Skill | 暂不建立,仅积累 Candidate(见 11) |
| 最后知识同步 | 2026-09-10:新增核验 2026-09-07 How to Create AI Videos from Text or Images(VIDEO 3.0)与 How Can I Make an Animation Video with AI?(VIDEO 3.0 Omni);同时重新读取 8/7 Prompt Guide 与 3.0 / 3.0 Omni User Guide。模型能力边界无新变化,本轮主要更新 Prompt 写法与 I2V / Multi-Shot 实操层。 |
来源:Kling VIDEO 3.0 Model User Guide(A1,2026-02-06)
| 能力类别 | 官方确认内容 |
|---|---|
| 生成入口 | Text-to-Video ・ Image-to-Video ・ Start & End Frames-to-Video |
| 叙事结构 | Multi-Shot ・ Custom Multi-Shot |
| 一致性 | Enhanced Element Consistency ・ Multi-image references ・ Character Element ・ Start Frame + Element Reference ・ Multi-Character Coreference(3+ 角色) |
| 音频 | Native Audio ・ Voice binding |
| 语言 | 中文 / 英文 / 日文 / 韩文 / 西班牙文 ・ Dialects / Accents |
| 时长 | Flexible Duration,3–15 秒输出 |
| 模式 | 控制粒度 |
|---|---|
| Multi-Shot | 模型根据 Prompt 自动规划镜头转换、构图与机位 |
| Custom Multi-Shot | 逐镜控制:Shot Content ・ Shot Duration ・ Shot Size ・ Perspective ・ Camera Movement |
<aside> 📌
Multi-Shot 不是旧版 Prompt Formula 的替代物,而是 VIDEO 3.0 在基础 Prompt Grammar 之上增加的结构化叙事能力。
</aside>
来源:Kling VIDEO 3.0 Omni Model User Guide(A1,2026-02-04)+Kling Element Library User Guide(A1,2026-02-05)· 正文核验 2026-09-03
| 能力类别 | 官方确认内容 |
|---|---|
| All-in-One Multimodal Input | 上传的图片、视频、Element 与文字一律被当作 prompt;模型突破模态限制,可综合理解任意组合 |
| 生成入口 | Text-to-Video ・ Image-to-Video ・ Start & End Frames-to-Video ・ Multi-image Reference ・ Element Reference ・ Video Element Reference(O1 不支持,Omni 新增) |
| Native Audio | 支持(O1 无 Native Audio、无 Multi-shot) |
| Multi-Shot / Custom Multi-Shot | 原生支持;可逐镜指定时长、构图、角度、叙事内容、运镜,并保证转场平滑 |
| 时长 | 自由时长 3–15 秒(O1 为 3–10 秒) |
| Element Voice Control | 新增:可给 Element 加声音(详见 06 Audio) |
| 一致性 | 参考生成的 element consistency 对比 O1 显著提升;多元素 / 元素+参考图自由混搭,群像与交互场景下可独立锁住每个角色 / 物体的特征 |
| 分辨率与计费 | 官方文档给出 1080p / 720p 两档,积分按秒计且与「是否有视频输入」相关;此项属平台 / 计费口径,不是 Prompt Grammar(登记在 08) |
| 视频编辑 / Prompt 改写等周边功能 | 官方明确「与 O1 相同」,详见 O1 User Guide(本轮未读取 O1 正文,不写结论) |
Omni 官方输入上限(硬边界)
| 输入类型 | 官方上限 |
|---|---|
| 图片 | 最多 7 张;宽高均 ≥ 300px;单文件 ≤ 10MB;格式 .jpg / .jpeg / .png |
| 视频 | 1 条;时长 3–10 秒;≤ 200MB;分辨率 ≤ 2K |
| 组合规则 | 有视频输入时:图片 / Element 合计最多 4 个;无视频时:最多 7 个 |
| 多图 Element | 每个 Element 至少 2 张(1 主参考图+1 补充图),最多 4 张(1 主+3 张多角度补充);建议主图为正面 |
| 视频角色 Element | 由 3–8 秒单人角色视频创建(App 可直接录制) |
| 角色配音音频 | 多图角色 Element 可上传 5–30 秒单人说话音频绑音色(建议背景干净、语速中等、情绪与风格一致);另一处官方表述为 ≥ 3 秒即可提取音色 |
<aside> ⛔
禁止把 Omni 的输入规则套到 VIDEO 3.0 上。
三套数字不同,互相套用就是跨版本拄。
</aside>