<aside> 🌊

这是 Kling / 可灵 的模型级知识库(人看的 Current Canon + 机器可查的分层结论)。当前阶段:Knowledge Accumulation尚未建立 Kling Professional Skill

Seedance 官方知识库 使用同一套 12 段模板。平台参数不进本页;本页只记模型能力、Prompt Grammar 与官方工作流。

</aside>

<aside> ⚖️

裁定顺序:能不能提交看平台 UI / MCP Connection 实际支持项;写法怎么生效看模型层官方正文。03 Prompt Grammar 与 07 Workflow / Agent Layer 严格隔离,互不回填。

</aside>

🧭 一分钟导航

我要做什么 去哪一段
知道现在该用哪个模型、哪套写法 01 Current Canon
查 3.0 到底支持什么能力 02 Model Capabilities
VIDEO 3.0 Omni 与普通 3.0 的区别 02.2 Omni 能力表 ・ 10 Version Delta
写单条 Prompt 03 Prompt Grammar
锁人物 / 物体 / 场景一致性 05 References / Elements
处理配音、对白、方言 06 Audio
用 MCP / Agent 批量生产 07 Workflow / Agent Layer
查这些结论的官方出处 09 Source Ledger
旧公式还能不能用 10 Version Delta ・ 12 Deprecated / Legacy

01 Current Canon(当前正式结论)

项目 当前结论
当前主力模型 Kling VIDEO 3.0(官方 Model User Guide,2026-02-06 发布)
VIDEO 3.0 Omni 已核验(A1 官方正文,2026-09-03):Kling VIDEO O1 的升级型号,全模态输入+Native Audio+Elements 3.0(含视频角色 Element 与声音绑定)+Custom Multi-Shot,自由时长 3–15 秒。能力表单独记在 02.2,不与普通 VIDEO 3.0 混用
两者谱系关系 VIDEO 2.6 → VIDEO 3.0;VIDEO O1 → VIDEO 3.0 Omni。同属 Kling 3.0 系列、同一统一多模态训练框架,但输入形态与 Element 绑定规则不同,不得互相套用
当前官方 Prompt 基础结构 基础 Canon(2026-08-07 Prompt Guide)Subject → Action → Setting / Scene → Camera → Lighting / Mood最新实操增量(2026-09-07 VIDEO 3.0 Guide)Scene + Subject + Movement + Audio + Style / Emotion / Camera。两者不冲突:9/7 版本把 Native Audio 与 VIDEO 3.0 实际生产字段显式纳入,并进一步要求先写主体动作,再写 Camera movement / framing;T2V 负责建立完整场景,I2V 因参考图已提供大量外观与构图信息,应把文字重心转向 movement / camera / audio。
官方核心态度 强 Prompt 来自清晰的 Scene Direction,不是依赖某个“神秘固定公式”
旧 Text-to-Video Formula Legacy but Structurally Valid:结构仍可用,参数与能力框架已过时
时长 Flexible Duration,3–15 秒
官方 Agent / MCP 工作流 已收录 3 篇(2026-08-27),一律归 WORKFLOW_LAYER
Professional Skill 暂不建立,仅积累 Candidate(见 11)
最后知识同步 2026-09-10:新增核验 2026-09-07 How to Create AI Videos from Text or Images(VIDEO 3.0)与 How Can I Make an Animation Video with AI?(VIDEO 3.0 Omni);同时重新读取 8/7 Prompt Guide 与 3.0 / 3.0 Omni User Guide。模型能力边界无新变化,本轮主要更新 Prompt 写法与 I2V / Multi-Shot 实操层

02 Model Capabilities(模型能力 · 官方正文确认)

来源:Kling VIDEO 3.0 Model User Guide(A1,2026-02-06)

能力类别 官方确认内容
生成入口 Text-to-Video ・ Image-to-Video ・ Start & End Frames-to-Video
叙事结构 Multi-Shot ・ Custom Multi-Shot
一致性 Enhanced Element Consistency ・ Multi-image references ・ Character Element ・ Start Frame + Element Reference ・ Multi-Character Coreference(3+ 角色)
音频 Native Audio ・ Voice binding
语言 中文 / 英文 / 日文 / 韩文 / 西班牙文 ・ Dialects / Accents
时长 Flexible Duration,3–15 秒输出

Multi-Shot 与 Custom Multi-Shot

模式 控制粒度
Multi-Shot 模型根据 Prompt 自动规划镜头转换、构图与机位
Custom Multi-Shot 逐镜控制:Shot Content ・ Shot Duration ・ Shot Size ・ Perspective ・ Camera Movement

<aside> 📌

Multi-Shot 不是旧版 Prompt Formula 的替代物,而是 VIDEO 3.0 在基础 Prompt Grammar 之上增加的结构化叙事能力。

</aside>

02.2 Kling VIDEO 3.0 Omni(单独记 · 禁止与普通 VIDEO 3.0 混成一套)

来源:Kling VIDEO 3.0 Omni Model User Guide(A1,2026-02-04)+Kling Element Library User Guide(A1,2026-02-05)· 正文核验 2026-09-03

能力类别 官方确认内容
All-in-One Multimodal Input 上传的图片、视频、Element 与文字一律被当作 prompt;模型突破模态限制,可综合理解任意组合
生成入口 Text-to-Video ・ Image-to-Video ・ Start & End Frames-to-Video ・ Multi-image Reference ・ Element Reference ・ Video Element Reference(O1 不支持,Omni 新增)
Native Audio 支持(O1 Native Audio、 Multi-shot)
Multi-Shot / Custom Multi-Shot 原生支持;可逐镜指定时长、构图、角度、叙事内容、运镜,并保证转场平滑
时长 自由时长 3–15 秒(O1 为 3–10 秒)
Element Voice Control 新增:可给 Element 加声音(详见 06 Audio)
一致性 参考生成的 element consistency 对比 O1 显著提升;多元素 / 元素+参考图自由混搭,群像与交互场景下可独立锁住每个角色 / 物体的特征
分辨率与计费 官方文档给出 1080p / 720p 两档,积分按秒计且与「是否有视频输入」相关;此项属平台 / 计费口径,不是 Prompt Grammar(登记在 08)
视频编辑 / Prompt 改写等周边功能 官方明确「与 O1 相同」,详见 O1 User Guide(本轮未读取 O1 正文,不写结论)

Omni 官方输入上限(硬边界)

输入类型 官方上限
图片 最多 7 张;宽高均 ≥ 300px;单文件 ≤ 10MB;格式 .jpg / .jpeg / .png
视频 1 条;时长 3–10 秒;≤ 200MB;分辨率 ≤ 2K
组合规则 有视频输入时:图片 / Element 合计最多 4 个;无视频时:最多 7 个
多图 Element 每个 Element 至少 2 张(1 主参考图+1 补充图),最多 4 张(1 主+3 张多角度补充);建议主图为正面
视频角色 Element 3–8 秒单人角色视频创建(App 可直接录制)
角色配音音频 多图角色 Element 可上传 5–30 秒单人说话音频绑音色(建议背景干净、语速中等、情绪与风格一致);另一处官方表述为 ≥ 3 秒即可提取音色

<aside> ⛔

禁止把 Omni 的输入规则套到 VIDEO 3.0 上。

三套数字不同,互相套用就是跨版本拄。

</aside>