AI 视频生成与短剧制作
从故事、商品资料、知识材料或真实经历到成片的完整生产线:34 类短剧视频方案、全模式视频生成、探店/电商工作区、数字人直播与口型同步,再加上混剪、字幕和发布工具。
🎭 短剧视频(需求到成片全流程)
把小说、剧本、商品资料、知识材料或真实经历变成可执行的镜头工程,最终产出 9:16 竖屏成片。可从连续故事、带货、口播、探店、品牌、测评、知识、课程、旅游等 34 类方案中选择方向;资料、大纲、分镜、素材职责和成片标准都会随方案变化。
方案资料:产品、受众、证据、主持人、场地或商品图会在生成大纲时集中填写,缺少必填内容会明确提示。
切换方案:直接导入的正文或脚本始终保留,其他正文可自行决定是否迁移;旧方案的素材、分镜、关键帧和输出不会混入新方案。
连续故事的 8 步标准化流程
① 大纲:你输入一句话简介(人物名写进简介即可),AI 生成剧情大纲。简介里的人名会原样保留进后续所有环节,不被擅自改名;大纲带结尾完整性检查,疑似截断时自动从断点续写,不完整绝不当成品保存
② 主线:AI 基于大纲生成故事圣经、人物设定、卷纲与伏笔。生成中断后再次点击可断点续写——跳过已完成阶段,从断点继续,不用全部重来
③ 小说:AI 按集执笔正文,每集生成后立即存盘,中断后只从断点续写。支持多集超长篇小说 pipeline:检索约束 → 正文执笔 → 锚点入库,长篇连载伏笔不漂移
④ 分镜稿:AI 从小说正文直接拆镜,10 路并行补全,必须覆盖每一段关键情节。单镜时长 4~15 秒按内容密度智能分配;对白按约 3 字/秒控制字数,超长台词自动拆成连续多镜。分镜稿为 ### 镜N 可编辑格式,改完保存即可;生成后自动检查质量并调用 AI 修复(最多两轮),遇到缺失场景自动补全
⑤ 补齐资产:一键从分镜稿抽取角色、场景、道具清单,批量并行生成参考图:主要角色自动生成三视图定妆(正面+侧面+背面),真人风格角色可在获得授权后加入私域人像素材库,为角色一致性打底
⑥ 关键帧:每镜提前生成首帧+末帧关键帧,可同时参考角色定妆、场景图、道具图等多张参考图。后台生成不卡界面;已有关键帧自动去重不重复生成,并自动存入素材库复用
⑦ 提示词:根据分镜、角色图、场景图、关键帧与导演/摄影数据,按官方引用格式(@图像N、@角色:名)自动组装每镜视频提交指令,每批 6 镜分批生成,30 镜也能完整产出
⑧ 视频:逐镜提交生成,每镜同时传入首帧与尾帧关键帧,画面从正确镜头开始、到正确镜头结束。全部镜头完成后自动进入后期流水线,一次产出带字幕与配乐的完整成片,还可一键导出剪映草稿继续精剪
核心亮点
智能分镜:10 路并行补全,速度快;对白自动控制字数(约 3 字/秒),超限对白强制拆为连续多镜并标注「续」;模型输出被截断时自动把输出预算放大一倍重试,仍被截断才报错,不再误报「空文本」
角色一致性:主要角色自动生成三视图定妆,按场次生成环境参考;真人角色支持授权后加入私域人像素材库,修改外貌后可一键「应用到分镜」。角色、场景、道具图绑定到每个镜头,同名角色不跨项目串肖像,跨镜人物长相不漂移
关键帧系统:首镜优先使用专用首帧,末帧接力上一镜,画面衔接连贯;参考图自动压缩优化,生成等待时间从 10+ 分钟降至正常;关键帧自动入库,下次直接复用
镜头管理:每镜双缩略图预览(首帧/末帧),双击看大图;全选/批量操作,逐镜独立生成、预览、重试;每镜带 180 秒超时保护,超时自动重试,不再卡死
提示词自动组装 + 自定义管理:按官方格式自动生成最终提交指令,确保引用序号与实际资源顺序一致;大纲/主线/小说/分镜稿/提示词五个标签页均支持「管理提示词」「重置提示词」,完整系统提示词可查看可编辑
后期四师:剪辑师(智能转场,自动识别交叉溶解/硬切)→ 调色师(色温统一,跨镜色调一致)→ 特效师(粒子/光晕/文字叠加)→ 字幕师(根据口播自动生成时间轴并烧录字幕),一次流程产出完整成片;新角色出场时画面自动标注「姓名+身份」,帮助观众记人
BGM 智能衔接:每镜首尾自动淡入淡出(首 1 秒淡入、末 1 秒淡出),同场景同情绪保持连续,剧情重大转折(反转/高潮/危机/场景切换)时允许换曲风;拼接环节不做音频交叉淡化,保护对白不被淡化
多集长篇小说:每集只提取相关细纲、伏笔和限长的全局资料;超过本地模型上下文上限时会显示本次请求量与模型上限并停止重复提交。旧项目只缺伏笔账本条目时可定向补齐,不必重做已有内容
项目安全切换:后台生成期间可以切到其他项目再返回,生成结果、用户编辑和界面刷新会继续归属于原项目,不再因重复加载而互相覆盖
剪映工程导出:一键把分镜视频导出为剪映可导入的草稿工程(含时间轴与轨道数据),在剪映里继续精剪、加花字、做包装
项目多文件存储:大纲、主线、小说、分镜稿、角色、场景、道具各自独立成文件,一个文件写入失败不影响其他;旧项目打开时自动迁移并备份,保存失败在日志中指明具体文件
产出规格
- 画幅:9:16 竖屏,专为抖音/快手/视频号短剧构图(人物面部保持画面垂直中心 1/3 区域)
- 单镜时长:4~15 秒自由分配——AI 根据每镜内容密度智能定长,短镜更紧凑、长镜更舒展
- 成片形态:单轨 BGM 无缝拼接 + 烧录字幕的完整一集,可直接发布或导出剪映草稿二次创作
谁适合用
- 网文/小说作者 → 把章节变成短剧试片,验证 IP 影视化效果
- 短剧制作团队 → 批量生产竖屏连续剧,多集长篇稳定连载
- 品牌方 → 制作剧情化广告,角色形象全程统一
- 内容工作室 → 解说漫剧、矩阵号批量出片
- 个人创作者 → 零基础把灵感梗概变成可发布的成片
- 编剧/导演 → 用 AI 分镜稿与关键帧快速预演剧本节奏
详细说明见 全部功能 · 短剧视频。
🎬 视频生成(全模式与多模板)
「视频生成」是客户端的云端视频工作台:先选模板,再填提示词与素材。3.1.8 新增全模式选项,同一模型支持文生视频、首尾帧图生视频和真正的多参考素材生视频,三种模式均支持 2K 与 5~15 秒;多参考模式最多可组合 9 张图片、3 段视频和 3 段音频。提交前软件会按当前选项校验素材数量和参数范围。
3.2.5 的自部署视频模型也已进入同一模型下拉框,当前做视频不扣账户算力。它支持文生视频、单图生视频和 2~3 张有顺序的关键帧转场,并按分辨率提供对应时长;关键帧模式用于控制转场顺序。
基础使用 · 通用参数
模型选择:可选模型、生成模式和参数会随当前云端配置显示;切换模型后请重新确认时长、比例和素材容量
时长与比例:单段 4~15 秒、每秒一档,默认 10 秒;比例有 9:16、16:9、1:1 等组合,竖屏短剧与横屏素材都能出
声音:生成的视频默认一律带声音,没有也不需要有「无声/有声」开关
参考素材:图片 / 视频 / 音频三类参考素材可混合提交;音频不只是配音,还能作为节奏与配乐参考,让剪辑点和画面律动对上节拍
清晰度:「智能超清尊享」(视频超清)模板在提示词首行写 upscale: 1080p(可选 1080p / 2K / 4K / 8K)即可指定输出清晰度档位,不写默认 1080p;档位越高,耗时与算力消耗越大
文生视频(纯文字,无需素材)
文生视频·基础(结构化):只写提示词即可出片,按「主体 / 场景 / 运动 / 镜头 / 光影 / 风格」结构化描述,越具体越可控
侧移跟拍(浅景深):内置商业质感运镜配方——缓慢横移加浅景深特写,适合美食、手作、桌面好物的氛围短片
联网搜索:选用该模板会自动启用官方联网检索,先检索近期公开资讯再生成新闻简报类短片;在提示词中写明检索主题与时间范围即可
电商产品展示:干净展台、稳定布光、缓慢推近,一键得到主图级产品展示视频
图生视频与多图组合
图生视频·基础(1 张图):以该图为首帧,延续其光影与氛围,让静态画面自然动起来
首尾帧·两图过渡(2 张图):图片1 作首帧、图片2 作尾帧,中间过程自动顺滑补全
多图组合场景(1~9 张):多张参考图中的人物走进指定环境——前几张为角色外观参考,后几张为场景氛围参考,透视与光照自动保持合理
多图角色场景(1~9 张):多角色同框叙事,角色定装图在前、场景氛围图在后,跨镜人物长相不漂移
智能多帧·关键帧链路(3~10 张):第 1 张为首帧,其余各图依次作为时间轴上的关键帧,按顺序平滑过渡衔接
分镜叙事(1~10 张):用「N-M秒:…」时间轴分段写法描述每个镜头,在对应时间点标注 @图像N,模型自动按时间轴解析,一条提示词产出多镜头叙事短片
多模态与综合生成
多模态·运镜+配音节奏(1 图 + 1 视频 + 1 音频):图片定视觉基调、视频定运镜节奏、音频定剪辑节拍,三者合成一条观感统一的短片
综合生成(不限素材类型与数量):界面默认模板。图片 / 视频 / 音频自由搭配、数量不限,配合 @图像N、@视频N、@音频N 引用精确指派每份素材的职责,复杂创意一次给足
参考视频编辑与视频复刻
视频编辑系列:以 1~3 段参考视频为基础做局部修改——主体替换(1 图 + 1 视频)、对象添加、对象删除、局部重绘、视频延长(续拍)、前序生成、风格迁移(1 图 + 1 视频)、轨道补全;运镜与节奏保持原片不变,只改你点名的地方
视频复刻(1 段视频 + 1~7 张图,不带音频):在保持参考视频运镜与节奏的前提下,用新图替换其中的商品或人物外观,正文写清要替换的对象与保留的元素;适合把验证过的镜头结构快速复用到新商品、新人物上
场景特效 · 模板成片 · 一键成片
场景特效模板(1~6 张图):提示词首行写 template: 模板ID(与官方控制台「场景特效」文档中的模板 ID 一致),正文描述想叠加特效的画面与动作,即可调用平台特效能力
模板成片(1~7 张图):叙事模板按图自动编排镜头;可选首行 story: 指定故事模板名,不写则使用平台默认故事线,几乎不用再写长提示词
一键成片系列:一键通用成片(1~7 张图,时长 1~180 秒)、一键电商成片(可选首行 language: 指定中英文口播倾向)、一键AI-MV(1~7 张图 + 1 段歌曲音频),素材丢进来直接出完整成片
能力更新:场景特效模板、模板成片和视频复刻会跟随客户端当前可用能力更新,具体选项以页面显示为准
对口型与数字人
对口型(1 段含人脸视频):上传 1 段含人脸的人物视频——再配 1 段参考音频,则按音频精准对口型;不配音频,则把提示词当作对白(至少 4 个字)先转语音再对口型,可选首行 voice_id: 指定音色
数字人(1 张人物图):一张正面或微侧、面部清晰的人物照片即可开口说话——配参考音频则按音频做口型与表演;或直接写口播文稿交给 TTS 朗读(建议不超过 2000 字),适合口播、课程、产品讲解的多语言批量产出
提示词技巧
- 六段式结构:按主体 → 场景 → 运动 → 镜头 → 光影 → 风格逐段描述,镜头语言(推近 / 横移 / 环绕 / 跟拍)写明确,画面可控性显著提升
- 分镜写法:多镜头短片用「0-2秒:… 2-4秒:…」时间轴分段,每镜写清画面、运动与参考图职责
- @图像N 引用:N 与界面素材列表顺序一致,写在每个镜头描述的开头(如「0-2秒:@图像1中角色入场…」),模型按时间轴自动解析
- @角色:名 引用:短剧视频流程中支持
@角色:名字命名引用,在角色首次出现前引用,提交时自动绑定该角色的参考图 - 联网主题:联网搜索模板中写明检索主题与时间范围(如「近 24 小时科技要闻」),并声明「除检索结果外勿编造事实」,资讯类短片更可靠
实用细节
中文报错:API 返回的英文错误会翻译成带原因与解决方法的中文提示——内容安全拦截、请求频率过高、密钥缺失或未配置、版权拦截等常见问题,都能直接看懂该怎么处理
提示词长度预检:当前模型配置了字符上限时,提交前会检查提示词长度;超出后直接显示本次字符数、模型上限,并建议精简或换模型,避免任务提交后才失败
提交即走:任务提交后立即返回任务 ID 并进入「云端任务」处理,不用等结果就能继续提交下一任务,批量出片效率高
参考图自动压缩:上传前自动压缩参考图、大幅缩小体积,上传更快;遇到真人肖像拦截时,自动将参考素材入库并用安全地址重试,无需手动操作
多参考图校验:多图模板会按当前模型容量提交素材;计划图片超过容量时,会在任务提交前列出实际上传和仅作文字约束的图片,由您选择继续或返回更换模型,不再静默丢图
模板详细说明见 全部功能 · 视频生成。
🧰 云端 AI 视频工具箱
客户端左侧「云端」分组另有 8 个工具:去水印字幕、字幕擦除、动作迁移、视频换人、换装换衣、高清修复、反推生图、口播视频。换装换衣在同一页提供“自然换装”和“强力覆盖”两种模式;各页均采用左侧素材与参数、右侧大结果预览、底部运行状态的布局,上传的视频会显示封面,多结果可逐张预览并双击打开。
暂未开放的工具仍会保留入口并说明原因,可在页面内重新检测;首次同步未完成或网络刷新失败时会保留原导航状态,不会把连接问题误显示为功能已下线。
口播视频现在可以直接输入文案,用本地超拟真V3先生成配音;需要指定音色时可选择本人或已获授权的参考音频,配音完成后会自动填入音频输入,再继续制作口播画面。任务进度与失败原因会持续显示,完成结果自动保存到输出目录并同步云端任务中心。
📱 探店视频 / 🛒 电商视频
客户端内独立的探店 / 电商工作区(基于视频生成的多镜管线),专注 文案 + 博主形象 + 音色 + 分镜 → 逐镜审核生成 → 自动拼接成片。探店与电商各占一个独立页签,分镜稿、参考素材与逐镜状态各自独立保存,互不干扰。
工作流程
① 填口播 / 卖点文案、上传店铺或产品参考图 → ② 设置博主形象与旁白音色 → ③ AI 生成完整分镜稿 → ④ 逐镜审核、逐镜生成 → ⑤ 一键拼接成片
分镜稿由 AI 分镜编导自动产出:先做成片规划(总时长、镜数 4~10、叙事链 钩子 → 卖点 → 细节 → CTA),再逐镜给出镜号、镜型(博主出镜 / B-roll 空镜)、时长(4~15 秒自选)、口播分句、中文画面描述、英文视频 prompt 与衔接说明。每镜独立调用视频模型生成竖屏 9:16 画面,单镜上限 15 秒,拍多少、怎么拍都清清楚楚。
核心亮点
博主形象系统:上传博主照片作为人物参考,出镜镜次自动以博主照为第一参考图,保证跨镜长相一致,分镜至少安排 2 镜博主出镜;纯景物空镜只使用店铺图片、不出现人物——出镜归出镜、空镜归空镜,素材分工清晰
音色参数化生成:性别、年龄、语言、风格四个维度自由组合,一键生成专属旁白音色并写入分镜。语言支持中文 / 英语 / 日语 / 韩语 / 法语 / 德语 / 西班牙语 7 种,风格可选温柔亲切、活泼开朗、沉稳大气、自然随和;也可上传参考音频,先试听再定稿
逐镜生成控制:每镜一张独立卡片,时长、主参考图、转场方式(硬切 / 交叉溶解 / 淡入淡出)、口播分句、英文 prompt、画面描述都可直接修改;每镜独立「生成此镜」按钮 + 状态指示(等待 / 生成中 / 完成 / 失败),失败的镜次单独重试,已完成的镜次不受影响
自动后期制作:调色统一 → 转场拼接 → 字幕烧录,「拼接成片」按钮实时显示完成进度,至少 2 镜就绪即可拼接,一次处理产出带字幕的完整成片
谁适合用
- 探店博主 / 达人 → 门店素材 + 口播文案,批量产出种草短片
- 实体商家 → 自己或虚拟博主出镜,低成本做门店宣传
- 电商卖家 → 产品图 + 卖点文案,快速生成带货短视频
- 矩阵号运营 → 同一套素材换文案、换音色,多版本批量出片
👤 数字人直播与口型同步
数字人口播与口型同步
「视频生成」内置「数字人」「对口型」模板:一张人物照片或一段人物视频,配一段口播文字(自动转语音)或一段参考音频,即可生成口型同步的说话视频。适合口播、课程、产品讲解、多语言版本批量产出。
- 数字人模板:恰好 1 张人物图(建议正面或微侧、面部清晰)。上传参考音频,人物即按音频做口型与表演;不上传音频时,口播文稿自动转语音驱动(可指定音色 ID,文稿建议 2000 字以内)
- 对口型模板:1 段含人脸的人物视频 + 1 段参考音频,人物按音频重新对齐口型;也可以直接写对白文本(至少 4 个字),先合成语音再驱动口型
数字人直播
三种直播画面模式,按场景自由选择:
纯音频直播
不启动画面管线,只做声音直播,资源占用最低,适合语音陪播、广播式带货
摄像头神经口型
真人摄像头采集 + 本地神经口型同步,只换口型、不换脸;口型就绪后才起声,失败可直接重试
数字人驱动
先训练专属数字人形象,再由实时引擎连续驱动开播;说完自然闭口,人物动作与背景继续播放
形象训练:提交人物视频素材即可训练专属数字人形象。训练前自动质检,点击训练后会显示预处理、真实百分比、当前阶段和已用时;处理中重复点击不会启动第二个任务
实时驱动:数字人以声音为主时钟,窗口预览、界面预览与虚拟摄像头共享同一条连续画面;句尾自然闭口,相邻两句话之间按素材帧率连续衔接
智能弹幕互动:自动识别弹幕意图,大模型生成回复再由数字人说出来;弹幕抓取覆盖抖音、快手、视频号、淘宝、百度、拼多多、TikTok、小红书 8 个平台
多平台分发:直播画面经 OBS 虚拟摄像头输出,配合 OBS 推流至抖音、快手、视频号、淘宝等平台,一处开播、多端可见
长时间脚本轮播:设置好脚本后可自动循环;快速停播重开会清理旧声音、弹幕回复与口型任务,建议仍按平台规则定期巡检直播状态
详见 AI 直播 专题页。
💻 本地视频能力(数据不出本机)
对口型、换脸、动作迁移、视频换人、混剪、去水印、字幕和音频提取都可在您自己的电脑上完成——素材不上传、不留痕,合同、内训、未发布成片等敏感内容放心处理。
👄 对口型
快速成片:在“AI直播”下方打开“对口型”,上传单段人物视频,选择配音音频或输入文案,即可在本机生成新口型 MP4
多语言文字配音:支持 69 种本地语言和方言;文字模式需选择本人或已获授权的参考音频克隆音色,必要时可填写参考音频原文
临时分析:人物视频只为当前任务临时分析,不加入数字人形象列表;竖屏和较长素材支持自适应预览与按需处理
结果管理:支持取消任务、播放生成结果和自选输出位置
✂️ 智能混剪(以过原创检测为目标)
素材获取:直接粘贴抖音分享链接,自动解析下载无水印素材;也可导入本地多段视频与 BGM
场景智能切分:自动检测镜头边界,把长素材拆成一个个可用场景片段,切分失败时自动降级为均匀分割,不中断流程
过原创混剪:以「过平台原创检测」为目标自动重排镜头顺序、跨批次去重、随机变速,限制同源片段连续出现,降低结构重复度
风格模板:内置通用带货 / 教程演示 / 情绪种草 / 节奏冲击四套风格,钩子、主体、结尾的节奏配比各有侧重,选风格即定剪法
一站式成片:自动生成字幕与封面,支持 AI 配音(含缅甸语、高棉语等多语种),混剪完成即得可发布成片
断点续剪:中途关闭或出错不丢进度,重新打开可从合并/后期阶段续跑;每次产出完整混剪报告,镜头来源与处理记录一目了然
🧽 视频去水印
手动框选:在预览画面上用鼠标直接框选水印区域,角标、台标、字幕条均可一次框多个区域
双模式擦除:边缘融合与内容修复按素材选择,尽量让处理区域自然融入背景
格式齐全:支持 mp4 / avi / mov / mkv / flv / wmv 常见视频格式,适合批量处理带角标的素材
📝 字幕 / 文字提取
双识别模式:本地离线识别(数据不出本机)与云端增强识别按需切换
带时间戳字幕:语音直接转成带时间轴的字幕文件,可回挂到成片,批量配字幕效率高
噪音场景建议:带背景音乐、环境噪音的视频,切换云端引擎识别准确率明显提升
🎵 音频提取
视频转音频:从本地视频文件提取音轨,输出 MP3 / WAV / AAC / FLAC / OGG 多种格式
码率可选:128k / 192k / 256k / 320k 四档码率,默认 192k,音质体积自己权衡
链接提取:粘贴抖音分享链接,解析下载后直接提取音频,找 BGM、扒口播都方便
🚀 多平台发布
一键自动发布:抖音、快手、小红书、B站 四平台全自动上传发布,同一成片多账号分发不再反复传
半自动辅助:视频号、百家号、TikTok 自动打开发布页并辅助填写,人工确认后发出
直通混剪产物:直接读取智能混剪的输出目录,剪完即发,矩阵号日更的体力活交给软件
以上功能在客户端本地页签中运行(云端 ASR 引擎需联网);详细步骤见 使用教程。
🚀 使用指南与常见问题
几条上手要点,帮你少走弯路;更多细节见下方常见问题。
使用指南
云端任务:提交后可查看排队、生成、完成与失败状态;右键还可复制脱敏后的任务详情。内容审核、参数、网络和账户问题会分别显示对应中文说明
算力提示:选择自部署文字、图片或视频模型当前不扣账户算力;其他联网模型的实际消耗以客户端说明和完成后的账户记录为准
首次使用:AI 模型按需下载——用哪个功能才下载哪个模型,首次使用某功能时请保持网络畅通并耐心等待。软件支持自动检查更新,更新完成后自动重启到新版本
线路切换注意:方舟线路与性价比线路的可选模型列表互不通用,切换线路后列表会整体更换,请重新选择模型再提交任务
常见问题
Q:生成失败,提示内容被安全系统拦截怎么办?
遇到安全拦截时,页面会优先显示审核原因。请修改提示词或更换参考素材后重试,并确保素材为原创或已获授权;需要反馈时可从云端任务复制已脱敏的任务详情。
Q:提示「请求频率过高」?
表示当前线路请求较集中,请稍后重试即可。高峰期云端任务也可能排队较久,可在「云端任务」中心查看排队状态,无需重复提交同一任务。
Q:生成的视频会带声音吗?
会。生成的视频默认一律带声音(无单独开关),无需手动选择;音频类参考素材还可作为节奏与配乐参考一并提交。
Q:单段视频最长多少?想做更长的视频怎么办?
单段时长 4~15 秒(每秒一档,默认 10 秒)。需要更长成片时,可按分镜逐段生成,再用短剧视频流水线自动拼接,或使用本地「智能混剪」合成为完整视频。
Q:参考图有什么要求?
图片尽量清晰、构图稳定,描述文案与画面一致效果更好;请确保您有权使用该素材。多图模板支持 1~9 张参考图同时约束画面(多角色同框、多图组合场景等),选择时支持 Ctrl/Shift 批量多选。若模型只支持单图,客户端会在提交前提示,不会静默忽略其余图片。
Q:生成的内容可以商用吗?
请确保您使用的素材(图片、视频、音频、文案)已获合法授权,并遵守所用模型服务方与发布平台的内容规则。生成内容请勿用于侵权、造假等违法用途,详见 关于我们。