全栈 AI 能力矩阵
当前版本 3.2.5。这里按「内容生产、云端生成、本地处理与直播」说明每项能力适合做什么、如何使用以及数据与资源边界。
先按创作目标选择入口
从需求到完整成片:使用「短剧视频」,可从 34 类内容方案中选择创作方向,并统一管理方案资料、大纲、资产、分镜、逐镜视频与最终拼接。
快速生成单条素材:使用「Agent 助手」「图片生成」「视频生成」或「音乐生成」;需要多张图片、多段视频或音频共同约束时,优先选择支持多参考素材的模板。
制作商品成套图片:使用「电商套图」,只需一张产品图即可同时生成 9 个职责不同的商品版位,适合主图、详情页与多市场素材准备。
直播与口播:使用「AI 直播」完成数字人驱动、摄像头口型、话术播报与弹幕互动;已有视频需要替换配音和口型时使用本地「对口型」。
处理已有素材:智能混剪、去水印、音频切片、音频提取、文字提取和音频编辑主要在本机执行,适合批量整理与二次创作。
想先免费创作:在文字、图片或视频的模型框选择“自部署模型”。当前 3.2.5 中这三类自部署模型均不扣账户算力,其他模型仍以客户端显示为准。
自部署模型需要联网,但当前明确免费;其他云端功能可能消耗算力,素材会按任务需要发送到云端;本地功能主要使用本机资源。实际可选模型、参数与工具状态以客户端当前页面为准。
☁️ 云端功能(需联网)
以下功能需要联网;选择当前明确免费的“自部署模型”不扣账户算力,其他模型可能消耗算力,具体以客户端内说明为准。任务提交后可在「云端任务」中查看进度、下载结果或复制脱敏后的任务摘要。
Agent 助手
适合做什么:在软件内与主流大模型对话,完成写文案、拆脚本、改话术、翻译摘要、排查报错思路、产品卖点头脑风暴等;「工作模式」下还能在对话中直接生成图片、视频、音乐、语音,一条对话完成从创意到素材。
怎么用:打开「Agent 助手」新建会话即可多轮追问并管理多个对话;工作模式下可直接让它参考上传素材生成图片、视频、音乐或语音。任务运行中可以追加引导、排队下一条或停止,历史消息也可编辑分支和恢复检查点。
结果管理:已生成的完整回答会保留在对应会话中;切换会话或同时生成多项媒体时,结果仍会回到最初发起任务的对话,不会丢失或串到其他会话。
免费选项:3.2.5 中选择“自部署模型”进行文字对话不扣账户算力;模型框直接使用当前运营配置的展示名称。
技能管理:助手不会把聊天内容自动制作成技能。技能只能由你在「技能管理」中手动导入,或经你同意后从技能商店安装;不要提交他人隐私、未授权作品全文或违法内容。
视频生成(多模板 · 与客户端同名)
在客户端「视频生成」中先选模板再填提示词与素材;可选模型、时长、比例和素材容量会随当前配置显示。3.1.8 新增全模式视频生成选项,同一模型可完成文生视频、首尾帧图生视频和真正的多参考素材生视频,三种模式均支持 2K 与 5~15 秒;多参考模式最多可组合 9 张图片、3 段视频和 3 段音频。其他模板常见时长为 4~15 秒,具体以客户端当前选项为准。
3.2.5 的自部署视频模型直接位于同一个模型下拉框中,当前生成视频不扣账户算力。它支持文生视频、单图生视频和 2~3 张有顺序的关键帧转场,并提供 480P、720P、1080P 与多种横竖比例;时长选项会随分辨率自动变化。
文生视频(仅需文字)
综合生成(不限素材类型与数量)
适合:客户端默认首模板:从纯文字描述到图片/视频/音频素材自由搭配的综合生成,宠物/人物小剧场、空镜氛围、概念广告、多素材创意片都可从这里起步。
怎么写:用自然语言写清主体、场景、运动、镜头、光影与风格;上传素材后在正文中用 @图像1、@图像2 等点名各素材的职责(谁的形象、哪段是运镜参考、哪段是节奏参考)。
注意:避免一次塞入互相矛盾的动作与描述;素材与文字冲突时画面会偏向素材,人物若不要某类形象请在风格或约束里写明。
文生视频·侧移跟拍(浅景深)
适合:咖啡、美食、美妆、小物件等桌面级特写,需要「横移 + 虚化背景」的商业质感。
怎么写:在提示里固定「缓慢横移、浅景深、焦点落在主体」;补充台面材质、窗光/暖光与蒸汽、液体等细节。
注意:与综合生成相比,本模板默认更偏「静物 + 微动」,大场面叙事可改用综合生成。
文生视频-联网搜索
适合:需要引用近期公开信息的竖屏简报、资讯摘要类画面(如科技/财经要闻),减少凭空编造。
怎么用:提示词里写清检索主题、时间范围与条数;程序在支持联网的线路下会附加检索工具。生成内容仍应人工核对事实。
注意:必须当前线路与账号支持联网;不适合强隐私或内训材料。
文生视频·电商产品展示
适合:单品主图视频、详情页头图、投放素材,需要干净展台与稳定布光。
怎么写:写清品类与卖点(材质、Logo 区、转盘或慢推),强调「三点布光、色彩还原、少畸变」;需要无字画面可在提示中说明。
注意:复杂多 SKU 同框建议拆多条任务或改用多图模板。
图生视频与多图(以参考图为主)
图生视频-基础(1张图)
适合:已有定妆照、产品图或插画,希望「让图动起来」但保持光影一致。
素材:恰好 1 张参考图;文中「图片1」对应该图。
怎么写:说明希望的动作幅度(微动/行走/推近)、是否手持感、电影感或二次元风格;避免与参考图构图严重冲突的描述。
首尾帧-两图过渡(2张图)
适合:明确知道「第一帧长什么样、最后一帧长什么样」,中间过程交给模型补全。
素材:按列表顺序:图1 = 首帧,图2 = 尾帧;主体轮廓与色调宜接近,过渡更稳。
怎么写:可指定横移、推拉或渐变,强调「光影连续、比例一致」。
多图组合场景
适合:人物与场景分别设计好,希望合成到同一镜头(如角色走进你画的街景)。
素材:2 张图:通常图1 人物外观、图2 环境。
怎么写:描述人物在场景中的位置、走向与透视关系,必要时写明光照方向以便融合自然。
多图角色场景
适合:多角色同框、群像、短剧分镜,需要多张定妆或场景参考同时约束画面。
素材:1~9 张参考图,顺序要在正文用「图片1」「图片2」… 逐一点名职责(谁的脸、谁的服装、哪张是景)。
注意:短剧视频在多角色镜次会走类似组包;张数越多越要写好每张分工,否则容易「粘脸」或主次不清。
智能多帧(关键帧链路)
适合:故事线已拆成多格关键画面,希望按时间顺序顺滑衔接(如分镜师已出 3~10 张关键帧)。
素材:3~10 张图;是否可用以及实际张数以当前模型和客户端提示为准。
怎么写:图1 作首帧,其后每张为沿时间推进的关键节点;补充每段衔接动作与情绪。
基于参考视频的编辑与延展
主体替换
适合:保留原视频的机位与动作,只把画面里某个物体换成新外观(如换包装、换道具模型)。
素材:1 张新外观参考图 + 1 段原始视频;提示词里写清被替换物体名称。
注意:运镜会以参考视频为准,勿期望改变大角度镜头运动。
对象添加
适合:在不变更原有表演的前提下,向画面里增加小元素(如蝴蝶、粒子、前景物体)。
素材:1~3 段参考视频(与界面列表一致);提示词具体写「增加什么、大致位置、不要挡脸」等。
对象删除
适合:去掉路牌、路人、电线等干扰物,保留主体动作与背景透视。
素材:1~3 段参考视频;写明删除对象及是否修补背景。
局部重绘/编辑
适合:改服装颜色、换招牌文字区域、微调局部材质而保持姿态与脸型。
素材:1~3 段参考视频;提示词限定「只改哪里、其余不变」。
视频延长(续拍)
适合:当前片段结束得突然,希望在时间轴向后自然接一段。
素材:1~3 段参考视频;描述延续动作、情绪与镜头语法,避免跳剪感。
前序生成(向前延长)
适合:补「进画之前发生了什么」,使现有视频首帧不再显得突兀。
素材:1~3 段参考视频;强调与首帧的光效、位置无缝衔接。
组合参考-风格迁移
适合:已有实拍动作,希望整体看起来像某张概念图的色调、笔触或电影 LUT。
素材:1 张画风/色调参考图 + 1 段视频;动作与时间线以视频为准,图只提供风格。
轨道补全
适合:画面有遮挡、缺角、穿帮区域,希望在不动时间轴的情况下修补完整。
素材:1~3 段参考视频;说明缺损区域大致位置与期望补全内容。
多模态单任务
多模态-参考运镜+配音节奏(图+视频+音频)
适合:已定首帧画面,想「镜头照着样片走」,且剪辑点卡在音乐/配音节拍上。
素材:1 图 + 1 参考视频 + 1 参考音频;请选择支持混合参考素材的模型。
怎么写:说明图负责氛围与首帧,视频负责运镜,音频负责节奏;避免三者叙事互相矛盾。
更多模板扩展(以客户端为准)
下列模板是否可用会随当前云端能力配置变化;首行格式、模板 ID、音色 ID 等请以软件内说明为准。
场景特效模板
适合:在人物或场景上叠加平台提供的特效模板(如互动特效类)。
怎么写:第一行写 template: 加官方模板 ID;正文描述动作与画面;可配 1~6 张参考图。
模板成片
适合:快速叙事短片,由平台按「多图顺序」帮你组镜。
素材:1~7 张图;可选首行 story: 故事模板名,不写则用默认故事线。
文生音频
适合:按文字描述直接生成一段环境声、氛围铺底或简单音乐性音频。
怎么写:用自然语言写场景与情绪,长度适中;用于给视频或直播垫底时可多试几条选最贴合的。
可控文生音效
适合:需要按秒控制「前 3 秒鸟叫、后 4 秒海浪」这类分段音效。
怎么写:可用 JSON 数组描述各时间段的 prompt,或直接一句中文作为整段音效说明。
语音合成
适合:把大段文稿读成音频,再给对口型或数字人模板用。
怎么写:第一行 voice_id: 加官方音色 ID;换行后全文朗读内容,注意字数上限。
声音复刻
适合:用你的参考音频训练临时音色,再 TTS 任意文案。
素材:须上传 1 段参考音频;第一行定义 voice_id:(英文字母开头、长度符合要求),换行写试听句。
动作同步
适合:让静态人像跟随参考视频里的身体动作(单人、正脸类效果较稳)。
素材:1 张正面人像 + 1 段约 2~30 秒动作视频。
对口型
适合:已有说话人镜头,要把嘴型对齐新配音或新台词。
素材:1 段含人脸的视频;可再传 1 段音频,或不传音频而用文本生成语音后对齐。
注意:纯文本驱动时对白长度、音色 ID 等规则见客户端提示。
数字人(视频生成 Tab 内模板)
与 AI 直播的数字人区别:此处是云端视频生成内的一套模板流程,强调 1 张人物图 + 音频或口播稿。
素材:恰好 1 张清晰人脸图;可选 1 段音频,无音频则用提示词中的口播全文走 TTS。
推荐提示词
适合:有图但不知道怎么写视频提示词,想先要一批创意方向。
结果:返回推荐文案/标签类内容,不直接输出可下载成片视频;可选首行 types: 指定请求类型。
智能超清尊享
适合:已有成片,需要云端超分到更高档位。
素材:1 段视频;第一行可写 upscale: 档位,或用 creation_id: 引用平台侧成片(二选一规则以客户端为准)。
一键通用成片
适合:1~7 张任意主题图,自动生成带叙事节奏的短片,时长可在界面选较大范围。
怎么写:正文可选主题、节奏、字幕口吻;图顺序会影响镜头组接。
一键电商成片
适合:多图商品展示 + 口播卖点,偏带货与促销信息。
怎么写:可首行 language: 指定中英文口播倾向;正文写卖点、优惠与品牌调性。
一键AI-MV
适合:有歌或伴奏 + 若干视觉参考图,快速做 MV 感短片。
素材:1~7 图 + 1 段约 10~180 秒音频;正文可说明是否对口型、色调与剪辑偏好。
视频复刻
适合:喜欢参考视频的运镜与节奏,但要换掉画面里的商品/人物外观。
素材:1 段 5~180 秒参考视频 + 1~7 张新外观图;正文说明替换谁、保留谁。
视频复刻
适合做什么:你有一段「想要同款节奏/运镜/气质」的参考片,希望在自己的人物或场景素材上复现类似表达方式,用于追热点形式、统一账号调性。
怎么用:在「视频生成」中选择「视频复刻」模板,上传 1 段参考视频 + 1~7 张图片(不带参考音频),填写希望保留或弱化的元素;提交后在云端任务取成片。
注意:参考片需你有权使用;复刻不等于复制他人原创内容用于侵权,生成结果仍建议人工审片。
探店 / 电商视频工作区
适合做什么:实体门店探店种草片、商品带货短片等「按秒编排 + 口播讲解」的竖屏内容,不必手写整套分镜。
怎么用:在客户端「探店」「电商」独立工作区(或「视频生成」中的「探店视频」「电商视频」模板)上传 1~9 张门店/商品图,探店模板可再加 1 段口播音频;工作区会按「成片规划(总时长、镜数、钩子→卖点→细节→CTA)」生成分镜稿,含口播分句与逐镜画面描述,每镜独立生成 9:16 竖屏视频并逐镜审核,最后拼接成片。
注意:参考图只按已上传张数引用,提示与分镜不会编造图中不存在的内容;发布前请核对门店与商品信息的真实性。
数字人口播
适合做什么:口播带货、课程口播、APP 更新说明、多语言播报等你需要「脸 + 声」但不必真人反复录制的场景。
怎么用:在「视频生成」中选择「数字人」或「对口型」模板:「数字人」模板用 1 张清晰人物图 + 配音音频(无音频则用口播稿文字转语音)生成口型同步的口播视频;「对口型」模板用 1 段含人脸的视频对齐新配音或新台词。完成后在云端任务下载成片。
注意:肖像须有权使用;声纹若使用在线语音服务也需遵守对应授权范围。需要实时出镜的直播场景请用「AI 直播」的数字人驱动。
音乐生成
适合做什么:为短视频、广告片头、直播间垫乐生成可循环的 BGM 或短曲,减少版权检索成本。
怎么用:用风格、情绪、速度与时长等关键词描述需求;生成结果为音频文件,可导入「智能混剪」或与视频轨道合成。
注意:商用发布前请确认当前服务对生成音乐的授权说明。
视频超清
适合做什么:已有成片需要云端超分到更高清晰度档位,用于大屏展示或二次发布。
怎么用:在「视频生成」中选择「智能超清尊享」模板,上传 1 段已有视频;首行可写 upscale: 档位(可选 1080p / 2K / 4K / 8K,不写则默认 1080p),提交后由云端完成超分。
注意:档位越高耗时与算力消耗越大;超分无法真正恢复源素材丢失的细节。
云端 AI 工具箱(8 项)
包含工具:去水印字幕、字幕擦除、动作迁移、视频换人、换装换衣、高清修复、反推生图、口播视频。它们是左侧「云端」分组中的独立入口,与本地去水印、提示词反推等功能互不影响;换装换衣可在同一页选择“自然换装”或“强力覆盖”。
操作方式:按页面提示选择图片、视频或音频并填写参数,点击「开始」后可持续查看上传、提交、处理和保存状态;输入素材与结果都支持大预览,多结果会以缩略图墙展示,双击即可用系统默认程序打开。
可用状态:暂未开放的工具仍会保留入口并说明原因,可在页面内重新检测;首次同步未完成或网络刷新失败时会保留导航,不会把连接问题误显示为功能已下线。
口播视频:没有现成音频时,可在页面内输入文案,用本地超拟真V3生成配音;可选参考音频克隆本人或已获授权的音色,生成后自动填入音频输入并继续制作。
结果:完成内容会自动保存到输出目录并同步到云端任务中心,方便继续预览、下载或再次处理。
提示词反推
适合做什么:看到别人的优质 AI 视频想知道「这是怎么生成的」,或把自己的成片「翻成提示词」再喂给视频生成做变体。
怎么用:上传视频或粘贴分享链接,客户端会按时间段核对完整画面与音轨,补充快速切镜、短动作、结尾、音乐变化和关键音效;结果可直接带到「视频生成」继续使用。
声音理解:输出会区分画内人物对白或演唱、画外旁白、含人声的背景音乐、环境拟音和无法确认的声源,减少把背景歌声误判成人物演唱。
失败与重试:任务被明确拒绝、处理失败或取消时会立即结束,可直接重新提交,无需重启客户端或清理任务记录;页面只显示可执行的产品提示。
注意:反推文本是近似概括,不保证与原作者意图一致;涉密内容勿上传。
电商套图
适合做什么:围绕同一商品快速准备主视觉、使用场景、氛围、细节、工艺、明暗、卖点、参数与尺寸共 9 张职责不同的图片,用于商品主图、详情页和投放素材。
怎么用:产品图是唯一必填项;Logo、商品名称、真实卖点和规格均可选填。提交后 9 个版位同时处理,右侧 3×3 九宫格分别显示每张图的状态和结果。
多语言文案:支持简繁中文、英语、日语、韩语及常用欧美、东南亚和中东语言。已有中文资料会忠实转换到目标语言,品牌、型号、数字和单位保持原样。
事实边界:未填写的尺寸、材质、功率或效果不会被擅自补造;每张成功结果可双击打开原图,未上传 Logo 时保留生成原图,上传后只额外叠加 Logo。
图片生成(11 套模板 · 客户端)
在「图片生成」中选模板会同时切换默认模型、是否组图、是否联网、尺寸策略等。标准模型由云端模型目录提供,兼容模板可走 4.x 并带「提示词优化」。参考图占位符为 @1、@2(按列表顺序),与视频页的 @Image1 不是同一套规则。除模板外,界面还提供「张数」下拉框(1~9 张)与「分辨率」设置,可按需调整出图数量与清晰度。上传多张参考图时,系统会确认所选模型能否完整接收:支持则全部提交,只支持单图则在扣费前明确提示更换模型或减少素材。
3.2.5 的自部署图片模型当前生成图片不扣账户算力,支持纯文字生成、单张参考图和双参考图;结果会直接回到当前页面。
新增 · 多图生图(0~9张)
适合:客户端默认首模板:可纯文字出图,也可叠加 1~9 张参考图做多图融合,商业静物、产品场景、穿搭与氛围图都能从这里起步。
怎么写:用自然语言描述主体、场景、光影与画质要求;上传参考图后用 @1、@2 点名每张图的作用(如 @1 商品、@2 场景)。
设置:默认标准模型、单张、不组图、不联网;参考图 0~9 张可选。
① 文生图·特写肖像
适合:时尚、杂志感、强光影的人物特写,无需参考图。
怎么用:在默认示例上改发型、服饰、灯光与情绪即可;单张输出。
② 图生图·材质替换
适合:商品静物摄影里「换一个材质」但保持构图与角度。
素材:1~9 张参考图;提示词写清要换的对象与目标材质(如陶瓷改玻璃)。
③ 多图生图·换装
适合:虚拟试衣、穿搭展示,把一件服装穿回指定模特。
素材:1~9 张参考图:@1 人物全身/半身,@2 服装平铺或穿搭参考,更多图可补充角度与细节。
怎么写:说明保留脸与体态、褶皱自然;勿与 @ 顺序矛盾。
④ 组图·科幻四分镜
适合:一次生成 4 张叙事连贯的分镜,角色与画风需一致。
怎么用:在提示里写清四格各自场景与情绪递进;程序会开组图序列(如 max 4 张)。
⑤ 参考图+组图·品牌视觉 GREEN
适合:拿一张 LOGO/主视觉,延展成套物料(包装、周边等)。
素材:1~9 张参考图;提示词里可改品牌名与品类,保持主色与图形语言一致。
⑥ 多图+组图·过山车三时段
适合:同一角色与道具在早/中/晚光线下的三连拍叙事。
素材:1~9 张参考图约束角色与玩偶形象;组图 3 张。
⑦ 联网搜索·五日天气预报图
适合:信息图、天气穿搭卡、需带检索数据的扁平插画。
设置:开启联网搜索与固定方形像素尺寸;提示里写明城市、天数与排版(如横向五卡)。
注意:检索结果需人工核对后再对外发布。
⑧ 参考图·四姿态组图
适合:同一人物四种动作/道具状态,用于表情包、电商展示位。
素材:1~9 张人物参考图;输出 4 张一组,画风与身份需可识别为同一人。
⑨ 兼容模式·四季庭院+提示词优化
适合:想试兼容模型上的组图能力,并接受「先优化提示词再出图」的流程。
设置:兼容模型 + 快速优化 + 4 张组图;适合插画类连续场景(如四季同一庭院)。
⑩ 文生图·主视觉海报(标题区留白)
适合:横版活动主 KV,后续要在 PS/Figma 里叠大标题。
怎么写:强调上方 15%~20% 留白、主体居中偏下、少细碎小字。
短剧视频(客户端重点能力)
短剧视频是从需求、资料或现有正文到分镜与成片的完整生产线。它提供 34 类内容方案,把大纲、分集内容、人物、商品、场景、证据、分镜、逐镜视频和最终拼接放进同一个工程中管理。
导入正文或脚本直接创建项目
支持格式:可导入 TXT、Markdown 或 DOCX,先选择对应内容方案,再按“第 N 集”或章节标题自动拆分;没有分集标记时会作为单集保存。
直接生产:导入后无需补做大纲和规划,可从当前正文或脚本继续生成分镜、关键帧、视频提示词与成片。修改正文后会提示重新生成分镜,避免沿用旧镜头。
34 类内容方案
覆盖场景:连续故事、带货、口播、探店、活动、品牌、企业、测评、知识、课程、旅游、招商、母婴、美妆、家装、汽车、房产和回忆录等方案均有独立资料与生成规则。
方案资料:产品、受众、证据、主持人、场地和商品图等内容会在“生成大纲”时按当前方案集中显示;缺少必填资料会明确提示,独立入口也允许先保存部分资料。
全流程生效:所选方案会继续约束大纲、正文或脚本、资产职责、分镜、关键帧、提示词和成片标准,不只是一个分类标签。
内容方案可控切换
内容保留:用户直接导入的正文或脚本始终保留;其他当前正文可由用户明确选择是否迁移,纯导入内容不会显示无意义的重复选择。
结果隔离:旧方案的大纲、规划、素材、分镜、关键帧、提示词和输出状态会与新方案隔离;运行中的项目任务不会被切换操作串改。
核心卖点:让内容进入可生产状态
识别:填写一句话需求后,AI 可识别适合的生产类型和细分方案,用户仍可调整组合;确认结果会随项目保存。
优势:从一段需求或素材自动走到可生成的视频镜头清单,并保留工程关系:当前方案组合、分集来源、角色与素材引用、镜头提示、成片来源都可以继续核对和修改。
输出:分镜表、角色/场景/道具参考图、单镜视频、拼接后的 9:16 竖屏成片;适合再接混剪、字幕、发布等模块。
阶段一:大纲、内容规划与分集产物
你提供:一句话需求、小说章节、商业资料、知识材料或回忆录事实,可继续指定风格、受众与表达重点。
软件做:按全部已选方案生成对应的大纲和内容规划。连续故事产出小说正文;商业、知识与回忆录产出独立的分集生产脚本,不再套用小说主角、反派或付费钩子模板。
可编辑:页面标题、按钮、空状态、规则编辑器和导出文件名都会跟随方案变化。不同方案组合的规则与结果按项目隔离;更改方案后,旧分镜、关键帧、提示词和视频不会被误当作当前结果继续使用。
长篇生成与项目切换
长篇稳定性:生成主线时会持续显示当前输出,完整设定生成结束后再统一切换结果;写每一集小说时只提取该集相关细纲、伏笔和有长度上限的全局资料,减少长篇内容挤满模型上下文。
清楚提示:本地文字模型收到超过上下文上限的材料时,会显示本次请求量与模型上限并停止重复提交;旧项目只缺伏笔账本条目时,可以保留已有内容并定向补齐缺项。
安全切换:后台生成期间可以切换到其他项目再返回,生成结果、当前编辑和界面刷新会继续归属于原项目,不再因重复加载项目快照而互相覆盖。
阶段二:分镜、资产与关键帧
软件做:连续故事强调人物行动和跨镜连续;商业内容强调产品与演示;知识内容强调步骤、图表和屏幕;回忆录强调有依据的人物、档案与地点。商业与知识内容允许无人出镜,不会强行添加角色。
你可介入:可编辑分镜、重绘或替换参考图,并调整角色、场景和道具。单镜重生成只使用同一剧集的相邻镜头,不会跨集借用首尾画面。
阶段三:逐镜视频
软件做:每镜按当前方案、分镜事实、实际参考素材、画幅和分辨率构建任务;旁白、解说和没有明确角色归属的画外音不会误绑人物音色。
并发与连续性:同一项目可以同时生成不同镜头,同一镜头仍会防止重复提交;同场景后一镜需要前一镜实际尾帧时会自动等待,避免并发破坏画面接续。
参考图容量:计划素材多于当前模型可接收数量时,提交前会列出实际上传和仅作文字约束的图片,由用户决定继续或更换模型,不会静默丢图。
旧来源管理:主线、分集内容、分镜、提示词或参考素材发生变化后,旧文件会标明“来源已变化”,仍可预览、打开和删除,但不会冒充当前镜头完成或继续参加合并。
单镜重试:重试中间镜头时继续使用完整分镜的前后镜关系;只生成部分镜头的批次不会覆盖整集最终成片状态。
阶段四:拼接与导出
软件做:只使用与当前方案、分镜和素材来源一致的镜头按时间轴拼接成片,可统一叠加单轨 BGM,减少多镜拼接后的断裂感。
界面:输出页操作集中在视频列表顶部,镜头缩略图会在后台生成并随源视频更新;打开按钮始终对应当前卡片的真实文件,播放器不可用时会显示易懂提示。
后续:可合并全部或部分有效镜头,再继续做字幕、混剪、超清输出或交给「多平台发布」。
话术生成
适合做什么:直播整场逐段话术、短视频口播稿、投放文案的多版本 A/B 草稿。
怎么用:粘贴原话术,设置目标字数(500~1000000),可一次勾选多种目标语言,并设置源语言、品牌与术语保留、同义词变量格式({ | } 或 【 】)及模型。3.2.5 会在生成前一次明确商品事实、参考口吻、正文结构与篇幅,让模型直接返回可保存的完整话术;空结果、明确截断、请求异常或文件无法保存时才会中止并说明原因。
多语言与变量:37 种目标语言分别约束文字体系、自然口语和区域表达。开启变量后,每个非空行会安排 3~5 组变量,每组提供 3~5 个可互换选项,同时保护价格、规格、数量、品牌和商品事实。结果可直接用于「AI 直播」脚本,或作为「数字人 / 对口型」模板的口播文本。
注意:涉及医疗、金融等强监管行业需人工合规审核;数字与承诺语不要盲信模型。
💻 本地功能(本机运行)
以下功能在您电脑本地执行,数据不上传至我方服务器;部分功能依赖 NVIDIA 显卡与显存,建议显存 6GB 及以上(如 RTX 3060)。
Agent 助手与图片生成的本地模式
入口:在 Agent 助手、图片生成或短剧视频现有的模型下拉框中,直接选择本地文字或图片能力,无需进入单独页面;名称与当前运营配置保持一致。
下载:首次使用会检查当前任务所需资源;缺少或损坏时先征求同意,再打开独立窗口显示总量、实时进度、速度、预计剩余时间和文件校验。窗口可转到后台,取消后保留已下载部分供下次续传。
体验:本地文字回复会显示实际输出量、耗时与生成速度;本地图片支持文字生成和单张参考图重绘,结果可在页面中预览。
AI 直播
能力:四种直播模式——纯音频直播、摄像头驱动、数字人驱动和视频素材直播;可长时间循环预设脚本,也可接弹幕做互动。
界面:选择视频素材直播后,高级参数默认收起,让素材和开播操作更集中;点击“展开参数设置”即可恢复叠加、实时画面变化与播放换镜三列完整设置。
指定主画面:@视频[产品近景] 切到对应名称的视频;@视频组[产品展示] 从对应分组选择;@随机视频 随机切换;@默认视频 回到默认素材。
临时叠加:@叠加[优惠角标;透明度=40%;大小=38%;位置=右上;持续=8秒] 可按名称临时加入叠加视频,@清除叠加 用于清除临时叠加。
执行时机:指令不会被朗读,并且只在包含它的那段话术真正开始播放时执行,不会提前改变前半句话的画面。
实时去重:在不修改源文件的前提下,直播画面可持续加入平滑的构图、旋转、清晰度与色彩变化;每次开播使用新的变化序列,多素材换镜还能设置近期不重复数量。
多层叠加:可同时启用多个叠加视频,每层分别设置透明度、位置、大小、混合方式、翻转、圆角和柔边;全屏叠加会按比例铺满并居中裁切。直播中调整参数不会重启主画面时间轴。
播放编排:支持基础速度、随机或顺序换镜、近期不重复数量、素材播完行为,以及循环时重新选择速度或起点;参数会随会话保存。
中控:直播中控连接各平台中控台,弹幕抓取覆盖 8 平台(抖音/巨量百应、快手、视频号、淘宝、百度、拼多多、TikTok、小红书),支持 AI 弹幕文字/语音回复、商品讲解弹窗、定时公屏、直播剧本与直播热键。
输出:直播画面可选窗口预览或 OBS 虚拟摄像头输出,配合 OBS 推流至各平台开播;弹幕自动回复需配置大模型接口。
连续性与恢复:摄像头模式会等口型功能真正就绪后再起声;数字人以实际声音位置为播放时钟,句间自然闭口且画面继续,下一句准备和短时画面波动不会造成先定格再跳帧。停播、快速重开或切换模式时会清理上一场的声音与画面任务;本地语音一次启动失败后仍可在稍后重新检查恢复。
形象训练:点击训练后立即显示处理窗口,预处理忙碌状态、训练百分比、当前阶段和已用时持续更新;处理中重复点击不会启动第二个任务。
更多:详见 AI 直播 专题页。
对口型
适合:给已有真人或数字人人物视频替换配音和口型,制作课程口播、产品讲解、多语言版本与角色对白。
怎么用:在“AI直播”下方进入“对口型”,每次上传一段人物视频,再选择现成音频,或输入文案并选择参考音频克隆本人或已授权音色;处理完成后在本机输出 MP4。
多语言:文字配音支持 69 种本地语言和方言;跨语言克隆、方言或自动识别不准时,可填写参考音频原文。
任务管理:支持取消、播放成片和自选输出位置;人物素材只用于本次临时分析,不会加入数字人形象列表。
智能混剪
流程:支持抖音/TikTok/小红书/快手/B站/微博/视频号/皮皮虾/知乎/微视 10 平台链接解析下载素材 → 场景智能切分 → 以「过原创检测」为目标的去重/重排/变速混剪 → 字幕封面、配音,支持断点续剪与混剪报告;素材列表会显示每段视频的真实封面,批量导入时更容易辨认。
模式:一键随机拼凑、语义叙事、单素材裂变、多素材拼接、智能优选、节拍卡点等 10 种混剪模式;默认模式不再显示无用提示和空白占位,切换到其他模式时仍会显示对应说明。
建议:素材分辨率尽量接近,避免横竖混剪导致大量黑边裁切。
多平台发布
适合:同一成片要发多个平台与账号,减少重复点击上传:抖音、快手、小红书、B站 支持一键自动发布,视频号、百家号、TikTok 为打开发布页的半自动模式,共覆盖 7 个平台。
注意:各平台登录态与审核规则独立,标题与话题需按平台习惯分别微调。
去水印
怎么用:视频去水印在本机执行,数据不离开电脑,适合内训片、合同演示等敏感素材大批量处理;支持手动框选、固定位置、智能检测(按首帧自动定位最多 2 个区域)三种定位方式。
处理方式:支持边缘融合、内容填充和高斯模糊等方式;复杂背景擦除后可能需要二次修补。
注意:对他人作品去水印并商用可能侵权;仅建议在权利清晰时使用。
转语音(含语音克隆)
处理方式:提供在线多语种合成与本地零样本语音克隆两种方式,支持多种语言、方言与情绪表达,可按页面选项调整语速和资源档位。
素材质量:3~10 秒、少混响、少背景乐的清晰干声最佳;口音与语速会继承到克隆结果。
用途:长文配音、角色统一声线、与本地数字人/直播搭配;模型与缓存默认留在本机。
合规:仅克隆本人或已书面授权的声音。
音频切片
适合:从长录音里切出多条短视频配音、或从播客里抽金句;支持音频及视频中的音轨,可批量处理。
参数:5 种分割模式(按静音 / 按时长 / 按节拍 / 按句子 / 自定义时间点),默认按时长连续切割,可设片段时长(1~300 秒)、音量标准化与淡入淡出,输出 MP3 / WAV / AAC / FLAC / OGG。
结果:处理窗口持续显示当前阶段、文件名和已用时,无声、过短或无效片段会自动过滤;结果统一保存到中文音频目录并可从页面直接打开。
音频提取
适合:把视频里的音轨抽出来单独使用,如提取解说配音、背景音乐再利用。
怎么用:支持本地视频文件,也可粘贴分享链接解析下载后提取;文件列表会显示每段视频的封面缩略图,输出 MP3(也可选 WAV / AAC / FLAC / OGG)。
文字提取
适合:自动生成字幕 SRT、会议纪要、视频文案再利用。
识别方式:支持本地离线识别与云端增强识别;方言与强 BGM 会降低准确率,强噪音素材可切换云端模式。
音频编辑
能力:面向带货音频的批量再加工——LLM「一键调整」(输入新商品信息改写重录)、关键词一键替换、关键词过滤删除、片段列表管理,可批量处理文件夹。
衔接:常放在「AI 直播」或「智能混剪」前,批量统一话术口径与商品信息。
🎭 数字人出镜与神经口型
摄像头神经口型:AI 直播的「摄像头驱动」模式下,真人摄像头采集画面后,由本地神经口型引擎按口播语音实时对齐嘴部动作——只换口型、不换脸。3.2.5 会从当前生成画面同步补强唇线、牙齿边缘和两侧嘴角,减少人物移动或张嘴时的软糊、黑白边缘与局部撕裂;开播前会先确认口型功能真正就绪,停播或切模式会回收后台资源与摄像头。
数字人出镜:AI 直播的「数字人驱动」模式下,先用一段本人或已授权的形象素材训练专属数字人(训练过程显示预处理、真实进度、阶段和已用时),再由实时引擎驱动播报与互动。声音连续播放,相邻句自然衔接;句尾闭口但人物动作与背景继续,适合长时间循环直播。
对口型:无需把素材训练成长期形象,上传单段人物视频后可直接用音频或多语言文字配音生成新口型 MP4;临时素材仅用于本次任务并保存在本机。
合规使用:数字人形象、肖像与声音素材请仅用于本人或已获得合法授权的内容;禁止用于诈骗、诽谤或绕过身份认证,禁止侵犯他人肖像权、名誉权与隐私。
📌 使用建议
- 云端任务:提交后可查看排队、处理中、完成与失败状态,也可右键复制脱敏后的任务详情。失败原因会区分内容审核、参数、网络和账户问题,方便按提示处理。
- 显存与性能:本地数字人驱动、神经口型、智能混剪与本地语音克隆等功能较吃显存,若遇显存不足可先关闭其他占用 GPU 的程序,或降低分辨率、批量大小。软件内提供「释放显存」等系统工具。
- 模型与依赖:首次使用某本地功能时会自动下载对应模型,请保持网络畅通;若下载失败可查看 常见问题 或 使用教程 中的手动下载说明。
- 合规使用:数字人、语音克隆等能力请仅用于合法、获得授权的场景,禁止侵犯他人肖像权、名誉权与隐私。详见 关于我们 免责声明。
- 结果复核:AI 生成内容可能出现事实、画面、文字或口型偏差,公开发布前请人工检查事实、版权、肖像授权、字幕与品牌信息。
- 隐私选择:敏感素材优先使用本地能力;使用云端功能前请确认素材已获得授权,并查看 隐私政策 了解数据处理范围。
更多能力持续迭代中。若您需要某一功能的详细步骤,可查看 使用教程 与配套文档;遇到问题可先看 常见问题 与 帮助与反馈说明。立即 下载体验 多财多亿AI。