前段时间,我用 AI 做了一条「云上天宫」风格的短片。从最初的想法,到剧本、人物、场景、分镜、视频生成,再到最后剪辑成片,整套流程只花了一个下午。
但后来也有朋友跟我反馈:跟着做一遍是会了,换一个题材、换一个故事,还是不知道从哪里下手。
其实这很正常。学会复刻一条片子,不等于真正掌握了 AI 视频的制作方法。真正想做到换个剧本、换套人物和场景也能自己做,关键是要把背后的完整流程搞明白。
所以今天这篇,我想带你从 0 到 1,把 AI 视频到底是怎么做出来的讲透。业内现在常用的一整套工作流,剧本怎么写、人物怎么定、场景怎么做、分镜怎么拆、视频怎么生成、最后怎么剪成一条完整的片子,我都会拆开给你看。
里面也会把自己实际在用的提示词、人物三视图模板和视频生成思路直接放出来。看完以后,你不仅是“看懂了”,而是真的知道下一条片子该从哪里开始。
01 工作流总览
很多新手第一次做 AI 视频,最容易犯的错误就是一上来直接去生成视频。今天刷到一个模型,就去试一下;明天又看到一个新平台,再换一个。最后模型试了一圈,积分也花了不少,还是做不出一条完整的片子。
其实 AI 视频真正的制作逻辑并不复杂。你可以先记住下面这条流程:
想法 → 剧本 → 人物资产 → 场景/道具资产 → 分镜图 → 视频生成 → 剪辑成片

后面不管你做的是古装、玄幻、都市、广告还是文旅片,底层思路都差不多。题材会变,模型会变,但这套流程基本不会变。所以这篇文章里,我们不追求把所有模型都学一遍,而是把流程跑通。
02 零基础到底需要哪些软件?
先说结论:如果你只是想完整做出第一条 AI 视频,不需要一口气学十几个软件。这篇里主要会用到三个:
- DeepSeek:负责剧本、剧情拆解和提示词优化。
- LibTV:负责人物、场景、分镜和视频生成。
- 剪映:负责最后的剪辑、字幕和音乐。
基本就够了。
聚合平台:LibTV
我这次主要用 LibTV 来跑整套生成流程。它比较方便的一点是,人物、场景、图片和视频都可以放在同一个画布里处理,不需要在不同网站之间来回切。双击画布,就可以创建图片或视频节点,模型选择栏里也能直接切换不同的图片、视频模型。



对新手来说,这种节点式画布还有一个好处:你可以非常直观地看到一条视频到底是怎么一步一步做出来的。
进阶:各家视频模型怎么选
上面这套三件套已经够你跑通第一条片子了。下面三个平台是“可选替换项”,不是必须的,想换换画质、控控预算的时候再看。
即梦(Seedance 系列):目前“一键成片”的第一梯队

- 擅长:seedance 2.0 提示词门槛极低,几句白话就能生成影视级运镜与剪辑;训练素材庞大,复杂主题响应出色。seedance 2.5 的氛围效果达到电影级,对提示词指令还原度高,表演自然。配合自家 Seedream 图像模型,理论上在平台内就能完成全流程出片。
- 短板:价格较贵。
可灵:画质与稳定性兼备的“六边形战士”

- 擅长:综合效果扎实,画质清晰稳定,擅长真人写实与厚重电影感。3.0/3.0 Omni 自定义分镜稳,支持角色主体库与人物音色绑定,配合音画同出、多图融合,质感出色,3.0 已支持原生 4K。
- 短板:大动态动作、极限运镜表现一般,更考验视听语言拆解与提示词精准度;台词还原度时好时坏,10 秒以上长素材抽卡率偏高;3.0/3.0 Omni 较贵,试错成本高。
海螺 AI(MiniMax H3):seedance 的平价平替

- 擅长:对提示词还原较好,复杂主题响应较为出色,文字排版和视觉包装特效效果不错;模型善于发挥想象力,找到镜头间的联系。
- 短板:电影氛围、人物细节、表演功力弱于 seedance 系列。
新手阶段,记住一句话:没有哪个模型是全能的,不同镜头用不同模型就行。
如果是人物剧情、对白、表演类镜头,我一般会优先考虑即梦(Seedance)。如果更看重画面清晰度和分辨率,可以考虑可灵。如果预算有限、需要大量测试,也可以用海螺 AI 先抽镜头。
如果你对各家大模型的 API 接入、价格和模型能力对比感兴趣,不妨留意一下 RouteFast.ai 这类模型中转站,它们通常会把主流模型整理清楚,方便按预算做选择。
03 剧本不会写?DeepSeek 帮你搞定
剧本没想清楚,后面所有东西都会跟着返工。但在 AI 时代,你不需要先写出一个完整故事。哪怕只有一个模糊的想法,也可以直接丢给 DeepSeek。

像这样,把零碎的想法一股脑全发给它。这种事它很拿手,你给它一个想法,它很快就能把剧本骨架搭出来。
但新手小白经常会有一个误区:AI 秒出剧本,不代表这个剧本能直接拍。拿到第一版以后,我一般还会自己再改一遍。核心只看三点——剧情逻辑顺不顺、画面能不能生成、台词像不像人话。这三件事先解决,返工至少省一半。
04 资产设计:整个流程最花时间的一步
剧本确定以后,下一步不是生视频,而是先做资产。
所谓资产,就是片子里反复出现的东西,主要有三类:人物、场景、道具。因为 AI 记不住上一镜——角色穿什么,房间什么样,桌子在哪边,前面不固定,后面每一镜都可能重新随机生成。所以连续剧情想稳,就必须把反复出现的资产固定下来。
人物资产
剧本定下来以后,我下一步一定是固定人物三视图。因为人物最容易出的问题就是变脸。很多同学都在问:不同批次生成的视频,人物样子变了,怎么办?今天一次说清。
不管拍什么类型的短片,生成之前,先给主要角色建一张标准参考图。就像下面这两个角色:


这里有四个要点。
要点 1:尽量不要背景
第一次做人物设定,背景越简单越好:纯色背景、主体完整、光线干净。背景越复杂,模型要处理的干扰信息就越多。
要点 2:人物比例要好看
尤其是现偶、古装、武侠、玄幻这类真人题材,我会明确要求:头小身长、接近二八比例、完整全身。不然很容易头大、腿短,像游戏 Q 版角色。

要点 3:人物尽量不要拿道具
图片的权重比文字的权重高。定妆照里让角色手里拿着道具,哪怕生成视频时你在文字里写“不要拿任何东西”,画面里还是大概率攥着道具。所以先把“人”定下来,再单独做道具。

要点 4:人物图一定要改成三视图
这是整个流程里最容易忽略的,但我现在一定会做的一步。很多人生成一张好看的角色半身照,就直接拿去做视频了。问题是:一张正面照,AI 根本不知道这个人背后长什么样。你让他转身,衣服结构就变了;让他侧脸,发型也换了。所以确定一个角色以后,我会马上把它改成标准人物设定图:左边人物近景,右边正面、侧面、背面三视图。

这个结构我用下来非常方便:左边负责锁脸,右边锁身体、服装和背面结构。后面无论做近景、侧面还是背影,都可以直接拿这一张当参考。
提示词总结
这套角色提示词我磨了一周,实测效果如下。



人物提示词(9:16):
高级感,氛围感,朦胧感清晰流畅细腻自然,oc渲染,cg渲染,真人质感 3D偏真人画风, 真人三庭五眼比例 人物渲染,神似bjd,肌理感,毛孔细腻 皮肤质感纹理 写实逼真,发丝精细且根根分明,细节五官细节发丝,发丝发光面部发光,虚拟引擎背景渲染轮廓光,暖色硬光/冷色硬光(选一个) 勾勒轮廓。面部柔光 均匀打亮。黑柔镜头 纯黑色背景 棚拍定妆照,正面镜头,半身照 。+你的提示词(只需要简单的描述就好 例如 身份+风格/性格)
三视图(16:9/21:9):
生成全身三视图以及一张面部特写。(最左边占满 1/3 的位置是超大的面部特写,右边 2/3 放正视图、侧视图、后视图,二八身材比例),纯色背景
场景资产
人物固定以后,下一步就是场景。场景就像是空房间,先把场景空间做好,再让人物进去演。因为如果你一上来就直接生“人物+场景”,模型很容易同时随机人物和环境,后面再想让不同镜头保持一致就会很难。
所以重要场景,我一般都会单独做一个无人物版本。比如这条片子里,我们主要需要两个场景。提示词如下:
新婚喜堂场景:
真人写实风格,影视剧质感,清代贵族国公府新婚礼堂内景,无人物。夜景,横屏宽画幅构图(电影级 16:9,机位在房门/堂前,镜头朝内拍向床榻方向)。画面主体为一张简洁的拔步床,床头悬挂大红绸缎帐幔(红色为点缀、不铺满),床沿铺锦缎喜被;床架以素净深色木料为主,仅在边角有少量描金线条、不做繁复雕花。床前两侧一对高脚铜制红烛台,红烛高烧、烛火摇曳,暖黄烛光为主要光源,光晕柔和、明暗有层次,避免整体通红。床周与墙壁零星贴几幅大红双喜字作点缀。房梁立柱为素净深棕木质、装饰纹样极少,地面铺暗红织锦地毯,暗部带轻微冷调,与暖烛光形成冷暖层次,整体花纹简约、克制。前景虚化可见门框与垂落红绸门帘一角。整体以金棕、暖黄、深木色为基调,红色点缀其中,华贵而不刺目、不堆砌纹饰,喜庆中透着一丝压抑。无任何人物、文字、水印、海报。

病居场景:
真人写实风格,影视剧质感,清代贵族园林居室内景,无人物。夜景,正打视角(机位在房门/入门处,镜头朝内拍向书案与火盆方向)。画面主体为靠窗的一张竹木书案,案上散放几张写满墨迹的诗稿与笔墨纸砚。书案斜后方靠墙放一张架子床,床架为浅色竹木、纹理素雅,床沿垂挂素白纱帐(或淡青色帐幔),被褥凌乱、显出病中痕迹。床前地面摆一只青瓷火盆,盆中余烬微红、几点火星明灭,窗棂糊素白窗纸,窗外竹影婆娑、透进冷白月色。室内陈设素雅但奢华:一挂淡青帷幔、一排湘妃竹书架、几案香炉。整体清冷、素净、萧瑟,冷月与微红火光形成冷暖对比,床与书案、火盆构成完整的病居空间层次。无任何人物、文字、水印、海报。横屏

这里其实不用担心不会写提示词。如果第一版效果不对,最简单的方法就是直接把你的修改意见告诉 AI。

如果还是不知道怎么描述场景,有个偷懒方法——找参考图。电影、剧集、摄影里看到喜欢的场景,直接把图丢给 AI,让它帮你分析这张图,反推可以生图的提示词。

这招对新手特别友好。很多时候不是没审美,是知道自己想要什么,却说不出来。让 AI 帮你“翻译”就行。
05 资产齐了,怎么生成视频?
人物、场景、道具都齐了,终于可以开始生成视频。素材在其他平台做的,直接上传到 LibTV。

接下来最关键的是:视频提示词怎么写?
新手最容易犯的错,就是把提示词写成一大段华丽文案,其实没必要。你已经有人物图、场景图、分镜图,提示词只干一件事——告诉 AI 接下来画面里发生什么。

提示词的一个简单模板:
真人影视剧风格,横屏16:9。
开场人物A站在画面左侧,身体朝右,人物B站在画面右侧,面向人物A,两人中间隔着木桌。
镜头1:中景固定机位,人物A抬头看向人物B,说:"你终于来了。"
镜头2:切人物B近景,人物B没有回答,只缓慢握紧右手。
镜头3:人物A表情逐渐严肃,镜头缓慢向前推进。只生成对白、衣料摩擦声和室内环境音,不生成背景音乐。
禁止字幕、文字、水印。
但在实际生成视频的时候,几乎所有人一定会遇到一个麻烦——不同批次的视频,人物站位很容易发生变化。上一条里还是男主站左边、女主站右边,到了下一条,AI 可能直接把两人的位置对调。
不同批次之间,AI 不会自动记住你上一条视频里的空间关系。所以我现在每开启一个新的视频批次,都会重新把这两件事描述一遍:人物和人物的位置关系,以及人物和场景的位置关系。

这一步看似麻烦,但对剧情的连贯性非常重要。
06 剪辑微调:最后 10% 决定质感
所有镜头生成好以后,最后一步就很简单了。把素材统一放进剪映,按照剧情顺序拼起来,再补字幕、音乐、环境音和必要的转场。

这里我比较建议,生成视频的时候尽量不要让 AI 自动加背景音乐。因为不同镜头生成出来的 BGM 很容易完全不一样。最后统一在剪辑阶段加,会干净很多。
写在最后
到这里,一条 AI 视频从 0 到 1 的完整流程已经很清楚了:
一个想法 → DeepSeek 写剧本 → 人物定妆 → 三视图 → 场景/道具资产 → 分镜图 → LibTV 生成视频 → 剪辑成片
接下来最该做的,是真正动手跑一遍。提示词永远收藏不完,但第一条视频得靠你自己做出来。
第一条不必追求完美,把流程完整跑通比什么都重要。很多问题,只有做到那一步才知道卡在哪;很多技巧,也是在一次次调整里慢慢摸出来的。先把第一条做出来,再做第二条、第三条。每做完一条,回头复盘,哪步顺、哪步卡、下次怎么更快。做得多了,属于你自己的方法论自然就沉淀出来了。
AI 时代,先玩起来,勇敢的人先享受世界。
如果你在实践过程中遇到问题,或者想找更多志同道合的开发者一起交流,欢迎到 云栈社区 逛逛,那里的知识库和问答区对新手相当友好。