2026 年 7 月 31 日,字节的 Seedance 2.5 和 MiniMax 的 海螺 H3 同一天发布。这不是巧合,而是 AI 视频生产链刚好在这一天补齐了最后两块拼图:Seedance 2.5 是一台虚拟摄影机,擅长长镜头叙事和前期拍摄;H3 是一间后期机房,擅长视频编辑、角色替换、花字包装和原生音效。两者配合,再加上写剧本的大模型和剪映,一个人从零做出 1-3 分钟的成片,流程已经压缩到 2-3 小时。
这篇教程按"开机前 → 拍摄 → 后期 → 成片"的真实顺序写,每一步都给出可直接照抄的提示词和参数,零基础可以跟着做完整条流水线。
0. 先认清工具:谁负责什么
AI 短剧最大的坑,是用一个工具硬扛所有环节。先记住这张分工表:
| 环节 | 工具 | 干什么 |
|---|---|---|
| 剧本 + 分镜表 | DeepSeek / 豆包(文本模型) | 出角色设定和分镜脚本 |
| 角色定妆照 | Seedream 5.0 Pro / 即梦图片 5.0 / 海螺 image-01 | 生成并锁定角色"母图" |
| 正片拍摄 | 即梦 Seedance 2.5 | 长镜头叙事、角色一致、运镜可控 |
| 后期包装 / 补镜 | 海螺 MiniMax H3 | 换脸换装换背景、花字特效、动作迁移、原生音效 |
| 配音配乐 | MiniMax speech-2.8-hd / Music 2.6、剪映 | 对白旁白、BGM |
| 剪辑成片 | 剪映 | 拼接、字幕、调色、节奏 |
两个主力模型的规格对比如下(数据为 2026 年 9 月官方口径,以平台实时价格为准):
| 规格 | Seedance 2.5 | MiniMax H3 |
|---|---|---|
| 定位 | 前期拍摄、长镜头叙事 | 后期编辑、视觉包装、广告动效 |
| 单段时长 | 4-30 秒原生直出,可延长至最长 3 分钟 | 5-15 秒 |
| 最高分辨率 | 1080p(480p/720p/1080p) | 2K(1440p),24fps |
| 参考素材 | 最多 50 个(30 图 / 10 视频 / 10 音频) | 最多 12 个(9 图 / 3 视频 / 3 音频) |
| 声音 | 支持原生出声、音色参考 | 原生双声道立体声(环境音/音效/对白同步出) |
| 独门能力 | 时间戳分段控制、长镜头一致性、白模/绿幕接入、Maya/Blender 插件 | 视频编辑( Artificial Analysis 编辑榜第一梯队)、文字/品牌元素跨帧不失真、动作迁移 |
| 入口 | 即梦 jimeng.jianying.com、豆包专业版、火山方舟 | 海螺 hailuoai.com、海螺 App、API |
| 参考价格 | 1080p 约 2.7 元/秒、720p 约 1.7 元/秒、480p 约 0.7 元/秒(折扣口径) | 2K 约 0.8 元/秒、768p 约 0.5 元/秒;网页端约 12 贝壳/秒,一条 15 秒 2K 约 10 元 |
补充一句开源党关心的:H3 的核心生成模块 H3-Base(33B)已在魔搭开源,本地 8G 显存可入门,但本地上限是 768p / 15 秒,2K 重生成和多模态理解模块仍需走官方 API。新手不用折腾本地,网页端足够。
省钱第一铁律:全程先用最低分辨率(Seedance 480p / H3 768p)"抽卡"定镜头,等整条片子的镜头都选定了,再只对终选镜头出 1080p / 2K 高清。一部 1-3 分钟的短剧,抽卡阶段成本通常几十元就能打住。
1. 第一步:写剧本和分镜表(约 15 分钟)
打开 DeepSeek 或豆包,不要只说"帮我写个职场反转短剧",出来的东西没法落地。用下面这个五层提示词模板,直接改括号内容:
你是一名专业短剧编剧,擅长【职场轻喜剧/甜宠/悬疑反转】,熟悉抖音、快手、红果短剧的快节奏叙事。
请创作一部【1-3】分钟的竖屏微短剧《【片名】》,故事框架:【一句话梗概,如:实习生被组长抢方案,会议上反手拿出证据反转】。
角色设定必须具体到可用于 AI 生图:
- 女主 林悦:24岁职场新人,干练黑色短发,银色细框眼镜,白色衬衫+高腰西裤,五官清秀有灵气
- 反派 张组长:40岁,地中海发型,深蓝色西装,表情油腻
(每个角色都要写清:年龄、发型、五官、标志性服饰、配饰)
输出两份 Markdown 表格:
1. 角色设定表(角色名/年龄/发型/五官/服装/标志特征)
2. 分镜脚本表,表头:镜号 | 景别 | 画面详细描述 | 对白/旁白 | 时长(秒) | 运镜 | 音效
要求:
- 共 12-15 个镜头,每镜 3-5 秒
- 开头 3 秒必须有钩子(冲突/悬念/反常画面)
- 画面描述写动作和情绪,如"林悦抬头望向张组长,眼神从紧张转为坚定",不要只写"两人对话"
- 对白简短,每句不超过 15 字
- 景别在远景(建场)、中景(叙事)、特写(情绪)之间切换
拿到分镜表后人工过一遍:人设描述里的发型、服饰、标志特征(银色细框眼镜这种)就是后面所有镜头的"一致性锚点",一个字都别省。
2. 第二步:拍"定妆照"——角色一致性的根(约 20 分钟)
90% 的"换镜头就换脸",病根在这一步偷懒。
- 打开即梦 → 图片生成 → 选 Seedream 5.0 Pro(或图片 5.0);
- 把角色设定表里的描述逐字输入,例如:
24岁中国女性,干练黑色短发,银色细框眼镜,白色衬衫高腰西裤,正面半身像,纯色浅灰背景,柔和均匀光线,高清写真质感; - 每个角色生成 20-30 张,从中选出 1 张最满意的作为"唯一母图"——选定之后不替换、不重抽、不改外观(即梦不支持中途换图锁定,母图选错整集重来);
- 进阶做法:给主角再生成一套五视图档案——正脸特写、正脸半身、45 度侧脸、90 度侧脸、背面,存进一个角色文件夹。后面拍侧脸、背影镜头时喂对应角度,AI 就不会"自由发挥";
- 关键道具(定情信物、工牌、那封被抢的方案文件)和主场景(办公室、会议室)也各出 1-2 张参考图存档。
母图的选择标准:正面、光线均匀无逆光、背景干净、五官清晰无遮挡。
3. 第三步:用 Seedance 2.5 拍正片(约 60 分钟,核心环节)
3.1 建任务
即梦网页端 → 视频生成 → 模型选 Seedance 2.5 → 竖屏短剧选 9:16(横屏选 16:9)→ 新手单段时长先设 5-8 秒。
3.2 喂参考素材(用掉 50 个素材额度)
点"添加参考",按角色和场景上传,并用 @image1、@video1、@audio1 在提示词里标注每份素材的用途:
@image1:女主母图(多个角色就 image1、image2 分别传)@image3:场景参考图(办公室)@video1:动作/运镜参考片段(可选,比如你想要某个特定的走位)@audio1:女主音色样本(可选,10-15 秒干净人声)
3.3 官方提示词公式(照这个结构写)
完整提示词 = [素材说明] + [一句话概括] + [时间戳分段的具体情节] + [全局补充]
可直接改的短剧镜头模板:
@image1 为女主林悦,@image2 为张组长,@image3 为会议室场景。
职场现实主义风格,电影感自然光,9:16 竖屏。
会议室里,林悦坐在长桌末端,张组长站在投影屏前抢占她的方案功劳。
0s-2s:中景,张组长指着投影屏侃侃而谈,表情得意,镜头缓慢推近
2s-4s:特写切林悦的脸,她垂眼,手指攥紧笔,眼神从紧张转为坚定
4s-6s:林悦猛地抬头看向张组长,嘴角微微上扬,镜头快速推到眼部特写
全局:人物面容、发型、服装与 @image1 @image2 严格保持一致;
林悦全程银色细框眼镜、白衬衫;不要新增人物;手部动作自然,不要多指。
一条铁律:喂了参考图之后,提示词里只写动作、表情、场景、运镜,不要再重复外貌描述(不要再写"黑短发、银框眼镜")。重复描述会和参考图打架,反而导致五官轻微位移。
3.4 锁角色
- 开启"角色参考/智能参考",参考强度设在 0.7-0.8:低于 0.7 锁不住脸型,高于 0.8 画面僵硬;
- 多角色同框时,每个角色用各自的母图独立标注,防止"串脸"。
3.5 镜头衔接:首尾帧接力
每个镜头生成后,截取它的最后一帧,作为下一个镜头的"首帧图"上传,提示词只写下一段的新动作。这样下一段的起始画面和上一段的结尾严格对齐,能压掉 90% 的转身、低头、侧脸崩坏。
长镜头另一种做法:用 Extend Video(延长视频)——选中已生成视频点延长,每次加 4-30 秒,提示词只描述新增部分,最长可拼到 3 分钟。
3.6 抽卡纪律(决定成片率的关键)
- 每个镜头生成 3-5 条选 1 条,不要一条过;
- 每生成 5 个镜头就强制回看校验:发色、眼睛、眼镜、服装、身形对不对,发现异常立即单镜重生,千万别抱着"后面再说"的心理批量往后跑——越往后返工成本越高;
- 抽卡阶段一律用 480p/720p,选定后再出高清。
4. 第四步:用 MiniMax H3 做后期和补救(约 30 分钟)
Seedance 拍完的素材,遇到以下情况不要重抽,交给 H3:
4.1 H3 最拿手的五件事
入口:hailuoai.com → 选择 H3 模型,支持自然语言指令编辑,一次请求最多传 12 个素材(9 图 / 3 视频 / 3 音频)。
- 替换角色/服装/背景:上传视频后直接下指令——
把 @video1 中男主的外套换成黑色皮衣,背景换成雨夜霓虹灯街道,人物动作不变; - 花字与视觉包装(H3 的招牌,视频编辑榜第一梯队)——
为视频添加综艺感花字标题"提案反转",文字随林悦抬头的动作弹出,配色与职场风格统一,文字清晰不变形。短剧的片头字、关键反转处的弹幕式花字、品牌道具特写,都能让成片质感上一个档; - 动作迁移:
人物参考 @image1,让她表演 @video1 中的街舞动作——舞蹈、打斗、复杂运镜不用在提示词里硬描述; - 白模/绿幕上色、实拍加特效:前期用 Blender 出白模或绿幕拍素材,H3 直接上色加特效,打通实拍和生成;
- 原生双声道:H3 每次生成自带环境音、音效甚至同步对白的立体声轨。空镜、氛围镜头可以直接用它的原生声音;但人物对白仍建议后期单独配音,中文口型和情绪可控性更高。
4.2 救场三板斧(两款工具通用)
- 脸崩了但身体动作对:留底板,用 H3 的"替换角色"指令把脸修回来,或用换脸工具把母图人脸映射回去——物理锁脸比任何提示词都管用;
- 只有尾帧崩:截下没崩的最后一帧,用首尾帧接力重生成后半段;
- 轻微面部闪烁:剪映里用叠化/淡入淡出转场掩盖,或把该镜头裁成近景/中景用。
4.3 终出高清
所有镜头定稿后,需要 2K 的关键镜头(特写、反转镜头)用 H3 出 2K(约 0.8 元/秒),叙事中景用 Seedance 1080p 即可。
5. 第五步:配音、音效、剪辑成片(约 20 分钟)
- 配音:对白用 MiniMax speech-2.8-hd(多音色、带情绪)或剪映自带朗读,按角色选不同音色;旁白一句一录,方便对节奏;
- BGM:MiniMax Music 2.6(约 1 元/首,可给风格描述)或剪映曲库,注意情绪转折处换音乐;
- 剪映拼接:
- 先用"智能字幕"识别对白,字幕字号占手机屏宽 5%-8%,白底黑边或黄底黑边,小图状态也要看得清;
- 前 3 秒放最强冲突画面当钩子;
- 全片套同一个滤镜/LUT——色调统一比单镜调得多好看更重要;
- 镜头之间硬切为主,转场用叠化遮瑕疵;
- 封面单独做:用最有张力的一帧 + 大字标题。
6. 常见翻车排查表
| 问题 | 原因 | 解法 |
|---|---|---|
| 换镜头就变脸 | 没有母图,或提示词重复外貌描述 | 定妆照锁定唯一母图;提示词只写动作 |
| 侧脸/背影崩 | 只喂了正脸 | 补五视图档案,侧脸镜头喂侧脸图 |
| 多角色串脸 | 同框未分别标注 | 每角色独立母图 + @image 分别引用 |
| 多长出手指/肢体鬼畜 | 动作超出单镜边界 | 单镜动作拆小;首尾帧接力;异常帧立刻重生 |
| 服装变色 | 跨镜头参数不统一 | 全局补充里锁服装;或 H3 替换服装修回 |
| 口型对不上 | 用了模型原生对白 | 人物对白一律后期配音 |
| 花字/文字乱码 | 用了不擅长文字的模型 | 文字包装交给 H3 |
| 场景光影跳变 | 各镜独立生成无统一锚点 | 场景参考图全片复用;时间戳里固定光线描述 |
| 越做越贵 | 直接高清抽卡 | 低清抽卡、定稿再出高清 |
7. 开工前 Checklist
- 分镜脚本表(12-15 镜,含景别/运镜/时长)
- 每个角色 1 张唯一母图(主角备五视图)
- 关键道具、主场景参考图
- Seedance:参考强度 0.7-0.8、提示词用时间戳公式、不重复外貌
- 每镜 3-5 条抽卡、每 5 镜校验一次、首尾帧接力
- 崩脸交给 H3 替换、花字包装交给 H3
- 终选镜头才出 1080p/2K
- 后期配音、智能字幕、全片统一色调、前 3 秒钩子
按这条流水线走,第一部片子可能要花半天,第二部开始就能稳定在 2-3 小时。工具迭代很快(版本号和积分规则会变),但"母图锁角色、分镜控节奏、低清抽卡高清出片、拍摄和后期分开"这四个原则不会变。
参考链接
- 即梦 AI(Seedance 2.5 官方入口):https://jimeng.jianying.com
- 海螺 AI(MiniMax H3 官方入口):https://hailuoai.com
- MiniMax 开放平台 H3 文档:https://platform.minimaxi.com/docs/guides/video-generation
- 火山方舟(Seedance / Seedream API):https://console.volcengine.com/ark
- Seedance 2.5 官方用户手册(提示词公式与 Extend/Edit 说明)