Back

用 Seedance 和 MiniMax H3 制作 AI 短剧保姆级教程:一个人、一台电脑、两小时出片的完整流水线

2026 年 7 月 31 日,字节的 Seedance 2.5 和 MiniMax 的 海螺 H3 同一天发布。这不是巧合,而是 AI 视频生产链刚好在这一天补齐了最后两块拼图:Seedance 2.5 是一台虚拟摄影机,擅长长镜头叙事和前期拍摄;H3 是一间后期机房,擅长视频编辑、角色替换、花字包装和原生音效。两者配合,再加上写剧本的大模型和剪映,一个人从零做出 1-3 分钟的成片,流程已经压缩到 2-3 小时。

这篇教程按"开机前 → 拍摄 → 后期 → 成片"的真实顺序写,每一步都给出可直接照抄的提示词和参数,零基础可以跟着做完整条流水线。

0. 先认清工具:谁负责什么

AI 短剧最大的坑,是用一个工具硬扛所有环节。先记住这张分工表:

环节 工具 干什么
剧本 + 分镜表 DeepSeek / 豆包(文本模型) 出角色设定和分镜脚本
角色定妆照 Seedream 5.0 Pro / 即梦图片 5.0 / 海螺 image-01 生成并锁定角色"母图"
正片拍摄 即梦 Seedance 2.5 长镜头叙事、角色一致、运镜可控
后期包装 / 补镜 海螺 MiniMax H3 换脸换装换背景、花字特效、动作迁移、原生音效
配音配乐 MiniMax speech-2.8-hd / Music 2.6、剪映 对白旁白、BGM
剪辑成片 剪映 拼接、字幕、调色、节奏

两个主力模型的规格对比如下(数据为 2026 年 9 月官方口径,以平台实时价格为准):

规格 Seedance 2.5 MiniMax H3
定位 前期拍摄、长镜头叙事 后期编辑、视觉包装、广告动效
单段时长 4-30 秒原生直出,可延长至最长 3 分钟 5-15 秒
最高分辨率 1080p(480p/720p/1080p) 2K(1440p),24fps
参考素材 最多 50 个(30 图 / 10 视频 / 10 音频) 最多 12 个(9 图 / 3 视频 / 3 音频)
声音 支持原生出声、音色参考 原生双声道立体声(环境音/音效/对白同步出)
独门能力 时间戳分段控制、长镜头一致性、白模/绿幕接入、Maya/Blender 插件 视频编辑( Artificial Analysis 编辑榜第一梯队)、文字/品牌元素跨帧不失真、动作迁移
入口 即梦 jimeng.jianying.com、豆包专业版、火山方舟 海螺 hailuoai.com、海螺 App、API
参考价格 1080p 约 2.7 元/秒、720p 约 1.7 元/秒、480p 约 0.7 元/秒(折扣口径) 2K 约 0.8 元/秒、768p 约 0.5 元/秒;网页端约 12 贝壳/秒,一条 15 秒 2K 约 10 元

补充一句开源党关心的:H3 的核心生成模块 H3-Base(33B)已在魔搭开源,本地 8G 显存可入门,但本地上限是 768p / 15 秒,2K 重生成和多模态理解模块仍需走官方 API。新手不用折腾本地,网页端足够。

省钱第一铁律:全程先用最低分辨率(Seedance 480p / H3 768p)"抽卡"定镜头,等整条片子的镜头都选定了,再只对终选镜头出 1080p / 2K 高清。一部 1-3 分钟的短剧,抽卡阶段成本通常几十元就能打住。

1. 第一步:写剧本和分镜表(约 15 分钟)

打开 DeepSeek 或豆包,不要只说"帮我写个职场反转短剧",出来的东西没法落地。用下面这个五层提示词模板,直接改括号内容:

你是一名专业短剧编剧,擅长【职场轻喜剧/甜宠/悬疑反转】,熟悉抖音、快手、红果短剧的快节奏叙事。

请创作一部【1-3】分钟的竖屏微短剧《【片名】》,故事框架:【一句话梗概,如:实习生被组长抢方案,会议上反手拿出证据反转】。

角色设定必须具体到可用于 AI 生图:
- 女主 林悦:24岁职场新人,干练黑色短发,银色细框眼镜,白色衬衫+高腰西裤,五官清秀有灵气
- 反派 张组长:40岁,地中海发型,深蓝色西装,表情油腻
(每个角色都要写清:年龄、发型、五官、标志性服饰、配饰)

输出两份 Markdown 表格:
1. 角色设定表(角色名/年龄/发型/五官/服装/标志特征)
2. 分镜脚本表,表头:镜号 | 景别 | 画面详细描述 | 对白/旁白 | 时长(秒) | 运镜 | 音效

要求:
- 共 12-15 个镜头,每镜 3-5 秒
- 开头 3 秒必须有钩子(冲突/悬念/反常画面)
- 画面描述写动作和情绪,如"林悦抬头望向张组长,眼神从紧张转为坚定",不要只写"两人对话"
- 对白简短,每句不超过 15 字
- 景别在远景(建场)、中景(叙事)、特写(情绪)之间切换

拿到分镜表后人工过一遍:人设描述里的发型、服饰、标志特征(银色细框眼镜这种)就是后面所有镜头的"一致性锚点",一个字都别省。

2. 第二步:拍"定妆照"——角色一致性的根(约 20 分钟)

90% 的"换镜头就换脸",病根在这一步偷懒。

  1. 打开即梦 → 图片生成 → 选 Seedream 5.0 Pro(或图片 5.0)
  2. 把角色设定表里的描述逐字输入,例如:24岁中国女性,干练黑色短发,银色细框眼镜,白色衬衫高腰西裤,正面半身像,纯色浅灰背景,柔和均匀光线,高清写真质感
  3. 每个角色生成 20-30 张,从中选出 1 张最满意的作为"唯一母图"——选定之后不替换、不重抽、不改外观(即梦不支持中途换图锁定,母图选错整集重来);
  4. 进阶做法:给主角再生成一套五视图档案——正脸特写、正脸半身、45 度侧脸、90 度侧脸、背面,存进一个角色文件夹。后面拍侧脸、背影镜头时喂对应角度,AI 就不会"自由发挥";
  5. 关键道具(定情信物、工牌、那封被抢的方案文件)和主场景(办公室、会议室)也各出 1-2 张参考图存档。

母图的选择标准:正面、光线均匀无逆光、背景干净、五官清晰无遮挡。

3. 第三步:用 Seedance 2.5 拍正片(约 60 分钟,核心环节)

3.1 建任务

即梦网页端 → 视频生成 → 模型选 Seedance 2.5 → 竖屏短剧选 9:16(横屏选 16:9)→ 新手单段时长先设 5-8 秒

3.2 喂参考素材(用掉 50 个素材额度)

点"添加参考",按角色和场景上传,并用 @image1@video1@audio1 在提示词里标注每份素材的用途:

  • @image1:女主母图(多个角色就 image1、image2 分别传)
  • @image3:场景参考图(办公室)
  • @video1:动作/运镜参考片段(可选,比如你想要某个特定的走位)
  • @audio1:女主音色样本(可选,10-15 秒干净人声)

3.3 官方提示词公式(照这个结构写)

完整提示词 = [素材说明] + [一句话概括] + [时间戳分段的具体情节] + [全局补充]

可直接改的短剧镜头模板:

@image1 为女主林悦,@image2 为张组长,@image3 为会议室场景。
职场现实主义风格,电影感自然光,9:16 竖屏。
会议室里,林悦坐在长桌末端,张组长站在投影屏前抢占她的方案功劳。

0s-2s:中景,张组长指着投影屏侃侃而谈,表情得意,镜头缓慢推近
2s-4s:特写切林悦的脸,她垂眼,手指攥紧笔,眼神从紧张转为坚定
4s-6s:林悦猛地抬头看向张组长,嘴角微微上扬,镜头快速推到眼部特写

全局:人物面容、发型、服装与 @image1 @image2 严格保持一致;
林悦全程银色细框眼镜、白衬衫;不要新增人物;手部动作自然,不要多指。

一条铁律:喂了参考图之后,提示词里只写动作、表情、场景、运镜,不要再重复外貌描述(不要再写"黑短发、银框眼镜")。重复描述会和参考图打架,反而导致五官轻微位移。

3.4 锁角色

  • 开启"角色参考/智能参考",参考强度设在 0.7-0.8:低于 0.7 锁不住脸型,高于 0.8 画面僵硬;
  • 多角色同框时,每个角色用各自的母图独立标注,防止"串脸"。

3.5 镜头衔接:首尾帧接力

每个镜头生成后,截取它的最后一帧,作为下一个镜头的"首帧图"上传,提示词只写下一段的新动作。这样下一段的起始画面和上一段的结尾严格对齐,能压掉 90% 的转身、低头、侧脸崩坏。

长镜头另一种做法:用 Extend Video(延长视频)——选中已生成视频点延长,每次加 4-30 秒,提示词只描述新增部分,最长可拼到 3 分钟。

3.6 抽卡纪律(决定成片率的关键)

  • 每个镜头生成 3-5 条选 1 条,不要一条过;
  • 每生成 5 个镜头就强制回看校验:发色、眼睛、眼镜、服装、身形对不对,发现异常立即单镜重生,千万别抱着"后面再说"的心理批量往后跑——越往后返工成本越高;
  • 抽卡阶段一律用 480p/720p,选定后再出高清。

4. 第四步:用 MiniMax H3 做后期和补救(约 30 分钟)

Seedance 拍完的素材,遇到以下情况不要重抽,交给 H3:

4.1 H3 最拿手的五件事

入口:hailuoai.com → 选择 H3 模型,支持自然语言指令编辑,一次请求最多传 12 个素材(9 图 / 3 视频 / 3 音频)。

  1. 替换角色/服装/背景:上传视频后直接下指令——把 @video1 中男主的外套换成黑色皮衣,背景换成雨夜霓虹灯街道,人物动作不变
  2. 花字与视觉包装(H3 的招牌,视频编辑榜第一梯队)——为视频添加综艺感花字标题"提案反转",文字随林悦抬头的动作弹出,配色与职场风格统一,文字清晰不变形。短剧的片头字、关键反转处的弹幕式花字、品牌道具特写,都能让成片质感上一个档;
  3. 动作迁移人物参考 @image1,让她表演 @video1 中的街舞动作——舞蹈、打斗、复杂运镜不用在提示词里硬描述;
  4. 白模/绿幕上色、实拍加特效:前期用 Blender 出白模或绿幕拍素材,H3 直接上色加特效,打通实拍和生成;
  5. 原生双声道:H3 每次生成自带环境音、音效甚至同步对白的立体声轨。空镜、氛围镜头可以直接用它的原生声音;但人物对白仍建议后期单独配音,中文口型和情绪可控性更高。

4.2 救场三板斧(两款工具通用)

  • 脸崩了但身体动作对:留底板,用 H3 的"替换角色"指令把脸修回来,或用换脸工具把母图人脸映射回去——物理锁脸比任何提示词都管用;
  • 只有尾帧崩:截下没崩的最后一帧,用首尾帧接力重生成后半段;
  • 轻微面部闪烁:剪映里用叠化/淡入淡出转场掩盖,或把该镜头裁成近景/中景用。

4.3 终出高清

所有镜头定稿后,需要 2K 的关键镜头(特写、反转镜头)用 H3 出 2K(约 0.8 元/秒),叙事中景用 Seedance 1080p 即可。

5. 第五步:配音、音效、剪辑成片(约 20 分钟)

  1. 配音:对白用 MiniMax speech-2.8-hd(多音色、带情绪)或剪映自带朗读,按角色选不同音色;旁白一句一录,方便对节奏;
  2. BGM:MiniMax Music 2.6(约 1 元/首,可给风格描述)或剪映曲库,注意情绪转折处换音乐;
  3. 剪映拼接
    • 先用"智能字幕"识别对白,字幕字号占手机屏宽 5%-8%,白底黑边或黄底黑边,小图状态也要看得清;
    • 前 3 秒放最强冲突画面当钩子;
    • 全片套同一个滤镜/LUT——色调统一比单镜调得多好看更重要;
    • 镜头之间硬切为主,转场用叠化遮瑕疵;
    • 封面单独做:用最有张力的一帧 + 大字标题。

6. 常见翻车排查表

问题 原因 解法
换镜头就变脸 没有母图,或提示词重复外貌描述 定妆照锁定唯一母图;提示词只写动作
侧脸/背影崩 只喂了正脸 补五视图档案,侧脸镜头喂侧脸图
多角色串脸 同框未分别标注 每角色独立母图 + @image 分别引用
多长出手指/肢体鬼畜 动作超出单镜边界 单镜动作拆小;首尾帧接力;异常帧立刻重生
服装变色 跨镜头参数不统一 全局补充里锁服装;或 H3 替换服装修回
口型对不上 用了模型原生对白 人物对白一律后期配音
花字/文字乱码 用了不擅长文字的模型 文字包装交给 H3
场景光影跳变 各镜独立生成无统一锚点 场景参考图全片复用;时间戳里固定光线描述
越做越贵 直接高清抽卡 低清抽卡、定稿再出高清

7. 开工前 Checklist

  • 分镜脚本表(12-15 镜,含景别/运镜/时长)
  • 每个角色 1 张唯一母图(主角备五视图)
  • 关键道具、主场景参考图
  • Seedance:参考强度 0.7-0.8、提示词用时间戳公式、不重复外貌
  • 每镜 3-5 条抽卡、每 5 镜校验一次、首尾帧接力
  • 崩脸交给 H3 替换、花字包装交给 H3
  • 终选镜头才出 1080p/2K
  • 后期配音、智能字幕、全片统一色调、前 3 秒钩子

按这条流水线走,第一部片子可能要花半天,第二部开始就能稳定在 2-3 小时。工具迭代很快(版本号和积分规则会变),但"母图锁角色、分镜控节奏、低清抽卡高清出片、拍摄和后期分开"这四个原则不会变。

参考链接

评论