亲手跑过的本地 AI 工作流
把本地 AI 创作的
每一步都记下来
一台机器跑通视频、人像与电商出图。
真实参数、显存占用、踩过的坑,全部记录。
ComfyUI
MiniMax-H3 视频
人像一致性
24G 显存 · ROCm
纯本地
不按次付费,只花电费
从抽卡到成片全在本机完成,重试不用再付费。
24G
显存档位是跑出来的
哪些尺寸稳、哪些一上就卡死,都是自己撞过才知道的。
真参数
分辨率 · 步数 · CFG · 权重
每篇都附完整参数表,照抄到你的工作流里就能复现。
带坑
失败经验比成功值钱
哪一步容易白跑几小时,我都写在正文里了。
作品
下面这些都是本机跑出来的原始产出,不是示意图。
MiniMax-H3 文生视频(含音频)· 768×768 · 64 帧 · 24fps · 点击播放
SDXL 写真 · 832×1216 → 1248×1824 二次放大
电商产品图 · BirefNet 抠图 + 棚拍背景合成
学习笔记
从环境搭建到出片,按我做过的顺序记录。
用 MiniMax-H3 做带音频的文生视频(24G 显存实测)
768×768、64 帧、4 步采样就能出画面 + 声音。记录模型搭配、Sigma Shift 取值和显存占用实况。
图生视频:让一张分镜图动起来
和文生视频共用一套模型,区别在这几处。包含分镜图该用什么比例、运镜提示词怎么写。
人像一致性:FaceID Plus V2 换脸实操
一张参考照就能保持脸型一致,权重怎么配才不“塑料脸”。含 antelopev2 与 CLIP-Vision 的加载顺序坑。
SDXL 写真文生图:832×1216 起步 + 二次放大
先用原生分辨率出图,再 Latent 放大到 1248×1824 低幅度重绘。这套两步法比一次出大图稳得多。
电商产品图:一键抠图换背景
BirefNet 抠图 + SDXL 生成纯色棚拍背景 + 合成。适合批量处理商品主图,附参数与边缘处理心得。
参数速查
这几套工作流的关键参数,方便自己回头查,也方便对照你的环境。
| 用途 | 核心模型 | 分辨率 | 步数 / CFG |
|---|---|---|---|
| 文生视频(带音频) | MiniMax-H3 fp8 + 4step Turbo LoRA | 768×768 · 64 帧 | 4 步 / 4.0 |
| 图生视频(带音频) | 同上(输入改为分镜图) | 768×768 · 64 帧 | 4 步 / 4.0 |
| 人像一致性 | SDXL 1.0 + FaceID Plus V2 | 832×1216 | 28 步 / 6.0 |
| 写真文生图 | SDXL 1.0 + Latent 放大 | 832×1216 → 1248×1824 | 28 步 + 18 步 / 6.0 |
| 电商产品图 | BirefNet + SDXL 背景 | 1024×1024 | 24 步 / 6.5 |
关于
一个人、一台机器,边学边做,把过程留在这里。
这个站是我的学习记录:哪些参数有用、哪些坑值得踩一次就够了。如果你也在折腾本地 AI 创作,希望这些记录能帮你省点时间。
微信扫码加我长按识别 / 截图后用微信扫一扫