LOCAL DEPLOY

本地多模态部署 —— 本地 GPU 跑通的生成式 AI 链路

ComfyUI 工作流 · 语音克隆 / 数字人 / 唇形同步 —— 工作流 → 节点图 → 真实调参笔记
01 · 部署链路总览本地 GPU 跑通 8 个 ComfyUI 工作流 —— 语音克隆 → 数字人 → 唇形同步
已跑通链路:文本理解 → 语音合成(TTS)→ 数字人驱动 → 唇形同步。在本地 GPU 环境部署并调通 8 个可一键导入的 ComfyUI 工作流,覆盖语音克隆、面部动画、音频/视频驱动数字人、对口型与帧插值。下面 02–04 三个模块把真实节点图蒸馏为逻辑链路,并附上我自己在节点里写下的调参/选型笔记——这些才是"亲手部署调试过"的证据。
环境配置依赖调试显存占用优化生成效果验证语音克隆唇形同步
02 · 语音克隆 · IndexTTS2声音生成 + 情感可控
用一段参考音色,把任意文本合成成「这个人的声音」,并能精细控制情绪。
参考音频本人原声音色
目标文本想让它说的话
情感控制EmotionFromText 文本→情感向量 / EmotionVector 手动
IndexTTS2克隆合成引擎
克隆语音保存为 wav
真实调参笔记:情感既可以由第二段「情绪参考音」提供,也可以用文本自动翻译成情感向量;手动调向量时所有分量之和不超过 1.50,否则情绪会失真——这是反复试错后定下的安全阈值。
声音克隆情感向量控制文本→情感映射
03 · 图片对口型 · LivePortrait静态照片 → 会说话的数字人
8 个工作流里节点最多、编排最复杂的一个(26 个节点),含人脸检测器选型与表情重定向。
输入图片一张静态人像
驱动源驱动视频 / 音频
人脸检测裁剪MediaPipe / FaceAlignment 可选
LivePortrait 处理表情迁移 + 眼/唇重定向
合成 + 遮罩贴回原图
数字人视频
真实选型权衡:人脸检测器在 MediaPipe 与 FaceAlignment 之间选——MediaPipe 不吃 GPU、CPU 上更快但检测精度较低;FaceAlignment 精度更高,还能用 back-camera 版本进一步提升。按素材质量按需切换,这正是工程选型能力的体现。
图片→数字人复杂 pipeline 编排人脸检测器选型眼/唇重定向
04 · 音频驱动数字人 · Sonic(SVD 路线)同一目标尝试的另一条技术路线
基于 Stable Video Diffusion,与 LivePortrait 是完全不同的技术路线——同一目标尝试多条路径。
输入图片人像
驱动音频说话语音
SVD Checkpoint视频生成底模
+
Sonic UNet音频驱动网络 · 半精度省显存
SONIC 采样器音画对齐
说话视频
真实调参笔记:duration 要按音频实际长度动态调,否则视频会在音频结束前提前截断;生成时若角色头顶被切掉,把 expand_ratio 从 0.5 调到 0.6~0.7 即可——这些都是踩坑后记在节点备注里的经验。
音频驱动Stable Video Diffusionfp16 显存优化多技术路线探索