Wayne
AI 产品经理作品集
项目简介
WordCraft
润言
语法助手
本地部署
LOCAL DEPLOY
本地多模态部署 —— 本地 GPU 跑通的生成式 AI 链路
ComfyUI 工作流 · 语音克隆 / 数字人 / 唇形同步 —— 工作流 → 节点图 → 真实调参笔记
01 · 部署链路总览
本地 GPU 跑通 8 个 ComfyUI 工作流 —— 语音克隆 → 数字人 → 唇形同步
已跑通链路
:文本理解 → 语音合成(TTS)→ 数字人驱动 → 唇形同步。在本地 GPU 环境部署并调通
8 个可一键导入的 ComfyUI 工作流
,覆盖语音克隆、面部动画、音频/视频驱动数字人、对口型与帧插值。下面 02–04 三个模块把真实节点图蒸馏为逻辑链路,并附上我自己在节点里写下的调参/选型笔记——这些才是"亲手部署调试过"的证据。
环境配置
依赖调试
显存占用优化
生成效果验证
语音克隆
唇形同步
02 · 语音克隆 · IndexTTS2
声音生成 + 情感可控
用一段参考音色,把任意文本合成成「这个人的声音」,并能精细控制情绪。
参考音频
本人原声音色
→
目标文本
想让它说的话
→
情感控制
EmotionFromText 文本→情感向量 / EmotionVector 手动
→
IndexTTS2
克隆合成引擎
→
克隆语音
保存为 wav
真实调参笔记
:情感既可以由第二段「情绪参考音」提供,也可以用文本自动翻译成情感向量;手动调向量时所有分量之和不超过 1.50,否则情绪会失真——这是反复试错后定下的安全阈值。
声音克隆
情感向量控制
文本→情感映射
03 · 图片对口型 · LivePortrait
静态照片 → 会说话的数字人
8 个工作流里节点最多、编排最复杂的一个(26 个节点),含人脸检测器选型与表情重定向。
输入图片
一张静态人像
→
驱动源
驱动视频 / 音频
→
人脸检测裁剪
MediaPipe / FaceAlignment 可选
→
LivePortrait 处理
表情迁移 + 眼/唇重定向
→
合成 + 遮罩
贴回原图
→
数字人视频
真实选型权衡
:人脸检测器在 MediaPipe 与 FaceAlignment 之间选——MediaPipe 不吃 GPU、CPU 上更快但检测精度较低;FaceAlignment 精度更高,还能用 back-camera 版本进一步提升。按素材质量按需切换,这正是工程选型能力的体现。
图片→数字人
复杂 pipeline 编排
人脸检测器选型
眼/唇重定向
04 · 音频驱动数字人 · Sonic(SVD 路线)
同一目标尝试的另一条技术路线
基于 Stable Video Diffusion,与 LivePortrait 是完全不同的技术路线——同一目标尝试多条路径。
输入图片
人像
→
驱动音频
说话语音
→
SVD Checkpoint
视频生成底模
+
Sonic UNet
音频驱动网络 · 半精度省显存
→
SONIC 采样器
音画对齐
→
说话视频
真实调参笔记
:duration 要按音频实际长度动态调,否则视频会在音频结束前提前截断;生成时若角色头顶被切掉,把 expand_ratio 从 0.5 调到 0.6~0.7 即可——这些都是踩坑后记在节点备注里的经验。
音频驱动
Stable Video Diffusion
fp16 显存优化
多技术路线探索