Appearance
07 · 数字人
架构剖析第七篇:数字人(Digital Human)渲染与语音,多后端 + VRAM 门控。 对应「技术架构长视频」章节 7。来源
ARCHITECTURE.md§8。
§8.1 多后端架构
- 数字人由 GPT-SoVITS(语音克隆)+ 本地渲染(CG 动画工坊 / 数字人组件)组合;
- 引擎解耦:可替换为不同 TTS / 渲染后端;
- 语音输入走 ASR(faster-whisper)→ 对话 → 语音回复 → 数字人口型。
相关操作见 通用手册·数字人。
§8.2 VRAM 门控
桌面是显存受限场景:
- 单一口径 VRAMGate(
src/base/vram_gate.py):4 级优先级、3 级驱逐策略; - 数字人(大身材)占用高 → 更可能被驱逐/延迟加载;
- 主循环预热 rewriter / decider / 最近的 DH:启动后瞬时可交互;
FAMILIARS_TIER*_MAX_MB按 GPU 分级设置阈值。
注意:无 GPU 的 VPS / 云端 demo 不启用数字人 —— 见 demo 说明。
与记忆协同
- DH 会话用同一套 DialogueManager / 记忆 —— 数字人就是另一个"发言外壳",记忆不因此隔离。
视频时间点映射
| 视频时间点 | 内容 |
|---|---|
| (待录制) | GPT-SoVITS + 渲染管线全流程 demo |
| (待录制) | VRAM 门控驱逐演示(低显存机器上跑大数据量) |
下一篇:08-安全与监控 →
