返回模板库
详情页
AI视频分镜
2026-07-31 20:13

底座大概率是 Hugging Face 开源的 spee...

用于把剧情、镜头和动作按时间轴拆解,提升 AI 视频的顺序稳定、动作连续和画面可执行性。

AI视频分镜
6531 min
底座大概率是 Hugging Face 开源的 speech-to-speech 项目: https://github.com/huggingface/speech-to-speech
它把本地语音助手清晰拆成四层:
Silero VAD v5 —— 判断你什么时候开始/停止说话

Whisper(或 Faster-Whisper / Parakeet 等)—— 语音转文字
LLM —— 生成回复,可直接接本地 llama.cpp
Qwen3-TTS —— 把文字变成语音
关键提醒: 这只是语音对话底座,视频里看到的角色形象、嘴型、表情、眨眼都不包含在内。官方默认配置也不是完全离线,必须自己把 LLM 指向本地的 llama.cpp(或 vLLM)服务器,才能真正做到不联网、数据不出电脑。

实测有人把这四层全塞进 15G 显存,还能热切换模型,实时对话+打断都比较顺畅。对隐私敏感、想玩本地陪伴的人来说,这个方向比任何云端产品都更干净。
如果想把“形象”也做出来(嘴型同步、微表情、Live2D 桌宠),还需要额外研究:
Live2D / VTube Studio
Unity Avatar

或者直接看 Open-LLM-VTuber 这类把语音+Live2D串起来的开源项目
本地AI伴侣已经从“能聊天”走到“能语音互动”了,下一步就是把形象和记忆系统叠上去。对想自己动手的人,这个 Hugging Face 项目目前是最值得研究的底座之一。
有搭过的朋友,欢迎分享你的显存占用和实际体验。