核心组件
| VAD | Voice Activity Detection,语音活动检测 | 判断用户当前是否正在说话,识别语音开始和结束,过滤静音及部分环境噪声,决定何时把音频交给 ASR | 麦克风音频流 | 说话开始、说话结束、有效语音片段 |
| ASR | Automatic Speech Recognition,自动语音识别 | 将用户说出的语音转换为文本,供 LLM 理解和处理 | 用户语音 | 识别后的文本 |
| LLM | Large Language Model,大语言模型 | 理解用户意图,结合上下文生成回答,也可以决定是否调用工具、查询数据或执行操作 | 用户文本、对话历史、工具结果 | 回复文本、工具调用指令 |
| TTS | Text-to-Speech,文本转语音 | 将 LLM 生成的回复文本合成为语音,通过浏览器或设备扬声器播放给用户 | 回复文本 | 音频流 |
四种架构
| End-to-end,full-duplex | 用户语音 → 统一端到端语音模型 → 回复语音 | 全双工:用户和 AI 可以同时说话 | 模型持续接收用户音频,并直接生成语音;用户可以随时打断,AI 也可以在用户说话时给出“嗯”“对”等反馈 | 交互最自然;打断响应快;理论链路最短 | 模型训练和控制难度最高;业务规则、输出内容和工具调用不容易精细控制 | 游戏角色、陪伴助手、强调自然交互的场景 |
| End-to-end,half-duplex | 用户语音 → 统一端到端语音模型 → 回复语音 | 半双工:用户说完后 AI 再回答 | VAD 判断用户是否说完,将一段语音交给端到端模型,模型直接生成回复语音 | 组件少;延迟较低;能保留语气、情绪等语音信息 | 依赖 VAD 判断说话结束;容易出现等待或提前截断;模型回复时通常难以自然重叠交流 | 通用语音助手、语音问答、对话轮次比较明确的场景 |
| Chained,2-components | 用户语音 → 理解模型 → 回复文本 → 语音生成模型 → 回复语音 | 通常为半双工 | 第一个模型同时承担“语音理解+文本回答”,相当于合并了 ASR 和 LLM;第二个模型将回答文本生成语音 | 比三组件链路更短;兼顾低延迟和一定的模块化能力;理解与语音生成可以分别优化 | 理解模型职责较重;中间文本会损失部分语气、节奏等非文本信息;可替换性弱于三组件架构 | 实时客服、销售助手等同时要求低延迟和业务定制的场景 |
| Chained,3-components | 用户语音 → ASR → 用户文本 → LLM → 回复文本 → TTS → 回复语音 | 通常为半双工 | 语音识别、语言理解和语音生成分别由三个独立组件完成 | 可定制性最强;ASR、LLM、TTS 可以独立替换;方便接入知识库、工具调用、审核和业务规则 | 链路最长;各组件延迟会累积;ASR 识别错误可能继续传递给 LLM | 企业客服、金融保险、业务办理等强调准确性、可控性和系统集成的场景 |
End-toend,full-duplex
用户与端到端语音模型之间直接进行双向语音交互
![![[Pasted image 20260803125501.png]]](https://www.wsisp.com/helps/wp-content/uploads/2026/08/20260803114036-6a707e346515f.png)
End-to-end,half-duplex
![![[Pasted image 20260803130051.png]]](https://www.wsisp.com/helps/wp-content/uploads/2026/08/20260803114036-6a707e348db2f.png)
Chained,2-components
![![[Pasted image 20260803131451.png]]](https://www.wsisp.com/helps/wp-content/uploads/2026/08/20260803114036-6a707e34992a2.png)
Chained,3-components
![![[Pasted image 20260803131822.png]]](https://www.wsisp.com/helps/wp-content/uploads/2026/08/20260803114036-6a707e34a6bee.png)
网硕互联帮助中心





评论前必须登录!
注册