云计算百科
云计算领域专业知识百科平台

voiceAgent四种架构

核心组件

核心组件全称在 Voice Agent 中的用途输入输出
VAD Voice Activity Detection,语音活动检测 判断用户当前是否正在说话,识别语音开始和结束,过滤静音及部分环境噪声,决定何时把音频交给 ASR 麦克风音频流 说话开始、说话结束、有效语音片段
ASR Automatic Speech Recognition,自动语音识别 将用户说出的语音转换为文本,供 LLM 理解和处理 用户语音 识别后的文本
LLM Large Language Model,大语言模型 理解用户意图,结合上下文生成回答,也可以决定是否调用工具、查询数据或执行操作 用户文本、对话历史、工具结果 回复文本、工具调用指令
TTS Text-to-Speech,文本转语音 将 LLM 生成的回复文本合成为语音,通过浏览器或设备扬声器播放给用户 回复文本 音频流

四种架构

架构组件链路交互方式主要特点优点主要代价适合场景
End-to-end,full-duplex 用户语音 → 统一端到端语音模型 → 回复语音 全双工:用户和 AI 可以同时说话 模型持续接收用户音频,并直接生成语音;用户可以随时打断,AI 也可以在用户说话时给出“嗯”“对”等反馈 交互最自然;打断响应快;理论链路最短 模型训练和控制难度最高;业务规则、输出内容和工具调用不容易精细控制 游戏角色、陪伴助手、强调自然交互的场景
End-to-end,half-duplex 用户语音 → 统一端到端语音模型 → 回复语音 半双工:用户说完后 AI 再回答 VAD 判断用户是否说完,将一段语音交给端到端模型,模型直接生成回复语音 组件少;延迟较低;能保留语气、情绪等语音信息 依赖 VAD 判断说话结束;容易出现等待或提前截断;模型回复时通常难以自然重叠交流 通用语音助手、语音问答、对话轮次比较明确的场景
Chained,2-components 用户语音 → 理解模型 → 回复文本 → 语音生成模型 → 回复语音 通常为半双工 第一个模型同时承担“语音理解+文本回答”,相当于合并了 ASR 和 LLM;第二个模型将回答文本生成语音 比三组件链路更短;兼顾低延迟和一定的模块化能力;理解与语音生成可以分别优化 理解模型职责较重;中间文本会损失部分语气、节奏等非文本信息;可替换性弱于三组件架构 实时客服、销售助手等同时要求低延迟和业务定制的场景
Chained,3-components 用户语音 → ASR → 用户文本 → LLM → 回复文本 → TTS → 回复语音 通常为半双工 语音识别、语言理解和语音生成分别由三个独立组件完成 可定制性最强;ASR、LLM、TTS 可以独立替换;方便接入知识库、工具调用、审核和业务规则 链路最长;各组件延迟会累积;ASR 识别错误可能继续传递给 LLM 企业客服、金融保险、业务办理等强调准确性、可控性和系统集成的场景

End-toend,full-duplex

用户与端到端语音模型之间直接进行双向语音交互
![[Pasted image 20260803125501.png]]

End-to-end,half-duplex

![[Pasted image 20260803130051.png]]

Chained,2-components

![[Pasted image 20260803131451.png]]

Chained,3-components

![[Pasted image 20260803131822.png]]

赞(0)
未经允许不得转载:网硕互联帮助中心 » voiceAgent四种架构
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!