2026年9月15日0 条留言
端到端语音大模型:AI 语音交互为什么从"拼装流水线"走向"一个模型"
过去的智能语音助手基本是一条流水线:语音识别(ASR)把声音转成文字,语言模型理解文字并生成回复文本,语音合成(TTS)再把文本读出来。这条链路成熟、可解释,但有两个难以回避的损耗:延迟逐段累加,以及副语言信息(语气、情绪、停顿)在"转成文字"那一步被丢掉。一、被忽略的"文字瓶颈"ASR 的输出是标准化的文本,说话人的情绪、犹豫、重音、语速都不再保留。对下游模型来说,一个哽咽的声音和一段平静的朗读