2026语音大模型从语音识别到全双工语音交互报告.pdf

2026语音大模型从语音识别到全双工语音交互报告.pdf
这份文档是由厦门大学智能语音实验室洪青阳老师分享的关于“语音大模型——从语音识别到全双工语音交互”的报告。核心内容主要涵盖以下五个部分: 一、背景与挑战 传统的级联式语音对话系统(ASR-LLM-TTS)面临信息丢失、错误累积和高延迟等问题。为了提供更自然的交互体验,行业正向端到端(E2E)对话模型和全双工(能同时听和说)语音交互演进,其核心挑战在于解决“插话打断”和“准确判停(端点检测/语义VAD)”。 二、语音识别(ASR)大模型 1. 发展历程:从早期的模板匹配、统计模型,发展至深度学习阶段(Transformer/Conformer),如今迈入基于LLM的大模型阶段。 2. 关键技术:采用BBPE(字节级双字节编码)分词器打破语言限制,实现多语种与方言的统一建模。 3. 开源代表:如OpenAI的Whisper、小红书的FireRedASR、阿里巴巴的Qwen3-ASR等,通过大规模数据显著提升了识别鲁棒性。 三、端到端对话模型 端到端系统主要由三个模块构成: 1. 语音编码器(Speech Tokenizer):分为语义Token(捕获内容)、声学Token(捕获音色语气,如EnCodec)以及兼顾两者的统一Token。 2. 大语言模型(LLM):直接处理离散化的语音Token,预测下一个Token。 3. 语音解码器(Speech Detokenizer):利用流匹配(Flow Matching)等技术将离散Token转化为梅尔频谱,再通过声码器重构波形。 代表性开源系统包括Moshi、GLM-4-Voice、Qwen-Omni系列、Kimi-Audio和Step-Audio2等。 四、全双工语音交互 全双工系统需实时处理系统输出和用户输入两条音频流。 1. 插话打断与判停:可通过声学VAD、专门的语义VAD(如EasyTurn、Phoenix-VAD、SoulX-Duplug)或端到端双流建模来实现。 2. 典型模型:包括Moshi(多流建模)、Freeze-Omni(冻结LLM参数)、NVIDIA的PersonaPlex以及腾讯的Covo-Audio。 五、落地应用与未来展望 1. 落地应用:推出了“声云语音转写”App、网页端语音翻译及StepAudio 2.5等演示系统。 2. 展望:未来将聚焦于全双工端到端对话模型的完善、语音思维链(CoT)的应用以及更智能的语音智能体(Voice Agent)的发展。
下载完整报告 | 9.96 MB | 72页
阅读和下载会消耗积分;登录、注册、邀请好友、上传报告可获取积分。
成为VIP会员可免费阅读和下载报告