2026语音大模型从语音识别到全双工语音交互报告.pdf

这份文档是由厦门大学智能语音实验室洪青阳老师分享的关于“语音大模型——从语音识别到全双工语音交互”的报告。核心内容主要涵盖以下五个部分:
一、背景与挑战
传统的级联式语音对话系统(ASR-LLM-TTS)面临信息丢失、错误累积和高延迟等问题。为了提供更自然的交互体验,行业正向端到端(E2E)对话模型和全双工(能同时听和说)语音交互演进,其核心挑战在于解决“插话打断”和“准确判停(端点检测/语义VAD)”。
二、语音识别(ASR)大模型
1. 发展历程:从早期的模板匹配、统计模型,发展至深度学习阶段(Transformer/Conformer),如今迈入基于LLM的大模型阶段。
2. 关键技术:采用BBPE(字节级双字节编码)分词器打破语言限制,实现多语种与方言的统一建模。
3. 开源代表:如OpenAI的Whisper、小红书的FireRedASR、阿里巴巴的Qwen3-ASR等,通过大规模数据显著提升了识别鲁棒性。
三、端到端对话模型
端到端系统主要由三个模块构成:
1. 语音编码器(Speech Tokenizer):分为语义Token(捕获内容)、声学Token(捕获音色语气,如EnCodec)以及兼顾两者的统一Token。
2. 大语言模型(LLM):直接处理离散化的语音Token,预测下一个Token。
3. 语音解码器(Speech Detokenizer):利用流匹配(Flow Matching)等技术将离散Token转化为梅尔频谱,再通过声码器重构波形。
代表性开源系统包括Moshi、GLM-4-Voice、Qwen-Omni系列、Kimi-Audio和Step-Audio2等。
四、全双工语音交互
全双工系统需实时处理系统输出和用户输入两条音频流。
1. 插话打断与判停:可通过声学VAD、专门的语义VAD(如EasyTurn、Phoenix-VAD、SoulX-Duplug)或端到端双流建模来实现。
2. 典型模型:包括Moshi(多流建模)、Freeze-Omni(冻结LLM参数)、NVIDIA的PersonaPlex以及腾讯的Covo-Audio。
五、落地应用与未来展望
1. 落地应用:推出了“声云语音转写”App、网页端语音翻译及StepAudio 2.5等演示系统。
2. 展望:未来将聚焦于全双工端到端对话模型的完善、语音思维链(CoT)的应用以及更智能的语音智能体(Voice Agent)的发展。
相关报告
-
6.13 MB 33页 情绪经济专题报告:小情绪有大市场,从性价比到心价比-中航证券-202606.pdf
-
3.42 MB 28页 电商大促新周期新打法洞察报告——从节点狂欢到常态深耕-艺恩-202603.pdf
-
38.3 MB 13页 2026创意趋势深度报告:从流动的焦虑,到具体的重建-PITCHINA-202512.pdf
-
25.02 MB 366页 2025年大模型应用:从提示工程到AI智能体报告.pdf
-
8.19 MB 186页 2026盘古大模型最佳实践报告202603.pdf
-
5.08 MB 76页 智穿未来 交互新纪元—中国智能穿戴市场洞察报告-毕马威-202609.pdf
-
4.09 MB 29页 票根经济:从入场凭证到消费入口-202609.pdf
-
12.53 MB 80页 智能体安全研究报告:从大模型安全到可控行动系统202606.pdf
-
4.03 MB 34页 2026AI行业框架培训—从Token经济学到三层叙事.pdf
-
1.83 MB 18页 从规模扩张到能力升级:美日德出海经验与中国企业全球化新路径-北大汇丰-202607.pdf
-
31.36 MB 59页 从流量场到价值场——2025-2026中免消费白皮书-中免-202608.pdf
-
16.12 MB 61页 Token技术产业链经济—从本质到出海的深度研究报告2026-模智空间-202608.pdf
-
22.19 MB 54页 2026从规模到价值:银保渠道的跃迁之路白皮书-德勤-202608.pdf
-
20.87 MB 21页 从赛道到趋势上海如何引领中国运动零售市场发展报告-世邦魏理仕-202608.pdf
-
19.88 MB 67页 2026消费智能科技增长白皮书:从技术涌现到商业落地-朴玉战略-202608.pdf