语音大模型概述(持续更新中2026.02)
写在最前面:访问我的知乎同款文章
背景介绍
语音大模型是什么?
2024年5月,OpenAI的GPT-4o发布,自然流畅的人机对话、强大的语音理解与多样化的语音回复、极低的延迟(0.3秒,与人类相当)让人印象深刻。
这使得研究者们重拾了对语音交互的热情,而且由于大语言模型的加持,语音交互的能力边界大幅提升。理想的语音大模型像人一样,应该具备:高质量语音理解(听)与回复(说)、多轮对话、低延迟、实时对话。
语音大模型(speech large language model, SpeechLLMs)亦有称之为语音对话模型(spoken dialogue models),本文统称之为语音大模型。
1 | |
上面是对语音大模型的一种定义,可以简单地定义为:和人一样能听会说的智能系统。
历史回顾
在大模型时代之前(Pre-LLM Stage),语音技术各个细分方向相对独立,包括语音识别、语音合成、语音增强、语音分离、声音事件监测、说话人识别等等。
随着深度学习的发展(Early-LLM Stage),语音技术开始进入预训练阶段,基于模型和大数据量的语音特征和表示。例如wav2vec、Hubert,大幅提升了模型效果。
进入大模型时代(SpeechLLM Stage),语音技术各个细分方向开始融合,更细分的任务融合成一个任务,例如声音复刻和语音合成融合为Zero-Shot TTS。语音技术开始走向”大一统”:语音大模型。
发展趋势
2022年之前,语音技术结合LLMs的工作开始萌芽。
2023年,紧跟LLMs的步伐,语音大模型相关工作开始涌现。
2024年,语音大模型相关研究更加深入,围绕高质量语音、全双工交互等热点难点。
技术路径
在大模型时代之前,实现一个人机语音对话系统是非常繁杂的,涉及多个模块:语音识别、意图识别、对话管理、对话生成、语音合成等模块。
在大模型时代,使用LLMs取代意图识别、对话管理、对话生成等多个模块,让人机对话系统变得简单且更加强大。根据模型是否能够直接理解和生成语音,分为级联、端到端两种技术路径:
- 级联(Cascaded): 语音识别(ASR)、LLM、语音合成(TTS)三部分级联构成。构建成本较低、各模块成熟且相对独立;但是能力潜力小、信息丢失(例如丢失情感信息)、延迟较大。典型例子有AudioGPT。
- 端到端(End-to-end): 一个模型实现语音的输入和输出。系统简单、能力(潜力)强、延迟低;构建成本较大、依赖大量的训练数据。典型例子有Moshi。
下图是级联系统与端到端系统的对比,可以看到两种系统中也分别有两种不同的技术路径,从上到下从完全的级联到完全的端到端。
下表是OpenAI的语音模式,GPT-4o是端到端的方式,GPT-3.5和GPT-4都是级联的方式,无论是副语言信息的理解和多样化表达,还是整体的延迟,GPT-4o都大幅领先,使用体验提升明显。
| Feature | GPT-3.5 | GPT-4 | GPT-4o | Moshi |
|---|---|---|---|---|
| Architecture | ASR + GPT-3.5 + TTS | ASR + GPT-4 + TTS | A single end-to-end model | A single end-to-end model |
| Acoustic Information | × | × | √ (speaker, background, emotion…) | √ |
| Expressive Audio Response | × | × | √ (laughter, emotion, singing…) | Multi emotions & styles |
| Latency | 2.8s | 5.4s | 0.32s | 0.23s average (minimum 0.16s) |
典型的语音大模型
这部分先介绍语音大模型的一般模块组成,然后按照时间顺序介绍几个典型的、有影响力的语音大模型。
模块组成
语音大模型一般由三个模块组成:
- 语音编码器(Speech Tokenizer): 有两类典型的Tokenizer,一种是Speech Encoder(如 Whisper Encoder),连续空间表示语音;另一种是RVQ结构的Neural Codec Encoder,离散空间表示语音。
- 大语言模型(Large Language Models): 各种语言模型均可。
- 语音合成器(Token-to-Speech Synthesizer): 和上述Speech Tokenizer相对应,前者对应典型的合成器,例如HiFi-GAN等;后者对应Neural Codec Decoder。

SpeechGPT (2023.05)

SpeechGPT是于2023年5月份,复旦大学提出来的语音大模型。
模块组成
| Speech Tokenizer | LLM | Speech Detokenizer |
|---|---|---|
| Hubert | LLaMA-7B | unit based HiFi-GAN |
模型框架

模型训练
- 阶段1:词表扩充&模态自适应。基于6万小时的无标注LibriLight语音数据。
- 阶段2:跨模态指令微调。训练数据包括1万小时GigaSpeech、3千小时CommonVoice、1千小时LibriSpeech。
- 阶段3:Chain-of-Modality Instruction Fine-Tuning。从moss-002-sft-data数据集中挑选的37,969条样本。
分析
- SpeechGPT 是将文本和语音模态融合到LLMs的一次尝试,让LLMs具备了语音理解和生成能力。
- 由于Chain-of-Modality的机制,SpeechGPT无法实现实时交互,只能是半双工交互。
LLaMA-Omni (2024.09)

LLaMA-Omni 是中科院计算所于2024年9月份发布出来的语音大模型。
LLaMA-Omni用少量的数据和算力成本,构建了LLaMA的语音模态能力。
模块组成
| Speech Tokenizer | LLM | Speech Detokenizer |
|---|---|---|
| whisper-large-v3 encoder | LLaMA-3.1-8B-Instruct | unit base HiFi-GAN |
模型框架

模型训练
LLaMA-Omni采用两阶段训练:
- 阶段1:基于语音指令,生成文本回复。Speech Adaptor、LLMs参与模型训练。
- 阶段2:基于语音指令,生成语音回复。LLMs、Speech Decoder参与模型训练。
分析
- 基于Whisper Encoder融合语音模态,最大程度减少了对LLMs的影响,保持了LLMs本身的能力。较少的训练数据即可实现模型搭建。
- 引入CTC、采用chunk机制合成语音,降低语音回复的延迟。
- 虽然LLaMA-Omni有较低的延迟,但其本质仍是半双工交互方式,不支持打断。
Moshi (2024.10)

Moshi由法国初创团队Kyutai开发的对标GPT-4o的语音交互模型,7月份发布,10月份公布了技术报告并开源了模型。
Moshi是一个多流的语音到语音的Transformer模型,支持全双工交互。
模块组成
| Speech Tokenizer | LLM | Speech Detokenizer |
|---|---|---|
| Mimi Encoder (12.5Hz x 8 Codebooks) | Helium-7B (As Temporal Transformer) & Depth Transformer (6 layers, d=1024, 16 heads) | Mimi Decoder |
模型框架

上图是Moshi的模型框架,几个特点:
- Multi-stream:用户语音输入、Moshi语音输出、内心独白。为自然语音交互做好了底层设计,可以同时听和说,支持用户打断。
- Neural Codec:Mimi为了更低比特率、流式编解码、同时包含语义和声学信息,做了针对性设计。
- RQ-Transformer:包含Temporal Transformer和Depth Transformer,TemporaryTransformer处理时间步S,DepthTransformer进一步扩展到多个流。这样,将O(S*K)计算复杂度(S为时间步,K为序列/多流个数)大约减少为O(S)个计算步。
Mimi是Neural Codec,输入24KHz音频,输出12.5Hz的8个Codec,每个取值范围2048,第一个是VQ从WavLM中蒸馏学习语义信息,其他的7个为RVQ。
模型训练
- 阶段1:Helium-7B 语言模型预训练。基于大量的文本数据。
- 阶段2:Moshi预训练。单流建模,文本和语音模态对齐。基于Whisper转写的7百万小时弱监督预训练数据。
- 阶段3:Moshi后训练。扩展到多流建模,让模型具备同时听和说的能力。采用了2千小时的电话数据集Fisher,8KHz采样率升采样到24KHz。
- 阶段4:Moshi微调。基于170小时自然对话,学习具有语音交叠的实时对话能力。基于2万小时包含70种说话风格的单说话人合成数据,使得Moshi具备固定音色。
值得一提的是,阶段3的训练,多流建模增加了Moshi的内心独白(Inner Monologue),也就是Moshi 生成语音相对应的文本,对应下图中Moshi stream的Text tokens。内心独白可以提升生成文本和语音的质量。
分析
- Moshi对标GPT-4o,实现了多样化语音理解与生成的全双工语音交互。
- Moshi的构建成本很高,需要大量的文本和语音数据,需要大量的算力。
- Moshi的建模方式可以看做是一种’原生多模态’的建模方式,相比于模态融合,其难度更高,还有很多值得探索。
GLM-4-Voice (2024.10)

GLM-4-Voice是智谱于2024年10月发布、11月公布技术报告的端到端语音模型。
GLM-4-Voice可以理解中英文语音,进行实时语音对话,并改变生成语音的情感、风格。
模块组成
| Speech Tokenizer | LLM | Speech Detokenizer |
|---|---|---|
| fine-tuned whisper-large-v3 with Quantizer (12.5Hz) | GLM-4-9B-Base | Flow Matching based on CosyVoice + Hifi-GAN vocoder |
模型框架

模型训练
- 预训练:文本预训练、语音-文本交替数据预训练,分别对应”根据用户音频做出文本回复”和”根据文本回复和用户语音合成回复语音”两个任务。
- 对齐:输入用户语音,流式输出文本-语音交替内容,语音输出以文本输出为参照保证了回复内容的质量。
分析
- GLM-4-Voice 通过语音-文本交替数据的预训练任务将语音模态和文本模态融入基座模型,这种方式对模态融合有很好的借鉴意义,具体细节可以他们的技术报告。
- GLM-4-Voice支持流式,为此对Whisper Encoder做了流式改造,标准卷积替换为因果卷积、双向注意力替换为因果注意力机制。
- GLM-4-Voice在模型结构侧面没有做全双工(开源的模型),不能同时听和说,而是”半双工”模式。
KE-Omni(2024.12)

KE-Omni是由贝壳语音团队于2024年12月发布的中英文语音大模型,在VoiceBench上取得优异成绩。
该工作构建了包含6万小时、4万多个说话人的高质量合成语音对话数据集KeSpeechChat,并基于该数据集将LLaMA能力扩展到语音模态。
模块组成
| Speech Tokenizer | LLM | Speech Detokenizer |
|---|---|---|
| whisper-large-v3 encoder | LLaMA-3.1-8B-Instruct | Transformer based duration predictor & Transformer based speech unit generator & unit base HiFi-GAN |
模型框架

文本对话构建(如下图):引入了大语言模型,对文本指令数据进行口语化的改写。
语音对话构建(如下图):提出了一种构建虚拟说话人音库的方法,丰富说话人的多样性。基于CosyVoice合成指定说话人音色的语音对话。对合成的语音对话进行质量筛选过滤。
分析
- 该工作提出了大规模高质量语音对话构造方法,并基于数据集在不同的数据尺度上验证了语音大模型的效果。
SLAM-Omni(2024.12) 
SLAM-Omni是上海交大和微软2024年12月推出的语音大模型,支持多轮中英文对话,生成语音音色可控。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper encoder | Qwen2-0.5B | CosyVoice-300M-SFT + flow matching + HiFi-GAN |
模型框架

分析
- 功能亮点:可以实现端到端的多轮语音对话,生成的语音音色可控。
- 多轮对话:推理过程中,保留了对话文本历史,是一种多轮对话可行方案,但丢失了其他非语义信息。
- 模态融合:文本和语音token交替生成,模态对齐上限较高但挑战也很高。
- LLM模型较小0.5B,能力可能受限。
MiniCPM-o 2.6(2025.01)

MiniCPM-o 2.6 是OpenBMB(清华大学自然语言处理实验室和面壁智能共同发起的开源社区)于2025年1月份开源的多模态大模型,对标GPT-4o,支持图像、语音的理解以及语音的生成。
贡献点
- 实现了多模态实时交互。
- 实现了语音生成的可控,包括情绪、口音、语速等。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper-medium-300M encoder | Qwen2.5-7B-Instruct | ChatTTS-200M |
模型框架

MiniCPM-o-2.6 模型输入语音(麦克风输入、音频文件输入)、视觉(图像、视频),模型输出语音。
为了实现多模态的实时交互,采用了时分复用(Omni-modality Time Division Multiplexing, OTDM)技术,能够及时响应各模态的输入。
模型训练 
MiniCPM-o-2.6采用了三阶段模型训练:
- Pretraining: 首先进行Vision Pretraining,使用图像-文本对对齐视觉和语言模态;然后进行Audio Pretraining,使用语音-文本对对齐语音和语言模态;最后是Omni Pretraining,基于时分复用机制,融合各个模态。
- Omni SFT:这个阶段基于高质量的多模态数据对模型微调,包括视觉问答、语音理解、语音生成、视频理解等数据类型, 从而实现这些模态上理解和生成能力以及指令遵循能力。
- RLAIF:参考了RLAIF-V的工作,来提升模型的可信性,减少幻觉。
Step-Audio(2025.02)
由阶跃星辰发布并开源的130B参数的语音大模型Step-Audio(跃问),具备实时对话、生成语音的风格控制(情感、方言、唱歌等),此外还具备工具调用、角色扮演的能力。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Linguistic Tokenizer + Semantic Tokenizer | Step-1(130B LLM) | CosyVoice |
模型框架

具体信息
- 模型大小:~130B
- 输入:语音
- 输出:语音
Baichuan-Audio(2025.02)
百川智能开源的 Baichuan-Audio 语音大模型,支持端到端的语音交互。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper encoder + RVQ | Qwen2.5-7B | CosyVoice |
模型框架

具体信息
- 模型大小:~8B
- 输入:语音
- 输出:语音
Phi-4-multimodal(2025.02)
Phi-4-multimodal是微软于2025年2月底发布的多模态大模型,支持视觉、听觉、自然语言(文本)多模态的理解。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Conformer | Phi-4-Mini | - |
模型框架

具体信息
- 模型大小:5.6B
- 上下文长度:128K tokens
- 输入:文本、图片、音频
- 输出:文本
Qwen2.5-Omni(2025.03.27)
Qwen2.5-Omni 是通义实验室于2025年3月推出的多模态大模型,提出Thinker-Talker的架构,支持文本、语音、图像、视频模态的输入,并可以流式地输出文本、语音。
创新点
- 提出了Thinker-Talker的架构,更好地满足实时理解与语音生成
- 多模态位置编码 TMRoPE,更好地对视频、音频时序建模
- 全模态对话

模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper-large-v3 | Qwen2.5-7B | qwen-tts-tokenizer |
模型框架



Kimi-Audio(2025.04)
Kimi-Audio 是月之暗面于2025年4月推出的语音大模型,支持音频的理解、生成以及转换(包括速度、口音、情绪、风格的控制)。技术报告详细介绍了模型的设计与训练、数据的构成,和之前工作相比有一定创新,更重要的是给出了实现的细节。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper + Audio Tokenizer | Qwen2.5-7B | Audio Detokenizer |
- Audio Tokenizer:包括两部分,Audio Tokenizer生成离散token;Whisper Encoder 生成连续Token
- LLM:Qwen2.5-7B 作为基座,输出部分除了原来的Text,还增加Audio,从而支持语音的输出。
- Audio Detokenizer:基于Flow-Matching 和 声码器(BigVGAN)将离散的Audio token转为语音。
模型框架

模型效果

分析
- Kimi-Audio 基于Qwen2.5-7B打造的支持语音理解和生成的语音大模型,在语音相关的任务上实现了较好的效果。
VITA-Audio(2025.05)
VITA-Audio 是腾讯优图于2025年5月发布的语音语言大模型,支持语音输入输出,其主要特点是低延迟、高效推理。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| GLM-4-Voice-Tokenizer | Qwen2.5-7B | GLM-4-Voice-Decoder |
模型框架

- 采用了 GLM-4-Voice tokenizer和decoder,既能保留语义信息,又具备较低的比特率。
- 引入轻量级MCTP(Multiple Cross-modal Token Prediction)模块,只需要LLM第一次前向的文本token和Hidden state,就可以开始生成语音,而不必等到较长的序列。
为何通过MCTP,只需要LLM第一次前向的文本token和Hidden state就可以开始生成语音?这是由于在语音生成过程中,语音和对应的文本是强相关的,如下图所示,语音”一行”基本只依赖文本”一行”。
分析
- VITA-Audio针对性的对语音生成速度进行优化,大大降低语音延迟。
LLaMa-Omni2(2025.05)
LLaMa-Omni2 相比于LLaMa-Omni,在语音理解编码器和语音生成模型结构都有所调整。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper-large-v3 | Qwen2.5-0.5B/1.5B/3B/7B/14B | SenseVoice-Large+FSQ + Flow Matching |
模型框架

小结
- LLaMa-Omni2相比于LLaMa-Omni,speech encoder部分替换为SenseVoice-Large,speech decoder部分替换为Text-to-Speech Language Model,以及Flow Matching。LLM采用Qwen2.5系列模型,整体的效果得分有所提升。
Step-Audio-AQAA(2025.06)
Step-Audio-AQAA是阶跃于2025年6月推出的端到端语音大模型,支持中文、英文、日语等多语种,具备角色扮演、逻辑推理等复杂任务的能力,此外生成语音自然且在情感、语速等方面可以自适应控制。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Linguistic & Semantic Tokenizer | Step-Omni(130B) | CosyVoice |
模型框架

模型框架特点:
- 双 Audio Tokenizer 架构:分离副语言与语义信息,提升多维度音频理解与生成能力。
- 端到端设计:整合语音理解、语言建模与语音生成模块,简化推理流程。
模型训练

- 预训练:大规模多语种语音-文本数据建模。
- SFT(有监督微调):优化任务表现与指令遵循能力。
- DPO(Direct Preference Optimization):基于偏好优化提升生成质量与一致性。
- 模型合并:融合不同阶段的权重,兼顾泛化能力与特定任务表现。
小结
- 模型框架:语音理解+LLM+语音生成。
- 两个Audio Tokenizer 分别提供副语言和语义信息。
- 多阶段训练,并将不同阶段模型权重合并。
Stream-Omni(2025.06)
Stream-Omni是中科院计算所于2025年6月推出的全模态大模型,为了更高效地实现模态间对齐,将语音、图像模态对齐到文本模态。
下图中,左边(a)是之前的多模态大模型的框架,右边(b)是Stream-Omni的模型框架,可以看到模态对齐以语义为中心,模型输入输出以语音为驱动。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| CosyVoice Tokenizer | LLaMA-3.1-8B-Instruct | CosyVoice-300M-25Hz |
模型框架

训练阶段

分析
- Stream-Omni朝着全模态、端到端模型架构迈近了一步。对实现原生多模态大模型有一定的参考价值。
OpenS2S(2025.07)
OpenS2S 是由中科院自动化所推出的,完全开源的、端到端的、具有共情能力的语音大模型。
从下表中可以看到,OpenS2S的开源包括了训练数据、代码、模型。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| whisper(from Qwen2-Audio) | Qwen3-8B-Instruct | GLM-4-Voice-Decoder |
模型框架

训练阶段
三阶段的训练:
- Stage1 语音理解的预训练
- Stage2 语音生成的预训练。Stage1.2 预训练阶段考虑到输入语音的情感。
- Stage3 共情语音指令微调。Stage3 使用共情语音指令数据微调模型,使得模型具备共情能力。

训练数据
值得一提的是,指令数据的query和response包含了多样的副语言信息,多种情感、年龄等。
整体效果
在VoiceBench和URO-Bench上取得了很有竞争力的效果。
分析
- OpenS2S 在开源程度上继续走了一步,实现了全方位的开源。
- OpenS2S 整体的模型框架和其他的工作例如LLama-Omni等有相似和延续性,并强调了共情能力。
MiDashengLM(2025.08)

MiDashengLM 是小米大模型团队于 2025 年 8 月推出的开源音频-语言模型(Audio-Language Model),兼具较强的音频理解能力与高效推理性能。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Dasheng-0.6B | Qwen2.5-Omni-7B | – |
模型框架
MiDashengLM 采用 Audio Encoder + Text Decoder 的 Transformer 架构,训练分为三个阶段,均以”预测下一个 Token”为目标:
- Audio-text模态对齐:通过 Audio Caption 任务实现语音与文本表征对齐。
- 预训练:基于 100 万+ 小时语音数据进行大规模建模。
- SFT:在 35 万小时多任务语音数据上优化性能。

框架对比
在与 Qwen2.5-Omni 和 Kimi-Audio-Instruct(均为 7B 尺寸)对比时,MiDashengLM 的主要特点为:
- Encoder 差异:MiDashengLM 使用 Dasheng Encoder,而对比模型均使用 Whisper Encoder。
- Token Rate 更低:最低仅 5Hz,显著减轻了语言模型的对齐负担。
- 模态对齐任务不同:采用 Audio Caption 而非 ASR 任务,在保持 ASR 能力的同时,提升了非 ASR 类任务的表现。

小结
MiDashengLM 以 Dasheng Encoder 实现超低 Token Rate,使其在多模态音频大模型中更具优势。通过 Audio Caption 而非传统 ASR 进行模态对齐,不仅保留了语音识别能力,还显著增强了模型在多样化音频理解任务上的泛化性能。例如在Audio Caption评测中,MiDasheng远超baseline:
FireRedChat(2025.09)
FireRedChat是小红书语音团队于2025年9月推出的语音交互框架,目标是实现实时语音对话agent,框架并不是完全端到端的模型,而是融合了ASR、LLM、TTS、pVAD、End-of-Turn等模块。
模型框架

Fun-Audio-Chat(2025.12)
Fun-Audio-Chat是阿里通义于2025年12月开源的语音对话大模型,尝试解决语音token rate 与文本token rate不匹配的问题,从而更好地实现大模型全双工对话能力。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper Encoder & S3Tokenizer | Qwen3-30B-A3B or Qwen3-VL-8B | S3Tokenizer |
另外为了解决语音token和文本token天然时间尺度不匹配的问题,引入了Dual-Resolution Speech Representations (DRSR),包括两部分:
- Speech Token Grouping:k=5,将token rate 由25Hz降到5Hz
- Speech Refined Head (SRH):将token rate恢复到25Hz
模型框架
两种模式:(a)半双工、(b)全双工
多阶段训练
- Pre-alignment:LLM参数冻结,其他模块参与训练,完成语音空间到语义空间的对齐。
- Core-Cocktail Training:先进行大学习率训练;再进行小学习率训练;在训练效率和LLM能力保持间取得平衡。
- Multi-Task DPO Training:多任务的DPO训练,包括robustness preference、instruction-following preference、audio understanding preference、voice empathy preference
小结
- Fun-Audio-Chat 作为一种纯后训练的大语音模型,在不引入大规模音频-文本预训练的前提下,解决联合语音-文本系统普遍面临的时间分辨率失配、灾难性遗忘与计算昂贵三大痛点,实现高效、高质量、强鲁棒的端到端口语交互。
Eureka-Audio(2026.02)
Eureka-Audio是百度于2026年2月开源的语音大模型,采用较小的模型尺寸(1.7B)表现出和更大模型(7B到30B)相当的能力。
模块组成
| Speech Tokenizer(Encoder) | LLM | Speech Detokenizer(Decoder) |
|---|---|---|
| Whisper Encoder | Qwen3-1.7B-base | - |
- Encoder:Whisper-large-v3 Encoder
- Adapter:Sparse MoE
- LLM:Qwen3-1.7B-Base
模型框架

训练阶段
预训练:
- Stage1 Alignment Stage:只训练Adapter,其他模块都冻住,采用三种类型数据:audio unimodal modeling, audio-to-text mapping, and audio–text interleaved modeling
- Stage2 Joint Pretraining Stage:所有模块都参与训练,除了上述三种类型数据,增加audio captioning data

后训练:
- 所有参数都参与训练
- 数据构造三个步骤如下图

小结
- Eureka-Audio是一个轻量级(1.7B)的语音大模型,表现出了和更大尺寸模型相近的性能
- 训练数据的构建有一定的启发意义
进阶话题一:音频推理
R1-AQA(2025.03)
R1-AQA是小米语音推出的具有推理能力的语音大模型,模型基于Qwen2-Audio-7B,在AVQA数据上进行GRPO训练,当时在MMAU上达到SOTA。
主要贡献
- GRPO 算法可以直接且有效地应用于音频模态。
- 仅使用 38,000 个后训练样本,强化学习的表现优于监督微调。
- 显式的推理过程在 AQA(音频问答)任务中并未显示出显著的优势,如何高效利用深度思考或逐步推理仍然是一个需要进一步研究的开放性问题。
MMAU性能

Ke-Omni-R(2025.04)
Ke-Omni-R 是由KE-Team 推出的具有推理能力的语音大模型,模型基于 Qwen2.5-Omni-7B 进行GRPO训练,在只需要1万条数据的条件下,在MMAU benchmark上达到新的SOTA(68.9%)。
主要贡献
- GRPO 算法:GRPO 算法显著提升了原本已经非常强大的基础模型(Qwen2.5-Omni-7B)的性能,即使在未见过的语音领域中也表现出卓越的泛化能力。
- 思考过程:引入简短的思考过程(少于 50 个词)在提升推理能力方面起到了至关重要的作用。
- KL 散度:在 GRPO 训练过程中,通过利用 KL 散度观察到了轻微的性能提升。
- 领域比例 vs 数据量:领域多样性比数据量更重要。我们仅使用了 10,000 个样本,其中 5,000 个随机选自 AVQA,另外 5,000 个来自 MusicBench。
MMAU性能

进阶话题二:全双工
PersonaPlex(2026.02)
PersonaPlex是Nvidia参考Moshi研发的全双工语音大模型,支持零样本语音克隆与细粒度角色控制的全双工对话语音模型。
主要贡献
模型架构方面,支持三个输入流:user audio, agent text, and agent audio自回归建模。
对话自然度与角色控制

双工效果

小结
- 混合系统提示(Hybrid System Prompt):在不改变底层全双工架构(基于Moshi)的前提下,通过时序拼接文本提示段(角色定义)与语音提示段(说话人样本),实现文本角色条件与音频语音克隆的联合控制。提示阶段使用440 Hz正弦波替代用户音频以确保条件稳定性。
- 大规模合成数据:构建包含1840小时客服对话与410小时问答对话的合成数据集,利用多说话人TTS(Dia)与单说话人TTS(Chatterbox)生成自然对话流,并通过负时长静音模拟打断行为。
- 新评估基准:提出 Service-Duplex-Bench(350个问题,覆盖50个服务角色),扩展Full-Duplex-Bench以测试多角色场景下的角色遵循能力,涵盖专有名词回忆、无法满足请求处理、客户情绪应对等维度。
其他(待补充)
- 音频&音乐
- 多模态融合
