参考文档 · 架构速查

Qwen3-ASR 架构速查卡

事实来源:技术报告 arXiv:2601.21337v2 · HF config.json / processor_config.json(1.7B-hf 与 0.6B-hf)· 提取日期 2026-08-28

三件套与数据流(10 秒音频示例)

站事实
输入16kHz 单声道波形;10 秒 = 160,000 样本
mel 前端128 维 Fbank;n_fft 400(25ms)/ hop 160(10ms)→ 100 帧/秒
AuT 编码器8 倍下采样 → 12.5 嵌入/秒(每嵌入 80ms);动态注意力窗口 1–8s
投影器连续嵌入对齐 LLM 隐藏维(非离散音频 token)
Qwen3 LLM自回归生成;音频嵌入替换 user 消息中的占位符

两个尺寸参数对照

配置项1.7B 版0.6B 版
LLM 基座Qwen3-1.7BQwen3-0.6B
AuT 编码器层数 / d_model / 头24 / 1024 / 1618 / 896 / 14
AuT FFN 维 / 参数量4096 / ~300M3584 / ~180M
编码器输出维(=LLM 隐藏维)20481024
LLM 层数 / 注意力头 / KV 头(GQA)28 / 16 / 828 / 16 / 8
LLM FFN / head_dim6144 / 1283072 / 128
词表 / 上下文长度151,936 / 65,536(RoPE θ=1M)151,936 / 65,536
dtypebfloat16
未 documented 键(语义未公开)downsample_hidden_size 480 · conv_chunksize 500 · n_window 50 · n_window_infer 800

特殊词元表

词元ID作用
<|im_start|>151644消息开始
<|im_end|>151645消息结束(也是 eos/pad)
<|audio_start|>151669音频段开始
<|audio_end|>151670音频段结束
<|audio_pad|>151676音频占位符,被嵌入替换(config: audio_token_id)
<asr_text>151704转写正文标记
<timestamp>151705ForcedAligner 时间戳标记(timestamp_token_id)

对话模板骨架

<|im_start|>system
{热词/上下文,自由文本,可选}
<|im_end|>
<|im_start|>user
<|audio_start|><|audio_pad|><|audio_end|>
<|im_end|>
<|im_start|>assistant
language {语言标签}<asr_text>{转写文本}<|im_end|>

强制语言:预填 language Chinese<asr_text> + continue_final_message。训练时 assistant 段放目标文本,apply_chat_template(..., processor_kwargs={"output_labels": True}),音频与 padding 自动 mask。

流式推理参数(报告 §4.5 / vLLM 示例)

参数值
块大小2 秒
回退词元数5
不封死块数报告:4;官方示例:2(以示例代码为准先试)
首字延迟 TTFT(0.6B,并发 1)平均 92ms / p95 105ms
流式 WER 代价约 0.6–0.9 点
单次最长音频1200 秒

训练四阶段(报告 §2.2)

阶段数据
① AuT 预训练~4000 万小时伪标签 ASR(中英为主)
② Omni 预训练(基座 Qwen3-Omni)3 万亿 token 多模态
③ ASR SFT多语 + 非语音 + 流式增强 + 上下文偏置;ASR-only 防注入
④ ASR RL(GSPO)~5 万条(35% 中英 + 35% 多语 + 30% 鲁棒性)

ForcedAligner-0.6B(时间戳伙伴)

AuT 编码器 + Qwen3-0.6B + 线性时间戳层;非自回归(NAR)槽填充,一次前向出词/字级时间戳;时间戳按 80ms 离散化(≤300 秒,3750 个类别)。平均时间戳误差 42.9ms(WhisperX 133ms)。

工具链速记

工具要点
transformers≥ v5.13.0;Qwen3ASRForConditionalGeneration;processor 的 apply_transcription_request(audio, language, prompt)
官方包pip install qwen-asr;vLLM 后端 Qwen3ASRModel.LLM(...);流式仅 vLLM 后端
vLLMvllm serve Qwen/Qwen3-ASR-1.7B,OpenAI 转写 API 兼容
config 顶层键architectures / audio_config / text_config / audio_token_id / timestamp_token_id / model_type "qwen3_asr" / dtype bfloat16

← 回到第 6 课 · 术语表