三件套与数据流(10 秒音频示例)
| 站 | 事实 |
| 输入 | 16kHz 单声道波形;10 秒 = 160,000 样本 |
| mel 前端 | 128 维 Fbank;n_fft 400(25ms)/ hop 160(10ms)→ 100 帧/秒 |
| AuT 编码器 | 8 倍下采样 → 12.5 嵌入/秒(每嵌入 80ms);动态注意力窗口 1–8s |
| 投影器 | 连续嵌入对齐 LLM 隐藏维(非离散音频 token) |
| Qwen3 LLM | 自回归生成;音频嵌入替换 user 消息中的占位符 |
两个尺寸参数对照
| 配置项 | 1.7B 版 | 0.6B 版 |
| LLM 基座 | Qwen3-1.7B | Qwen3-0.6B |
| AuT 编码器层数 / d_model / 头 | 24 / 1024 / 16 | 18 / 896 / 14 |
| AuT FFN 维 / 参数量 | 4096 / ~300M | 3584 / ~180M |
| 编码器输出维(=LLM 隐藏维) | 2048 | 1024 |
| LLM 层数 / 注意力头 / KV 头(GQA) | 28 / 16 / 8 | 28 / 16 / 8 |
| LLM FFN / head_dim | 6144 / 128 | 3072 / 128 |
| 词表 / 上下文长度 | 151,936 / 65,536(RoPE θ=1M) | 151,936 / 65,536 |
| dtype | bfloat16 |
| 未 documented 键(语义未公开) | downsample_hidden_size 480 · conv_chunksize 500 · n_window 50 · n_window_infer 800 |
特殊词元表
| 词元 | ID | 作用 |
| <|im_start|> | 151644 | 消息开始 |
| <|im_end|> | 151645 | 消息结束(也是 eos/pad) |
| <|audio_start|> | 151669 | 音频段开始 |
| <|audio_end|> | 151670 | 音频段结束 |
| <|audio_pad|> | 151676 | 音频占位符,被嵌入替换(config: audio_token_id) |
| <asr_text> | 151704 | 转写正文标记 |
| <timestamp> | 151705 | ForcedAligner 时间戳标记(timestamp_token_id) |
对话模板骨架
<|im_start|>system
{热词/上下文,自由文本,可选}
<|im_end|>
<|im_start|>user
<|audio_start|><|audio_pad|><|audio_end|>
<|im_end|>
<|im_start|>assistant
language {语言标签}<asr_text>{转写文本}<|im_end|>
强制语言:预填 language Chinese<asr_text> + continue_final_message。训练时 assistant 段放目标文本,apply_chat_template(..., processor_kwargs={"output_labels": True}),音频与 padding 自动 mask。
流式推理参数(报告 §4.5 / vLLM 示例)
| 参数 | 值 |
| 块大小 | 2 秒 |
| 回退词元数 | 5 |
| 不封死块数 | 报告:4;官方示例:2(以示例代码为准先试) |
| 首字延迟 TTFT(0.6B,并发 1) | 平均 92ms / p95 105ms |
| 流式 WER 代价 | 约 0.6–0.9 点 |
| 单次最长音频 | 1200 秒 |
训练四阶段(报告 §2.2)
| 阶段 | 数据 |
| ① AuT 预训练 | ~4000 万小时伪标签 ASR(中英为主) |
| ② Omni 预训练(基座 Qwen3-Omni) | 3 万亿 token 多模态 |
| ③ ASR SFT | 多语 + 非语音 + 流式增强 + 上下文偏置;ASR-only 防注入 |
| ④ ASR RL(GSPO) | ~5 万条(35% 中英 + 35% 多语 + 30% 鲁棒性) |
ForcedAligner-0.6B(时间戳伙伴)
AuT 编码器 + Qwen3-0.6B + 线性时间戳层;非自回归(NAR)槽填充,一次前向出词/字级时间戳;时间戳按 80ms 离散化(≤300 秒,3750 个类别)。平均时间戳误差 42.9ms(WhisperX 133ms)。
工具链速记
| 工具 | 要点 |
| transformers | ≥ v5.13.0;Qwen3ASRForConditionalGeneration;processor 的 apply_transcription_request(audio, language, prompt) |
| 官方包 | pip install qwen-asr;vLLM 后端 Qwen3ASRModel.LLM(...);流式仅 vLLM 后端 |
| vLLM | vllm serve Qwen/Qwen3-ASR-1.7B,OpenAI 转写 API 兼容 |
| config 顶层键 | architectures / audio_config / text_config / audio_token_id / timestamp_token_id / model_type "qwen3_asr" / dtype bfloat16 |
← 回到第 6 课 · 术语表