参考文档 · 随课增长
术语表(ASR / LLM / Qwen3-ASR)
- 语音识别ASR, Automatic Speech Recognition
- 把声音信号转成文字的技术。输入是音频,输出是文本转写。本课程的目标领域;Qwen3-ASR 就是 ASR 模型。
- 词错误率WER, Word Error Rate
- 衡量转写质量的核心指标:编辑距离(替换+插入+删除次数)÷ 参考答案词数,越低越好。中文常按"字错误率 CER"计算。微调有没有用,就看它降没降。
- 采样Sampling
- 把连续声波变成离散数字:每秒记录固定次数声压值。采样率单位 Hz。Qwen3-ASR 要求 16kHz 单声道输入。
- 采样率Sample Rate, Hz
- 每秒采样次数。16kHz = 每秒 16000 个数字,足够覆盖语音频段。
- 波形Waveform
- 采样后的声压随时间变化的数字序列,是音频最原始的数字形态。
- 频谱 / 梅尔频谱Spectrogram / Mel-spectrogram
- 把波形按短窗切开、对每窗做傅里叶变换得到的"时间 × 频率 × 能量"图;mel 刻度模拟人耳对频率的感知。传统 ASR 前端的标准特征;现代模型的前端具体配置以 Qwen3-ASR 技术报告为准。
- 编码器Encoder
- 把输入序列(如音频特征)压缩成富含语义的向量表示的网络。Qwen3-ASR 中是 AuT(Audio Transformer)语音编码器。
- 解码器Decoder
- 把编码表示转成目标序列(文字)的网络。Qwen3-ASR 的解码器就是 Qwen3 大语言模型本体。
- 自回归Autoregressive
- 逐个词元生成、每次以已生成内容为条件的生成方式。Qwen3-ASR 的转写是 LLM 自回归生成,不是 CTC 一次性对齐。
- 词元Token
- 模型处理文本的最小单位(词片/字/字节)。LLM 读和写的都是 token 序列。
- 参数 / 参数量Parameters / B
- 模型中可学习的权重数值总量;B = 十亿。Qwen3-ASR 有 0.6B 与 1.7B 两个尺寸(0.6B 含编码器总参数约 0.9B)。
- 预训练Pre-training
- 在海量数据上从头训练模型的过程。Qwen3-ASR 建立在 Qwen3-Omni 预训练基座之上。
- 微调Fine-tuning
- 在预训练模型上用特定数据继续训练,使其适配具体领域/口音/词汇。
- LoRALow-Rank Adaptation
- 冻结原模型、只训练一小块低秩适配参数的微调法,显存占用小。T4 16GB 上微调 Qwen3-ASR 的现实路线。
- 推理Inference
- 用训练好的模型做预测(此处=转写音频),不更新参数。
- 流式 / 离线Streaming / Offline
- 流式=边说边出字(低延迟);离线=整段音频一次转写(更高精度)。Qwen3-ASR 单模型统一支持两者。
- 热词 / 上下文偏置Hotwords / Contextual Biasing
- 转写前给模型提供领域词表或自由文本提示,引导专有名词识别。Qwen3-ASR 通过 prompt / system message 注入。
- 大语言模型LLM, Large Language Model
- 超大规模的自回归 Transformer,经海量文本训练,懂语言规律。现代 ASR 把"听写"交给听觉编码器、把"成文"交给 LLM。
- CTCConnectionist Temporal Classification
- 一种让音频帧与文字对齐的训练损失,解码非自回归、一次输出。老一代 ASR 主流;Qwen3-ASR 未采用,是重要的对照概念。
- 多模态Multimodal
- 模型能处理多种输入类型(文本+音频+图像)。Qwen3-Omni 是音频+文本多模态模型,Qwen3-ASR 是其"专职听写"后代。
- 向量 / 嵌入Vector / Embedding
- 把一个词元(或一帧音频)映射成一串数字,语义相近的东西向量也相近。神经网络不直接处理词和声音,处理的是它们的向量。
- 上下文Context
- 一个词周围的其他信息。"苹果"配上"手机"是品牌,配上"照片"是水果——词义依赖上下文,这正是注意力要利用的东西。
- 注意力机制Attention
- 让序列中每个位置按"相关程度"加权汇聚其他位置信息的机制:每个词同时是提问者(Q)、被查者(K)和信息携带者(V)。
- Q / K / VQuery / Key / Value
- 注意力三件套:Query="我要找什么",Key="我是什么"(用于被匹配),Value="我携带的实际信息"。Q 与各 K 打分 → 加权汇总各 V。
- 自注意力Self-Attention
- 序列对自己做注意力:句中每个词同时向所有词(含自己)查询信息。Transformer 与 Qwen3-ASR 编码器的核心操作。
- 多头注意力Multi-Head Attention
- 并行运行多组独立的注意力,每组(头)学习不同的关注模式——有的盯语法搭配,有的盯语义关联,最后拼接结果。
- 位置编码Positional Encoding
- 向向量中注入"我在序列第几位"的信息。注意力本身对顺序无感("我打你"和"你打我"会得到同样关注度),必须补位置。现代模型多用 RoPE 旋转位置编码,Qwen3 系列也在用。
- SoftmaxSoftmax
- 把一串任意分数变成"总和为 1"的概率分布的函数。注意力用它在打分后决定各位置分到多少关注;LLM 用它在词表上选出下一个词元。
- TransformerTransformer
- 2017 年提出的、完全基于注意力的网络结构,是当今几乎所有大模型(含 Qwen3、Whisper、AuT 编码器)的共同骨架。
- 频率Frequency, Hz
- 每秒完成完整周期(出发→峰→谷→回到起点)的次数,单位 Hz。1Hz = 每秒振动 1 个来回;440Hz = 音乐标准音 A。频率决定波的密疏,对应听感上的音调高低;与音量无关(那是振幅)。人说话的能量主要在约 300–3400Hz。语谱图的纵轴;人耳与 ASR 都靠频率结构分辨声音内容。
- 振幅Amplitude
- 声波偏离平衡位置的幅度,对应响度。波形的纵轴;只看得出"多响",看不出"什么音"。
- 采样定理 / 奈奎斯特Nyquist Theorem
- 采样率的一半是可忠实记录的最高频率。16kHz 采样 → 最多保留 8kHz 成分,覆盖语音足够。
- 基频 / 谐波F0 / Harmonics
- 声带振动的最低频率(基频,决定音高)及其整数倍(谐波)。在语谱图上呈现为一排等距水平条纹。
- 共振峰Formant
- 声道共鸣使某些谐波格外响的频段,决定元音身份("啊"vs"衣")。谐波条纹中亮度的起伏就是共振峰,人声的指纹。
- 傅里叶变换 / FFTFourier Transform / FFT
- 把一段信号分解为"含有哪些频率、各占多少"的数学工具;FFT 是其快速算法。STFT = 逐帧 FFT,语谱图的生成器。
- 帧 / 窗口Frame / Window
- 把波形切成的小段(典型 25 毫秒一段,每 10 毫秒前移一次)。AuT 编码器做注意力的对象就是帧序列。
- 语谱图Spectrogram
- 时间 × 频率 × 能量的二维图(能量用亮度表示),由 STFT 排开各帧得到。"说一句话 = 条纹快速移动变化"。
- mel 刻度Mel Scale
- 按人耳感知(低频敏感、高频迟钝)压缩频率轴得到的刻度。锚点:1000Hz = 1000 mel。梅尔频谱 = 现代 ASR 的标准输入画像。
- mel 滤波器组Mel Filterbank
- 一组中心在 mel 轴等距、铺在 Hz 轴上的三角加权窗口(低频又窄又密、高频又宽又稀)。三个作用:①把细频点按人耳刻度装桶压缩;②抹平谐波细节、保留共振峰包络;③软边界(权重渐变 + 相邻重叠)防止硬切造成的特征跳变。Whisper 用 80 带;频带数是前端真实可调的超参数。
- 频带Band
- 一段频率区间及合并后的能量值。梅尔频谱的一"柱"就是一个频带。
- 投影器Projector
- 把编码器输出对齐到语言模型输入空间的小模块。Qwen3-ASR 三件套之一:AuT 出 2048 维连续嵌入,经投影器送进 Qwen3 LLM。
- GQAGrouped-Query Attention
- 分组查询注意力:多个查询头共享同一组 K/V(Qwen3-ASR 是 16 查询头共享 8 组 KV)。多头注意力的省显存/提速变体,推理时 KV 缓存减半。
- 对话模板Chat Template
- 把"system 热词 + user 音频占位符 + assistant 输出"拼成模型输入的固定格式,用特殊词元(<|im_start|> 等)分段。微调造数据必须遵循它。
- 伪标签Pseudo-labeling
- 用已有模型给无标注数据生成标签,再拿去训练新模型。AuT 预训练的 4000 万小时数据即伪标签产物。
- AEDAttention Encoder-Decoder
- 注意力编码器-解码器架构(传统 seq2seq ASR 范式)。AuT 是按 AED 框架预训练的编码器。
- 非自回归NAR, Non-Autoregressive
- 一次前向并行输出全部结果、不逐词元生成。Qwen3-ForcedAligner 即 NAR(槽填充式),与 ASR 主模型的自回归生成形成对照。
- KV Cache
- 推理时缓存的每层每个位置的 K/V 向量。Prefill 阶段写入,Decode 阶段每步读取——免去历史重算,是自回归推理的基石。大小 = token 数 × 每 token KV(0.6B 为 112KB)。
- Prefill(预填充)
- 推理第一阶段:一次性并行计算全部输入位置,填满 KV Cache,并产出第一个输出词元。算力 bound(GPU 并行舒适区);TTFT 的主要成分。
- Decode(解码阶段)
- 推理第二阶段:每步只算一个新位置、读全量 KV Cache、输出一个词元,循环到结束词元。访存 bound(每步要把全部权重读一遍)——批处理能分摊此成本的根源。
- Detokenize(后处理)
- 把输出词元 id 序列转回文本:查词表 + 剥离特殊词元(如 language 标签、<asr_text>)。
- 端点检测 / VAD
- 判定一句话何时说完:语音活动检测(VAD)识别静音,静音超阈值(常 300–800ms)触发断句与最终结果。流式体感的关键调参项。
- 不封死块 / 回改
- 流式解码中,最近若干块的结果保持"暂定"权,后续声学上下文到达后可修订(官方评测:最后 4 块不封死;5-token fallback 防无限等待)。
- 线性映射 / 仿射变换
- y = Wx + b:按权重矩阵 W 的列「配方」重新混合输入坐标,b 平移。投影器、线性层、输出头全是它;方阵且可逆时只换坐标系、信息无损。
- 张量形状:时间轴 × 特征轴
- 全链路张量的两条轴:轴 0(时间/序列长)随音频时长变化;轴 1(特征宽度)由架构定死。判读形状先问「哪条轴在变」。