参考文档 · 随课增长

术语表(ASR / LLM / Qwen3-ASR)

全课程统一用语。新术语入表后,所有课程与对话都遵循此处的定义。

语音识别ASR, Automatic Speech Recognition
把声音信号转成文字的技术。输入是音频,输出是文本转写。本课程的目标领域;Qwen3-ASR 就是 ASR 模型。
词错误率WER, Word Error Rate
衡量转写质量的核心指标:编辑距离(替换+插入+删除次数)÷ 参考答案词数,越低越好。中文常按"字错误率 CER"计算。微调有没有用,就看它降没降。
采样Sampling
把连续声波变成离散数字:每秒记录固定次数声压值。采样率单位 Hz。Qwen3-ASR 要求 16kHz 单声道输入。
采样率Sample Rate, Hz
每秒采样次数。16kHz = 每秒 16000 个数字,足够覆盖语音频段。
波形Waveform
采样后的声压随时间变化的数字序列,是音频最原始的数字形态。
频谱 / 梅尔频谱Spectrogram / Mel-spectrogram
把波形按短窗切开、对每窗做傅里叶变换得到的"时间 × 频率 × 能量"图;mel 刻度模拟人耳对频率的感知。传统 ASR 前端的标准特征;现代模型的前端具体配置以 Qwen3-ASR 技术报告为准。
编码器Encoder
把输入序列(如音频特征)压缩成富含语义的向量表示的网络。Qwen3-ASR 中是 AuT(Audio Transformer)语音编码器。
解码器Decoder
把编码表示转成目标序列(文字)的网络。Qwen3-ASR 的解码器就是 Qwen3 大语言模型本体。
自回归Autoregressive
逐个词元生成、每次以已生成内容为条件的生成方式。Qwen3-ASR 的转写是 LLM 自回归生成,不是 CTC 一次性对齐。
词元Token
模型处理文本的最小单位(词片/字/字节)。LLM 读和写的都是 token 序列。
参数 / 参数量Parameters / B
模型中可学习的权重数值总量;B = 十亿。Qwen3-ASR 有 0.6B 与 1.7B 两个尺寸(0.6B 含编码器总参数约 0.9B)。
预训练Pre-training
在海量数据上从头训练模型的过程。Qwen3-ASR 建立在 Qwen3-Omni 预训练基座之上。
微调Fine-tuning
在预训练模型上用特定数据继续训练,使其适配具体领域/口音/词汇。
LoRALow-Rank Adaptation
冻结原模型、只训练一小块低秩适配参数的微调法,显存占用小。T4 16GB 上微调 Qwen3-ASR 的现实路线。
推理Inference
用训练好的模型做预测(此处=转写音频),不更新参数。
流式 / 离线Streaming / Offline
流式=边说边出字(低延迟);离线=整段音频一次转写(更高精度)。Qwen3-ASR 单模型统一支持两者。
热词 / 上下文偏置Hotwords / Contextual Biasing
转写前给模型提供领域词表或自由文本提示,引导专有名词识别。Qwen3-ASR 通过 prompt / system message 注入。
大语言模型LLM, Large Language Model
超大规模的自回归 Transformer,经海量文本训练,懂语言规律。现代 ASR 把"听写"交给听觉编码器、把"成文"交给 LLM。
CTCConnectionist Temporal Classification
一种让音频帧与文字对齐的训练损失,解码非自回归、一次输出。老一代 ASR 主流;Qwen3-ASR 未采用,是重要的对照概念。
多模态Multimodal
模型能处理多种输入类型(文本+音频+图像)。Qwen3-Omni 是音频+文本多模态模型,Qwen3-ASR 是其"专职听写"后代。
向量 / 嵌入Vector / Embedding
把一个词元(或一帧音频)映射成一串数字,语义相近的东西向量也相近。神经网络不直接处理词和声音,处理的是它们的向量。
上下文Context
一个词周围的其他信息。"苹果"配上"手机"是品牌,配上"照片"是水果——词义依赖上下文,这正是注意力要利用的东西。
注意力机制Attention
让序列中每个位置按"相关程度"加权汇聚其他位置信息的机制:每个词同时是提问者(Q)、被查者(K)和信息携带者(V)。
Q / K / VQuery / Key / Value
注意力三件套:Query="我要找什么",Key="我是什么"(用于被匹配),Value="我携带的实际信息"。Q 与各 K 打分 → 加权汇总各 V。
自注意力Self-Attention
序列对自己做注意力:句中每个词同时向所有词(含自己)查询信息。Transformer 与 Qwen3-ASR 编码器的核心操作。
多头注意力Multi-Head Attention
并行运行多组独立的注意力,每组(头)学习不同的关注模式——有的盯语法搭配,有的盯语义关联,最后拼接结果。
位置编码Positional Encoding
向向量中注入"我在序列第几位"的信息。注意力本身对顺序无感("我打你"和"你打我"会得到同样关注度),必须补位置。现代模型多用 RoPE 旋转位置编码,Qwen3 系列也在用。
SoftmaxSoftmax
把一串任意分数变成"总和为 1"的概率分布的函数。注意力用它在打分后决定各位置分到多少关注;LLM 用它在词表上选出下一个词元。
TransformerTransformer
2017 年提出的、完全基于注意力的网络结构,是当今几乎所有大模型(含 Qwen3、Whisper、AuT 编码器)的共同骨架。
频率Frequency, Hz
每秒完成完整周期(出发→峰→谷→回到起点)的次数,单位 Hz。1Hz = 每秒振动 1 个来回;440Hz = 音乐标准音 A。频率决定波的密疏,对应听感上的音调高低;与音量无关(那是振幅)。人说话的能量主要在约 300–3400Hz。语谱图的纵轴;人耳与 ASR 都靠频率结构分辨声音内容。
振幅Amplitude
声波偏离平衡位置的幅度,对应响度。波形的纵轴;只看得出"多响",看不出"什么音"。
采样定理 / 奈奎斯特Nyquist Theorem
采样率的一半是可忠实记录的最高频率。16kHz 采样 → 最多保留 8kHz 成分,覆盖语音足够。
基频 / 谐波F0 / Harmonics
声带振动的最低频率(基频,决定音高)及其整数倍(谐波)。在语谱图上呈现为一排等距水平条纹。
共振峰Formant
声道共鸣使某些谐波格外响的频段,决定元音身份("啊"vs"衣")。谐波条纹中亮度的起伏就是共振峰,人声的指纹。
傅里叶变换 / FFTFourier Transform / FFT
把一段信号分解为"含有哪些频率、各占多少"的数学工具;FFT 是其快速算法。STFT = 逐帧 FFT,语谱图的生成器。
帧 / 窗口Frame / Window
把波形切成的小段(典型 25 毫秒一段,每 10 毫秒前移一次)。AuT 编码器做注意力的对象就是帧序列。
语谱图Spectrogram
时间 × 频率 × 能量的二维图(能量用亮度表示),由 STFT 排开各帧得到。"说一句话 = 条纹快速移动变化"。
mel 刻度Mel Scale
按人耳感知(低频敏感、高频迟钝)压缩频率轴得到的刻度。锚点:1000Hz = 1000 mel。梅尔频谱 = 现代 ASR 的标准输入画像。
mel 滤波器组Mel Filterbank
一组中心在 mel 轴等距、铺在 Hz 轴上的三角加权窗口(低频又窄又密、高频又宽又稀)。三个作用:①把细频点按人耳刻度装桶压缩;②抹平谐波细节、保留共振峰包络;③软边界(权重渐变 + 相邻重叠)防止硬切造成的特征跳变。Whisper 用 80 带;频带数是前端真实可调的超参数。
频带Band
一段频率区间及合并后的能量值。梅尔频谱的一"柱"就是一个频带。
投影器Projector
把编码器输出对齐到语言模型输入空间的小模块。Qwen3-ASR 三件套之一:AuT 出 2048 维连续嵌入,经投影器送进 Qwen3 LLM。
GQAGrouped-Query Attention
分组查询注意力:多个查询头共享同一组 K/V(Qwen3-ASR 是 16 查询头共享 8 组 KV)。多头注意力的省显存/提速变体,推理时 KV 缓存减半。
对话模板Chat Template
把"system 热词 + user 音频占位符 + assistant 输出"拼成模型输入的固定格式,用特殊词元(<|im_start|> 等)分段。微调造数据必须遵循它。
伪标签Pseudo-labeling
用已有模型给无标注数据生成标签,再拿去训练新模型。AuT 预训练的 4000 万小时数据即伪标签产物。
AEDAttention Encoder-Decoder
注意力编码器-解码器架构(传统 seq2seq ASR 范式)。AuT 是按 AED 框架预训练的编码器。
非自回归NAR, Non-Autoregressive
一次前向并行输出全部结果、不逐词元生成。Qwen3-ForcedAligner 即 NAR(槽填充式),与 ASR 主模型的自回归生成形成对照。
KV Cache
推理时缓存的每层每个位置的 K/V 向量。Prefill 阶段写入,Decode 阶段每步读取——免去历史重算,是自回归推理的基石。大小 = token 数 × 每 token KV(0.6B 为 112KB)。
Prefill(预填充)
推理第一阶段:一次性并行计算全部输入位置,填满 KV Cache,并产出第一个输出词元。算力 bound(GPU 并行舒适区);TTFT 的主要成分。
Decode(解码阶段)
推理第二阶段:每步只算一个新位置、读全量 KV Cache、输出一个词元,循环到结束词元。访存 bound(每步要把全部权重读一遍)——批处理能分摊此成本的根源。
Detokenize(后处理)
把输出词元 id 序列转回文本:查词表 + 剥离特殊词元(如 language 标签、<asr_text>)。
端点检测 / VAD
判定一句话何时说完:语音活动检测(VAD)识别静音,静音超阈值(常 300–800ms)触发断句与最终结果。流式体感的关键调参项。
不封死块 / 回改
流式解码中,最近若干块的结果保持"暂定"权,后续声学上下文到达后可修订(官方评测:最后 4 块不封死;5-token fallback 防无限等待)。
线性映射 / 仿射变换
y = Wx + b:按权重矩阵 W 的列「配方」重新混合输入坐标,b 平移。投影器、线性层、输出头全是它;方阵且可逆时只换坐标系、信息无损。
张量形状:时间轴 × 特征轴
全链路张量的两条轴:轴 0(时间/序列长)随音频时长变化;轴 1(特征宽度)由架构定死。判读形状先问「哪条轴在变」。

← 回到第 1 课