深度学习笔记:术语表 - MuxiaoWF跳到主要内容

深度学习笔记:术语表

深度学习学习笔记系列的术语速查表,用通俗语言解释所有专业术语。基于Bishop《深度学习:基础与概念》,覆盖概率论、神经网络、优化、CNN、Transformer、生成模型等核心概念。

周一 9月 01 2025
6224 字 · 22 分钟

这是深度学习笔记系列的配套术语表。每个术语都附带通俗解释和首次出现的文章链接,方便随时查阅。

建议配合系列文章使用——术语表帮你快速回忆,文章帮你深入理解。


第1篇相关:多项式拟合、概率论与信息论

第1篇 | 覆盖Ch1-2

术语英文通俗解释
误差函数Error Function衡量模型预测值和真实值之间差距的函数,越小说明模型画的线离数据点越近
过拟合Overfitting模型太复杂,把数据里的随机噪声也当规律学进去了,在新数据上表现很差
欠拟合Underfitting模型太简单,连数据的基本规律都没学到
正则化Regularization给模型参数加惩罚项,防止参数过大导致过拟合,就像给模型加了个”紧箍咒”
权重衰减Weight Decay正则化的另一种叫法,因为惩罚项会让权重在训练过程中不断”缩小”
交叉验证Cross-Validation把数据分成多份轮流训练和验证,公平评估模型性能的方法
超参数Hyperparameter训练前需要人工设定的参数(如学习率、网络层数),不是模型自己学出来的
激活函数Activation Function对神经元的加权求和结果做非线性变换的函数,常用的有ReLU、sigmoid、tanh
预激活Pre-activation神经元的加权求和结果,就是把输入各自乘上权重加起来,但还没过激活函数
多层感知机Multi-Layer Perceptron (MLP)由多层神经元组成的神经网络,层数越多能学到的模式越复杂
概率密度函数Probability Density Function (PDF)描述连续变量在某点附近概率大小的函数,曲线下的面积代表概率
先验概率Prior观测数据之前对事件概率的信念,比如”根据天气预报,下雨概率30%”
后验概率Posterior观测数据之后更新的事件概率,比如”看到地面湿了之后,下雨概率变成73%”
似然Likelihood给定参数下观测到数据的概率,用来判断哪组参数最能解释现有数据
最大似然估计Maximum Likelihood Estimation (MLE)找到最可能产生观测数据的参数值——“哪组参数让数据出现的概率最大”
Entropy衡量随机变量不确定性或”混乱度”的指标,越不确定熵越大
KL散度Kullback-Leibler Divergence衡量两个概率分布之间差异的指标,值越大说明两个分布越不同
互信息Mutual Information衡量两个变量之间共享信息量的指标,值越大说明两个变量越相关
频率学派Frequentist认为概率就是”反复做很多次实验,某件事发生的频率”,参数是固定但未知的
贝叶斯学派Bayesian认为概率是”我们对某件事发生的相信程度”,通过贝叶斯定理更新信念
偶然不确定性Aleatoric Uncertainty数据本身固有的噪声(如测量误差),无法通过增加数据消除
认知不确定性Epistemic Uncertainty因数据不足导致的不确定性,数据越多越小
累积分布函数Cumulative Distribution Function (CDF)P(z)=zp(x)dxP(z) = \int_{-\infty}^z p(x)dx,表示”xx小于等于zz的概率”
经验分布Empirical Distribution在每个观测数据点处放一根高度为 1/N1/N 的”针”来近似真实分布的做法
精度Precision方差的倒数 1/σ21/\sigma^2,精度越大说明分布越集中
雅可比矩阵Jacobian Matrix由向量函数所有一阶偏导数组成的矩阵,行列式的绝对值表示变换前后的体积缩放比例
雅可比因子Jacobian Factor概率密度变量变换时的缩放因子 dg/dy\|dg/dy\|,确保变换后总概率守恒
Jensen不等式Jensen’s Inequality对凸函数 fff(E[x])E[f(x)]f(E[x]) \leq E[f(x)],用于证明KL散度非负

第2篇相关:概率分布与线性回归

第2篇 | 覆盖Ch3-4

术语英文通俗解释
伯努利分布Bernoulli Distribution描述抛硬币这种只有两种结果(正面/反面)的概率分布
多项式分布Multinomial Distribution掷骰子这种有多种结果的概率分布,是伯努利分布的推广
高斯分布/正态分布Gaussian / Normal Distribution最常见的”钟形曲线”分布,自然界中很多现象都近似服从它
协方差Covariance衡量两个变量一起变化的程度——正协方差说明同增同减,负协方差说明此增彼减
Moments描述分布形状的统计量:一阶矩是均值(重心),二阶矩与方差(分散程度)相关
偏差-方差权衡Bias-Variance Tradeoff模型简单则偏差高(打偏了)方差低(很稳定),复杂则偏差低(打得准)方差高(忽左忽右)
线性回归Linear Regression用一条直线(或超平面)来拟合数据的最简单回归模型
高斯混合模型Gaussian Mixture Model (GMM)K个高斯分布加权混合,可以逼近任意连续密度函数
指数族分布Exponential Family把各种常见分布(伯努利、高斯、泊松等)用统一”模板”写出的数学框架
充分统计量Sufficient Statistic概括数据所有信息的函数,知道它就够了,原始数据可以丢掉
自然参数Natural Parameter指数族分布标准形式中的参数向量,是原始参数的变换
核密度估计Kernel Density Estimation (KDE)在每个数据点放一个”小山丘”叠加起来估计密度的非参数方法
基函数Basis Function对输入特征做固定的非线性变换(如 xx2x \to x^2),把线性模型扩展为非线性
正规方程Normal Equation线性回归的闭式解:w=(ΦTΦ)1ΦTt\mathbf{w} = (\mathbf{\Phi}^T\mathbf{\Phi})^{-1}\mathbf{\Phi}^T\mathbf{t}
设计矩阵Design Matrix每行是样本的基函数值组成的矩阵 Φ\mathbf{\Phi},线性回归的核心
马哈拉诺比斯距离Mahalanobis Distance考虑特征间相关性的”距离”度量,协方差矩阵为单位矩阵时退化为欧氏距离
决策理论Decision Theory用损失函数量化预测代价,从概率模型中做出最优决策的框架

第3篇相关:分类与深度神经网络

第3篇 | 覆盖Ch5-6

术语英文通俗解释
判别函数Discriminant Function直接输出分类决策的函数——输入数据,输出”属于哪个类别”
决策边界Decision Boundary分类器将不同类别分开的分界线,就像地图上的省界
1-of-K编码 / One-Hot编码One-Hot Encoding用长度为K的向量表示K个类别,只有对应位置为1其余为0,比如类别2→[0,1,0,0,0]
逻辑斯谛回归Logistic Regression用sigmoid函数做二分类的模型,虽然名字带”回归”但其实是分类方法
Sigmoid函数Sigmoid Function把任意实数压缩到0~1之间的S形曲线函数,输出可以解释为概率
Softmax函数Softmax Function把多个实数转换成概率分布的函数,确保所有输出加起来等于1
交叉熵Cross-Entropy衡量分类预测和真实标签差异的损失函数,预测越准交叉熵越小
生成模型Generative Model先学习每个类别的数据”长什么样”,再用贝叶斯定理分类
判别模型Discriminative Model直接学习”怎么区分不同类别”,不关心每个类别具体长什么样
混淆矩阵Confusion Matrix展示分类器在各类别上预测结果的表格,能看出哪类容易被搞混
ROC曲线ROC Curve绘制不同阈值下真阳性率和假阳性率的曲线,越靠近左上角越好
维度灾难Curse of Dimensionality高维空间中数据变得极其稀疏,低维的直觉在高维中完全失效
数据流形Data Manifold高维数据实际分布的低维结构——比如手写数字图片虽然有784维,但实际变化只有几个因素
残差连接Residual Connection允许信息绕过某些层直接传递的连接方式,帮助训练非常深的网络
迁移学习Transfer Learning在一个任务上学到的知识用到另一个相关任务上,比如用ImageNet预训练的模型做医学图像分类
张量Tensor多维数组的统称——标量是0维、向量是1维、矩阵是2维,更高维的叫张量
混合密度网络Mixture Density Network (MDN)能输出多个可能结果(而非单一预测)的网络,适用于一个输入对应多个合理输出的情况
朴素贝叶斯分类器Naive Bayes Classifier假设所有特征在给定类别下条件独立的生成分类器
线性判别分析Linear Discriminant Analysis (LDA)假设各类别共享同一协方差矩阵的生成分类器,产生线性决策边界
二次判别分析Quadratic Discriminant Analysis (QDA)各类别允许有各自协方差矩阵的生成分类器,产生二次决策边界
径向基函数网络Radial Basis Function (RBF) Network以训练样本为中心放置局部基函数的网络
表示学习Representation Learning自动学习输入数据的有效表示,而非依赖人工设计的特征
对比学习Contrastive Learning通过拉近相似样本、推远不相似样本来学习表示的自监督方法
残差网络Residual Network (ResNet)使用跳跃连接绕过某些层的深层网络,使得训练非常深的网络成为可能
前向传播Forward Propagation输入逐层通过网络计算输出的过程
数据增强Data Augmentation通过对现有样本做变换(旋转、裁剪、翻转)来人工扩充训练数据
AUCArea Under ROC Curve (AUC)ROC曲线下的面积,0.5=随机猜测,1.0=完美分类
F-scoreF-score (F1)精确率和召回率的调和平均数,综合衡量分类性能

第4篇相关:梯度下降、反向传播与正则化

第4篇 | 覆盖Ch7-9

术语英文通俗解释
梯度Gradient函数在某点变化最快的方向和速率——站在山上,梯度指向最陡的上坡方向
学习率Learning Rate控制每次参数更新步长大小的超参数——步子太大容易跨过最优解,太小则训练太慢
随机梯度下降Stochastic Gradient Descent (SGD)每次只用一部分数据估计梯度,比用全部数据快很多但噪声更大
动量Momentum让优化器有”惯性”,帮助冲过局部最小值和鞍点
Adam优化器Adam Optimizer结合动量和自适应学习率的优化算法,是目前最常用的优化器之一
反向传播Backpropagation从输出层到输入层逐层计算梯度的算法,是训练神经网络的核心
链式法则Chain Rule复合函数求导的法则——反向传播的数学基础
DropoutDropout训练时随机”关闭”一部分神经元的正则化技术,防止过拟合
批量归一化Batch Normalization对每一层的输入做标准化处理,让训练更快更稳定
权重初始化Weight Initialization训练开始前给参数赋初始值的方法,好的初始化能让训练更顺利
梯度消失/爆炸Vanishing/Exploding Gradients深层网络中梯度在传递过程中变得极小或极大的问题
早停Early Stopping当验证集误差不再下降时提前停止训练的正则化方法
Hessian矩阵Hessian Matrix误差函数对所有参数的二阶偏导数组成的方阵,描述误差曲面的局部弯曲程度
AdaGradAdaptive Gradient通过累积梯度平方来自适应调整每个参数学习率的优化器,适合稀疏特征
RMSPropRoot Mean Square Propagation用指数加权移动平均改进AdaGrad的优化器,能”忘记”早期梯度
指数加权移动平均Exponential Moving Average (EMA)近期数据权重更大、远期数据逐渐”遗忘”的平均方法
层归一化Layer Normalization对单个样本的所有特征做归一化(不同于批量归一化跨样本归一化),Transformer中常用
自动微分Automatic Differentiation将任意可微程序分解为基本运算来精确计算梯度的技术
归纳偏置Inductive Bias学习算法对目标函数所做的假设集合,决定了模型如何从有限数据泛化
双重下降Double Descent测试误差先降后升(经典偏差-方差区间)再降(过参数化区间)的现代现象
集成方法Ensemble Method组合多个模型的预测来获得比单个模型更好的泛化性能

第5篇相关:卷积网络与概率图模型

第5篇 | 覆盖Ch10-11

术语英文通俗解释
卷积Convolution用一个小的滤波器在输入上滑动,提取局部特征——就像用放大镜逐块扫描图片
滤波器/卷积核Filter / Kernel卷积操作中用于提取特征的小矩阵,不同的核提取不同的特征(边缘、纹理等)
池化Pooling对特征图做下采样,缩小尺寸保留主要特征——就像把照片缩小但还能看清内容
特征图Feature Map卷积操作的输出,表示在不同位置检测到的特征
感受野Receptive Field输出特征图上一个点对应输入图像的区域大小
概率图模型Probabilistic Graphical Model用图结构(节点和边)表示变量间概率关系的模型
贝叶斯网络Bayesian Network用有向图表示因果关系的概率图模型——箭头表示”因为A所以B”
马尔可夫随机场Markov Random Field用无向图表示相关关系的概率图模型——连线表示”A和B相关”
d-分离d-separation判断贝叶斯网络中两个变量是否条件独立的方法
平移等变性Translation Equivariance输入平移时输出也平移同样距离——CNN不管特征在图像哪个位置都能检测到
全卷积网络Fully Convolutional Network (FCN)用1×1卷积替换全连接层,能处理任意大小输入的网络
转置卷积Transposed Convolution可学习的上采样操作,将低分辨率特征图映射回高分辨率
上采样Up-sampling增加特征图空间分辨率的操作,用于分割和生成任务
U-NetU-Net对称的编码器-解码器架构,通过跳跃连接保留空间细节,用于语义分割
跳跃连接Skip Connection将编码器层直接连到对应解码器层,保留下采样丢失的空间细节
显著性图Saliency Map可视化技术,显示输入图像的哪些区域对分类决策影响最大
对抗性攻击Adversarial Attack对输入添加人眼不可察觉的微小扰动,导致网络做出完全错误的预测
风格迁移Style Transfer用CNN特征将一张图的”内容”和另一张图的”风格”组合起来
马尔可夫链Markov Chain下一步只取决于当前状态的随机过程(无记忆性)
隐马尔可夫模型Hidden Markov Model (HMM)观测数据由形成马尔可夫链的隐藏状态生成的模型
状态空间模型State-Space Model观测数据依赖于随时间演化的潜变量的通用框架

第6篇相关:Transformer与图神经网络

第6篇 | 覆盖Ch12-13

术语英文通俗解释
注意力机制Attention Mechanism让模型动态地为不同输入分配不同重要性权重——读文章时自动关注重点段落
自注意力Self-AttentionQuery、Key、Value都来自同一输入序列的注意力,让序列中的每个元素都能”看到”其他所有元素
Query / Key / ValueQuery / Key / Value注意力中的三个角色:Query是”我在找什么”,Key是”我有什么标签”,Value是”我的实际内容”
多头注意力Multi-Head Attention多个并行的注意力头,每个头关注不同类型的依赖关系(语法、语义等)
位置编码Positional Encoding给输入序列加上位置信息,因为自注意力本身不区分顺序
TransformerTransformer基于自注意力机制的深度学习架构,是现代NLP和多模态模型的基础
词嵌入Word Embedding将词映射到低维稠密向量的技术,语义相近的词在向量空间中距离也近
分词Tokenization将文本切分成token(词、子词或字符)的过程
BERTBERT双向编码器,通过”完形填空”式预训练学习语言理解
GPTGPT生成式预训练Transformer,通过”预测下一个词”式预训练学习文本生成
图神经网络Graph Neural Network (GNN)处理图结构数据(分子、社交网络等)的神经网络
消息传递Message PassingGNN中节点聚合邻居信息的机制——每个节点从邻居那里”收集情报”然后更新自己
过平滑Over-SmoothingGNN层数过多后节点表示趋于相同的问题——“近朱者赤近墨者黑”到最后大家都一样
邻接矩阵Adjacency Matrix用矩阵表示图中哪些节点之间有边相连
置换不变性Permutation Invariance输出不随输入节点排列顺序改变而改变的性质
束搜索Beam Search每步保留B个最优候选序列的解码策略,平衡搜索质量和计算量
温度参数Temperature Parameter控制softmax采样随机性的参数——越低越确定,越高越随机
掩码注意力Masked Attention阻止token关注未来位置的注意力机制,用于自回归解码器
交叉注意力Cross-AttentionQ来自解码器、K和V来自编码器输出的注意力,桥接编码器和解码器
大语言模型Large Language Model (LLM)在海量文本上预训练的超大规模Transformer模型,能完成各种语言任务
低秩适应Low-Rank Adaptation (LoRA)冻结预训练权重、只训练低秩矩阵的微调方法,可训练参数减少几个数量级
提示工程Prompt Engineering通过设计输入提示引导大语言模型完成任务,无需更新权重
视觉TransformerVision Transformer (ViT)将图像切成patch当作token,用Transformer处理图像的架构
梅尔频谱图Mel Spectrogram用感知均匀的频率尺度将音频波形转换为时频矩阵
图注意力网络Graph Attention Network (GAT)用注意力动态加权不同邻居重要性的GNN变体
聚合算子Aggregation OperatorGNN消息传递中用于合并邻居信息的函数(求和、均值、最大值)
置换等变性Permutation Equivariance节点级预测随节点排列顺序一致变化的性质,GNN必须满足
字节对编码Byte Pair Encoding (BPE)迭代合并最频繁相邻字符对的分词方法,直到达到目标词表大小

第7篇相关:采样方法与潜变量模型

第7篇 | 覆盖Ch14-16

术语英文通俗解释
蒙特卡洛方法Monte Carlo Methods用大量随机实验来近似计算的方法——比如通过随机投点估算圆周率
马尔可夫链蒙特卡洛Markov Chain Monte Carlo (MCMC)通过构建一个”随机游走”过程来采样的方法,走的步数够多后分布会收敛到目标分布
潜变量/隐变量Latent Variable数据中存在但观测不到的隐藏因素——比如你看到一个人的表情(观测),推测他的心情(潜变量)
K-means聚类K-Means Clustering将数据分成K个簇的无监督学习算法——“物以类聚”
EM算法Expectation-Maximization处理含隐变量模型的迭代优化算法——先猜测隐变量(E步),再优化参数(M步),反复循环
主成分分析Principal Component Analysis (PCA)找到数据最大方差方向进行降维的方法——就像给3D物体找最佳的2D投影角度
证据下界Evidence Lower Bound (ELBO)对数似然的一个可优化的”保底”下界,VAE训练的核心目标函数
变分推断Variational Inference用一个简单的分布去近似复杂的后验分布的推断方法
拒绝采样Rejection Sampling从”包络”分布中采样,根据是否落在目标密度下方来接受或拒绝
提议分布Proposal Distribution拒绝采样和MCMC中用于提议候选样本的”替身”分布
接受概率Acceptance Probability拒绝采样和MCMC中接受一个提议样本的概率,直接影响采样效率
能量模型Energy-Based Model通过能量函数定义概率:p(x)eE(x)p(x) \propto e^{-E(x)},能量越低概率越高
配分函数Partition Function能量模型中的归一化常数 ZZ,需要对整个空间积分,通常难以计算
白化Whitening将数据变换为零均值、单位协方差、各维度不相关的预处理步骤
因子分析Factor Analysis类似概率PCA但允许每个观测维度有各自的噪声方差(对角协方差)
独立成分分析Independent Component Analysis (ICA)假设潜变量是统计独立的非高斯变量,用于盲源分离
卡尔曼滤波器Kalman Filter潜变量形成马尔可夫链的序列数据状态空间模型,用于跟踪和时间序列
去量化Dequantization通过加均匀噪声将离散观测转为连续变量,防止密度坍缩到整数点

第8篇相关:GAN、标准化流、自编码器与扩散模型

第8篇 | 覆盖Ch17-20

术语英文通俗解释
生成对抗网络Generative Adversarial Network (GAN)生成器和判别器对抗训练的生成模型——造假者和鉴定师互相博弈,最终造假者能造出以假乱真的作品
生成器GeneratorGAN中负责生成假数据的网络,目标是骗过判别器
判别器DiscriminatorGAN中负责判断数据真假的网络,目标是识破生成器
标准化流Normalizing Flows通过一系列可逆变换将简单分布变成复杂分布的生成模型——就像把一团橡皮泥捏成复杂形状
自编码器Autoencoder将输入压缩到低维表示再重建的网络,学习数据的”精华摘要”
变分自编码器Variational Autoencoder (VAE)在自编码器中引入概率建模的生成模型,能生成新数据而不仅仅是重建
扩散模型Diffusion Model通过逐步去噪来生成数据的模型——先把图片完全变成噪声,再学习怎么一步步恢复回来
前向过程Forward Process扩散模型中逐步给数据加噪声的过程,直到变成纯噪声
反向过程Reverse Process扩散模型中逐步去噪恢复数据的过程,这就是生成新数据的过程
噪声预测Noise Prediction扩散模型的核心思想——不直接预测图片,而是预测”加了什么噪声”,然后把噪声减掉
向量量化Vector Quantization将连续向量映射到离散码本中最近的码字,用于VQ-VAE等模型
得分函数Score Function指向概率密度增大方向的向量——告诉你往哪个方向走能找到更高概率的区域
模式崩溃Mode CollapseGAN训练失败——生成器只产出少数几种输出,忽略了完整数据分布
Wasserstein距离Wasserstein Distance衡量把一个分布”搬”成另一个分布的最小”工作量”,即使分布不重叠也有意义
循环一致性损失Cycle Consistency LossCycleGAN中确保A→B→A能还原原图的损失,实现无配对图像翻译
耦合流Coupling Flow可控的标准化流设计(如Real NVP),一部分输入基于另一部分做变换
掩码自回归流Masked Autoregressive Flow (MAF)似然计算快但采样慢的自回归流
逆自回归流Inverse Autoregressive Flow (IAF)采样快但似然计算慢的自回归流,MAF的计算特性反转
重参数化技巧Reparameterization Trick将随机性从参数中分离(z=μ+σϵ\mathbf{z} = \mathbf{\mu} + \mathbf{\sigma} \cdot \mathbf{\epsilon}),使VAE中梯度能通过采样反向传播
去噪自编码器Denoising Autoencoder从损坏的输入恢复干净输入来学习鲁棒表示,扩散模型的概念前身
掩码自编码器Masked Autoencoder (MAE)用大面积掩码+Transformer的图像去噪自编码器
引导扩散Guided Diffusion在扩散生成中加入引导信号,控制生成朝期望方向(如特定类别或文本描述)进行
无分类器引导Classifier-Free Guidance同时训练条件和无条件生成,推理时控制混合比例,Stable Diffusion的主流方法
潜扩散模型Latent Diffusion Model在压缩的潜空间而非像素空间运行扩散过程,大幅降低高分辨率图像的计算量
对比散度Contrastive Divergence能量模型的训练算法,用短链采样近似似然梯度,避免计算配分函数
朗之万动力学Langevin Dynamics结合得分函数梯度上升和随机噪声扰动的采样方法
去噪得分匹配Denoising Score Matching通过学习去噪来训练得分函数估计器,等价于扩散模型的训练目标
扩散核Diffusion Kernel条件分布 $q(z_t
随机微分方程Stochastic Differential Equation (SDE)离散扩散过程的连续时间极限,统一了扩散模型、得分匹配和朗之万动力学
神经常微分方程Neural ODE将神经网络视为连续动力系统而非离散层,通过ODE求解器定义网络

感谢您的阅读!如果可以,给俺点些关注吧~

深度学习笔记:术语表

周一 9月 01 2025
6224 · 22 分钟
封面
示例歌曲
示例艺术家
封面
示例歌曲
示例艺术家
0:00 / 0:00