深度学习笔记:术语表
深度学习学习笔记系列的术语速查表,用通俗语言解释所有专业术语。基于Bishop《深度学习:基础与概念》,覆盖概率论、神经网络、优化、CNN、Transformer、生成模型等核心概念。
周一 9月 01 2025
6224 字 · 22 分钟
这是深度学习笔记系列的配套术语表。每个术语都附带通俗解释和首次出现的文章链接,方便随时查阅。
建议配合系列文章使用——术语表帮你快速回忆,文章帮你深入理解。
第1篇相关:多项式拟合、概率论与信息论
第1篇 | 覆盖Ch1-2
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 误差函数 | Error Function | 衡量模型预测值和真实值之间差距的函数,越小说明模型画的线离数据点越近 |
| 过拟合 | Overfitting | 模型太复杂,把数据里的随机噪声也当规律学进去了,在新数据上表现很差 |
| 欠拟合 | Underfitting | 模型太简单,连数据的基本规律都没学到 |
| 正则化 | Regularization | 给模型参数加惩罚项,防止参数过大导致过拟合,就像给模型加了个”紧箍咒” |
| 权重衰减 | Weight Decay | 正则化的另一种叫法,因为惩罚项会让权重在训练过程中不断”缩小” |
| 交叉验证 | Cross-Validation | 把数据分成多份轮流训练和验证,公平评估模型性能的方法 |
| 超参数 | Hyperparameter | 训练前需要人工设定的参数(如学习率、网络层数),不是模型自己学出来的 |
| 激活函数 | Activation Function | 对神经元的加权求和结果做非线性变换的函数,常用的有ReLU、sigmoid、tanh |
| 预激活 | Pre-activation | 神经元的加权求和结果,就是把输入各自乘上权重加起来,但还没过激活函数 |
| 多层感知机 | Multi-Layer Perceptron (MLP) | 由多层神经元组成的神经网络,层数越多能学到的模式越复杂 |
| 概率密度函数 | Probability Density Function (PDF) | 描述连续变量在某点附近概率大小的函数,曲线下的面积代表概率 |
| 先验概率 | Prior | 观测数据之前对事件概率的信念,比如”根据天气预报,下雨概率30%” |
| 后验概率 | Posterior | 观测数据之后更新的事件概率,比如”看到地面湿了之后,下雨概率变成73%” |
| 似然 | Likelihood | 给定参数下观测到数据的概率,用来判断哪组参数最能解释现有数据 |
| 最大似然估计 | Maximum Likelihood Estimation (MLE) | 找到最可能产生观测数据的参数值——“哪组参数让数据出现的概率最大” |
| 熵 | Entropy | 衡量随机变量不确定性或”混乱度”的指标,越不确定熵越大 |
| KL散度 | Kullback-Leibler Divergence | 衡量两个概率分布之间差异的指标,值越大说明两个分布越不同 |
| 互信息 | Mutual Information | 衡量两个变量之间共享信息量的指标,值越大说明两个变量越相关 |
| 频率学派 | Frequentist | 认为概率就是”反复做很多次实验,某件事发生的频率”,参数是固定但未知的 |
| 贝叶斯学派 | Bayesian | 认为概率是”我们对某件事发生的相信程度”,通过贝叶斯定理更新信念 |
| 偶然不确定性 | Aleatoric Uncertainty | 数据本身固有的噪声(如测量误差),无法通过增加数据消除 |
| 认知不确定性 | Epistemic Uncertainty | 因数据不足导致的不确定性,数据越多越小 |
| 累积分布函数 | Cumulative Distribution Function (CDF) | ,表示”小于等于的概率” |
| 经验分布 | Empirical Distribution | 在每个观测数据点处放一根高度为 的”针”来近似真实分布的做法 |
| 精度 | Precision | 方差的倒数 ,精度越大说明分布越集中 |
| 雅可比矩阵 | Jacobian Matrix | 由向量函数所有一阶偏导数组成的矩阵,行列式的绝对值表示变换前后的体积缩放比例 |
| 雅可比因子 | Jacobian Factor | 概率密度变量变换时的缩放因子 ,确保变换后总概率守恒 |
| Jensen不等式 | Jensen’s Inequality | 对凸函数 :,用于证明KL散度非负 |
第2篇相关:概率分布与线性回归
第2篇 | 覆盖Ch3-4
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 伯努利分布 | Bernoulli Distribution | 描述抛硬币这种只有两种结果(正面/反面)的概率分布 |
| 多项式分布 | Multinomial Distribution | 掷骰子这种有多种结果的概率分布,是伯努利分布的推广 |
| 高斯分布/正态分布 | Gaussian / Normal Distribution | 最常见的”钟形曲线”分布,自然界中很多现象都近似服从它 |
| 协方差 | Covariance | 衡量两个变量一起变化的程度——正协方差说明同增同减,负协方差说明此增彼减 |
| 矩 | Moments | 描述分布形状的统计量:一阶矩是均值(重心),二阶矩与方差(分散程度)相关 |
| 偏差-方差权衡 | Bias-Variance Tradeoff | 模型简单则偏差高(打偏了)方差低(很稳定),复杂则偏差低(打得准)方差高(忽左忽右) |
| 线性回归 | Linear Regression | 用一条直线(或超平面)来拟合数据的最简单回归模型 |
| 高斯混合模型 | Gaussian Mixture Model (GMM) | K个高斯分布加权混合,可以逼近任意连续密度函数 |
| 指数族分布 | Exponential Family | 把各种常见分布(伯努利、高斯、泊松等)用统一”模板”写出的数学框架 |
| 充分统计量 | Sufficient Statistic | 概括数据所有信息的函数,知道它就够了,原始数据可以丢掉 |
| 自然参数 | Natural Parameter | 指数族分布标准形式中的参数向量,是原始参数的变换 |
| 核密度估计 | Kernel Density Estimation (KDE) | 在每个数据点放一个”小山丘”叠加起来估计密度的非参数方法 |
| 基函数 | Basis Function | 对输入特征做固定的非线性变换(如 ),把线性模型扩展为非线性 |
| 正规方程 | Normal Equation | 线性回归的闭式解: |
| 设计矩阵 | Design Matrix | 每行是样本的基函数值组成的矩阵 ,线性回归的核心 |
| 马哈拉诺比斯距离 | Mahalanobis Distance | 考虑特征间相关性的”距离”度量,协方差矩阵为单位矩阵时退化为欧氏距离 |
| 决策理论 | Decision Theory | 用损失函数量化预测代价,从概率模型中做出最优决策的框架 |
第3篇相关:分类与深度神经网络
第3篇 | 覆盖Ch5-6
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 判别函数 | Discriminant Function | 直接输出分类决策的函数——输入数据,输出”属于哪个类别” |
| 决策边界 | Decision Boundary | 分类器将不同类别分开的分界线,就像地图上的省界 |
| 1-of-K编码 / One-Hot编码 | One-Hot Encoding | 用长度为K的向量表示K个类别,只有对应位置为1其余为0,比如类别2→[0,1,0,0,0] |
| 逻辑斯谛回归 | Logistic Regression | 用sigmoid函数做二分类的模型,虽然名字带”回归”但其实是分类方法 |
| Sigmoid函数 | Sigmoid Function | 把任意实数压缩到0~1之间的S形曲线函数,输出可以解释为概率 |
| Softmax函数 | Softmax Function | 把多个实数转换成概率分布的函数,确保所有输出加起来等于1 |
| 交叉熵 | Cross-Entropy | 衡量分类预测和真实标签差异的损失函数,预测越准交叉熵越小 |
| 生成模型 | Generative Model | 先学习每个类别的数据”长什么样”,再用贝叶斯定理分类 |
| 判别模型 | Discriminative Model | 直接学习”怎么区分不同类别”,不关心每个类别具体长什么样 |
| 混淆矩阵 | Confusion Matrix | 展示分类器在各类别上预测结果的表格,能看出哪类容易被搞混 |
| ROC曲线 | ROC Curve | 绘制不同阈值下真阳性率和假阳性率的曲线,越靠近左上角越好 |
| 维度灾难 | Curse of Dimensionality | 高维空间中数据变得极其稀疏,低维的直觉在高维中完全失效 |
| 数据流形 | Data Manifold | 高维数据实际分布的低维结构——比如手写数字图片虽然有784维,但实际变化只有几个因素 |
| 残差连接 | Residual Connection | 允许信息绕过某些层直接传递的连接方式,帮助训练非常深的网络 |
| 迁移学习 | Transfer Learning | 在一个任务上学到的知识用到另一个相关任务上,比如用ImageNet预训练的模型做医学图像分类 |
| 张量 | Tensor | 多维数组的统称——标量是0维、向量是1维、矩阵是2维,更高维的叫张量 |
| 混合密度网络 | Mixture Density Network (MDN) | 能输出多个可能结果(而非单一预测)的网络,适用于一个输入对应多个合理输出的情况 |
| 朴素贝叶斯分类器 | Naive Bayes Classifier | 假设所有特征在给定类别下条件独立的生成分类器 |
| 线性判别分析 | Linear Discriminant Analysis (LDA) | 假设各类别共享同一协方差矩阵的生成分类器,产生线性决策边界 |
| 二次判别分析 | Quadratic Discriminant Analysis (QDA) | 各类别允许有各自协方差矩阵的生成分类器,产生二次决策边界 |
| 径向基函数网络 | Radial Basis Function (RBF) Network | 以训练样本为中心放置局部基函数的网络 |
| 表示学习 | Representation Learning | 自动学习输入数据的有效表示,而非依赖人工设计的特征 |
| 对比学习 | Contrastive Learning | 通过拉近相似样本、推远不相似样本来学习表示的自监督方法 |
| 残差网络 | Residual Network (ResNet) | 使用跳跃连接绕过某些层的深层网络,使得训练非常深的网络成为可能 |
| 前向传播 | Forward Propagation | 输入逐层通过网络计算输出的过程 |
| 数据增强 | Data Augmentation | 通过对现有样本做变换(旋转、裁剪、翻转)来人工扩充训练数据 |
| AUC | Area Under ROC Curve (AUC) | ROC曲线下的面积,0.5=随机猜测,1.0=完美分类 |
| F-score | F-score (F1) | 精确率和召回率的调和平均数,综合衡量分类性能 |
第4篇相关:梯度下降、反向传播与正则化
第4篇 | 覆盖Ch7-9
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 梯度 | Gradient | 函数在某点变化最快的方向和速率——站在山上,梯度指向最陡的上坡方向 |
| 学习率 | Learning Rate | 控制每次参数更新步长大小的超参数——步子太大容易跨过最优解,太小则训练太慢 |
| 随机梯度下降 | Stochastic Gradient Descent (SGD) | 每次只用一部分数据估计梯度,比用全部数据快很多但噪声更大 |
| 动量 | Momentum | 让优化器有”惯性”,帮助冲过局部最小值和鞍点 |
| Adam优化器 | Adam Optimizer | 结合动量和自适应学习率的优化算法,是目前最常用的优化器之一 |
| 反向传播 | Backpropagation | 从输出层到输入层逐层计算梯度的算法,是训练神经网络的核心 |
| 链式法则 | Chain Rule | 复合函数求导的法则——反向传播的数学基础 |
| Dropout | Dropout | 训练时随机”关闭”一部分神经元的正则化技术,防止过拟合 |
| 批量归一化 | Batch Normalization | 对每一层的输入做标准化处理,让训练更快更稳定 |
| 权重初始化 | Weight Initialization | 训练开始前给参数赋初始值的方法,好的初始化能让训练更顺利 |
| 梯度消失/爆炸 | Vanishing/Exploding Gradients | 深层网络中梯度在传递过程中变得极小或极大的问题 |
| 早停 | Early Stopping | 当验证集误差不再下降时提前停止训练的正则化方法 |
| Hessian矩阵 | Hessian Matrix | 误差函数对所有参数的二阶偏导数组成的方阵,描述误差曲面的局部弯曲程度 |
| AdaGrad | Adaptive Gradient | 通过累积梯度平方来自适应调整每个参数学习率的优化器,适合稀疏特征 |
| RMSProp | Root Mean Square Propagation | 用指数加权移动平均改进AdaGrad的优化器,能”忘记”早期梯度 |
| 指数加权移动平均 | Exponential Moving Average (EMA) | 近期数据权重更大、远期数据逐渐”遗忘”的平均方法 |
| 层归一化 | Layer Normalization | 对单个样本的所有特征做归一化(不同于批量归一化跨样本归一化),Transformer中常用 |
| 自动微分 | Automatic Differentiation | 将任意可微程序分解为基本运算来精确计算梯度的技术 |
| 归纳偏置 | Inductive Bias | 学习算法对目标函数所做的假设集合,决定了模型如何从有限数据泛化 |
| 双重下降 | Double Descent | 测试误差先降后升(经典偏差-方差区间)再降(过参数化区间)的现代现象 |
| 集成方法 | Ensemble Method | 组合多个模型的预测来获得比单个模型更好的泛化性能 |
第5篇相关:卷积网络与概率图模型
第5篇 | 覆盖Ch10-11
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 卷积 | Convolution | 用一个小的滤波器在输入上滑动,提取局部特征——就像用放大镜逐块扫描图片 |
| 滤波器/卷积核 | Filter / Kernel | 卷积操作中用于提取特征的小矩阵,不同的核提取不同的特征(边缘、纹理等) |
| 池化 | Pooling | 对特征图做下采样,缩小尺寸保留主要特征——就像把照片缩小但还能看清内容 |
| 特征图 | Feature Map | 卷积操作的输出,表示在不同位置检测到的特征 |
| 感受野 | Receptive Field | 输出特征图上一个点对应输入图像的区域大小 |
| 概率图模型 | Probabilistic Graphical Model | 用图结构(节点和边)表示变量间概率关系的模型 |
| 贝叶斯网络 | Bayesian Network | 用有向图表示因果关系的概率图模型——箭头表示”因为A所以B” |
| 马尔可夫随机场 | Markov Random Field | 用无向图表示相关关系的概率图模型——连线表示”A和B相关” |
| d-分离 | d-separation | 判断贝叶斯网络中两个变量是否条件独立的方法 |
| 平移等变性 | Translation Equivariance | 输入平移时输出也平移同样距离——CNN不管特征在图像哪个位置都能检测到 |
| 全卷积网络 | Fully Convolutional Network (FCN) | 用1×1卷积替换全连接层,能处理任意大小输入的网络 |
| 转置卷积 | Transposed Convolution | 可学习的上采样操作,将低分辨率特征图映射回高分辨率 |
| 上采样 | Up-sampling | 增加特征图空间分辨率的操作,用于分割和生成任务 |
| U-Net | U-Net | 对称的编码器-解码器架构,通过跳跃连接保留空间细节,用于语义分割 |
| 跳跃连接 | Skip Connection | 将编码器层直接连到对应解码器层,保留下采样丢失的空间细节 |
| 显著性图 | Saliency Map | 可视化技术,显示输入图像的哪些区域对分类决策影响最大 |
| 对抗性攻击 | Adversarial Attack | 对输入添加人眼不可察觉的微小扰动,导致网络做出完全错误的预测 |
| 风格迁移 | Style Transfer | 用CNN特征将一张图的”内容”和另一张图的”风格”组合起来 |
| 马尔可夫链 | Markov Chain | 下一步只取决于当前状态的随机过程(无记忆性) |
| 隐马尔可夫模型 | Hidden Markov Model (HMM) | 观测数据由形成马尔可夫链的隐藏状态生成的模型 |
| 状态空间模型 | State-Space Model | 观测数据依赖于随时间演化的潜变量的通用框架 |
第6篇相关:Transformer与图神经网络
第6篇 | 覆盖Ch12-13
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 注意力机制 | Attention Mechanism | 让模型动态地为不同输入分配不同重要性权重——读文章时自动关注重点段落 |
| 自注意力 | Self-Attention | Query、Key、Value都来自同一输入序列的注意力,让序列中的每个元素都能”看到”其他所有元素 |
| Query / Key / Value | Query / Key / Value | 注意力中的三个角色:Query是”我在找什么”,Key是”我有什么标签”,Value是”我的实际内容” |
| 多头注意力 | Multi-Head Attention | 多个并行的注意力头,每个头关注不同类型的依赖关系(语法、语义等) |
| 位置编码 | Positional Encoding | 给输入序列加上位置信息,因为自注意力本身不区分顺序 |
| Transformer | Transformer | 基于自注意力机制的深度学习架构,是现代NLP和多模态模型的基础 |
| 词嵌入 | Word Embedding | 将词映射到低维稠密向量的技术,语义相近的词在向量空间中距离也近 |
| 分词 | Tokenization | 将文本切分成token(词、子词或字符)的过程 |
| BERT | BERT | 双向编码器,通过”完形填空”式预训练学习语言理解 |
| GPT | GPT | 生成式预训练Transformer,通过”预测下一个词”式预训练学习文本生成 |
| 图神经网络 | Graph Neural Network (GNN) | 处理图结构数据(分子、社交网络等)的神经网络 |
| 消息传递 | Message Passing | GNN中节点聚合邻居信息的机制——每个节点从邻居那里”收集情报”然后更新自己 |
| 过平滑 | Over-Smoothing | GNN层数过多后节点表示趋于相同的问题——“近朱者赤近墨者黑”到最后大家都一样 |
| 邻接矩阵 | Adjacency Matrix | 用矩阵表示图中哪些节点之间有边相连 |
| 置换不变性 | Permutation Invariance | 输出不随输入节点排列顺序改变而改变的性质 |
| 束搜索 | Beam Search | 每步保留B个最优候选序列的解码策略,平衡搜索质量和计算量 |
| 温度参数 | Temperature Parameter | 控制softmax采样随机性的参数——越低越确定,越高越随机 |
| 掩码注意力 | Masked Attention | 阻止token关注未来位置的注意力机制,用于自回归解码器 |
| 交叉注意力 | Cross-Attention | Q来自解码器、K和V来自编码器输出的注意力,桥接编码器和解码器 |
| 大语言模型 | Large Language Model (LLM) | 在海量文本上预训练的超大规模Transformer模型,能完成各种语言任务 |
| 低秩适应 | Low-Rank Adaptation (LoRA) | 冻结预训练权重、只训练低秩矩阵的微调方法,可训练参数减少几个数量级 |
| 提示工程 | Prompt Engineering | 通过设计输入提示引导大语言模型完成任务,无需更新权重 |
| 视觉Transformer | Vision Transformer (ViT) | 将图像切成patch当作token,用Transformer处理图像的架构 |
| 梅尔频谱图 | Mel Spectrogram | 用感知均匀的频率尺度将音频波形转换为时频矩阵 |
| 图注意力网络 | Graph Attention Network (GAT) | 用注意力动态加权不同邻居重要性的GNN变体 |
| 聚合算子 | Aggregation Operator | GNN消息传递中用于合并邻居信息的函数(求和、均值、最大值) |
| 置换等变性 | Permutation Equivariance | 节点级预测随节点排列顺序一致变化的性质,GNN必须满足 |
| 字节对编码 | Byte Pair Encoding (BPE) | 迭代合并最频繁相邻字符对的分词方法,直到达到目标词表大小 |
第7篇相关:采样方法与潜变量模型
第7篇 | 覆盖Ch14-16
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 蒙特卡洛方法 | Monte Carlo Methods | 用大量随机实验来近似计算的方法——比如通过随机投点估算圆周率 |
| 马尔可夫链蒙特卡洛 | Markov Chain Monte Carlo (MCMC) | 通过构建一个”随机游走”过程来采样的方法,走的步数够多后分布会收敛到目标分布 |
| 潜变量/隐变量 | Latent Variable | 数据中存在但观测不到的隐藏因素——比如你看到一个人的表情(观测),推测他的心情(潜变量) |
| K-means聚类 | K-Means Clustering | 将数据分成K个簇的无监督学习算法——“物以类聚” |
| EM算法 | Expectation-Maximization | 处理含隐变量模型的迭代优化算法——先猜测隐变量(E步),再优化参数(M步),反复循环 |
| 主成分分析 | Principal Component Analysis (PCA) | 找到数据最大方差方向进行降维的方法——就像给3D物体找最佳的2D投影角度 |
| 证据下界 | Evidence Lower Bound (ELBO) | 对数似然的一个可优化的”保底”下界,VAE训练的核心目标函数 |
| 变分推断 | Variational Inference | 用一个简单的分布去近似复杂的后验分布的推断方法 |
| 拒绝采样 | Rejection Sampling | 从”包络”分布中采样,根据是否落在目标密度下方来接受或拒绝 |
| 提议分布 | Proposal Distribution | 拒绝采样和MCMC中用于提议候选样本的”替身”分布 |
| 接受概率 | Acceptance Probability | 拒绝采样和MCMC中接受一个提议样本的概率,直接影响采样效率 |
| 能量模型 | Energy-Based Model | 通过能量函数定义概率:,能量越低概率越高 |
| 配分函数 | Partition Function | 能量模型中的归一化常数 ,需要对整个空间积分,通常难以计算 |
| 白化 | Whitening | 将数据变换为零均值、单位协方差、各维度不相关的预处理步骤 |
| 因子分析 | Factor Analysis | 类似概率PCA但允许每个观测维度有各自的噪声方差(对角协方差) |
| 独立成分分析 | Independent Component Analysis (ICA) | 假设潜变量是统计独立的非高斯变量,用于盲源分离 |
| 卡尔曼滤波器 | Kalman Filter | 潜变量形成马尔可夫链的序列数据状态空间模型,用于跟踪和时间序列 |
| 去量化 | Dequantization | 通过加均匀噪声将离散观测转为连续变量,防止密度坍缩到整数点 |
第8篇相关:GAN、标准化流、自编码器与扩散模型
第8篇 | 覆盖Ch17-20
| 术语 | 英文 | 通俗解释 |
|---|---|---|
| 生成对抗网络 | Generative Adversarial Network (GAN) | 生成器和判别器对抗训练的生成模型——造假者和鉴定师互相博弈,最终造假者能造出以假乱真的作品 |
| 生成器 | Generator | GAN中负责生成假数据的网络,目标是骗过判别器 |
| 判别器 | Discriminator | GAN中负责判断数据真假的网络,目标是识破生成器 |
| 标准化流 | Normalizing Flows | 通过一系列可逆变换将简单分布变成复杂分布的生成模型——就像把一团橡皮泥捏成复杂形状 |
| 自编码器 | Autoencoder | 将输入压缩到低维表示再重建的网络,学习数据的”精华摘要” |
| 变分自编码器 | Variational Autoencoder (VAE) | 在自编码器中引入概率建模的生成模型,能生成新数据而不仅仅是重建 |
| 扩散模型 | Diffusion Model | 通过逐步去噪来生成数据的模型——先把图片完全变成噪声,再学习怎么一步步恢复回来 |
| 前向过程 | Forward Process | 扩散模型中逐步给数据加噪声的过程,直到变成纯噪声 |
| 反向过程 | Reverse Process | 扩散模型中逐步去噪恢复数据的过程,这就是生成新数据的过程 |
| 噪声预测 | Noise Prediction | 扩散模型的核心思想——不直接预测图片,而是预测”加了什么噪声”,然后把噪声减掉 |
| 向量量化 | Vector Quantization | 将连续向量映射到离散码本中最近的码字,用于VQ-VAE等模型 |
| 得分函数 | Score Function | 指向概率密度增大方向的向量——告诉你往哪个方向走能找到更高概率的区域 |
| 模式崩溃 | Mode Collapse | GAN训练失败——生成器只产出少数几种输出,忽略了完整数据分布 |
| Wasserstein距离 | Wasserstein Distance | 衡量把一个分布”搬”成另一个分布的最小”工作量”,即使分布不重叠也有意义 |
| 循环一致性损失 | Cycle Consistency Loss | CycleGAN中确保A→B→A能还原原图的损失,实现无配对图像翻译 |
| 耦合流 | Coupling Flow | 可控的标准化流设计(如Real NVP),一部分输入基于另一部分做变换 |
| 掩码自回归流 | Masked Autoregressive Flow (MAF) | 似然计算快但采样慢的自回归流 |
| 逆自回归流 | Inverse Autoregressive Flow (IAF) | 采样快但似然计算慢的自回归流,MAF的计算特性反转 |
| 重参数化技巧 | Reparameterization Trick | 将随机性从参数中分离(),使VAE中梯度能通过采样反向传播 |
| 去噪自编码器 | Denoising Autoencoder | 从损坏的输入恢复干净输入来学习鲁棒表示,扩散模型的概念前身 |
| 掩码自编码器 | Masked Autoencoder (MAE) | 用大面积掩码+Transformer的图像去噪自编码器 |
| 引导扩散 | Guided Diffusion | 在扩散生成中加入引导信号,控制生成朝期望方向(如特定类别或文本描述)进行 |
| 无分类器引导 | Classifier-Free Guidance | 同时训练条件和无条件生成,推理时控制混合比例,Stable Diffusion的主流方法 |
| 潜扩散模型 | Latent Diffusion Model | 在压缩的潜空间而非像素空间运行扩散过程,大幅降低高分辨率图像的计算量 |
| 对比散度 | Contrastive Divergence | 能量模型的训练算法,用短链采样近似似然梯度,避免计算配分函数 |
| 朗之万动力学 | Langevin Dynamics | 结合得分函数梯度上升和随机噪声扰动的采样方法 |
| 去噪得分匹配 | Denoising Score Matching | 通过学习去噪来训练得分函数估计器,等价于扩散模型的训练目标 |
| 扩散核 | Diffusion Kernel | 条件分布 $q(z_t |
| 随机微分方程 | Stochastic Differential Equation (SDE) | 离散扩散过程的连续时间极限,统一了扩散模型、得分匹配和朗之万动力学 |
| 神经常微分方程 | Neural ODE | 将神经网络视为连续动力系统而非离散层,通过ODE求解器定义网络 |
感谢您的阅读!如果可以,给俺点些关注吧~