
不确定性量化(uncertainty quantification)是什么?
统计学家乔治·博克斯曾说过:“所有模型都是错的,但有些是有用的。”无论是定性模型、人工智能模型、动态数学模型还是统计模型,都无法完全捕捉现实的复杂性。
模型会受到多种不确定性的影响。不确定性的来源包括系统中的随机过程或随机特性(称为偶然不确定性,aleatoric uncertainty)、知识的不完备性(称为认知不确定性,epistemic uncertainty)以及计算能力的限制。
不确定性量化(Uncertainty Quantification, UQ) 不仅帮助我们估计模型随时间的准确性,还能展示可能结果的范围,并指导如何减少测量和模型中的不确定性。
不确定性和准确性是两个密切相关但不同的概念。预测准确性指的是预测值与已知值的接近程度,而不确定性则描述预测值和目标值的可能变化范围。例如,一个仅对苹果图像进行红绿分类的计算机视觉系统,其固有的不确定性远低于一个对全球所有水果种类进行分类的系统。不确定性量化 是衡量这两个问题不确定性差异的精确方法。
当模型包含不确定性时,其输出会以不同概率发生变化。我们将这些输出视为随机变量,并使用概率分布来衡量不确定性。分布越宽,结果的不确定性越高。对于高斯分布,方差是一个有效的衡量指标,但许多现实世界的系统会产生非标准分布,需要不同的测量方法。
不确定性量化方法 帮助我们判断对某一预测的置信度。这种预测可以是统计技术(如分布检验)或机器学习算法的预测或推理。UQ 还能帮助我们了解模型可能结果的范围。例如,如果天气模型预测有 70% 的降雨概率,UQ 可以判断这个概率是基于可靠的训练数据,还是存在较大不确定性,实际概率可能在 50% 到 90% 之间。
UQ 方法的重要性在于,它揭示了误差和未知因素如何影响最终结果。这可以防止模型过于自信,并指导如何提高机器学习模型的准确性。通过计算 UQ,我们可以识别哪些不确定性最为关键,优化模型训练,并帮助决策者理解预测的可靠性。UQ 将“模型可能会出错”这样的模糊表述转化为具体的、可量化的信息,明确模型可能出错的程度和方式。这在医学、无故障工程等高可靠性领域尤为宝贵。
不确定性量化的方法
不确定性主要分为两类:数据驱动的不确定性 和 模型驱动的不确定性。在两种情况下,了解预测的可靠性(无论是预测前还是预测后)都很有帮助。例如,一个模型可能预测门铰链在失效前能开合 约 ±1000 次,同时还能显示当前关闭铰链导致其损坏的可能性。
以下是几种常见的 UQ 方法:
基于采样的方法
基于采样的方法是最常用的不确定性量化技术之一,因为它们能处理任意复杂的模型,并提供直观且全面的不确定性描述。通过生成大量可能场景,采样方法可以构建统计图像,展示可能的结果及其不确定性。这些方法通过对多个采样输出的统计分析来表征不确定性分布,而不是通过解析计算。
- 蒙特卡洛模拟(Monte Carlo Simulation):最常见的方法之一,通过对模型进行数千次随机输入模拟,观察输出范围。这种方法在参数模型中尤为常见,通过比较不同模型的置信区间和输出,展示所有可能值的范围。
- 拉丁超立方采样(Latin Hypercube Sampling):蒙特卡洛的优化版本,所需运行次数更少,但仍能有效覆盖输入空间。
- 蒙特卡洛丢弃(Monte Carlo Dropout):在预测时保持 dropout 层活跃,进行多次前向传播,得到输出分布。Dropout 主要用于正则化,防止过拟合或欠拟合。蒙特卡洛丢弃在测试时应用 dropout,使用不同丢弃掩码运行多次前向传播,使模型生成预测分布,而非单一估计点。这种方法计算效率高,无需多次训练神经网络。
- 高斯过程回归(Gaussian Process Regression, GPR):当运行实际模型成本过高时,统计学家会使用 GPR 等技术创建简化的“代理”模型。GPR 是一种贝叶斯方法,通过高斯过程(一组具有联合高斯分布的随机变量)建模预测的确定性。GPR 将函数分布作为先验,并根据观测数据生成后验分布。其输出天然表达模型对估计的确定或不确定程度,适合优化、时间序列预测等场景。Scikit-learn 等库提供了 GPR 的不确定性分析实现。
采样方法的选择取决于模型和场景中最关注的特征。现实应用通常结合多种方法。
贝叶斯方法
贝叶斯统计通过贝叶斯定理结合先验信念和观测数据,更新假设的概率。贝叶斯方法通过分配概率分布(而非单一固定值)明确处理不确定性。相比单一“最佳”估计,贝叶斯方法提供可能估计的概率分布。
- 贝叶斯推理:随着新数据的到来更新预测,自然融入不确定性。马尔可夫链蒙特卡洛(MCMC) 方法在数学解复杂时用于实现贝叶斯方法,通过从高维复杂分布(尤其是贝叶斯推理中的后验分布)中采样。
- 贝叶斯神经网络(Bayesian Neural Networks,BNNs):与传统神经网络不同,BNNs 将网络权重视为概率分布,而非固定点估计。这种概率方法实现严格的不确定性量化。BNNs 维护所有参数的概率分布,预测均值和方差、预测分布的样本,以及从分布中导出的可信区间。PyMC 和 Tensorflow-Probability 等开源库支持 BNNs 的实现。
集成方法
集成方法的核心思想是,如果多个独立训练的模型在预测上存在分歧,这种分歧表明预测的不确定性。反之,如果所有模型一致,说明预测置信度较高。通过集成预测的方差或分布范围,可以量化不确定性。
假设 f₁, f₂, …, fₙ 表示 N 个集成成员对输入 x 的估计,不确定性可量化为: Var[f(x)]=1N∑i=1N(fi(x)−fˉ(x))2\text{Var}[f(x)] = \frac{1}{N} \sum_{i=1}^N (f_i(x) – \bar{f}(x))^2Var[f(x)]=N1i=1∑N(fi(x)−fˉ(x))2
其中 fˉ(x)\bar{f}(x)fˉ(x) 是集成均值。通过训练多个不同架构、训练数据子集或初始化的模型,并组合其预测。缺点是计算成本高,需多次训练和运行模型。
保形预测
保形预测(Conformal Prediction) 是一种无分布、模型无关的不确定性量化技术,为回归任务提供预测区间,为分类任务提供预测集。它以最小的模型和数据假设提供有效覆盖保证,特别适合处理预训练的黑盒模型。
保形预测只需数据点可交换(exchangeable),无需独立同分布。它适用于任何预测模型,并允许设置模型的可接受预测不确定性。例如,在回归任务中,若需 95% 覆盖率,模型应输出一个包含真实值的区间,95% 的时间内真实值落在此区间内。
使用保形预测时,数据分为训练集、基线测试集和校准集。校准集用于计算 非符合度分数(nonconformity scores, si),衡量预测的异常程度。对于新输入,根据这些分数构建预测区间以保证覆盖率。
在分类任务中,非符合度分数衡量新实例与训练集实例的偏差程度,通常为: si=1−f(xi)[yi]s_i = 1 – f(x_i)[y_i]si=1−f(xi)[yi]
如果新实例属于某类的预测概率高,非符合度分数低,反之亦然。通过对校准集的 si 分数排序,计算 95% 覆盖率的阈值 q。对于新测试样本,若其 si 小于 q,则将其标签纳入预测集。
保形预测与分类器的准确性略有不同,因为它可能识别多个类。在多类分类中,保形预测还能显示所有类的覆盖率,并为单个类分配覆盖率。
不确定性量化的应用
不确定性量化 在机器学习、人工智能开发和计算机科学领域至关重要。以下是一些常见应用:
时间序列预测中的不确定性
在金融、经济、天气预测和供应链管理中,管理和量化时间序列预测的不确定性对决策至关重要。概率模型(如 ARIMA 或贝叶斯神经网络)因其输出分布(而非单一值)而受到青睐。ARIMA 模型通过捕捉自回归(AR)和移动平均(MA)分量,并通过差分确保平稳性,生成点预测后评估残差(观测值与预测值的差异),使用正态分布残差的标准差构建预测区间。区间越宽,预测的不确定性越大。
深度学习与不确定性
深度学习模型因高维度和非线性关系,量化不确定性具有挑战性。以下是常用技术:
- 深度集成(Deep Ensembles):训练多个独立初始化的网络,预测方差表示不确定性,计算成本较高。
- 蒙特卡洛丢弃:在推理时保持 dropout 层活跃,多次前向传播近似贝叶斯推理,生成预测分布。
- 批量归一化不确定性:在推理时从学习的批量统计中随机采样,生成预测分布。
主动学习
主动学习 是一种可扩展的机器学习范式,算法可选择性地从数据点中学习,而非固定数据集。通过选择“最有信息量”的未标记样本,主动学习在更少标记数据下实现更高性能。不确定性量化 可帮助识别最不确定的样本,这些样本通常能提供最大信息增益。
不确定性量化的度量
不确定性量化的度量通常用于比较同一架构的不同模型,而非不同架构或绝对值。度量分为两大类:适当评分规则 和 校准度量。
适当评分规则
适当评分规则适合具有天然不确定性估计的概率模型,衡量预测概率分布与真实分布的偏差。常见方法包括:
- 负对数似然(Negative Log Likelihood, NLL):直接衡量模型预测概率分布与观测结果的契合度,兼顾准确性和置信度。
- 布里尔分数(Brier Score):用于分类任务,范围严格限定在 0-1,评估预测概率与观测频率的匹配度及置信度。
- 连续秩概率分数(Continuous Ranked Probability Score, CRPS):广泛用于气象、水文等领域,衡量预测累积分布函数与真实结果的差异。
校准度量
校准度量适合预训练模型或使用 softmax 输出的分类任务,衡量“真实置信度”与“预测置信度”的差异。校准意味着模型预测的置信度 p 应有约 p 比例的正确率。常见度量包括:
- 期望校准误差(Expected Calibration Error, ECE):将预测按置信度分箱,计算每箱置信度与准确度的平均差异,范围 0(完美校准)到 1(最差校准)。
- 最大校准误差(Maximum Calibration Error, MCE):测量所有分箱中置信度与准确度的最大差异,揭示最差校准区域。
- 自适应校准误差(Adaptive Calibration Error, ACE):使用自适应分箱策略,确保每箱样本数大致相等,适合数据量有限场景。
总结
不确定性量化 是机器学习中不可或缺的工具,帮助开发者、研究者和决策者理解模型预测的可靠性和可能结果范围。通过采样方法、贝叶斯方法、集成方法和保形预测等技术,UQ 将模型的“可能出错”转化为具体、可量化的信息,广泛应用于时间序列预测、深度学习、主动学习等领域。适当评分规则和校准度量进一步确保模型的置信度与现实一致,为高可靠性场景提供坚实支持。


