高斯过程(Gaussian Process, GP)是一种把"函数"本身当随机变量看待的概率模型:它不给你一条确定的曲线,而是给你无穷多条可能的曲线,并告诉你每条曲线出现的可能性有多大。
打个比方。你要预测一家新门店的营业额,输入是面积、人流等特征。普通回归会画出一条线,然后说"就它了"。高斯过程的做法是,先规定任意几个输入点上的输出服从一个多维正态分布。这个分布由两部分定:均值函数(通常设为零)和协方差函数,也就是核函数(kernel function)。核函数描述两点之间的相关性——距离越近,输出越像;距离越远,输出就越可能分道扬镳。常用的径向基函数(Radial Basis Function, RBF)核,也叫平方指数核,就是"越近越像"的最直接表达。
训练时,高斯过程其实很"懒":它不学一组固定参数,而是把 n 个训练点的协方差矩阵存下来。预测新点时,用贝叶斯公式求条件分布,得到均值加方差。均值是预测值,方差是不确定度。离训练数据近,方差小,它很自信;离得远,方差大,它在提醒你"这里我没见过"。
这正是它在小数据场景下受欢迎的原因:20 个实验样本的配方优化、材料筛选、超参数调优(贝叶斯优化 Bayesian Optimization 常用它当代理模型),它给出的不只是"试哪里",还有"哪里最值得试"。
和相邻方法的区别可以这样看:
| 方法 | 输出 | 天然不确定度 | 小数据表现 | 主要代价 |
|---|---|---|---|---|
| 高斯过程 | 均值+方差 | 有,解析可得 | 好 | 训练 O(n³) |
| 线性回归 | 点估计 | 需额外假设 | 一般 | 模型太简单 |
| 神经网络 | 点估计 | 通常没有 | 需要较多数据 | 调参、算力 |
| 随机森林 | 点估计,可看树间分散 | 近似 | 较好 | 外推能力弱 |
高斯过程最硬的约束是计算复杂度 O(n³):n 是训练样本数。样本从一千涨到一万,计算量约涨一千倍,内存也吃紧。所以实践中常用稀疏近似、诱导点、随机傅里叶特征等办法降复杂度,或者改用神经网络做代理模型、再外挂不确定度估计。
对从业者的意义:数据量不大、每次实验很贵、又必须知道"哪儿最不确定"时,高斯过程往往是首选工具。对普通职场人,记住一句话就够:它不只给一个答案,还附赠一句"我有多确定"。具体实现与超参数选择,以你所用的库的官方页面为准。
