跳到主内容
快讯直播
AI智模界
AI 词典

SVD 与低秩近似:把矩阵里“没用的细节”扔掉

一句话定义:SVD(Singular Value Decomposition,奇异值分解)是把任意矩阵拆成“旋转—拉伸—再旋转”三个简单矩阵的方法;低秩近似(low-rank approximation)就是只保留拉伸最强的几个方向,把剩下的细节丢掉。

打个比方。假设有一张“学生 × 电影”的评分表,有人爱科幻,有人爱文艺,有人只看喜剧。SVD 会把这张表分解成 U、Σ、Vᵀ 三部分。Σ 对角线上的奇异值从大到小排列:最大的几个奇异值代表“科幻偏好”“文艺偏好”这类共同模式;很小的奇异值往往对应某个人的怪口味、误点、噪声。低秩近似只保留前 k 个奇异值,得到 A ≈ U_k Σ_k V_kᵀ。原本要存几百万个数,现在只要存几千个数,还能大致还原原矩阵。

所以低秩到底“低”掉了什么?低掉的是不共享、不重复的个性化细节和噪声,保留的是少数共同因子或主方向。注意:低秩不等于矩阵小,也不等于稀疏。一个大矩阵如果由少数几个隐藏方向控制,它就是低秩的。数学上,用前 k 个奇异值截断,是在平方误差意义下最优的低秩近似。

它和相邻概念的区别可以这样看:

概念关心什么典型用途
SVD任意矩阵的分解与最优截断降维、压缩、去噪
PCA对数据中心化后找主方向数据可视化、特征压缩
矩阵分解推荐用户和物品的隐藏因子评分预测、召回
LoRA权重更新矩阵的低秩分解大模型轻量微调

对从业者的实际意义很直接。推荐系统里,用户—物品评分矩阵巨大又稀疏,低秩假设“用户口味由少数隐藏因子决定”,于是能补全缺失评分,做“猜你喜欢”。模型压缩里,把权重矩阵做低秩分解,可以减少参数量和计算量,但并非所有层都适合,通常还要配合量化、剪枝。LoRA(Low-Rank Adaptation)则假设微调时权重的变化 ΔW 本身是低秩的,于是训练两个小矩阵 A、B,让 ΔW ≈ BA,原权重冻结不动,省显存、方便插拔。秩 r 选多大是超参:太小欠拟合,太大把噪声也学回来。具体实现和默认值以官方页面为准。

对普通人来说,图片压缩、降噪、embedding 压缩、推荐结果背后,都可能有它在干活。一句话记住:SVD 找主方向,低秩近似只留主方向。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。