返回首页

降维(Dimensionality Reduction)入门:PCA 与 t-SNE 是怎么把高维数据"压扁"的

2026年10月7日 08:02来源: 润百AI0 条留言技术教程

为什么要降维

现实数据动辄几十、几百甚至上千个特征:一张小图就有数千个像素,一段文本向量可能有几百维。维度一高,麻烦就跟着来——计算和存储成本上升,可视化无从下手,而且高维空间里样本会变得极其稀疏,距离度量逐渐"失灵",这就是所谓的"维度灾难"。降维(Dimensionality Reduction)就是想办法用更少的维度,尽量保留原来数据里真正有用的信息。

降维的两条思路

一是特征选择:从原有特征里挑出最有用的若干列,含义不变,比如只保留方差最大、或与目标最相关的特征。二是特征提取(投影):把原特征重新组合成新的、更少的维度,新维度通常是原特征的函数,往往不再有直观含义。PCA 和 t-SNE 都属于后者。

PCA:找"信息量最大"的方向

主成分分析(Principal Component Analysis,PCA)的思路是:把数据投影到一个低维子空间,让投影后的方差尽可能大——方差越大,说明保留下来的信息越多。它对数据中心化后,通过协方差矩阵的特征向量(或奇异值分解 SVD)得到一组互相正交的主成分:第一主成分方差最大,第二主成分次之,依此类推,取前 k 个就完成了降维。

PCA 的优点是数学基础明确、可逆(能近似还原)、计算快;缺点是它是线性方法,只能捕捉线性结构,且对特征尺度敏感,通常要先标准化。它也常被用来去噪和压缩。

t-SNE 与 UMAP:为了"看得见"

t-SNE(t-分布随机邻域嵌入)是一种非线性降维方法,主打可视化。它把高维中"相近"的点在低维(通常降到二维)里也拉近,把"不相近"的点推开,擅长把复杂的高维簇在平面上铺开,是神经网络特征可视化常用工具。但它计算较慢,而且低维图中簇与簇之间的距离没有可靠意义,不能据此判断"簇 A 真的比簇 B 更远"。UMAP 是后来出现的方法,速度更快,对全局结构的保持通常更好,近年被广泛使用。

怎么选

目的是压缩、去噪、加速下游模型:优先 PCA(线性、可控、可逆)。目的是把高维数据画成图给人看:用 t-SNE 或 UMAP。数据规模很大、又要兼顾局部与全局结构:常直接用 UMAP,或先用 PCA 降到几十维再跑 t-SNE(这是常见的两步做法)。

常见误区

1. 把 t-SNE 图当作"真相"——它主要反映局部邻近关系,簇的大小和间距都不稳定,换个随机种子图就可能变样。

2. 忘记标准化——PCA 对量纲极其敏感,不标准化会让数值大的特征主导结果。

3. 以为降维一定提升精度——它更多是用来压缩、去噪和可视化;维度并非越低越好,砍掉有用信息反而会让效果变差。

一句话总结

降维是给高维数据"瘦身"和"翻译":PCA 用线性投影保留最大方差,t-SNE 与 UMAP 为非线性的可视化服务。理解它们的适用边界,往往比记住公式更重要。

【参考来源】综合整理自公开发表的教材与行业资料,包括 scikit-learn 关于 PCA、t-SNE 的官方文档,以及 PCA、t-SNE、UMAP 等方法的公开论文与综述。

机器学习

AI 圆桌讨论

Introduction to Dimensionality Reduction: How PCA and t-SNE Flatten High Dimensional Data

主题

  • 讨论考察 PCA 和 t-SNE 如何将高维数据展平为可查看的图谱,并比较线性投影与非线性嵌入。
  • 核心问题:每种方法保留了什么、扭曲了什么,何时更偏好其中一种,以及如何验证可能被复用为证据的图谱。
  • 关键要点
  • PCA 是一种保留全局方差的线性方法;早期成分捕捉主要变异轴。它有可能丢弃低方差的稀有信号,并放大批次效应、缩放选择或离群值。
  • t-SNE 是非线性的,保留局部邻域,常能揭示 PCA 遗漏的簇,例如在单细胞 RNA 测序中。它对困惑度、初始化和距离度量敏感;簇间距离不可靠,新数据点无法直接投影。
  • 观察者执行最终降维:人类视觉擅长识别簇和梯度,但不擅长精确判断距离和密度。图谱需要投影说明和失真预算,就像地图比例尺。
  • 提议的信任手段包括:PCA 的解释方差和重构误差;t-SNE 的邻域稳定性、参数扫描和置信半径;以及用于验证的阴性对照、盲法评分和留出模态。
  • 批评者警告:解释方差不是普适的失真预算,稳定性不等于真相,置信半径可能暗示虚假的精确性。如果验证标签源自早先的可视化,就可能循环。
  • 独立证据很难获得,因为诸如 Perturb-seq、CITE-seq、空间和药物筛选等检测通常共享样本、流程或特征选择。真正的检验需要预先指定的簇、匹配零模型、批次偏移对照和破坏机制的干预。
  • 更强的标准是融贯:使用具有不同失效模式的对抗性方法。一个在 PCA、t-SNE 和基于图的方法中都存活下来的结构,不太可能是单一流程的伪影。
  • 援引 Hacking 的操纵标准:当一个簇能够被分选、扰动并证明其行为符合预测,而不仅仅是被描绘出来时,它就变得真实。

主要分歧

  • 热情者:降维是翻译,不是压缩。PCA 强调广泛变异;t-SNE 强调感知相似性。嵌入应产生可证伪的预测,失真预算应附属于从图中得出的决策。
  • 怀疑者:方差不是重要性,t-SNE 距离意义不大。稳定性可能反映稳定的伪影,外部验证往往重新编码了共享假设。阴性证据和机制检验比视觉信任图例更重要。
  • 观察者:失真不仅在图中,也在下游,当图像成为聚类或门控的输入时。验证的独立性是一个终结于约定的无穷回归;跨方法去相关误差和操纵簇是更好的出路。
  • 实践分歧:比例尺应成为实时信任图例,还是阴性证据账本?失真应附属于图,还是附属于从图中作出的每个决策?

结论

  • PCA 和 t-SNE 是互补的适配器,不是真理机器。PCA 偏向全局线性方差;t-SNE 偏向局部相似性。当被当作领土时,两者都可能误导。
  • 一个可辩护的工作流程会报告投影方法、参数、预处理、敏感性和阴性对照;将图谱与前瞻性正交检验配对;并将不确定性附属于下游决策,而不仅仅是图像。
  • 最强的保证来自跨具有不同偏差的方法的融贯,加上干预性或功能性验证。没有嵌入是最终的;它通过产生并经受可证伪预测来赢得信任。
留言讨论

留言 (0)

暂无留言,来写第一条吧

发表留言