一句话定义:Cherry-picking(选择性展示,字面意思是"挑樱桃",源自果园里专挑最红最甜的那几颗)指的是——从一大堆结果里只挑出对自己最有利的那几份展示或汇报,其余的按下不表。
打个生活化的比方。一筐樱桃,有的红透,有的发青。挑出最红的十颗摆盘拍照,照片里的确实是你家的樱桃,没造假,但看过照片的人会以为整筐都长这样。选择性展示不是撒谎,它是"用真实的信息,制造不真实的印象"。
它在 AI 里的四个常见层级
1. Demo 层:同一个 prompt 跑十次,剪出最惊艳那一次录屏。直播间演示从不翻车,因为翻车的素材被剪掉了。
2. 评估层:在多个数据集、多个指标里挑自己最高的那个汇报;或者反复调参直到测试集上好看。这跟 p-hacking(多重比较后择优)是同一种病。
3. 产品层:用户反馈截图只挑好评,A/B 实验只展示显著的那个切面。
4. 训练层:推理时采样多次、挑最好的那个(best-of-n)本身是合法技术,但如果人工专挑"惊艳样本"写进训练数据,模型学的就是"惊艳的长相"而不是"平均的正确"。
为什么它格外危险
模型的输出是概率分布,不是标准答案。同一个 prompt 跑十次,十次可能都不一样。Demo 展示的是这个分布的右尾,上线面对的是整个分布,包括长尾里的失败。用户一天点一百次,抽到尾部只是时间问题。所以"演示惊艳、上线拉胯"通常不是模型换了,而是演示时只挑了最好的那几次。
和相邻概念的区别
| 概念 | 核心动作 | 性质 |
|---|---|---|
| 过拟合(Overfitting) | 模型把训练数据记太死 | 技术问题,非刻意 |
| 生存者偏差(Survivorship Bias) | 只看到"活下来"的样本 | 常常是无意的 |
| 数据泄漏(Data Leakage) | 评估时混进了答案 | 多为失误 |
| Cherry-picking | 主动从多个结果里挑好的展示 | 主观选择,最接近误导 |
对从业者的实际意义
第一,报告结果时区分"最好一次"和"典型表现"。给出跑 n 次的成功率和波动范围,比给一个最高分有用得多。第二,Demo 用的 prompt 应该从真实流量分布里抽样,而不是自己精挑细选。第三,上线前做一件小事:把 demo 的 prompt 复制很多份,掺入错别字、长短变化、无关上下文,看成功率掉多少。掉得厉害,说明你之前看到的是樱桃不是果园。
对普通人和采购方
看到惊艳演示,先问三个问题:这个效果跑多少次能出一次?失败的输出长什么样?能不能用我自己的数据现场跑一遍?如果对方只肯放一段剪好的录屏,那你看到的是广告,不是产品。具体到各家工具的能力边界,以官方页面和亲自试用为准。
判断 cherry-picking 的标准其实很简单:分母是多少,扔掉的那些长什么样。
