跳到主内容
快讯直播
AI智模界
AI 词典

Cherry-picking:Demo 惊艳,上线拉胯

一句话定义:Cherry-picking(选择性展示,字面意思是"挑樱桃",源自果园里专挑最红最甜的那几颗)指的是——从一大堆结果里只挑出对自己最有利的那几份展示或汇报,其余的按下不表。

打个生活化的比方。一筐樱桃,有的红透,有的发青。挑出最红的十颗摆盘拍照,照片里的确实是你家的樱桃,没造假,但看过照片的人会以为整筐都长这样。选择性展示不是撒谎,它是"用真实的信息,制造不真实的印象"。

它在 AI 里的四个常见层级

1. Demo 层:同一个 prompt 跑十次,剪出最惊艳那一次录屏。直播间演示从不翻车,因为翻车的素材被剪掉了。

2. 评估层:在多个数据集、多个指标里挑自己最高的那个汇报;或者反复调参直到测试集上好看。这跟 p-hacking(多重比较后择优)是同一种病。

3. 产品层:用户反馈截图只挑好评,A/B 实验只展示显著的那个切面。

4. 训练层:推理时采样多次、挑最好的那个(best-of-n)本身是合法技术,但如果人工专挑"惊艳样本"写进训练数据,模型学的就是"惊艳的长相"而不是"平均的正确"。

为什么它格外危险

模型的输出是概率分布,不是标准答案。同一个 prompt 跑十次,十次可能都不一样。Demo 展示的是这个分布的右尾,上线面对的是整个分布,包括长尾里的失败。用户一天点一百次,抽到尾部只是时间问题。所以"演示惊艳、上线拉胯"通常不是模型换了,而是演示时只挑了最好的那几次。

和相邻概念的区别

概念核心动作性质
过拟合(Overfitting)模型把训练数据记太死技术问题,非刻意
生存者偏差(Survivorship Bias)只看到"活下来"的样本常常是无意的
数据泄漏(Data Leakage)评估时混进了答案多为失误
Cherry-picking主动从多个结果里挑好的展示主观选择,最接近误导

对从业者的实际意义

第一,报告结果时区分"最好一次"和"典型表现"。给出跑 n 次的成功率和波动范围,比给一个最高分有用得多。第二,Demo 用的 prompt 应该从真实流量分布里抽样,而不是自己精挑细选。第三,上线前做一件小事:把 demo 的 prompt 复制很多份,掺入错别字、长短变化、无关上下文,看成功率掉多少。掉得厉害,说明你之前看到的是樱桃不是果园。

对普通人和采购方

看到惊艳演示,先问三个问题:这个效果跑多少次能出一次?失败的输出长什么样?能不能用我自己的数据现场跑一遍?如果对方只肯放一段剪好的录屏,那你看到的是广告,不是产品。具体到各家工具的能力边界,以官方页面和亲自试用为准。

判断 cherry-picking 的标准其实很简单:分母是多少,扔掉的那些长什么样。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。