能力激发(Capability Elicitation)指的是:通过挑选合适的提示词、示例、推理步骤、解码参数和外部工具,把模型"其实已经会、但默认状态下用不出来"的能力真正榨出来。它关心的不是给模型加本事,而是别让评测和产品把本事看漏了。
打个面试的比方。一位候选人确实会写 SQL,但你只问了一句"你懂数据库吗",他答"懂一点",于是你在评估表上写"数据库能力弱"。问题不在他,在问法。模型也一样:它的能力存在权重里,但每次生成只是"预测下一个词"。如果提示过于简短、含糊、缺乏铺垫,模型就容易被推向那条最省事、最模板化的回答路径——那条路上当然显得笨。
再换个角度:同一场考试,闭卷还是开卷、有没有例题、时间够不够,分数能差出一大截。分数反映的往往不只是知识量,还有考试设计。这也是为什么"某个模型在某个榜单上分数低"这件事,本身说明不了太多——可能只是没人给它足够好的发挥条件。
常见的激发手段包括:给几个范例(few-shot)、要求分步推理(AI 词典:Chain-of-Thought">Chain-of-Thought,思维链)、明确输出格式与思考步骤、允许多次采样后取最优、接上代码执行或检索工具、让它先复述题意再作答。这些做法都不改动模型参数,只是改变"怎么问"。
容易混淆的几个邻近概念,可以这样区分:
| 概念 | 是否改模型权重 | 关注点 |
|---|---|---|
| 能力激发 | 否 | 把已有能力问出来 |
| 提示工程 | 否 | 是激发的一种主要手段 |
| 能力训练/微调 | 是 | 把新能力写进去 |
| 模型评测 | 否 | 目的,需靠激发保证公平 |
换句话说,提示工程是手段,能力激发是目标,评测是它最重要的应用场景之一。
对从业者的实际意义有三层。做评测时,看到低分先别下"模型不行"的结论,要问一句:这是能力缺失,还是激发不足?比较两个模型时,如果给 A 精心设计的提示、给 B 随手一句,比的其实是"谁更扛得住烂提示"。做产品时更是如此——同一个底座模型,配上不同的提示、脚手架和工具,体验可以差出档次,这些工作本身就是产品价值,不是可有可无的糖衣。做安全评估时方向反过来同样成立:要用足够强的激发方式去试探风险能力,否则容易低估。
对普通职场人,结论很朴素:答得不好,先换个问法。给个例子、说清格式、让它先分步想、允许它反问你需要什么信息,往往比换一个模型更管用。至于具体模型对提示的敏感程度,各家差异不小,以官方文档和实际测试为准。
