一个名为 HarnessTax 的项目页面(harnesstax.github.io)上线,标题直译为“脚手架税:Harness 对编码智能体到底有多重要?”。页面未附带摘要,具体方法与结论需查阅原文,但从命名即可看出它试图量化的问题:在编码任务中,模型之外的那层框架,究竟贡献了多少、又拖累了多少。
这里的 harness 指模型之外的整套工程外壳,通常包括智能体循环、工具与函数定义、系统提示与指令组织、上下文与历史管理、代码读写与补丁应用方式、命令执行与测试反馈回传、失败重试与终止策略等。同一个模型放进不同的 harness,实际表现往往差别明显,而这部分差别过去很少被单独计量。
“harness tax”这一说法,指向的正是被计入模型成绩单、却未必由模型权重承担的那部分成本。它至少有两层意义:
- 对评测:若不同系统使用不同脚手架,横向比较模型能力就缺乏可比性,基准结论需要明确说明 harness 条件。
- 对工程:如果性能差距有相当部分来自包裹层而非模型本身,那么优先打磨工具接口、上下文压缩与失败反馈回路,可能比更换模型更直接、成本更低。
对 AI 从业者而言,这个问题的价值在于把一个长期被模糊处理的变量单独拎出来讨论。harness 目前既缺少统一规范,也很少被公开描述,而它恰恰是编码智能体产品差异化的主要来源之一。读者可前往该页面查看其具体定义、实验设置与结论。
