跳到主内容
快讯直播
AI智模界
AI 词典

提示词压缩:几千字压到几百字,压掉的是什么

提示词压缩(Prompt Compression)指的是:在不明显损害模型输出质量的前提下,把送进模型的提示文本变短。

压掉的是哪些字

被压掉的通常是四类:

1. 语言冗余。礼貌语、连接词、重复强调——"麻烦你""非常重要""换句话说""正如前面提到的"。这些词对人有用,对模型基本是噪声。

2. 无关上下文。检索增强(RAG,Retrieval-Augmented Generation)召回的文档里,跟问题无关的段落、页眉页脚、导航文字、反复出现的条款编号。

3. 可预测的内容。一段话里,前半句已经把后半句说死了的部分。压缩工具常用一个小模型给每个词元(token)打"意外程度"分,分数低的先删。

4. 结构重复。少样本示例(few-shot)里反复出现的模板句、每条都一样的指令前缀。

不该压掉的:否定词、数字、专有名词、硬约束("只能用中文""不要编造")。删掉一个"不"字,意思就反了,这是压缩最容易出事的地方。

打个比方

像搬家打包。聪明人不会扔东西,而是扔掉纸箱、气泡膜、说明书里重复的那几页,把被子抽真空。体积小了,到新家拆开还是那些家当。压缩追求的是提高信息密度,不是把行李减到最少。

和相邻概念的区别

概念砍的依据结果长什么样
提示词压缩每个片段的信息量可能不太通顺
摘要人的阅读需求通顺、像人话
上下文截断位置(老的先扔)保留原文
检索(RAG)相关性,在进来之前就筛保留原文

关键差别:摘要追求"人看得懂",压缩追求"模型答得对"。所以压缩后的文本可能人读起来莫名其妙——只剩一串名词和数字——但模型照样答得对。

实际意义

词元就是钱和延迟。AI 词典:上下文窗口">上下文窗口再大,塞得太满也会让模型注意力被稀释,关键信息反而被淹没。压缩能同时省钱、提速、提准,所以在长文档问答、多轮对话、批量处理里很常见。

但压缩是有损的。压缩率越高,丢关键信息的风险越大,而且往往丢得悄无声息——不报错,只是答错。稳妥做法是:保留原文以便回溯,在真实任务上做 A/B 对比,而不是只看压缩率这一个指标。合同、病历、财务这类高风险场景,宁可少压。

对普通职场人来说,把提示里的"请""麻烦""非常感谢"删掉,把约束和事实留下,就已经是手动版压缩了。省下的不只是钱,还有模型的注意力。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。