一句话定义:视觉微调">指令微调(Visual AI 词典:Instruction Tuning">Instruction Tuning)是在图文对齐预训练之后,用「图片 + 人类指令 + 理想回答」的数据继续训练多模态模型,让它学会按指令描述、问答和推理图片内容。
打个比方。预训练像带小孩翻画册:看多了,孩子能把「猫」这个词和猫的样子对上号,这叫「能看图」。但你把画册推过去问「这只猫为什么躲在沙发下?」他可能只会指着说「猫、猫」。指令微调则像大人开始示范对话:「你看它耳朵往后压、旁边有只狗,所以它害怕。」孩子慢慢学会:原来问题要这样答,要讲原因,要分点,不知道就说不知道。
这里的关键分工是:
| 维度 | 图文对齐预训练 | 视觉指令微调 |
|---|---|---|
| 目标 | 把图像和语言映射到同一语义空间 | 让模型按指令组织回答 |
| 数据 | 海量图文对,弱监督 | 图片、指令、高质量答案三元组 |
| 典型行为 | 判断图文是否匹配、续写 | 描述、问答、多轮对话、推理 |
| 好比 | 认识词汇 | 学会对话 |
预训练解决「看不看得懂」,指令微调解决「听不听话、好不好用」。一个模型如果能把图片编码得很好,却答非所问、格式混乱、该拒答时硬编,问题通常不在图像编码器,而在指令数据与微调策略。
指令数据从哪来?常见做法是:人工写少量高质量种子,再用更强的模型基于图片自动生成问答对,最后清洗和人工抽检。数据质量往往比数量更关键。要覆盖多轮追问、否定句、计数、空间关系、文字识别、图表理解,还要教它说「图中看不到」。只喂「这张图里有什么」这类单一问法,模型就会变成复读机。
对从业者的实际意义有三点。第一,评估要分开看:视觉感知错误和指令遵循错误是两类问题,混在一起会误判方向。第二,产品体验的瓶颈常在数据侧,不在算力侧;构造覆盖真实场景的指令集,比盲目堆参数更划算。第三,微调后的模型仍可能继承预训练阶段的偏见和幻觉,上线前要有抽检和兜底话术。
对普通人来说,手机里的识图问答、截图提问、无障碍图片描述,背后大多经过这一步。你感觉它「会聊天」,不是因为它真的理解了世界,而是因为有人教过它:面对这类图片和这类问题,人类通常希望听到什么样的回答。具体实现与最新进展,以官方页面为准。
