跳到主内容
快讯直播
AI智模界
AI 词典

Self-Instruct:让模型自己出题自己答题

一句话定义:Self-Instruct 是一种让大模型自己生成训练数据的方法——模型既当出题人又当答题人,批量产出「指令 + 回答」(instruction-response)样本,再用这些样本做微调(fine-tune),让它更听得懂人话。

它是怎么跑起来的

人先手写一小撮「种子」(seed),通常几十到几百条,比如"把这段话改成正式语气""给这段代码写注释"。然后进入循环:

1. 让模型看着已有样本,仿造出新的、不一样的指令;

2. 让模型给新指令写出答案;

3. 过滤:和已有样本太像的、太短的、格式坏掉的、满篇讲自己是个助手的元话语,统统扔掉;

4. 合格样本回灌进样本池,参与下一轮生成。

如此滚雪球,几百条种子能扩到几万乃至几十万条。打个比方:给新人看几份标准工单做示范,之后他自己写工单、自己填处理结果,主管只抽查明显不合格的丢掉,攒够一摞就成了培训教材。

和相邻概念的差别

概念与 Self-Instruct 的区别
人工标注指令和答案都由人写,质量稳但贵、慢、覆盖窄
知识蒸馏(distillation)学生模型模仿老师模型的输出,输入分布是现成的;Self-Instruct 的重点恰恰是"自己造输入"
RLHF靠人类对多个回答排序来对齐偏好,回答的是"哪个更好";Self-Instruct 造的是监督微调(SFT)数据
自洽性(self-consistency)推理时多采样几次投票选答案,不生产训练数据

为什么它重要

它把"数据从哪来"从纯人力问题,变成了能自动跑的工程流水线。此后大量合成数据(synthetic data)方案基本都沿用"种子—生成—过滤—回灌"这个骨架。对做垂类微调的人,先手写几百条高质量种子,再用强模型扩增,是性价比很高的起步姿势。

对普通职场人有两点含义。一是你用的助手"更会听人话",背后可能就有这类自产数据。二是它有个天然短板:模型不会的东西,自问自答也变不出来,答错了还会被当成教材固化。所以数据量和数据质量是两件事,生成样本必须过滤,关键场景还得有人复核。

具体流程细节各家实现不同,以官方论文或文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。