跳到主内容
快讯直播
AI智模界
AI 词典

Span 掩码与去噪目标:挖掉一整段,逼模型读懂全局

一句话定义

Span 掩码(span masking)是一种自监督预训练目标:把输入文本里连续的一整段内容遮住,让模型根据剩下的上下文把它还原;去噪目标(denoising objective)是更大的一类,泛指“先把输入弄坏,再让模型修复”的训练方式,Span 掩码是其中最常用的一种。

原理:从“填一个词”到“补一整句”

经典的掩码语言模型(AI 词典:Masked Language Modeling">Masked Language Modeling, MLM)像完形填空,但只挖一个词:“今天天气真___,我们去公园吧。”模型看一眼邻居就能猜出“好”。这种题靠的是局部搭配统计,不太需要读懂整段话。

Span 掩码把题目改难:“今天天气真好,___,所以我们临时改了计划。”被挖掉的可能是整整一句“结果下午下起了暴雨”。这时左边的“天气好”和右边的“改了计划”之间有因果缺口,模型必须调用通篇语义、常识和篇章逻辑去补。

更关键的是训练信号的密度。挖一个词,答对一个词就得分;挖一整段,模型要在没有局部线索的情况下生成一串连贯文本,误差信号会逼着模型把“这段话讲了什么”压缩进上下文表示里。可以理解为:只挖一个词,模型学的是词语搭配;挖一整段,模型被迫学“这段话在说什么”。

和相邻概念的区别

训练目标怎么做模型主要学到什么
单 token 掩码(MLM)随机遮住个别词词级搭配、局部语法
Span 掩码 / span 去噪遮住连续片段,还原整段句法、篇章连贯、全局语义
其他去噪目标打乱句子顺序、删句、替换片段后再还原句子间关系、长程结构

重点不在于谁更先进,而在于破坏方式决定了模型要补哪一层的知识。破坏越结构化,模型越需要理解全局;但难度过高也会让训练变慢、收益递减。

对从业者与普通人的意义

从业者:预训练目标和噪声设计是决定表示质量的关键变量之一。做摘要、问答、检索这类依赖长距离信息的任务时,span 级别的去噪通常比单 token 掩码更能学到篇章信息。至于掩多长、掩多少比例,属于需要实验调的超参,具体默认值以各模型的官方论文和代码为准。

普通人:这解释了为什么大模型“接得上话”。它不是逐词猜下一个字,而是在训练中被反复要求补全缺失的整段内容,于是学会了用上下文推断意图。你给它一段省略了中间环节的对话,它也能大致还原逻辑,背后就是这类去噪训练在起作用。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。