跳到主内容
快讯直播
AI智模界
AI 词典

数据质量过滤:预训练前的第一道筛子

一句话定义

数据质量过滤(Data Filtering)是指:在把海量网页文本喂给大模型做预训练之前,先用一套规则加模型,把明显没价值、有害、格式烂掉的样本挑出来扔掉的过程。它决定了"谁能进池子"。

打个比方

它像一卡车刚收上来的菜要进厨房前的挑拣:泥、烂叶、杂草、塑料袋先扔掉,剩下的才能下锅。量是少了,但留下来的每一份都更像"能吃的"。

具体在筛什么

  • 格式垃圾:网页导航栏、页脚、评论区模板、"点击查看更多"这类反复出现的样板文字
  • 无信息量:短到没有上下文的片段、乱码、纯符号、多种语言混杂的段落
  • 有害与隐私:暴力、色情、诈骗话术,以及手机号、邮箱、证件号这类个人信息
  • 质量打分低:用一个小分类模型或启发式规则给每篇打一个"像不像好文章"的分,低于阈值就丢
  • 整站排除:批量生成的 SEO 站群、机器翻译农场

它和去重、数据配比各自管哪一段

这三件事最容易被混为一谈,其实管的不是同一段:

环节管什么不管会怎样
数据质量过滤单条样本值不值得留模板垃圾、乱码、有害内容混进训练
去重(Deduplication)同一内容是否反复出现白烧算力,模型爱复读,输出变僵
数据配比(Data Mixing)留下的各来源按什么比例混模型偏科,某类能力特别弱

用流水线打比方:过滤是"挑菜",去重是"别把同一棵菜数两遍",配比是"这锅汤里肉、菜、盐各放多少"。实际工程里顺序会交叉,但逻辑上大致是先粗过滤、再去重、再精筛打分,最后按配比采样。

对从业者和普通人意味着什么

对做训练的人:过滤通常是预训练里性价比最高的一步,数据质量往往比单纯堆量更影响最终表现。但筛得太狠也会丢掉长尾知识、小众语言和方言,阈值和多样性之间要权衡。另外,过滤规则务必留版本记录,否则实验无法复现,也说不清"这次为什么变好了"。

对普通职场人:你感觉到的"某类模型中文更顺了""有的模型说话像在复读""问冷门问题就答不上来",背后常常就是过滤、去重、配比这三步的差别。网页内容是否被采集、平台允不允许采集,各家政策不同,以各站官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。