跳到主内容
快讯直播
AI智模界
AI 词典

Common Crawl:模型读的"互联网"其实是这份快照

一句话定义:Common Crawl 是一个非营利项目,长期自动抓取全网公开网页,把抓下来的原始内容打包成公开存档免费供人下载——它本身不是搜索引擎,却是大多数大语言模型预训练语料的起点。

它是怎么运转的

它像一台不知疲倦的复印机:从一批种子网址出发,顺着链接不断爬行,把每个页面的正文、抓取时间、HTTP 头信息原样打包成压缩存档(WARC 格式),定期发布一次快照,任何人可以下载。规模以拍字节(PB)计。

打个比方:如果把互联网想象成一座不停拆建的城市,搜索引擎是随叫随到的导航 App——它记住路网,随时更新,但不保存每条街的全部细节,而且内部索引并不对外开放。Common Crawl 更像一辆每天绕城拍一遍的街景车:不管美丑、不辨真假,把看到的街道原封不动拍下来存档,谁想拿去用就去下载。它不排序、不评判,也不为"这页内容对不对"负责。

容易混淆的几个东西

Common Crawl搜索引擎索引维基百科
目的公开存档检索与排序人工编纂知识
形态原始网页处理后的索引审核过的条目
质量参差,含大量垃圾经过排序筛选相对可靠
获取免费下载不对外开放可作高质量语料

还有一个关键区别:Common Crawl 不等于训练数据。它是"毛坯房",直接拿来训练效果很差——里面塞满导航栏、广告、乱码和重复页面。所以业界会再做一道加工:去重、语言识别、过滤低质页面、抽取正文,做成清洗后的数据集再喂给模型。同样一堆原始快照,清洗配方不同,训出来的模型差别很大。

对谁意味着什么

对从业者:数据配方是核心竞争力之一。选哪个时间段的快照、用什么规则过滤、给小语种留多少配额,直接决定模型的知识面和"脏话率、偏见率"。中文网页在这份快照里占比不高,所以中文模型往往还得额外自建语料。

对普通人:当模型说出一段过时信息、或者冒出某种刻板印象时,它多半不是"想错了",而是在复述它读过的东西——而它读的东西,很大程度来自这份快照。想明白这一点,就不会把模型当成无所不知的权威,而是一个"读过海量网页的实习生":见多识广,但也会把网上的偏见和噪音一起背下来。具体的抓取范围与使用条款,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。