一句话定义:Common Crawl 是一个非营利项目,长期自动抓取全网公开网页,把抓下来的原始内容打包成公开存档免费供人下载——它本身不是搜索引擎,却是大多数大语言模型预训练语料的起点。
它是怎么运转的
它像一台不知疲倦的复印机:从一批种子网址出发,顺着链接不断爬行,把每个页面的正文、抓取时间、HTTP 头信息原样打包成压缩存档(WARC 格式),定期发布一次快照,任何人可以下载。规模以拍字节(PB)计。
打个比方:如果把互联网想象成一座不停拆建的城市,搜索引擎是随叫随到的导航 App——它记住路网,随时更新,但不保存每条街的全部细节,而且内部索引并不对外开放。Common Crawl 更像一辆每天绕城拍一遍的街景车:不管美丑、不辨真假,把看到的街道原封不动拍下来存档,谁想拿去用就去下载。它不排序、不评判,也不为"这页内容对不对"负责。
容易混淆的几个东西
| Common Crawl | 搜索引擎索引 | 维基百科 | |
|---|---|---|---|
| 目的 | 公开存档 | 检索与排序 | 人工编纂知识 |
| 形态 | 原始网页 | 处理后的索引 | 审核过的条目 |
| 质量 | 参差,含大量垃圾 | 经过排序筛选 | 相对可靠 |
| 获取 | 免费下载 | 不对外开放 | 可作高质量语料 |
还有一个关键区别:Common Crawl 不等于训练数据。它是"毛坯房",直接拿来训练效果很差——里面塞满导航栏、广告、乱码和重复页面。所以业界会再做一道加工:去重、语言识别、过滤低质页面、抽取正文,做成清洗后的数据集再喂给模型。同样一堆原始快照,清洗配方不同,训出来的模型差别很大。
对谁意味着什么
对从业者:数据配方是核心竞争力之一。选哪个时间段的快照、用什么规则过滤、给小语种留多少配额,直接决定模型的知识面和"脏话率、偏见率"。中文网页在这份快照里占比不高,所以中文模型往往还得额外自建语料。
对普通人:当模型说出一段过时信息、或者冒出某种刻板印象时,它多半不是"想错了",而是在复述它读过的东西——而它读的东西,很大程度来自这份快照。想明白这一点,就不会把模型当成无所不知的权威,而是一个"读过海量网页的实习生":见多识广,但也会把网上的偏见和噪音一起背下来。具体的抓取范围与使用条款,以官方页面为准。
