预训练(Pretraining)
预训练是 大语言模型训练流程的第一阶段:用海量无标注文本(万亿 token 级别), 让模型通过"下一个 token 预测"任务自监督学习语言知识和世界知识。
典型规模
- GPT-2:~10B tokens
- LLaMA 1:~1.4T tokens
- LLaMA 3:~15T tokens
- 业界顶级模型:数十 T tokens 起
数据来源
- 网页:Common Crawl 是最大单一来源(占 60-80%),需要严格清洗。
- 代码:GitHub、StackOverflow(提升代码能力)。
- 书籍:高质量长文本(Project Gutenberg、Books3)。
- 学术:arXiv 论文、PubMed(提升科学推理)。
- 多语言:CC100、mC4 等多语言语料。
关键技术
- 数据清洗:dedup(去重)、quality filter(用模型给数据打分)、PII 移除。
- 数据配比:代码 / 百科 / 新闻 / 对话 怎么配直接影响下游能力。
- 课程学习:先易后难,或反之。
- Scaling Law:模型大小、数据量、计算量如何配比(Chinchilla 论文)。
进一步阅读
- Chinchilla Scaling Law — 计算最优的模型/数据配比