跳到主内容
智客 ZICQ

智客百科 技术术语

预训练(Pretraining)

技术术语
别名: 预训练 ·2026-09-14

预训练(Pretraining)

预训练是 大语言模型训练流程的第一阶段:用海量无标注文本(万亿 token 级别), 让模型通过"下一个 token 预测"任务自监督学习语言知识和世界知识。

典型规模

  • GPT-2:~10B tokens
  • LLaMA 1:~1.4T tokens
  • LLaMA 3:~15T tokens
  • 业界顶级模型:数十 T tokens 起

数据来源

  • 网页:Common Crawl 是最大单一来源(占 60-80%),需要严格清洗。
  • 代码:GitHub、StackOverflow(提升代码能力)。
  • 书籍:高质量长文本(Project Gutenberg、Books3)。
  • 学术:arXiv 论文、PubMed(提升科学推理)。
  • 多语言:CC100、mC4 等多语言语料。

关键技术

  • 数据清洗:dedup(去重)、quality filter(用模型给数据打分)、PII 移除。
  • 数据配比:代码 / 百科 / 新闻 / 对话 怎么配直接影响下游能力。
  • 课程学习:先易后难,或反之。
  • Scaling Law:模型大小、数据量、计算量如何配比(Chinchilla 论文)。

进一步阅读