数据清洗
数据清洗是发现并处理数据中的重复、格式错误、缺失值及不符合任务要求的内容,使后续训练或检索有稳定、可追溯的输入。
一个建议流程
- 保留原始快照与稳定 ID,记录来源和转换版本。
- 检查编码、字段类型与空值;清除网页导航等模板噪声时保留有效正文。
- 按任务制定过滤规则,抽样审查被保留和被删除的内容。
- 用精确去重识别完全重复项,用近似去重发现改写或局部重复。
- 检查集合间重叠,并记录每一步的删除数量与原因。
这些是工程建议,不是适用于所有数据的固定处理顺序。涉及统计量拟合的转换必须只在训练集拟合,见 数据泄漏。
去重与质量
Lee 等人的研究发现,训练语料去重可以减少其所测模型的逐字记忆与训练评测集重叠;这不能推导为所有任务都会获得同样幅度的提升。
示例:知识库清洗
假设同一帮助页被三个网址转载,我们建议保留一个主版本,同时保存来源映射;新版操作步骤覆盖旧版时标记版本,而不是把两版拼成一段。代码、金额、否定词与表格结构不宜机械删除。
检查结果
建议比较清洗前后的重复率、解析失败率、任务覆盖与抽样错误。数据变少不等于质量变高;过严过滤可能删掉稀有语言或边缘场景。
参考资料
- Deduplicating Training Data Makes Language Models Better — 去重研究及其实验边界。
- Hugging Face Datasets:Process — map、filter 与数据转换。
- scikit-learn:Common pitfalls — 预处理与泄漏。