跳到主内容
智客 ZICQ

智客百科 技术术语

数据清洗

技术术语
别名: Data Cleaning 数据去重 Deduplication ·2026-10-07

数据清洗

数据清洗是发现并处理数据中的重复、格式错误、缺失值及不符合任务要求的内容,使后续训练或检索有稳定、可追溯的输入。

一个建议流程

  1. 保留原始快照与稳定 ID,记录来源和转换版本。
  2. 检查编码、字段类型与空值;清除网页导航等模板噪声时保留有效正文。
  3. 按任务制定过滤规则,抽样审查被保留和被删除的内容。
  4. 用精确去重识别完全重复项,用近似去重发现改写或局部重复。
  5. 检查集合间重叠,并记录每一步的删除数量与原因。

这些是工程建议,不是适用于所有数据的固定处理顺序。涉及统计量拟合的转换必须只在训练集拟合,见 数据泄漏。

去重与质量

Lee 等人的研究发现,训练语料去重可以减少其所测模型的逐字记忆与训练评测集重叠;这不能推导为所有任务都会获得同样幅度的提升。

示例:知识库清洗

假设同一帮助页被三个网址转载,我们建议保留一个主版本,同时保存来源映射;新版操作步骤覆盖旧版时标记版本,而不是把两版拼成一段。代码、金额、否定词与表格结构不宜机械删除。

检查结果

建议比较清洗前后的重复率、解析失败率、任务覆盖与抽样错误。数据变少不等于质量变高;过严过滤可能删掉稀有语言或边缘场景。

参考资料