数据集
数据集是按任务组织的一组样本,可以包含文本、图像、标签或交互记录。模型训练、验证与评测使用的数据承担不同职责;检索知识库则为 RAG 提供回答时读取的材料。
训练、验证与测试
| 划分 | 用途 | 应避免的做法 |
|---|---|---|
| 训练集 | 学习参数或拟合预处理器 | 混入测试题与答案 |
| 验证集 | 比较配置、选择模型 | 反复调参后仍把分数当最终结果 |
| 测试集 | 在冻结方案后评估泛化 | 用测试分数指导下一轮调参 |
划分比例没有通用标准。建议先明确使用场景,再按用户、文档来源或时间划分,防止同一实体的近似样本跨集合出现,见 数据泄漏。
应记录哪些字段
建议用数据卡记录来源、采集方式、语言、规模、标签定义、许可、适用场景与已知偏差。样本数与 token 数应分开报告,并说明去重前后、划分方式和版本。
示例:客服问答数据
以下为设计示例,不是真实数据集统计:
{"id":"example-001","group_id":"ticket-demo","question":"如何重置密码?","answer":"进入账户设置并验证身份。","source":"help/password","version":"v1","split":"train"}
同一工单的改写问题应一起划分。检索库还可记录原文位置与访问权限;训练集需要另行确认标签质量及是否适合训练。
参考资料
- Hugging Face:Dataset Cards — 数据卡与元数据。
- Datasheets for Datasets — 来源、组成与用途的文档框架。
- scikit-learn:交叉验证 — 按组划分。