开源与开放权重大语言模型
开源大语言模型与开放权重模型经常被混用,但公开权重并不足以说明整个 AI 系统符合开源定义。判断时应分别查看权重、代码、数据说明与许可。
两个概念
开放权重通常表示模型参数可取得;使用、修改与分发范围仍取决于许可。OSI 的 Open Source AI Definition 1.0 则要求使用、研究、修改与分享的自由,以及适合修改的形式,包括数据说明、代码和参数。定义并不简单要求公开全部原始训练数据。
这里按 OSI 定义区分术语;社区、厂商或其他标准可能使用不同口径。
一个建议核查表
| 项目 | 需要查明的问题 |
|---|---|
| 权重与版本 | 是否能下载?是否有固定 revision? |
| 代码 | 推理与训练相关代码公开到什么程度? |
| 数据说明 | 是否说明来源、筛选、标注与处理? |
| 许可 | 权重、代码和数据是否分别有条款? |
| 复现 | 能否在自己的任务上复现实验结果? |
具体许可判断应回到该版本的原始文件,不能只看模型名字或下载按钮。
使用场景
自托管、离线推理与微调是可能的使用方式,前提是版本许可与技术条件允许。我们建议在选型记录中保存模型 revision、许可链接和评测设置,避免升级后无法追踪依据。
参考资料
- OSI:Open Source AI Definition 1.0 — 开源 AI 的定义与所需组成。
- OSI:Open Weights — 开放权重与开源的区别。