涌现能力
涌现能力用于描述模型规模增加时,某些任务表现从弱或接近随机突然转为明显有效的现象。如何定义这种“突然”,与评测指标和实验设置有关。
原始研究如何定义
Wei 等人 2022 年的论文将小模型没有、大模型出现,且无法简单从小模型表现外推的能力称为涌现能力。它描述的是特定模型系列与任务的观测,不是每次扩大模型都会出现新能力的保证。
为什么存在争议
Schaeffer 等人 2023 年指出,非线性或不连续的评分方式可能让连续的改进看起来像突变;换用不同指标时,一些所测能力曲线会更平滑。该结果质疑部分观测的解释,并未证明所有规模相关能力都不存在。
一个指标示例
以下是人为设定的教学例子:若任务要求 5 步全部正确才计分,单步正确率由 0.5 增至 0.8,在独立假设下整题成功率会由约 3.1% 升至 32.8%。评分曲线变化很大,但这本身不能证明模型内部发生离散跃迁。
如何阅读相关结论
建议同时检查模型系列、训练数据、提示方法、样本量、误差范围,以及 exact match 与连续指标是否给出一致趋势。不要仅凭一张曲线把涌现等同于 AGI。
参考资料
- Emergent Abilities of Large Language Models — 2022 年定义与观测。
- Are Emergent Abilities of Large Language Models a Mirage? — 指标选择与解释争议。