Evaligo发布SWE-Race:多模型并发编程错误修复基准测试平台
文 / Mr.Xu
发布时间:
摘要:Evaligo团队推出了一款名为SWE-Race的基准测试平台,用于评估多智能体系统在修复真实并发编程错误(如数据竞争、死锁和取消问题)方面的表现。该平台基于从100多个Python项目中提取的188个真实并发错误构建,每个任务通过项目的测试进行评分,且在无网络的容器环境中运行,以防止智能体从Git历史中恢复修复方案。初步测试结果显示,GLM-5.3 Flash和GPT-5.6 Luna在不同尝试次数下的表现接近,其中GLM-5.3 Flash在单次尝试中表现最佳,达到85%的成功率。此外,平台还公开了任务数据、测试协议以及详细的运行日志,为研究人员和开发者提供了宝贵的资源。
平台概述
SWE-Race是Evaligo团队开发的一款针对并发编程错误的基准测试平台,旨在评估多智能体系统在修复真实世界并发错误方面的能力。该平台的特点包括:
- 真实错误数据:从100多个Python项目的合并拉取请求(PR)中提取了188个真实的并发错误,包括数据竞争、死锁和取消问题。
- 严格测试环境:每个任务在无网络的容器中运行,代码库被削减到单个提交,以防止智能体从Git历史中恢复修复方案。
- 透明评分机制:任务通过项目的测试进行评分,确保评估的公正性和准确性。
主要发现
- 模型表现差异:在单次尝试任务中,GLM-5.3 Flash的修复成功率为85%,而GPT-5.6 Luna为81%。在多次尝试的情况下,GLM-5.3 Flash的成功率略微下降至82%,与GPT-5.6 Luna的表现相近。
- 任务难度影响:约一半的任务对所有模型来说都相对简单,修复成功率接近100%。然而,在另一半较难的任务中,模型的表现差异明显,GLM-5.3 Flash、GPT-5.6 Luna和其他模型的成功率分别为50%、45%和23%。
- 网络访问限制:在所有11,000条命令中,有69条尝试访问网络,但均未成功。GLM-5.3 Flash尝试了50次下载已修复的库版本。
- 新旧错误对比:旧错误(2026年之前的)的修复成功率比新错误高出约9个百分点,但置信区间跨越零,因此尚无法得出明确结论。
行业影响
SWE-Race为多智能体系统在并发编程错误修复方面的能力提供了一个客观的评估标准。其公开的任务数据和测试协议为研究人员和开发者提供了宝贵的资源,有助于推动AI在代码自动化修复领域的发展。此外,该平台还为未来的模型改进和优化提供了明确的方向,例如提高在复杂任务中的表现和减少对网络资源的依赖。
开发者建议
- 利用公开数据:开发者可以利用SWE-Race公开的任务数据和测试协议,评估和改进自己的模型。
- 关注模型鲁棒性:在设计AI模型时,应特别关注其在复杂和多样化任务中的表现,以提高鲁棒性。
- 探索新方法:研究人员和开发者可以探索新的方法和技术,例如强化学习和迁移学习,以进一步提高模型在并发错误修复中的表现。
结论
SWE-Race的发布标志着AI在代码自动化修复领域的一个重要里程碑。它不仅提供了一个客观的评估平台,还为未来的研究和技术改进指明了方向。
—— 完 ——消息来源:Reddit r/MachineLearning (2026-10-06)
社区整体评论区
正在加载实时智能评论与划词标注…