AI模型软件工程能力评估基准
工程AI模型能力评估
使用这些基准来测试和比较AI模型在软件工程任务中的表现
可修改 · 可复制查看与实测
按场景找到模板,替换任务材料,再交给 AI 使用。
6个模板
工程AI模型能力评估
使用这些基准来测试和比较AI模型在软件工程任务中的表现
可修改 · 可复制查看与实测
工程代码生成工具使用体验优化
在提交代码生成请求时使用,确保工具优先完成当前任务
实测codexcode generation tools
可修改 · 可复制查看与实测
工程代码生成与编译器开发
将任务目标输入模型,监控子智能体协作过程,必要时进行人工干预
实测Qwenllama.cpplibcapstone
可修改 · 可复制查看与实测
工程代码生成
在向 Claude 发送代码修改请求时使用,确保只执行明确要求的更改
实测claude
可修改 · 可复制查看与实测
工程代码生成与审查
将代码库URL、功能描述和参考文档URL填入提示词中,发送给本地大语言模型进行代码生成…
实测Qwen 3.8 27Bchatgptclaude
可修改 · 可复制查看与实测
工程性能基准测试
使用提供的模型和参数设置进行性能基准测试
实测llama.cppQwen
可修改 · 可复制查看与实测