智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #SkillOpt #智能体 #技能优化 #微软研究院 #可训练参数

微软研究院发布SkillOpt:将智能体技能视为可训练参数,无需更新模型权重即可显著提升性能

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 6 次阅读

中文阅读 (Chinese) English Version

摘要:微软研究院提出SkillOpt框架,将智能体的技能文件视为冻结模型外部的可训练参数,通过前向-反向-更新循环、验证门控和拒绝编辑反馈等机制,实现可控的技能优化。在六个基准、七个目标模型和三种执行模式下,SkillOpt在全部52个评估单元中取得最佳或并列最佳结果,例如将GPT-5.5的六基准平均分从58.8提升至82.3。优化后的技能文件紧凑、可审计且可跨模型和工具迁移,为智能体领域适配提供轻量级新路径。


概述

大型语言模型(LLM)越来越多地被部署为能够收集证据、调用工具和执行多步骤任务的智能体。对于这些智能体,关键问题不再是能否调用工具,而是能否可靠且一致地完成任务。当前,智能体技能通常来自三个来源:专家手工编写、前沿模型一次性生成、或智能体在执行后粗略修改。这些方法都不具备深度学习优化器的特性:缺乏步长控制、留出验证和失败修订的记忆。因此,技能往往随着每次重写而变得更长、更漂移,一个看似合理的修订可能会悄悄降低实际任务性能。这种不受控制的技能演化已成为从智能体原型到可靠生产级部署的主要障碍。

SkillOpt 的工作原理

SkillOpt 将技能编辑组织为文本空间中的前向-反向-更新循环。在前向传播中,冻结的目标模型使用当前技能执行一批训练任务;批次大小控制每次更新获得的证据量。在反向传播中,一个独立的优化器模型读取生成的轨迹,从成功轨迹中提炼要保留的模式,从失败中提炼要纠正的模式。

在更新步骤中,优化器提出小的添加、删除和替换编辑;候选编辑被合并、去重、排序,并通过文本学习率(即每步编辑预算)进行裁剪。每个候选技能必须通过严格的验证门:只有在留出验证集上得分严格高于当前技能时才会被采纳。被拒绝的编辑不会丢弃,而是进入拒绝编辑缓冲区,作为后续优化器调用的负反馈。在较慢的节奏上,逐轮的慢/元更新整合了单批无法揭示的长期教训。有界编辑、验证门控和最佳版本选择共同使技能优化可控且可审计,确保技能收敛而非漂移。

跨基准、模型和执行模式的持续增益

研究团队在六个基准(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld)、七个目标模型(从前沿规模的 GPT-5.5 到小型开源 Qwen3.5-4B)以及三种执行模式(直接聊天、Codex 和 Claude Code)上评估了 SkillOpt。与人工编写的技能、一次性 LLM 技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 相比,SkillOpt 在所有 52 个评估单元中均取得最佳或并列最佳结果。这些性能提升对于不更新模型权重的方法而言异常显著。

以 GPT-5.5 直接聊天为例,SkillOpt 将六基准平均分从 58.8 提升至 82.3,绝对提升 23.5 分,比每个单元选择最佳竞争方法的“神谕”还高 5.4 分。最大增益出现在程序性基准上:SpreadsheetBench 从 41.8 升至 80.7,OfficeQA 从 33.1 升至 72.1,LiveMathematicianBench 从 37.6 升至 66.9。同一接口也适用于智能体循环,在 Codex 中提升 GPT-5.5 24.8 分,在 Claude Code 中提升 19.1 分(相对于无技能基线)。

小模型加技能文件:缩小与前沿模型的差距

SkillOpt 还缩小了小型或开源模型与前沿模型之间的差距,而无需改变任何权重或在推理时增加额外模型调用。优化后,GPT-5.4-mini 的六基准平均分(64.3)超过了较大 GPT-5.4 的无技能基线(59.7),GPT-5.4-nano(57.4)超过了 GPT-5.2 的无技能基线(51.3)。Qwen3.5-4B(40亿参数开源模型)也超过了 GPT-5.2 的无技能基线。以前需要更大模型才能获得的增益,现在可以通过一个优化的技能文件近似实现。

技能的可迁移性:一次训练,处处复用

优化后的技能文件捕获的是可复用的任务解决流程,而非针对单一模型、基准或执行环境的过拟合指令。在迁移实验中,技能在跨模型规模、跨执行工具以及迁移到相近数学基准时仍能带来性能提升。最清晰的例子是跨工具迁移:在 Codex 中训练的电子表格技能,直接放入 Claude Code 且无需进一步优化,将无技能基线从 22.1 提升至 81.8(+59.7),略高于直接在 Claude Code 中训练达到的 80.4。由于两个工具暴露了不同的工具接口,这表明 SkillOpt 学习的是通用工作流逻辑,而非特定于工具的配方。

紧凑、可读、由极少数被接受的编辑构建

最终产物 best_skill.md 既不是不透明的参数块,也不是不断增长的日志。在六个案例研究中,最终技能长度的中位数约为 920 个 token,由于验证门拒绝了大多数提案,最终文件中仅接受了一到四个编辑。OfficeQA 的 +39.0 分增益来自单个被接受的编辑。学习到的规则读起来像经验丰富的从业者的建议。组件消融实验证实了这些控制机制的作用:移除拒绝编辑缓冲区会降低所有三个消融基准的分数,同时移除元技能和慢更新会使 SpreadsheetBench 从 77.5 降至 55.0。

智能体时代的新适配层

SkillOpt 为智能体的领域适配提供了一条更轻量级的路径:无需微调权重、硬编码任务逻辑或手动调整提示,团队可以训练一个小的、可版本化的、可审计的自然语言技能层——只要存在自动评估或可靠的验证器。通过将学习率、调度、验证划分、拒绝样本和慢更新引入智能体技能,SkillOpt 表明训练不必局限于模型权重,模型外部的程序性知识也可以被优化。当这个过程受到控制、验证和记录时,自然语言技能就成为连接前沿模型能力与现实工作负载的稳定、可迁移、可逆的适配器。

资源与致谢

相关论文、项目页面和 GitHub 仓库已公开,团队还发布了配套项目 SkillLens。开发者可基于 SkillOpt 针对自己的任务和验证器训练可复用技能。


原文出处:Microsoft Research Blog, “SkillOpt: Agent skills as trainable parameters”, 2026-06-30.


消息来源:Microsoft Research AI (2026-06-30)

—— 完 ——

主题标签: #SkillOpt #智能体 #技能优化 #微软研究院 #可训练参数

社区整体评论区

正在加载实时智能评论与划词标注…