智客 ZICQ
EN 登录 / 注册
智客前沿 前沿论文 #Echoverse #计算机使用智能体 #合成环境 #强化学习 #微软研究院

微软发布Echoverse:深度演化环境让9B模型逼近GPT-5.4,计算机使用智能体训练新范式

Mr.Xu 的头像

文 / Mr.Xu

发布时间: · 2 次阅读

中文阅读 (Chinese) English Version

摘要:微软研究院推出Echoverse,一个用于训练计算机使用智能体的深度演化环境框架。通过构建十个高保真领域世界和两个能力世界,并采用环境、任务、验证器与模型共同演化的闭环,Echoverse使9B参数的Qwen3.5模型在综合基准上从36.5%提升至67.1%,逼近GPT-5.4的80.7%。实验表明,深度世界优于浅层世界,针对性能力训练可泛化至未见布局,强化学习进一步突破模仿上限。微软已开源四个世界及其代码、数据和验证器,为智能体研究提供高保真训练基础设施。


微软发布 Echoverse:深度演化环境重塑计算机使用智能体训练

微软研究院近日发布 Echoverse,一个用于训练计算机使用智能体的深度演化环境框架。该框架通过构建高保真合成世界,让智能体在真实、可重置、可验证的环境中学习多步骤工作流,显著提升小模型的性能,使其逼近前沿大模型。

核心突破:深度优于数量

Echoverse 的核心假设是:训练计算机使用智能体的关键不在于环境数量,而在于环境的深度和演化能力。研究团队构建了十个深度领域世界(如 EchoMail、EchoBank、EchoStay)和两个能力世界(日期选择器和嵌套过滤器),每个世界都具备行为保真、状态一致、工作流深度、权威验证和领域价值五大特性。

实验表明,在相同领域暴露下,浅层世界训练会导致模型性能下降(Allrecipes 从 80% 降至 75%),而深层世界则带来显著提升(Allrecipes 升至 85%,Hugging Face 从 48% 升至 65%)。深度世界保留了真实工作流的因果结构,使模型学会跨步骤依赖,而非孤立动作。

能力世界:精准打击薄弱环节

针对智能体普遍存在的 UI 控件操作困难(如日期选择器、嵌套过滤器),Echoverse 构建了能力世界,将单一控件以多种形式呈现。日期选择器世界覆盖 6 种核心组件、10 种上下文,并保留 10 种未见组件;嵌套过滤器世界涵盖 20 种组件家族,并保留 9 种复合面板。训练后,模型在未见布局上的表现显著提升(日期选择器 held-out 从 34% 提升至 54%,过滤器 held-out 从 62.8% 提升至 84.1%),证明模型学到了规则而非死记布局。

共同演化:环境与模型同步提升

Echoverse 的独特之处在于将环境构建与模型训练视为一个闭环。每次分级运行不仅产生训练数据,还反馈环境缺陷,驱动环境、任务和验证器的修复。例如,EchoStay 中一个损坏的访客计数控件曾阻塞 24 个任务中的 15 个,修复后完成率从 48% 提升至 78%。经过两轮共同演化,EchoStay 上的模型得分从 16.2% 翻倍至 38.5%,接近 GPT-5.4 的 50.4%。

强化学习:突破模仿上限

Echoverse 本身即强化学习环境(RLE),支持重置、并行采样和数据库级奖励。研究团队以 SFT 模型为起点,在五个世界上进行 RL 训练,使用数据库验证器和多模态评判器提供奖励。在保留任务上,评判得分从 58% 提升至 69%,模型学会了何时停止、恢复和放弃,超越了纯模仿的局限。

开源与影响

微软已开源四个世界(EchoStay、EchoForge、日期选择器、嵌套过滤器)的代码、数据和验证器,支持研究者复现和扩展。Echoverse 为计算机使用智能体提供了高保真训练基础设施,其“深度、目标化、可验证”的理念可能成为该领域的新标准。

原文出处:Microsoft Research Blog, "Echoverse: Deep, evolving environments for computer-use agents", 2026-07-30.


消息来源:Microsoft Research AI (2026-07-30)

—— 完 ——

主题标签: #Echoverse #计算机使用智能体 #合成环境 #强化学习 #微软研究院

社区整体评论区

正在加载实时智能评论与划词标注…