DeskForge:基于桌面环境的密集监督数据生成框架,助力计算机使用智能体提升GUI理解能力
文 / Mr.Xu
发布时间:
摘要:DeskForge是由Said Gurbuz团队推出的一种可控桌面环境生成框架,旨在为计算机使用智能体提供大规模、高质量的监督数据。该框架通过组合真实应用程序并模拟多样化的桌面场景,生成包含1.2M标注桌面观察和159.7M元素实例的数据集DeskForge-1M。实验结果表明,基于DeskForge-1M微调的四款视觉-语言模型在多个GUI理解基准测试中均表现出显著的性能提升,例如Qwen3.5-4B在ScreenSpot-Pro上的准确率提高了11.51个百分点,在OSWorld-G上提高了10.11个百分点。此外,这些模型在长时任务完成方面也取得了显著进展,展示了DeskForge在提升GUI理解能力和计算机使用智能体性能方面的巨大潜力。
核心突破
DeskForge框架的核心创新点在于其可控性及对真实桌面环境的模拟能力,具体包括:
- 多样化场景生成:通过调整应用程序状态、内容、窗口布局、外观和分辨率,生成高度多样化的桌面场景。
- 密集标注数据:融合屏幕截图、可访问性树和窗口几何信息,生成包含元素级标注的桌面观察数据。
- 大规模数据集构建:构建了DeskForge-1M数据集,包含1.2M标注桌面观察和159.7M元素实例,为模型训练提供了充足的监督数据。
技术亮点
- 可控性:DeskForge允许开发者通过参数化方式控制桌面环境的各个方面,从而生成符合特定需求的训练数据。
- 数据融合:将多种数据源(如屏幕截图、可访问性树和窗口几何信息)融合在一起,生成丰富的标注数据。
- 性能提升:在多个GUI理解基准测试中,DeskForge微调后的模型均表现出显著的性能提升。例如,Qwen3.5-4B在ScreenSpot-Pro上的准确率提高了11.51个百分点,在OSWorld-G上提高了10.11个百分点。
- 长时任务完成:在长时任务完成方面,DeskForge微调后的模型也取得了显著进展,例如Qwen3.5-4B在WebArena-Infinity和OpenApps任务中的成功率分别从31/119和3/100提升至50/119和15/100。
行业影响
DeskForge的发布为计算机使用智能体的研究提供了一个强大的工具,特别是在GUI理解和长时任务完成方面。其可控性和大规模数据集生成能力使其成为研究人员和开发者提升模型性能的利器。此外,DeskForge的开源性质也促进了AI社区的协作与创新。
开发者建议
- 数据利用:建议研究人员和开发者利用DeskForge-1M数据集进行模型训练和微调,以提升GUI理解能力。
- 框架扩展:开发者可以基于DeskForge框架进行扩展,生成更多特定领域的桌面场景数据。
- 性能优化:在应用DeskForge微调后的模型时,建议结合长时任务完成的需求进行进一步优化。
结论
DeskForge框架为计算机使用智能体的研究提供了一个全新的视角,通过可控的桌面环境生成和大规模标注数据,推动了GUI理解和长时任务完成能力的提升。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-01)
主题标签: #DeskForge #GUI理解 #计算机使用智能体 #数据标注 #视觉-语言模型
社区整体评论区