智客 ZICQ
EN 登录 / 注册
智客信息 大模型 #Tencent #多模态模型 #感知与认知 #vLLM #OmniDocBench

腾讯发布Youtu-Parsing-Omni:多模态解析模型革新感知与认知任务处理

Mr.Xu 的头像

文 / Mr.Xu

发布时间:

中文阅读 (Chinese) English Version

摘要:腾讯发布了一款名为Youtu-Parsing-Omni的紧凑型多模态解析模型,该模型能够处理文档页面、自然图像、图表、几何图形、音频和音视频等多种输入格式,并生成统一的结构化JSON输出,涵盖感知(布局元素、文本、表格等)和认知(字幕、叙述、报告等)任务。该模型采用统一架构,支持任务驱动的输出选择,并在多个基准测试中表现出色,例如在OmniDocBench v1.6上取得了96.96的综合得分,成为开放权重模型中的领先者。此外,Youtu-Parsing-Omni还集成了vLLM插件,简化了部署流程,为开发者提供了高效的多模态处理工具。


腾讯发布Youtu-Parsing-Omni:多模态解析模型革新感知与认知任务处理

腾讯近日发布了一款名为Youtu-Parsing-Omni的多模态解析模型,该模型具备以下核心特点:

  • 多模态输入处理:支持文档页面、自然图像、图表、几何图形、音频和音视频等多种输入格式。
  • 统一输出结构:生成统一的结构化JSON输出,涵盖感知(布局元素、文本、表格等)和认知(字幕、叙述、报告等)任务。
  • 任务驱动输出选择:通过任务提示(--task参数)选择输出家族,例如文档解析、自然图像解析、图表解析等。

技术亮点

  1. 统一架构:采用统一架构处理七种解析任务,简化了模型架构并提升了处理效率。
  2. 多模态编码器:集成了图像、音频和音视频帧的编码能力,在单一模型中实现多模态输入处理。
  3. 卓越性能:在OmniDocBench v1.6上取得了96.96的综合得分,成为开放权重模型中的领先者;在OmniParsingBench上平均得分75.08,仅次于Gemini-3-Pro。
  4. 易部署:提供了vLLM插件、预设的部署设置、任务提示和推理示例,简化了模型的实际应用。

行业影响

Youtu-Parsing-Omni的发布标志着多模态AI模型在处理复杂任务方面的重大进步。其强大的感知与认知能力使其在文档处理、图像识别、音频分析等领域具有广泛的应用潜力。例如,在企业文档解析、自动化报告生成、跨模态数据融合等场景中,Youtu-Parsing-Omni能够显著提升工作效率。此外,其易部署的特性也降低了开发者的使用门槛,推动了多模态AI技术的普及。

开发者建议

  • 探索多模态应用场景:开发者可以利用Youtu-Parsing-Omni处理多种输入格式,探索新的应用场景,例如智能文档处理、跨模态数据分析等。
  • 优化任务提示:通过调整任务提示参数,开发者可以定制模型的输出内容,以满足特定需求。
  • 结合其他工具:将Youtu-Parsing-Omni与其他AI工具结合使用,例如自然语言处理模型或知识图谱,进一步提升应用效果。

消息来源:Reddit r/LocalLLaMA (2026-10-09)

—— 完 ——

主题标签: #Tencent #多模态模型 #感知与认知 #vLLM #OmniDocBench

社区整体评论区

正在加载实时智能评论与划词标注…