Source-linked AI summary

GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents

GLM-V Team, :, Wenyi Hong, Xiaotao Gu, Ziyang Pan, Zhen Yang, Yuting Wang, Yue Wang, Yuanchang Yue, Yu Wang, Yanling Wang, Yan Wang, Xijun Liu, Wenmeng Yu, Weihan Wang, Wei Li, Shuaiqi Duan, Sheng Yang, Ruiliang Lv, Mingdao Liu, Lihang Pan, Ke Ning, Junhui Ji, Jinjiang Wang, Jing Chen, Jiazheng Xu, Jiale Zhu, Jiale Cheng, Ji Qi, Guobing Gan, Guo Wang, Cong Yao, Zijun Dou, Zihao Zhou, Zihan Wang, Zhiqi Ge, Zhijie Li, Zhenyu Hou, Zhao Xue, Zehui Wang, Zehan Qi, Zehai He, Yutao Zhang, Yusen Liu, Yukuo Cen, Yuchen Li, Yuan Wang, Yu Yang, Yongbin Liu, Yijian Lu, Yifan Xu, Yanzi Wang, Yanxiao Zhao, Yanfeng Wang, Yadong Xue, Yabo Xu, Xinyu Zhang, Xinyu Liu, Xiao Liu, Wenyi Zhao, Wenkai Li, Tianyu Tong, Tianshu Zhang, Shudan Zhang, Shengdong Yan, Qinkai Zheng, Mingde Xu, Licheng Bao, lat Long long, Jiaxing Xu, Jiaxin Fan, Jiawen Qian, Jiali Chen, Jiahui Lin, Jiadai Sun, Haozhi Zheng, Haoran Wang, Haochen Li, Hanyu Lai, Han Xu, Fan Yang, Dan Zhang, Da Yin, Chuangxin Zhao, Chengcheng Wu, Boyan Shi, Bowen Lv, Bowei Jia, Bo Li, Bin Chen, Baoxu Wang, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Minlie Huang, Yuxiao Dong, Jie Tang

arXiv:2604.26752v3cs.CV

TL;DR

多模态智能体需要在推理与行动过程中感知并整合异构上下文,但当前系统仍面临细粒度感知方面的挑战。GLM-5V-Turbo将多模态感知贯穿模型设计、训练、强化学习和智能体基础设施,在多模态智能体任务上取得强劲表现,其中Design2Code得分为94.8。

  • 问题

    通用智能体需要对异构多模态上下文进行原生处理,并将其与感知、推理和决策整合起来。

  • 方法

    GLM-5V-Turbo结合专用视觉编码器、一体化多模态训练,以及覆盖超过30类感知、推理和智能体任务类别的联合强化学习。

  • 结果

    GLM-5V-Turbo在多模态智能体和编码任务上取得强劲表现,其中Design2Code得分为94.8,超过Claude Opus 4.6。

  • 要点与局限

    开发过程表明,多模态感知、分层优化和可靠的端到端验证,是构建多模态智能体时需要实际考虑的因素。

  • 要点与局限

    多模态上下文管理仍是瓶颈,因为在长轨迹中保留图像和视频会消耗上下文预算,并使忠实压缩变得更加复杂。

Abstract

from arXiv · show

We present GLM-5V-Turbo, a step toward native foundation models for multimodal agents. As foundation models are increasingly deployed in real environments, agentic capability depends not only on language reasoning, but also on the ability to perceive, interpret, and act over heterogeneous contexts such as images, videos, webpages, documents, GUIs. GLM-5V-Turbo is built around this objective: multimodal perception is integrated as a core component of reasoning, planning, tool use, and execution, rather than as an auxiliary interface to a language model. This report summarizes the main improvements behind GLM-5V-Turbo across model design, multimodal training, reinforcement learning, toolchain expansion, and integration with agent frameworks. These developments lead to strong performance in multimodal coding, visual tool use, and framework-based agentic tasks, while preserving competitive text-only coding capability. More importantly, our development process offers practical insights for building multimodal agents, highlighting the central role of multimodal perception, hierarchical optimization, and reliable end-to-end verification.

1 概述

GLM-5V-Turbo 通过将多模态处理融入模型设计、训练和基础设施,致力于实现原生多模态智能体能力。相较于 GLM-5-Turbo,它在保持较强文本智能体与编码性能的同时,取得了出色的多模态智能体结果,并强调感知、分层优化、验证和受控评估是关键开发原则。

  • 动机: 概述提出了通用智能体模型的需求:将先进智能与对复杂多模态上下文的原生处理能力相结合,以支持现实世界交互和生产力导向的领域 [49]此类应用包括知识工作 、软件工程 [20] 和图形用户界面任务 [16] [43]
  • 模型设计与训练: GLM-5V-Turbo 通过 CogViT(一种用于细粒度理解的视觉编码器)和 Multimodal Multi-Token Prediction,为纯文本和多模态输入实现原生多模态建模。该预测方法旨在适配大规模基础设施,同时在预训练和……过程中实现视觉与语言的全程融合。
  • 结果: 这些协同推进使 GLM-5V-Turbo 具备原生多模态智能体能力,同时相较于仅支持语言的 GLM-5-Turbo,保持较强的文本智能体与编码性能。这些能力既体现在基准测试结果中,也体现在实际智能体场景中,包括 Z.ai、Claude Code 和 OpenClaw
  • 结果: GLM-5V-Turbo 在多模态智能体基准测试中取得了出色结果,包括 ImageMining 上的 30.7、BrowseComp-VL 上的 51.9、MMSearch [18] 上的 72.9、SimpleVQA [7] 上的 78.2、AndroidWorld [30] 上的 75.7,以及 OSWorld [44] 上的 62.3。它在 PinchBench 上还取得 87.0/80.7,在 ClawEval [46] 上取得 57.7/75.0,并在另一项基于 Claw 的评估中取得 57.6;不过,所提供的段落在该数值后被截断。
  • 经验总结: 开发过程表明,感知是基础,相较于单体式端到端训练,分层优化更为可取;对于端到端智能体任务,清晰的规范、可靠的验证和受控评估不可或缺。这些原则有助于有效构建、评估和优化智能体系统。

2 模型、训练与基础设施

GLM-5V-Turbo 将多模态感知融入模型设计、训练、强化学习和基础设施,以支持高效且可扩展的智能体能力。其联合多模态优化提升了多项感知与智能体技能,同时揭示了训练任务分布之外的能力退化风险。

  • 模型设计: CogViT 是一种参数高效的视觉编码器,具备强大的通用、细粒度、几何和空间感知能力,通过两阶段表征学习与跨模态对齐进行训练。Figure 1 对比了 CogViT 与其他 state-of-the-art 视觉编码器在通用和细粒度多模态任务上的表现。
  • 模型设计: MMTP 支持纯文本和多模态输入,采用基于 <|image|> 的设计,可降低训练损失、提升收敛稳定性,同时减少流水线并行通信。该设计避免在流水线并行阶段之间传递视觉嵌入,并提升系统可扩展性与工程可维护性。
  • 多模态训练与 RL: 针对 30 多类任务的 RL,相比 SFT,使 RefCOCO-avg 上的 grounding 和 pointing 提升 4.8%,PointBench 上提升 3.2%。训练还采用了面向 UI-to-code 任务的 relative visual policy optimization 等改进方法 [45]
  • 多模态训练与 RL: 联合多任务 RL 通常能够减少跨域干扰,使多个领域共同提升,并相较于 SFT 中常见的权衡实现稳定增益。在分布更窄的领域中,协同训练也能稳定优化过程,而单任务 RL 往往会出现振荡。
  • 多模态训练与 RL: 后训练阶段,随着模型容量和已学习的思维模式集中于采样任务,RL 任务分布之外的能力可能会退化。这一局限尤其影响与训练任务分布更为正交的能力。
  • 训练基础设施: 训练栈统一异构任务与奖励,同时解耦流水线阶段、管理多模态记忆,并动态平衡视觉输入负载。该基础设施包括统一的 VLM RL Gym、集中式 verifier 编排、异步阶段重叠、结合 CPU offloading 的定向重计算,以及拓扑感知的分区。

3 多模态智能体能力与生态

GLM-5V-Turbo 将多模态智能体从孤立的工具使用扩展到覆盖视觉搜索、编码、研究和数字界面的完整感知—规划—执行闭环。它结合扩展的多模态工具链、智能体框架集成和文档支撑生成,以支持多模态任务的自主解决。

  • 多模态智能体能力: GLM-5V-Turbo 通过在多模态搜索、标注、截图和网页阅读工具之间切换,支持长时域感知—规划—执行。扩展后的工具链使智能体能够理解视觉环境、选择行动,并根据结果进行调整。
  • 多模态智能体能力: MMSearch-Plus 达到 30.0,几乎是 GLM-4.6V 的八倍;BrowseComp-VL 达到 51.9,ImageMining 达到 30.7。这些结果表明,模型在涉及网页导航和视觉挖掘的复杂多模态任务上取得了提升。
  • 智能体框架集成: GLM-5V-Turbo 与 Claude Code 和 AutoClaw 集成,负责多模态推理核心,同时委托执行逻辑,以支持跨数字界面的自主任务。这一集成使模型从被动代码生成转向主动的系统级协作。
  • ImageMining: ImageMining 通过智能体式视觉挖掘评估“用图像思考、用图像深度搜索”,而非传统 VQA [19] [35]其 217 个案例覆盖七个领域,需要局部裁剪或放大等多步操作,性能取决于对图像内容进行精确的工具使用。
  • 多模态深度研究: 该模型通过迭代收集信息、整合证据、更新状态,并生成交错呈现的报告、幻灯片和文档式成文,执行多模态深度研究。它从网页、图表、结构化文档和截图中联合提取文本与视觉证据,并在下游输出中保留二者的关联。

4 开发过程中的设计视角

开发过程总结出三条并非普适的实践性设计视角:感知是更高层多模态能力的基础,智能体训练受益于分层优化,而长时程任务需要明确的规格说明、可靠的验证与受控评估。总体而言,这些视角强调夯实感知基础、在不同能力层级间分配优化,并使端到端任务足够稳定,从而提供可复用的反馈。

  • 视角 1:感知仍是基础: 感知仍是基础,因为细粒度与空间错误可能传播至多模态推理、决策和执行环节。作者将其视为反复出现的开发观察,而非普适规则。
  • 视角 1:感知仍是基础: 通过多模态编码、grounding 和自我批评训练来强化感知学习,并减少反复出现的 GUI 感知失败。Frontend 或 SVG 编码练习布局、结构、相对位置和局部细节;批评数据针对误读界面、误识别元素以及下一步操作错误。
  • 视角 2:分层优化: 通过在元素感知、GUI grounding、单步操作和轨迹级操作之间进行分层优化,可以更高效地构建智能体能力。该策略应对环境与数据成本高、长时程组合困难、解路径不唯一,以及对不断变化的环境状态的依赖。
  • 视角 3:可靠的端到端任务设计: 端到端长时程任务需要明确的规格说明、可靠的结果验证和受控评估,才能产生稳定且可复用的优化反馈。现实任务往往是开放式的,规格说明不完整、边界模糊,并依赖中间决策;Vision2Web [14] 将更丰富的任务规格说明和基于工作流的验证落地。

5 评测

GLM-5V-Turbo 在多模态编码、工具使用和 GUI agent 基准测试中表现强劲,同时保持扎实的纯文本编码能力。其视觉能力也能有效迁移到通用 agent 框架和面向执行的评测中。

  • 评测范围: 评测涵盖多模态编码、多模态工具使用、GUI agent,以及纯文本编码和 Claw 任务。基准测试包括 Design2Code、Flame-VLM-Code、Vision2Web、BrowseComp-VL、MMSearch、AndroidWorld、WebVoyager、CC-Bench-V2、PinchBench、ClawEval 和 ZClawBench。
  • 多模态编码、工具使用与 GUI agent: GLM-5V-Turbo 在编码、工具使用和 GUI agent 基准测试中取得了强劲的多模态结果,涵盖 UI-to-code、视觉网站开发、多模态搜索、视觉对齐 QA 和基于环境的交互。评测涵盖多模态编码、多模态工具使用和 GUI agent 任务。
  • 纯文本编码与 Claw: 该模型在纯文本编码基准测试中仍保持良好表现,表明加入视觉能力并不会实质性削弱其底层编码性能。CC-Bench-V2 评估 Claude Code 在 CC-Backend、CC-Frontend 和 CC-Repo-Exploration 上的表现。
  • 纯文本编码与 Claw: GLM-5V-Turbo 能有效迁移到具备视觉能力的 agent 框架中,在面向执行的评测里原生感知屏幕内容并更有效地据此行动。在 Claw agent 框架内的 PinchBench、ClawEval 和 ZClawBench 上均报告了强劲结果。

6 仍待解决的挑战

当前主要挑战包括促成真正的智能体策略涌现、管理长时程多模态上下文,以及理解模型能力如何与周围 harness 共同塑造。这些问题涉及探索、信息保留和系统级设计,而非孤立的能力提升。

  • 总体挑战: 因此,未来的智能体模型开发需要解决策略涌现、长时程多模态上下文管理以及模型–harness 设计中的相互关联问题。这些挑战被认为比孤立的能力提升更为核心。
  • 策略涌现: 智能体开发必须超越在熟悉推理和行动路径上的局部改进,转向真正更优策略的涌现。手工构造或强过滤的冷启动轨迹会限制探索;更高的轨迹多样性有助于 reinforcement learning 发现邻近的改进变体,并可能是策略涌现的必要条件。
  • 多模态上下文管理: 长时程智能体难以保留多模态上下文,因为图像,尤其是视频,比文本更激进地消耗上下文预算。随着上下文增长,丢弃较早的视觉观测可以节省预算,但也可能丢失后续推理、规划或验证所需的信息。
  • 模型–harness 交互: 智能体能力越来越由模型及其 harness 共同塑造,其中包括任务分解、工具使用、记忆机制和验证循环。这扩大了设计空间,但也使开发复杂得多,因为系统行为不仅取决于模型,还取决于周围的 harness。

7 贡献

本节致谢参与该工作的贡献者、技术负责人和学术顾问。贡献者姓名按名字的逆字母顺序列出。

  • 贡献者按名字的逆字母顺序从 Z 到 A 列出。
  • 核心贡献者包括 Ziyang Pan、Zhen Yang、Yuting Wang、Yue Wang,以及其他列出的贡献者。
  • Wenyi Hong 和 Xiaotao Gu 被确定为技术负责人;Peng Zhang、Debing Liu、Bin Xu、Juanzi Li、Minlie Huang、Yuxiao Dong 和 Jie Tang 为学术顾问。

A 演示案例

本节通过涵盖多种场景的典型定性示例,展示 GLM-5V-Turbo 的能力与优势。

  • A 演示案例: 通过典型定性示例展示 GLM-5V-Turbo 的能力。
  • A 演示案例: 这些演示涵盖多种场景,定性地展现了模型的优势。

A.1 与智能体系统和技能结合

GLM-5V-Turbo 在股票分析、基于 GUI 的网页复现和由 PRD 驱动的网站生成等智能体系统与技能中得到展示。这些案例表明,该模型能够通过集成式智能体工作流收集信息、整理资源、生成报告并实现网站。

  • 股票分析: GLM-5V-Turbo 将 OpenClaw 与 glmv-stock-analyst 技能结合,用于收集多源信息并生成专业的 NVIDIA 股票分析报告。报告包括技术分析、基本面分析、分析师情绪和行动计划。
  • 网页复现: 借助 Claude Code 和 glmv-web-replication 技能,GLM-5V-Turbo 通过 GUI 探索目标网站、收集资源,并用 HTML 复现页面。任务要求具备较高的视觉保真度和功能完整性。
  • PRD 驱动的网站生成: 借助 Claude Code 和 glmv-prd-to-app 技能,GLM-5V-Turbo 根据产品需求文档和项目内容,在工作目录中设计并实现网站。展示的任务根据 PRD 和 act 文件夹内容,在 ./act_workspace 下构建项目。

A.2 多模态编码

GLM-5V-Turbo 展示了覆盖全栈网站创建、视觉界面重构、智能体资产检索,以及研究内容网站或幻灯片生成的多模态编码能力。这些示例表明,该模型能够将高层请求或视觉参考转化为可执行且视觉组织清晰的界面和演示文稿。

  • 全栈网站生成: 该模型能够生成完整的全栈电子商务网站,包含多个功能页面、深色模式、视差滚动和动态结账功能。演示网站包含欢迎页、购物页、品牌故事页和单页结账界面,并支持运费计算与地址建议。
  • UI 复现: 给定参考图像后,GLM-5V-Turbo 能够用可执行的网页代码重构移动端情绪追踪界面,并以风格一致的页面和交互对其进行扩展。该示例同时涵盖界面复现,以及合理的后续页面或交互模拟。
  • 智能体 UI 复现: 在智能体 UI 复现任务中,该模型能够联合理解截图、检索其中的图像资产,并用 HTML 重构网页。这展示了视觉理解、资产收集和高保真界面复现之间的协同能力。
  • 研究内容生成: 该模型还能够将研究论文转化为视觉组织清晰的英文网站,以及交错呈现文本和图表、可直接用于演示的 PowerPoint 幻灯片组。这些示例围绕 GLM-5 和 Attention Is All You Need 总结研究动机、方法或架构、系统设计和关键发现。

A.3 多模态深度研究

GLM-5V-Turbo 展示了如何为 Apple Wearables 专题报告收集权威、高质量的图像素材,并以图文交错的英文插图形式呈现。

  • A.3 多模态深度研究: GLM-5V-Turbo 通过官方 z.ai 网站为 Apple Wearables 专题报告收集图像素材。示例为每张选定图像标注了原始来源。
  • A.3 多模态深度研究: 该流程要求所收集素材来自权威来源,并具有较高图像质量。每张选定图像都附有其原始来源的引用。
  • A.3 多模态深度研究: 输出是一份将图像与说明性文字交错编排的英文插图报告。这些格式与语言要求属于演示查询的一部分。

A.4 基于文档的写作 … A.8 空间推理

这些示例展示了基于文档的写作、多语言 OCR 与转写、多模态视觉搜索、视频跟踪、视觉定位以及空间推理,涵盖多样的输入和输出格式。

  • A.4 基于文档的写作: 模型阅读一份 103 页的中文北京旅行指南,并为外国人撰写总结十个必游景点的评论。
  • A.5 OCR 与文档解析: 模型识别图像中的文字及其语言,并将包含文本、表格和图表的教材页面转写为 Markdown。
  • A.6 视觉搜索与推理: 模型结合图像信息与多模态搜索工具,回答复杂问题,并根据总价、评价和体验建议对酒店进行排序。
  • A.7 视觉识别与定位: 模型通过视频跟踪篮球运动员和指定物体,逐秒生成带有边界框且标签在全局保持一致的结果。
  • A.7 视觉识别与定位: 模型对人物、姓名、手写答案、书写错误和电路板元件进行定位,包括基于搜索的元件识别以及与 H100 的比较。
  • A.7 视觉识别与定位: 模型使用 9 个数值表示中心、尺寸和旋转角度,并以 JSON 输出家具和植物的 3D 边界框。
  • A.8 空间推理: 模型通过数手指并以 [[x,y]] 格式标记每根手指的位置,执行空间计数与定位。
Loading 2604.26752v3…