• 简体中文
  • 模型策略

    Midscene 的模型策略有两个目标。一是用纯视觉理解用户实际看到的界面,让 UI 自动化不受渲染技术限制。二是提供可选的多种模型组合能力,应对复杂场景。

    基于可见界面的纯视觉路线

    大模型驱动的 UI 自动化需要完成任务规划和元素定位。业界主要有两种定位方式:结合 DOM 与截图标注,或直接基于截图进行纯视觉定位。Midscene 采用纯视觉路线——由模型直接分析界面截图来定位目标元素,执行 UI 操作和元素定位时不依赖 DOM 或额外标注。

    这一选择让用户看到的界面成为自动化的唯一依据,为 Midscene 带来以下优势:

    • 以一致的方式操作浏览器 Canvas、Android、iOS 和桌面应用等不同类型的界面。
    • 摆脱 UI 渲染技术栈的限制,无需维护 Selector 或额外的界面标注。
    • 校验颜色、高亮状态和布局等用户实际看到的效果。
    • 更接近真实用户操作软件的方式,发现潜在的交互设计问题
    • Token 消耗量只与页面分辨率和任务复杂度相关,不会随着页面结构(如 DOM 数量)膨胀而膨胀

    使用视觉路径也有明确的不足。纯视觉定位要求模型具备视觉理解能力,只能使用指定的、对 GUI 操作比较稳定的模型,而不是任意 LLM。Midscene 用更高的模型能力要求,换取跨平台的一致性和更低的界面维护成本。

    Midscene 在数据提取或页面理解场景中,仍可按需附带 DOM 信息。具体参数请参考 API Reference

    组合多种模型应对复杂场景

    Midscene 默认使用一个多模态模型,完成任务规划、元素定位和页面理解等工作。这条默认路线可以覆盖大多数 UI 自动化场景,也让用户用最少的配置开始使用 Midscene。

    当复杂规划、数据提取或页面理解对模型能力有更高要求时,可以在默认模型的基础上增加 Planning 模型和界面理解(Insight)模型。不同模型按照各自擅长的能力分工,共同完成一条自动化任务链路:

    模型在组合中的作用
    默认模型提供基础能力,负责元素定位(Locate),以及未交给 Planning 或 Insight 模型的其他任务
    Planning 模型增强复杂目标、多步骤任务和分支场景中的规划能力
    Insight 模型增强数据提取、断言和页面理解能力

    这种协作方式可以扩展 Midscene 处理复杂任务的能力,但也可能增加任务耗时和 Token 消耗。建议从默认模型开始,仅在遇到明确的能力瓶颈时引入专用模型。

    下一步

    本文只介绍 Midscene 的模型理念和选择原则。配置方法请参考可选:配置多个模型。如果任务效果不理想,请参考模型调试与可观测性定位问题。