• 简体中文
  • 案例展示

    本文介绍了跨平台 GUI Agent、E2E 测试和社区实践等案例。

    跨平台 GUI Agent 案例

    Web

    Prompt:填写 GitHub 注册表单并通过表单校验,但不要提交。

    Midscene 会为每次任务生成完整报告,供开发者回溯操作过程。上述 Demo 的报告请参考:report.html

    iOS

    Prompt : 打开美团,帮我下单一杯 manner 超大杯冰美式咖啡,要加浓少冰喔,到结算页面让我确认

    查看此次任务的完整报告:report.html

    Prompt : Open Twitter and auto-like the first tweet by @midscene_ai

    查看此次任务的完整报告:report.html

    Android

    Prompt : 打开懂车帝,搜索 su7 车型,查看参数配置

    查看此次任务的完整报告:report.html

    Prompt : Open the Booking App, search for a hotel in Tokyo for four adults on Christmas, with a score of 8 or above.

    查看此次任务的完整报告:report.html

    HarmonyOS

    Prompt :打开设置,滚动查找「关于手机」,查看设备信息。

    查看此次任务的完整报告:report.html

    桌面端

    macOS

    Prompt:通过 Safari 发一条推文宣传 Midscene 支持 AutoGLM,要求如下:

    1. 文案内容:Midscene now supports AutoGLM!
    2. 媒体内容:使用下载文件夹里的 AutoGLM 视频!

    查看此次任务的完整报告:report.html

    Prompt:打开 Google 查询圣何塞明天天气温度

    查看此次任务的完整报告:report.html

    Windows

    Prompt:打开 Sauce Demo 电商网站,登录并添加商品到购物车

    查看此次任务的完整报告:report.html

    Linux

    Prompt:打开 TodoMVC,添加多个任务并筛选

    查看此次任务的完整报告:report.html

    E2E 测试场景

    懂车帝 App:Doubao Seed 2.1 Turbo

    以下 5 个用例使用 doubao-seed-2-1-turbo-260628,测试 Android 端懂车帝 App 的排行榜筛选功能。测试设备分辨率为 720 × 1600。

    用例 1:销量榜功能测试

    • 测试内容: 验证销量榜在选择“轿车 + 上上个月 + 燃油车 + 18–25 万”时,组合筛选和结果展示是否正确
    • 步骤数: 8 / 16(脚本 / 模型调用)
    • Token 量: 输入 126,935(缓存 89,760)/ 输出 3,109
    • 费用: ¥0.203
    • 测试报告: 查看报告

    用例 2:销量榜组合筛选测试

    • 测试内容: 验证销量榜在选择“SUV + 上个月 + 插电式混动”时,组合筛选和结果展示是否正确
    • 步骤数: 4 / 14(脚本 / 模型调用)
    • Token 量: 输入 137,310(缓存 100,000)/ 输出 2,472
    • 费用: ¥0.200
    • 测试报告: 查看报告

    用例 3:新能源榜功能测试

    • 测试内容: 验证新能源榜在选择“SUV + 近半年 + 纯电动 + 18–25 万”时,组合筛选和结果展示是否正确
    • 步骤数: 8 / 18(脚本 / 模型调用)
    • Token 量: 输入 149,996(缓存 103,896)/ 输出 6,279
    • 费用: ¥0.283
    • 测试报告: 查看报告

    用例 4:降价榜功能测试

    • 测试内容: 验证降价榜在选择“MPV + 近一年 + 新能源”并设置 15–30 万自定义价格时,组合筛选和结果展示是否正确
    • 步骤数: 13 / 29(脚本 / 模型调用)
    • Token 量: 输入 253,991(缓存 174,176)/ 输出 8,203
    • 费用: ¥0.448
    • 测试报告: 查看报告

    用例 5:榜单切换与筛选重置测试

    • 测试内容: 验证从销量榜切换至新能源榜时关联筛选条件是否正确重置,并验证后续筛选及恢复默认状态是否正确
    • 步骤数: 16 / 28(脚本 / 模型调用)
    • Token 量: 输入 217,283(缓存 151,848)/ 输出 5,688
    • 费用: ¥0.357
    • 测试报告: 查看报告
    Doubao 计价口径

    输入单价按 $0.423 / M Tokens、缓存读取单价按 $0.08452 / M Tokens、输出单价按 $2.113 / M Tokens 计算,人民币费用按 $1 ≈ ¥6.8 估算。5 个用例平均消耗约 182,253 Token,平均费用约 ¥0.298。以上数据仅代表本次测试,实际费用会随任务复杂度、缓存命中率和模型价格变化。

    Reddit App:Qwen 3.7 Plus

    以下 2 个用例使用 qwen/qwen3.7-plus,测试 Android 端 Reddit App 的社区搜索、加入和帖子点赞功能。测试设备分辨率为 720 × 1600。

    用例 1:搜索并加入 Midscene 社区

    • 测试内容: 搜索 Midscene,打开准确的 r/midscene 社区,按需加入并验证账号已处于加入状态
    • 步骤数: 7 / 17(脚本 / 模型调用)
    • Token 量: 输入 147,127(缓存 34,816)/ 输出 3,418
    • 费用: ¥0.289
    • 测试报告: 查看报告

    用例 2:点赞 Midscene 社区首篇帖子

    • 测试内容: 打开准确的 r/midscene 社区,按需点赞帖子列表中的首篇帖子,并验证其已处于点赞状态
    • 步骤数: 6 / 12(脚本 / 模型调用)
    • Token 量: 输入 103,231(缓存 8,704)/ 输出 3,142
    • 费用: ¥0.237
    • 测试报告: 查看报告
    Qwen 计价口径

    输入单价按 $0.32 / M Tokens、缓存读取单价按 $0.064 / M Tokens、输出单价按 $1.28 / M Tokens 计算,人民币费用按 $1 ≈ ¥6.8 估算。2 个用例平均消耗约 128,459 Token,平均费用约 ¥0.263。以上数据仅代表本次测试,实际费用会随任务复杂度、缓存命中率和模型价格变化。

    社区案例

    有社区开发者成功基于 Midscene 与任意界面集成的特性,扩展了机械臂 + 视觉模型 + 语音模型等模块,运用于车机大屏测试场景中。