案例展示
本文介绍了跨平台 GUI Agent、E2E 测试和社区实践等案例。
跨平台 GUI Agent 案例
Web
Prompt:填写 GitHub 注册表单并通过表单校验,但不要提交。
Midscene 会为每次任务生成完整报告,供开发者回溯操作过程。上述 Demo 的报告请参考:report.html
iOS
Prompt : 打开美团,帮我下单一杯 manner 超大杯冰美式咖啡,要加浓少冰喔,到结算页面让我确认
查看此次任务的完整报告:report.html
Prompt : Open Twitter and auto-like the first tweet by @midscene_ai
查看此次任务的完整报告:report.html
Android
Prompt : 打开懂车帝,搜索 su7 车型,查看参数配置
查看此次任务的完整报告:report.html
Prompt : Open the Booking App, search for a hotel in Tokyo for four adults on Christmas, with a score of 8 or above.
查看此次任务的完整报告:report.html
HarmonyOS
Prompt :打开设置,滚动查找「关于手机」,查看设备信息。
查看此次任 务的完整报告:report.html
桌面端
macOS
Prompt:通过 Safari 发一条推文宣传 Midscene 支持 AutoGLM,要求如下:
- 文案内容:Midscene now supports AutoGLM!
- 媒体内容:使用下载文件夹里的 AutoGLM 视频!
查看此次任务的完整报告:report.html
Prompt:打开 Google 查询圣何塞明天天气温度
查看此次任务的完整报告:report.html
Windows
Prompt:打开 Sauce Demo 电商网站,登录并添加商品到购物车
查看此次任务的完整报告:report.html
Linux
Prompt:打开 TodoMVC,添加多个任务并筛选
查看此次任务的完整报告:report.html
E2E 测试场景
懂车帝 App:Doubao Seed 2.1 Turbo
以下 5 个用例使用 doubao-seed-2-1-turbo-260628,测试 Android 端懂车帝 App 的排行榜筛选功能。测试设备分辨率为 720 × 1600。
用例 1:销量榜功能测试
- 测试内容: 验证销量榜在选择“轿车 + 上上个月 + 燃油车 + 18–25 万”时,组合筛选和结果展示是否正确
- 步骤数: 8 / 16(脚本 / 模型调用)
- Token 量: 输入 126,935(缓存 89,760)/ 输出 3,109
- 费用: ¥0.203
- 测试报告: 查看报告
用例 2:销量榜组合筛选测试
- 测试内容: 验证销量榜在选择“SUV + 上个月 + 插电式混动”时 ,组合筛选和结果展示是否正确
- 步骤数: 4 / 14(脚本 / 模型调用)
- Token 量: 输入 137,310(缓存 100,000)/ 输出 2,472
- 费用: ¥0.200
- 测试报告: 查看报告
用例 3:新能源榜功能测试
- 测试内容: 验证新能源榜在选择“SUV + 近半年 + 纯电动 + 18–25 万”时,组合筛选和结果展示是否正确
- 步骤数: 8 / 18(脚本 / 模型调用)
- Token 量: 输入 149,996(缓存 103,896)/ 输出 6,279
- 费用: ¥0.283
- 测试报告: 查看报告
用例 4:降价榜功能测试
- 测试内容: 验证降价榜在选择“MPV + 近一年 + 新能源”并设置 15–30 万自定义价格时,组合筛选和结果展示是否正确
- 步骤数: 13 / 29(脚本 / 模型调用)
- Token 量: 输入 253,991(缓存 174,176)/ 输出 8,203
- 费用: ¥0.448
- 测试报告: 查看报告
用例 5:榜单切换与筛选重置测试
- 测试内容: 验证从销量榜切换至新能源榜时关联筛选条件是否正确重置,并验证后续筛选及恢复默认状态是否正确
- 步骤数: 16 / 28(脚本 / 模型调用)
- Token 量: 输入 217,283(缓存 151,848)/ 输出 5,688
- 费用: ¥0.357
- 测试报告: 查看报告
输入单价按 $0.423 / M Tokens、缓存读取单价按 $0.08452 / M Tokens、输出单价按 $2.113 / M Tokens 计算,人民币费用按 $1 ≈ ¥6.8 估算。5 个用例平均消耗约 182,253 Token,平均费用约 ¥0.298。以上数据仅代表本次测试,实际费用会随任务复杂度、缓存命中率和模型价格变化。
Reddit App:Qwen 3.7 Plus
以下 2 个用例使用 qwen/qwen3.7-plus,测试 Android 端 Reddit App 的社区搜索、加入和帖子点赞功能。测试设备分 辨率为 720 × 1600。
用例 1:搜索并加入 Midscene 社区
- 测试内容: 搜索 Midscene,打开准确的
r/midscene社区,按需加入并验证账号已处于加入状态 - 步骤数: 7 / 17(脚本 / 模型调用)
- Token 量: 输入 147,127(缓存 34,816)/ 输出 3,418
- 费用: ¥0.289
- 测试报告: 查看报告
用例 2:点赞 Midscene 社区首篇帖子
- 测试内容: 打开准确的
r/midscene社区,按需点赞帖子列表中的首篇帖子,并验证其已处于点赞状态 - 步骤数: 6 / 12(脚本 / 模型调用)
- Token 量: 输入 103,231(缓存 8,704)/ 输出 3,142
- 费用: ¥0.237
- 测试报告: 查看报告
输入单价按 $0.32 / M Tokens、缓存读取单价按 $0.064 / M Tokens、输出单价按 $1.28 / M Tokens 计算,人民币费用按 $1 ≈ ¥6.8 估算。2 个用例平均消耗约 128,459 Token,平均费用约 ¥0.263。以上数据仅代表本次测试,实际费用会随任务复杂度、缓存命中率和模型价格变化。
社区案例
有社区开发者成功基于 Midscene 与任意界面集成的特性,扩展了机械臂 + 视觉模型 + 语音模型等模块,运用于车机大屏测试场景中。

