GUI Agent与Computer Use
核心范式:AI 通过"看屏幕"直接操作图形界面——不靠 API、不解析 DOM,像人一样点击、输入、滚动。
技术路线对比:
纯视觉:截图 → VLM 理解 → 输出坐标动作(click/type/scroll),跨平台泛化强
混合:DOM/accessibility tree + 视觉兜底,网页场景更稳(OpenClaw 类)
关键能力 = GUI Grounding(像素级定位)+ System-2 推理(先思考再动作)
标杆数据:
字节 UI-TARS-2:OSWorld 47.5%(约为 Claude Computer Use 22% 的两倍),AndroidWorld 73.3%
ScreenSpot-V2 定位精度 94.2%;游戏环境达人类 60% 水平
OpenAI Operator 在纯网页任务(WebVoyager 87%)仍领先
落地要点:
私密场景选本地部署(UI-TARS 7B 约 16GB 显存)
生产架构:MCP 集成工具 + 截图反馈循环 + 反思式纠错
风险:CAPTCHA 破解、误操作敏感界面——需操作白名单与人工确认关键步骤
