Computer Use
AI操作电脑从演示变成商用功能,短任务已超人类,长流程完成率仅一到两成。本文给出API、RPA、Computer Use与人工的四步选择顺序。

一句话看懂:Computer Use让AI通过截屏“看”屏幕,再输出鼠标点击和键盘输入“做”操作,像人一样使用网页和桌面软件。它不需要目标系统提供API,只要人能操作的界面,AI原则上都能操作。但决定能不能用它的是任务长度和动作可逆性:十几步以内、结果能核对、出错可重来的任务已可交给它;一小时以上的长流程完整完成率仍只有一到两成,不可逆动作必须由人确认。

从“回答”到“操作”:Computer Use是怎么工作的

过去的AI主要做三件事:回答、生成、建议,最后一步由人来完成。Computer Use让AI自己完成最后一步,它的工作方式是一个循环:

  1. 截取当前屏幕画面;
  2. 模型判断画面上有什么、下一步该做什么;
  3. 输出一个具体动作,例如“点击坐标(512, 300)的按钮”或“在输入框里输入订单号”;
  4. 执行动作后再次截屏,检查结果,进入下一轮。

Anthropic的开发者文档把这项能力概括为四类操作:截屏查看、鼠标控制、键盘输入,以及由此组合出的桌面自动化。

Computer Use和RPA有什么区别

两者都通过界面操作软件,区别在于“怎么知道下一步做什么”。RPA按预先录制或编写的脚本执行,每一次点击的位置和顺序都是固定的;Computer Use拿到的是一个目标,由模型看着屏幕自己决定步骤。

维度 传统RPA Computer Use
指令形式 逐步写死的脚本 自然语言描述的目标
界面改版后 脚本通常失效,需要重新开发 多数情况下能自行适应
遇到意外弹窗或异常 大多中断报错 能尝试判断和处理,但不一定正确
执行速度 快,接近程序速度 慢,每一步都要截屏和推理
单次执行成本 低 较高(每步都要调用模型)
结果的可预测性 高,同样输入得到同样结果 较低,同一任务两次执行的路径会有差异
适合的任务 高频、稳定、大批量 长尾、多变、中低频

两者不是替代关系。流程稳定、每天执行上千次,RPA更便宜也更可控;流程经常变、每种情况只出现几十次,写RPA脚本不划算,Computer Use更合适。

为什么Agent需要Computer Use

Agent要完成真实工作,就要进入企业的各种系统。理想的做法是通过API或MCP调用,但企业里有不少系统没有可用的接口:老旧的ERP界面、政府和银行的网页门户、供应商后台、只能在桌面客户端里操作的行业软件。微软在Copilot Studio中推出Computer Use时,给出的定位就是在没有API可以直连系统时,让Agent仍然能完成任务:人能用的应用,Agent也能用。

因此,Computer Use在Agent的工具箱里扮演的是“最后一公里”的角色:API能解决的用API,解决不了的,由Computer Use接住。这与已经用飞书、钉钉或企业微信,怎样判断 AI 办公 Agent 真正接进了工作流?中讨论的办公Agent接入逻辑一致。

API自动化和GUI自动化分别适合什么

维度 API自动化(含MCP) GUI自动化(RPA / Computer Use)
前提 系统提供接口 有可操作的界面即可
速度 毫秒到秒级 秒到分钟级
稳定性 高,接口有版本约定 受界面改版、弹窗、网络延迟影响
权限控制 可以细到某个接口、某个字段 通常继承登录账号的全部权限
审计 每次调用有结构化日志 需要额外录屏或截图留痕
适合 核心业务、高频交易、数据同步 无接口系统、临时性和长尾任务

表中“权限控制”一行值得管理者特别注意:Computer Use登录一个系统后,能做的就是这个账号在界面上能做的一切,很难像API那样只开放某一个动作。

今天已经能做什么,还不能稳定做什么

公开测试数据给出了一个清楚的分界。OSWorld是一个在真实桌面环境中执行369项任务的测试集,原始论文中人类完成率为72.36%。到2026年7月,前沿AI在其校验版OSWorld-Verified上的得分已超过85%。但在2026年发布的OSWorld 2.0上,任务改成接近真实职业场景的长流程,人类完成一项任务的中位时间约1.6小时,最好的AI配置完整完成率约为20.6%(来源:arXiv 2607.26041,2026-07)。

不同来源对OSWorld 2.0的数字并不一致:另外两份2026年的技术报告引用官方榜单时,列出的前沿模型完整完成率在13%到14%之间(来源:arXiv 2609.00028、arXiv 2607.28227)。差异主要来自测试时间、模型版本和工具配置不同。无论取哪个数字,结论相同:长流程的完整完成率在一到两成之间,与短任务的表现差距很大。另外,OSWorld-Verified的榜单成绩是“模型加工具加策略”的系统成绩,不同提交的步数上限和权限设置并不相同,不宜直接当作采购依据。

下表是Runwise根据上述测试结果做的归纳,不是OSWorld本身的任务分类:

用同样的框架诊断你的业务

如果你正在评估哪些流程可以交给Computer Use,与其凭感觉试错,不如用AI顾问把任务长度、可逆性和权限要求逐项过一遍,先筛出真正适合的场景。

免费体验 Upskill AI 顾问 →

任务类型 今天的状态 例子
单一应用、十几步以内、结果可核对 已经可以稳定使用 从网页门户下载对账单、在表格中整理数据、填写标准表单
跨两三个应用、步骤中等 可用,但需要抽检 从邮件附件提取信息录入系统、比对两个系统里的订单状态
跨多个应用、一小时以上的长流程 还不能稳定完成 完整的月结对账、跨部门的项目资料整理
涉及登录验证、支付、对外发送 技术上能做,不应全自动 付款、提交申报、给客户发邮件

OSWorld 2.0记录的失败原因集中在四类:中途丢失约束条件、漏掉过程中出现的信息、跳过核对步骤、无法从隐藏状态中恢复。这些正是企业长流程里最常见的情形。这与做了 300 个 AI 场景,CFO 为什么还不买单?中提到的AI落地困境高度相关。

哪些办公室流程最适合Computer Use

适合优先尝试的流程,通常同时满足四个条件:没有API、步骤不长、每次结果能核对、出错可以重来。例如:

立即登录阅读全文
登录或注册即可解锁全站内容,即表示你理解并同意 服务协议 与 隐私政策
  • 从银行、税务、社保、供应商等网页门户下载文件和对账单;
  • 在没有接口的老系统里查询信息并汇总;
  • 把邮件、PDF中的信息录入内部系统的草稿状态,由人确认后提交;
  • 软件界面的回归测试。

哪些任务风险太高,不能全自动

Computer Use有一个API自动化没有的风险:它会阅读屏幕上的所有内容,而屏幕内容有相当一部分来自外部网页、邮件和文档。Anthropic在官方文档中明确提示,Computer Use的风险在接触互联网时会上升,在某些情况下,网页或图片中的指令会覆盖用户的指令,导致模型出错;建议在权限最小的专用虚拟机或容器中运行,并对涉及现实后果的操作要求人工确认。

以下几类任务不应全自动:

  • 资金操作:付款、转账、退款;
  • 对外产生约束的动作:提交申报、签署、给客户或监管机构发送信息;
  • 不可逆的数据操作:删除记录、修改主数据;
  • 身份验证:输入密码、短信验证码、人脸识别。

中国市场已经有过一次公开的边界测试。2025年12月,搭载豆包手机助手的工程样机上市后,用户用它自动操作微信时出现账号被强制下线,淘宝和部分银行App也出现登录或支付受限的情况;豆包随后下线了操作微信的功能,并表示遇到支付、身份验证等环节会暂停,由用户接管(来源:澎湃新闻,2025-12-03;虎嗅,2025-12)。这说明,AI操作界面除了技术问题,还要过目标平台的风控规则。企业在规划Computer Use时,要把“对方系统是否允许自动化操作”列为前置检查项。这与下属自己搭了个能发客户邮件的 Agent,你批不批?六类动作的授权决策表中讨论的授权边界问题一脉相承。

被低估的二阶影响:自动化的阻力从“没有接口”转到“权限和对方的规则”

过去一个流程不能自动化,最常见的理由是“那个系统没有接口”。Computer Use让这个理由失效后,阻力会转到两个新地方(Runwise判断)。

第一是内部权限。Computer Use用一个账号登录系统后,能做的就是这个账号能做的一切。企业原来按“人”设计的账号权限,大多比单个自动化任务需要的范围宽得多,需要为Agent重新切分出窄权限账号。

第二是外部平台的规则。银行、电商、社交平台和政务网站都有识别脚本操作的风控措施,豆包手机助手的案例已经证明,对方可以随时让AI的操作失效。依赖外部网站的Computer Use流程,要预留“被对方拦截”时的人工替代方案。

Human-in-the-loop应该放在哪里

人工确认不需要放在每一步,否则Computer Use就失去了意义。建议放在四个节点:

  1. 登录和身份验证:由人完成,或使用专门为Agent开设、权限受限的账号。
  2. 提交之前:Agent把表单填好、停在提交按钮前,由人确认后提交。
  3. 对外发送之前:邮件、消息、申报材料,发送前人工确认。
  4. 异常出现时:Agent判断不确定或页面与预期不符时,暂停并交给人,而不是自己尝试。

一个流程该用API、RPA、Computer Use还是人工

可以按下面的顺序判断:

  1. 系统有稳定的API或MCP Server吗?有,用API自动化。它最快、最稳、权限最容易控制。
  2. 没有API,但流程稳定、批量大吗?是,用RPA。每天执行上千次的固定流程,RPA的成本和可预测性都优于Computer Use。
  3. 没有API,流程多变或量不大,且步骤不长、结果能核对吗?是,用Computer Use,并在提交和对外发送前设置人工确认。
  4. 以上都不满足,或者动作不可逆、影响重大?由人执行,AI可以准备材料和草稿。

给管理者的四条判断

  1. 按任务长度选场景,不按部门选场景。先挑十几步以内、结果能核对的任务,长流程等测试数据和内部试点都证明可行后再推进。
  2. 给Computer Use开专用账号和专用环境。不用员工本人的账号,运行在隔离的虚拟机或托管浏览器里,账号权限只覆盖任务所需。
  3. 把“停在提交前”作为默认设计。起步阶段,Agent负责把事情做到最后一步之前,最后一步由人完成。
  4. 能改API的系统,优先改API。Computer Use是没有接口时的补位方案,不是长期架构。Runwise的判断是:一个流程如果每年要跑上万次,改造接口的投入通常更划算,具体取决于系统改造的报价。这与AI产品怎么定价?席位、用量、Credit、结果收费,2026年该怎么选中讨论的AI成本与价值逻辑相通。

常见问题(FAQ)

Computer Use是什么?

Computer Use是AI模型通过截取屏幕画面来“看”,再输出鼠标点击、键盘输入等动作来“做”,像人一样操作网页和桌面软件,无需目标系统提供API。

Computer Use和RPA有什么区别?

RPA按预先录制的脚本执行,界面改版后常失效;Computer Use由模型看着屏幕自主决定步骤,能适应界面变化,但速度更慢、成本更高、结果可预测性更低。

Computer Use现在能稳定完成哪些任务?

单一应用、十几步以内、结果可核对的任务已可稳定使用,如下载对账单、整理数据、填写标准表单;跨多个应用、一小时以上的长流程完成率仅一到两成。

哪些任务不适合用Computer Use全自动?

资金操作、对外产生约束的动作、不可逆的数据操作、身份验证等高风险任务不应全自动,必须在提交或发送前设置人工确认。

企业如何选择API、RPA、Computer Use还是人工?

有稳定API用API;无API但流程稳定批量大用RPA;无API且流程多变步骤不长用Computer Use;动作不可逆或影响重大则保留人工执行。

想把这套打法用到你自己的业务上?

如果你们团队已经有一些RPA资产,或者正在纠结某个流程该用API、RPA还是Computer Use,可以用我们的AI顾问做一次快速诊断,把选型顺序和风险点理清楚。

💎 核心承诺:先诊断、再合作,思路不对不推进。

专属咨询热线:400 822 8832

扫码添加顾问 Ben 企业微信

扫码加顾问 Ben 评估
点个赞鼓励一下作者吧~
点赞
收藏
请用微信扫码分享哦~
分享
加入AI创新
专业交流群

免费送7行业30+案例
及时看最新直播/研报

勿删,用于自定义目录加锚点,隐藏即可

相关文章推荐
点赞
收藏
请用微信扫码分享哦~
分享

还差一步
扫码锁定入群名额

加我时请备注下方群名

创新战略交流群

免费送“2024新业务孵化/战略创新指南”

B2C增长创新群

免费送“10大消费行业50个增长案例汇总”

B2B增长创新群

免费送“7大B2B行业30个增长案例汇总”

AI应用创新群

免费送“20篇AI研报+110套GPT提示”
关闭按钮
欢迎来到Runwise即能创新社区!
登录装饰图,三个人围坐在电脑前,对某个灵感进行沟通和讨论
已有账号?
电话咨询
7x24热线,欢迎致电咨询
微信咨询
扫码添加专家微信
扫码添加专家微信
享专家1V1咨询