先说一个真实的卡壳场景

上个月,我媳妇让我帮她整理一个出差报销单。公司内部系统是那个老得掉牙的 OA,不支持 Excel 导入,只能一条一条手工录入。我坐在电脑前录到第八条的时候,脑子突然冒出一个念头:这种重复点击的活儿,能不能甩给 AI 干?于是那个下午我试了 OpenAI 的 Operator、Anthropic 的 Computer Use,还翻出了吃灰很久的 Hermes Agent。折腾完发现一条清晰的分界线:不是所有 Agent 都适合你,但有一类「不用写代码」的方案确实能救急。这篇文章我把三天的实测细节全抖出来,包括我踩的坑、看到的报错、以及最后的选型建议。

先说结论:Operator 适合「云端托管型」任务,你把浏览器交给它,它替你点;Computer Use 适合「本地+桌面」任务,它模拟你的鼠标键盘;Hermes Agent 则更像个「自学成才」的本地管家,配置好之后能自己调工具。三个都试过之后,我明确的建议是:先想清楚你的任务发生在浏览器里还是本地软件里,再决定用哪个。

Operator 实测:把浏览器交给 OpenAI 的云端 Agent

我用的 Operator 是 ChatGPT Pro 订阅里带的,版本是 2 月的那个公开预览版。登录之后界面是一个独立的浏览器窗口,你可以输入一个任务描述,比如「打开携程,查下周五上海到北京的高铁票,选最早一班,把价格截图发我」。它会在云端开一个真正的 Chromium 实例,然后一步步操作,每一步都有截图和文字说明。

我第一次跑的是「帮我填一个 Google Form 表单」,里面有五个字段,包括姓名、邮箱、日期选择器、下拉菜单和一段备注。Operator 的表现出乎意料地好,它居然能理解「日期选择器要点击展开再选」这种隐含的交互逻辑,整个流程两分钟跑完,没有出错。但第二个任务就翻车了——我让它登录一个需要短信验证码的网站。它弹出了验证码输入框,然后停住了,界面上显示「等待用户介入」。这时候你需要在侧边栏手动输入验证码,它才能继续。也就是说,Operator 不是全自动,遇到验证码、登录、支付这类环节,它需要你介入。

还有个细节:Operator 是云端跑的,意味着它访问的网站看到的 IP 是 OpenAI 的服务器 IP。有些网站对数据中心 IP 有风控,比如我试的某个银行网银,直接弹出了「异常访问」的提示。这个坑很现实,如果你要操作的是金融类、政务类网站,Operator 大概率会被拦下来。另外,Operator 的会话有超时限制,免费用户基本用不了,Pro 用户每次会话最长大概 20 分钟,超时它会把当前状态保存成截图,你可以下次继续。

我实际跑的时候还遇到一个报错:「The action was not allowed by the website's robots.txt」。这是 Operator 内置了 robots.txt 检测,某些网站明确禁止自动化访问时,它不会硬闯。这个限制有时候很烦,因为很多小网站的 robots.txt 写得很宽泛,但 Operator 宁可保守也不冒险。如果你想让它操作一个你没试过的网站,建议先手动开一遍,确认没有验证码和反爬机制,再交给 Operator。

Computer Use 实测:让 Claude 学会用你的鼠标

Computer Use 是 Anthropic 在 Claude 3.5 Sonnet 时代推出的功能,我测试时用的是 claude-3-5-sonnet-20241022 这个版本,API 接口里加了一个 computer 工具类型。它的思路完全不一样——Operator 是在云端托管浏览器,Computer Use 是给你一个 Python SDK,你传入截图和坐标,它返回「点击哪个位置、输入什么文本」的指令,然后你在本地用 pyautogui 或 AppleScript 去执行。

我写了一个最简单的 demo,大概长这样:

import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-3-5-sonnet-20241022",
    max_tokens=1024,
    tools=[{
        "type": "computer_20241022",
        "name": "computer",
        "display_width_px": 1440,
        "display_height_px": 900
    }],
    messages=[{
        "role": "user",
        "content": "打开计算器,输入 123*456,截图结果"
    }]
)

跑起来之后,Claude 会返回一个 tool_use 块,里面包含 action 类型(比如 click、type、screenshot)和坐标值。你拿着坐标去执行,然后把新的截图回传给它,形成一个循环。这个循环需要你自己写,大概 50 行 Python 就能搞定。

实测中我发现 Computer Use 的「视觉理解」能力很强。我让它打开 macOS 的「系统设置」,找到「显示器」面板,把分辨率从默认改成 1440x900。它居然能通过截图里的 UI 布局推断出左侧边栏的滚动方向,第一次就点对了。但坑也在这里——它对 UI 变化的敏感度太高。有一次我开着两个窗口,它截图的时候把窗口 A 的内容当成了窗口 B,然后对着错误的位置一顿操作。解决方式很笨但有效:每次截图前把目标窗口手动置顶,或者用一个脚本先激活窗口再截图。

另外一个很实际的限制是速度。Computer Use 每一步都要调一次 API,每次往返大概 3-5 秒,一个 10 步的操作就要将近一分钟。而且 token 消耗不小,我跑了 20 分钟就烧掉了大概 3 美元。如果你只是偶尔用一次,成本还能接受;想拿来跑日常重复劳动,得精打细算。

对比选型:你的任务发生在哪里?

两台「AI 操作员」都试过之后,我画了一条分界线:任务发生在浏览器内,选 Operator;任务发生在本地软件、桌面程序或者需要高隐私的场景,选 Computer Use。这条线听起来简单,但实际操作起来有更多细节。

Operator 的优势是「托管」——你不用管浏览器环境、不用装依赖、不用处理反爬。它适合的场景有:查资料并整理成表格、批量填写网页表单、在网页版工具里做数据录入、比较多个电商网站的价格。但它要求目标网站对数据中心 IP 友好,而且不能有短信验证码。我用它跑了一个「把 20 条物流信息录入到快递后台」的任务,每条信息包含单号、快递公司和备注,它跑得飞快,准确率大概 95%,有一条因为日期格式没识别对,需要我手动改。

Computer Use 的优势是「通用」——只要能截图的软件,它都能操作。我拿它试过本地 Excel 的数据整理(把一列拆成两列然后去重)、微信 PC 版的消息转发(这个有点危险,不推荐)、以及一个内部 CRM 系统的数据补录。CRM 那个任务我印象最深:系统是 IE 时代的老古董,网页版根本打不开,只有 Windows 客户端。Operator 直接没法用,Computer Use 配合 Windows 的截图和 pyautogui 反而跑通了。

还有一个隐藏的选型维度:隐私。Operator 的所有操作都在 OpenAI 的服务器上执行,你的数据要经过它的云端。如果你处理的是公司机密或者个人隐私数据,心理上那关可能过不去。Computer Use 的所有截图和指令都在本地闭环(除了调 API 时发送截图内容),至少没有额外的云端浏览器。我个人的建议是:涉及敏感数据,用 Computer Use 加本地模型(比如 Hermes 配 Ollama)更稳妥。

成本上,Operator 的 Pro 订阅是 200 美元/月,包含所有功能;Computer Use 按 token 计费,我的实测是每个任务大概 0.5-2 美元。如果你的使用频率是每天几个任务,Operator 更划算;如果你是偶尔用一次,按量付费的 Computer Use 更灵活。

Hermes Agent:一个「不用写代码」的本地补充方案

说到本地方案,我不得不提 Hermes Agent。它跟 Operator 和 Computer Use 的定位不同,它的强项是「把任务拆解成可复用的技能」,而且配置起来很快。安装就一句命令:pip install hermes-agent。第一次跑的时候它会自动创建 ~/.hermes/ 目录,里面有 config.yaml 主配置文件和 skills/ 文件夹,每个技能是一个 JSON 或 YAML 文件,描述触发条件和执行动作。

我试了一个场景:每天上午十点自动整理前一天的销售数据,生成一个 Markdown 报告,发到我的邮箱。这个任务如果用 Operator 来做,你得每天手动打开网页去复制数据;用 Computer Use 来做,你得写一个定时循环脚本。Hermes 的思路是:你在 ~/.hermes/skills/ 里放一个技能文件,里面定义好「从数据库拉数据、格式化、发送邮件」的步骤,然后用 hermes cron create 创建一个定时任务,它就自动跑了。

配置片段大概长这样:

# ~/.hermes/config.yaml
memory:
  enabled: true
  backend: sqlite
skills:
  dir: ~/.hermes/skills/
cron:
  timezone: Asia/Shanghai

技能文件 daily_report.yaml 里定义步骤时,不需要写代码,只需要把动作描述清楚,Hermes 会调用内置的工具去执行。比如「查询 sqlite 数据库的 sales 表,按日期筛选昨天的数据,用 jinja2 模板渲染成 markdown,用 smtp 发送到 xxx@email.com」。每个动作都是配置项,不是代码。

记忆功能也很有意思。你执行 hermes memory add "销售数据的来源表是 orders,不是 sales",它会存进本地 sqlite。下次跑任务时它先查记忆,然后自动修正查询语句。我一开始配置错了表名,一直报错,后来用 memory 命令补了一条提示,第二次跑就对了。这种「用自然语言修正配置」的体验,比改 YAML 舒服多了。

不过 Hermes 也有自己的适用边界。它更适合「有明确输入输出」的任务,比如定时拉数据、发消息、调 API。让它去操作一个复杂的 GUI 应用,它就力不从心了——它没有截图能力,也不模拟鼠标键盘。如果你想让它跟本地软件交互,得自己写一个工具脚本,然后通过 skills/ 里的配置暴露给 Hermes。所以我的定位是:Operator 负责浏览器,Computer Use 负责本地 GUI,Hermes 负责后台数据和定时任务,三者互补,不冲突。

实战中的报错和应对

这三天的测试里,我记录了不少报错,挑几个典型的说说。

Operator 最常遇到的是「页面元素不可见」。有一次我让它登录一个后台管理系统,它点击「登录」按钮后,界面弹出了一个模态框。Operator 的截图里能看到模态框,但它尝试点击模态框下方的元素,结果失败了。报错信息是「Element not visible or obstructed」。解决办法是给任务描述里加一句「如果出现弹窗,先关闭再继续」,它就会在操作前先检查并关闭弹窗。

Computer Use 的报错更多样。最常见的是坐标偏移——Claude 返回的坐标是基于它看到的截图,但如果你在它截图之后移动了窗口,坐标就失效了。我遇到一次它点击了错误的按钮,把系统设置里的壁纸换成了纯黑色,然后它自己没发现,继续下一步操作。后来我加了一个「每次点击前重新截图并确认坐标」的步骤,虽然慢了一些,但准确率提升了很多。另外,如果截图分辨率跟显示器的实际分辨率不一致,坐标也会偏。我建议把显示器分辨率固定为 1920x1080,并给 Claude 传入同样的分辨率参数。

Hermes 这边,我踩的最大的坑是 Python 版本。我一开始用系统自带的 Python 3.8 跑 pip install hermes-agent,装的时候没报错,但启动时提示「requires Python >= 3.10」。升级到 3.11 之后一切正常。还有一次 hermes cron create 创建定时任务后,任务没有按预期时间触发,查了一下发现是 config.yaml 里的时区没设,默认是 UTC,我改成 Asia/Shanghai 就好了。所以如果你也用 Hermes,装完第一件事就是检查 Python 版本和时区配置。

另外,Operator 和 Computer Use 都有「任务被中断」的问题。Operator 遇到验证码会停下来等你;Computer Use 如果 API 超时,整个循环就断了。处理方式不同:Operator 你可以手动介入完成验证码,然后让它继续;Computer Use 你需要在代码里加一个「重试 3 次,每次等待 5 秒」的逻辑,避免单次超时导致整个任务失败。我的 Python 脚本里加了十行重试代码,跑起来稳多了。

最后的选择建议

如果你跟我一样是个不想写代码、又想用 AI Agent 干活的普通人,我的建议是这样的:

你的任务全部发生在网页上,而且网站比较正规(没有奇怪的反爬),直接订阅 ChatGPT Pro 用 Operator。它最省心,你只需要把任务描述得足够清楚,比如「打开某某网站,登录,点击左侧菜单的某某,找到某某数据,复制到表格里」。描述得越具体,它跑得越准。

你的任务涉及本地软件、桌面程序,或者你处理的数据比较敏感,那就花一晚上学一下 Computer Use 的基本用法。你不需要写很复杂的代码,照着 Anthropic 官方文档里的 Python 示例改一改就能跑。关键是要理解「截图-返回坐标-执行-再截图」这个循环,剩下的事情 Claude 会帮你判断。

你的任务偏后台、偏定时、偏数据整理,而且你想让它越用越聪明,那就装一个 Hermes Agent。它那套技能文件和记忆系统,用起来像在给一个实习生写操作手册,写完之后它就照着执行,还能根据你的反馈调整。安装命令就是 pip install hermes-agent,配置文件在 ~/.hermes/config.yaml,技能放在 ~/.hermes/skills/,记忆用 hermes memory 命令管理,定时任务用 hermes cron create 创建。这套组合拳打下来,日常的重复劳动基本都能覆盖。

别指望一个 Agent 解决所有问题。我这三天的体验是:每种工具都有自己的脾气,Operator 怕验证码、Computer Use 怕坐标漂移、Hermes 怕配置错。但你只要摸清了它们的脾气,把任务按「浏览器内 / 本地 GUI / 后台数据」分类,然后选对工具,效率提升是实打实的。

💬 你用过哪些AI工具?

写这篇的时候我突然想到,每个人电脑里的 AI 工具链大概都不一样。有人习惯用网页版 ChatGPT,有人天天挂着 Claude 的桌面客户端,还有人像我一样在本地折腾 Hermes。你平时用得最顺手的 AI 工具是哪个?遇到卡壳的时候是硬啃文档还是直接换工具?欢迎在评论区聊聊你的实战经历。

另外,如果你也在纠结选哪个模型或者哪个 Agent 平台,可以去 AI House 排行榜(aibunkhouse.com/rankings/)逛逛,那里有最新的模型排名和用户投票,看看别人都在用什么,给喜欢的模型投一票,说不定能帮你少走点弯路。

常见问题 / FAQ

先说一个真实的卡壳场景

上个月,我媳妇让我帮她整理一个出差报销单。公司内部系统是那个老得掉牙的 OA,不支持 Excel 导入,只能一条一条手工录入。我坐在电脑前录到第八条的时候,脑子突然冒出一个念头:这种重复点击的活儿,能不能甩给 AI 干?于是那个下午我试了 OpenAI 的 Operator、Anthropic 的 Computer Use,还翻出了吃灰很久的 Hermes Agent。折腾完发现一条清晰的分界线...

Operator 实测:把浏览器交给 OpenAI 的云端 Agent

我用的 Operator 是 ChatGPT Pro 订阅里带的,版本是 2 月的那个公开预览版。登录之后界面是一个独立的浏览器窗口,你可以输入一个任务描述,比如「打开携程,查下周五上海到北京的高铁票,选最早一班,把价格截图发我」。它会在云端开一个真正的 Chromium 实例,然后一步步操作,每一步都有截图和文字说明。 我第一次跑的是「帮我填一个 Google Form 表单」,里面有五个字段...

Computer Use 实测:让 Claude 学会用你的鼠标

Computer Use 是 Anthropic 在 Claude 3.5 Sonnet 时代推出的功能,我测试时用的是 claude-3-5-sonnet-20241022 这个版本,API 接口里加了一个 computer 工具类型。它的思路完全不一样——Operator 是在云端托管浏览器,Computer Use 是给你一个 Python SDK,你传入截图和坐标,它返回「点击哪个位置、...

对比选型:你的任务发生在哪里?

两台「AI 操作员」都试过之后,我画了一条分界线:任务发生在浏览器内,选 Operator;任务发生在本地软件、桌面程序或者需要高隐私的场景,选 Computer Use。这条线听起来简单,但实际操作起来有更多细节。 Operator 的优势是「托管」——你不用管浏览器环境、不用装依赖、不用处理反爬。它适合的场景有:查资料并整理成表格、批量填写网页表单、在网页版工具里做数据录入、比较多个电商网站...

Hermes Agent:一个「不用写代码」的本地补充方案

说到本地方案,我不得不提 Hermes Agent。它跟 Operator 和 Computer Use 的定位不同,它的强项是「把任务拆解成可复用的技能」,而且配置起来很快。安装就一句命令:pip install hermes-agent。第一次跑的时候它会自动创建 ~/.hermes/ 目录,里面有 config.yaml 主配置文件和 skills/ 文件夹,每个技能是一个 JSON 或 ...