现在 AI Agent 框架多到挑花眼。每个都说自己好,实际用起来各有各的毛病。这篇文章把我用过的四个主流框架逐一对比,只说真话不说套话,帮你选对工具少走弯路。

AutoGPT:名气最大但最不实用

AutoGPT 是 Agent 圈的老大哥,GitHub 上十几万星,名气最大。但我试过两次都放弃了。第一次让它写一个简单的网页爬虫。它先想用 Selenium,发现没装 pip 包就自己 pip install selenium,装到一半说 Python 版本不兼容,又换成了 playwright。playwright 也装上了,但是启动浏览器报错——没有安装 Chromium 二进制文件。折腾了五分钟,终于能打开页面了。

然而爬虫开始跑之后,又发现问题:目标网站有反爬机制,页面返回的状态码是 403。AutoGPT 自动切换策略,改用 requests 直接发 HTTP 请求。requests 能请求到页面了,但它把整个 HTML 文件原样抓下来了。它又自己写了一段解析逻辑,把标题和正文分开。脚本跑完,我一看结果——标题是对的,但正文里混了一堆导航栏文字和 footer 内容,CSS 类名没选对。前前后后折腾了 20 分钟,最后产出的数据还是错的。

AutoGPT 最大的问题不是不能干活,而是太爱绕圈子。一个简单任务会走很多弯路,每一步都可能出错。出错了它会自动尝试修复,但修复本身可能引入新问题,又需要再次修复,形成死循环。我认识的一个朋友让 AutoGPT 写一个统计 Excel 里行列数的脚本,结果 AutoGPT 先安装了 openpyxl,发现不行,又装 pandas,然后又装 xlrd,最终发现自己走了弯路,从零开始重新写。这种事几乎每次用都会遇到。

适合做技术演示——效果确实震撼,但不适合日常干活。我认识的几个重度用户,每天都要花时间检查 AutoGPT 有没有跑偏,比自己做还累。

LangGraph:能力天花板最高但学习成本也最高

LangGraph 是 LangChain 团队出的 Agent 框架。能力上限确实是最高的——你想要多复杂的 Agent 流程它都能搭出来。支持条件分支(Conditional Edge)、循环(Loop)、子 Agent(Subgraph)、人工介入节点、检查点恢复(Checkpointer),几乎可以认为是 Agent 领域的功能最全的工具箱。

我在 LangGraph 上看到最复杂的案例是一个多 Agent 协作的代码审查流水线:一个 CodeWriter Agent 生成代码,一个 Reviewer Agent 做代码审查,一个 Tester Agent 跑单元测试。测试没通过就退回给 CodeWriter 修改,改完再走一遍审查→测试的循环,最多重试三次。整个流程用 StateGraph 定义,每个 Agent 的状态通过 SharedState 传递。非常精妙,可以说是 Agent 流程设计的教科书级别的案例。

但我自己试着搭类似的东西时被狠狠教育了一回。写四个节点的图花了一天半。最坑的一个问题:状态机的 State 定义里有一个字段类型写成了 str,但运行时实际返回的是 None,导致整个图在第二个节点就卡住了。LangGraph 的报错信息又不够直观,只告诉你"TypeError: expected str, got NoneType",但没说哪个字段在哪一步出的问题。我一行一行打日志才找到。

问题在于要写出能跑的系统,你得先学懂一套完整的概念体系:节点(Node)、边(Edge)、状态机(StateGraph)、条件分支(Conditional Edge)、检查点(Checkpointer)。我用了一个周末看文档才写出来一个能正常运行的 Agent。到了第二周不翻文档还是写不出来。而且 LangChain 的 API 变化很快,网上搜到的教程很多已经过期了,照着写会报 API 不存在的错误。

如果你有工程背景、时间充裕,LangGraph 是最好的选择。但如果你就想快点用起来,它可能会让你怀疑人生。我建议先拿 Hermes 或 Cline 快速验证想法,真有复杂流程需求再上 LangGraph。

Hermes Agent:性价比最高的选择

Hermes 是 Nous Research 做的开源 Agent 框架。配置简单到离谱——一条命令装完,跑 hermes chat 就能直接用,默认带工具调用和文件操作。最让我觉得良心的是不绑定特定模型。DeepSeek、通义千问、OpenAI、Claude 随便换,改个 yaml 配置文件就行。对于国内开发者来说,直接用 DeepSeek 是个大加分项,不用折腾海外信用卡注册和网络问题。

我从安装到跑通自动日报系统花了一个周末。具体来说:周五晚上装了 Hermes 和 DeepSeek 的配置,周六搭了一套定时任务每天早上抓 GitHub Trending 热门项目,再让 Hermes 自动汇总成日报,周日上午修了几个小 bug(主要是 cron 表达式写错了导致任务跑了两遍),周日晚上就正式上线了。现在每天早上 9 点手机收到推送,看一眼 GitHub 今天有什么新项目值得关注,全程不费脑子。

Hermes 还有一个很实用的功能:memory 和 skill。如果某个工作流跑成功了,可以一键保存成 skill,下次同类任务直接复用。比如我搭好日报系统之后又搭了一个"分析公众号文章趋势"的工作流,也是直接套用之前的 skill 模板改几个参数就搞定了。这种积累效应会让你的效率越来越高。

缺点也很明显。社区还不够大,Discord 群里活跃人数大概就一两百,遇到问题搜中文资料基本没有,只能去 GitHub Issues 里翻。文档有些地方写得简略,比如配置自定义工具的部分只有示例代码没有完整说明,我翻了源码才搞清楚参数结构。不过对于 80% 的日常场景——自动写日报、定时抓数据、批量处理文件、监控网站变化——完全够用了。

Cline / Claude Code:编程场景的最优解

如果你的 Agent 需求就是写代码,Cline(VS Code 插件)和 Claude Code(终端工具)是这个领域做得最好的。它们专为编程场景深度优化——改代码、修 bug、跑测试、提 PR 一条龙,而且有很强的项目上下文理解能力。

我拿 Claude Code 重构过一个项目,把一段 500 行的面条代码拆成 5 个独立模块,自动生成了对应的单元测试,还帮我检查了一遍重构后有没有引入回归 bug。总共花了不到半小时,比我手改快了两倍不止。Cline 在 VS Code 里用起来更顺手,选中代码直接让 AI 改,不用复制粘贴。它的 diff 展示方式也很直观,新增行用绿色、删除行用红色,一眼就能看到 AI 改了哪里,不像命令行里看 diff 那么费劲。

但是 Cline 和 Claude Code 有一个明显的局限:出了编程这个范围就不太灵了。我试过让 Claude Code 帮我发一封简单邮件,它直接回复说"抱歉,我只专注代码操作,发送邮件不在能力范围内"。你在终端里输入"帮我订个外卖",它会一脸茫然。它们是编程场景的专用工具,不是通用 Agent。

另外要提一嘴的是,Claude Code 的 Token 消耗非常大。一个中等规模的项目重构,一次对话就能用掉几十万 Token。用 Anthropic 的 API 的话,一天下来可能烧掉十几美金。如果你是个人开发者、预算有限,建议先在小的子模块上试水,不要一次性梭哈。

四种框架一句话总结

AutoGPT——炫技可以,干活算了。LangGraph——上限最高,学习曲线最陡。Hermes——日常够用,配置零门槛。Cline / Claude Code——编程专用,术业有专攻。

选框架最重要的不是比参数,而是想清楚你每天到底要做什么事。通用场景选 Hermes,复杂流程选 LangGraph,纯写代码选 Cline/Claude Code。AutoGPT 适合当玩具研究架构设计思路,但不适合当成生产力工具来依赖。