大叔自由人
主流 AI Agent 架构解析:同一个大脑,五种干活的姿势
技术分享

主流 AI Agent 架构解析:同一个大脑,五种干活的姿势

最近被问得最多的一个问题是:“我想做个 Agent,用什么架构?”

问的人背景各异:有想给学生做 AI 助手的,有想给公司客服接大脑的,还有看了几篇论文来问 LangGraph、AutoGen、Manus 到底啥区别的。大家共同的困惑是——框架和名词太多,架构图一张比一张花,看完更不知道该选哪个了。

今天这篇,就把主流 Agent 架构拆个干净。先剧透结论:不管名字多花哨,拆开看就五种姿势。 看懂这五种,市面上 90% 的 Agent 框架你都能一眼认祖归宗。

万变不离其宗:先认识那个循环

Agent 的基本骨架:一个循环

所有 Agent 的祖宗,都是同一个循环:感知 → 思考 → 行动 → 观察 → 再思考……

用户丢进来一个任务目标,大脑(LLM)看一眼当前的状况,想一步,动手干一步(调工具、查数据、发消息),把结果再吃回上下文,然后接着想下一步。直到任务完成,交差。

就这么个循环。所谓”架构”的差异,全在四个问题上的取舍:

  • 谁想? 一个大脑包办,还是规划和执行分开?
  • 谁干? 单兵作战,还是拉一支小队?
  • 想几轮? 走一步看一步,还是先画好整张路线图?
  • 谁把关? 干完就交差,还是有人批改打回?

后面五种架构,就是这四道题的五个典型答案。

姿势一:ReAct —— 边想边做

四种主流架构一览

ReAct(Reasoning + Acting)是最早、也最经典的姿势,2022 年的论文提出,到今天仍是大量 Agent 的默认骨架。

它的哲学是走一步,看一步:想下一步干什么 → 干 → 看结果 → 再想下一步。没有总规划,每一步都根据最新的现场反馈临时决定。

像什么?像一个老练的探案警察:没有剧本,每条线索出现,现场决定下一步查哪里。

  • 优势:灵活、应变强,面对开放、未知、需要探索的任务表现好。
  • 代价:每一步都要把全部历史塞进上下文让模型重新决策,任务一长,token 哗哗地烧,还容易”想偏了越走越远”。

适合:搜索、问答、闲聊、探索类任务——目标模糊,路径靠现场摸。

姿势二:计划-执行 —— 先谋后动

和 ReAct 相反,这个姿势要求先把整张路线图画出来,再照着走:规划者(Planner)把大任务拆成一份步骤清单,执行者(Executor)逐项打钩。

像什么?像一个项目经理:先写项目计划,再派活、盯进度、逐项验收。

  • 优势:步骤明确、全局在握,长任务不容易跑偏;规划和执行分开,各自还能换不同的模型(规划用强模型,执行用便宜模型)。
  • 代价:计划赶不上变化。中途环境变了,死板地照原计划走会翻车——所以实践中往往加一步”执行中发现问题,回炉重规划”。

适合:流程已知的长任务——写一份调研报告、完成一次数据分析、跑一条固定的业务流水线。

姿势三:反思 —— 自己批改自己

前两种姿势都默认”干完就交差”,反思(Reflection)加了一道工序:干完先别交,自己批一遍,不合格打回重写。

实现上有两种玩法:让同一个模型扮演两个角色(干活的我 + 批改的我),或者干脆上两个模型互相挑刺。代表工作是 Reflexion、Self-Refine 这一路。

像什么?像学生写完作文,先自己通读一遍,改掉病句再交给老师。

  • 优势:输出质量肉眼可见地提升,尤其是有明确评价标准的任务。
  • 代价:轮次翻倍,时间和 token 都翻倍。

适合:写代码、写文案、出方案——一切”第一遍必然粗糙、值得打磨”的创作型任务。

姿势四:编排-执行 —— 一个项目经理带几个外包

编排-执行架构

到这里,Agent 从单兵变成小队。编排-执行(Orchestrator-Workers)的结构是:一个编排者(Orchestrator)拿到任务后,现场判断该拆成哪几个子任务,分派给若干个工人(Worker)并行去干,干完收拢结果、汇总交付。

注意它和”计划-执行”的区别:计划-执行的清单是事先写死的,编排-执行的分工是看了任务现场动态决定的——更像项目经理看到需求后临时外包,而不是照一份旧甘特图施工。

Anthropic 在《Building Effective Agents》里把它归为最实用的工作流模式之一,多模态处理(同时看文档、图片、表格)尤其受益。

  • 优势:子任务并行,快;每个工人有独立上下文,一个跑偏污染不到别人。
  • 代价:token 消耗是单 Agent 的好几倍,慢、贵、难调试。

适合:能动态拆分的中型任务——改多个文件的代码、同时处理多种格式的资料。

姿势五:多智能体 —— 真正的团队

最后是排面最大的:多个有独立角色、独立记忆、独立工具的智能体组成团队,有分工、有通信、有协商。AutoGen、MetaGPT、CrewAI、LangGraph 的多智能体图,都属于这一路。

和姿势四的区别在于”自主程度”:编排-执行里工人是听指挥的外包,多智能体里的成员是能自己决定怎么干、甚至互相讨论反驳的”同事”——比如调研、写作、审稿三个角色组成编辑部,审稿的可以把写作的稿子打回去吵一架。

  • 优势:上限高,复杂任务能拆出专业分工,还能用角色扮演互相纠错。
  • 代价:工程复杂度和 token 成本都是最高的,而且”多个模型互相说话”极难调试——出了问题,五个嫌疑人,个个看起来都有理。

适合:可拆分、可并行、有清晰角色分工的大型任务。小任务硬上多智能体,纯属给自己找不痛快。

怎么选:一张决策树

架构选型决策树

五种姿势摆完,给一张实操的选型路线:

  1. 任务能一句话说清、一步干完? 那根本别用 Agent,一次普通的 LLM 调用就够了。这是最多人犯的错——给一个翻译需求套上多智能体。
  2. 任务是开放探索的? ReAct。
  3. 质量优先、输出需要打磨? ReAct 或计划-执行,加上反思。
  4. 步骤明确、流程已知? 计划-执行(+反思,质量加强版)。
  5. 任务大、可拆、可并行? 编排-执行,或者更进一步上多智能体。

还有一条贯穿始终的原则:能用简单架构解决的,绝不用复杂的。 业界的经验数据很一致——多智能体的 token 消耗是单 Agent 的好几倍,效果却不一定更好。很多团队的落地复盘都是同一个故事:最初上了花哨的多智能体,最后收敛回”单 Agent + 好工具 + 反思”。

架构是为任务服务的,不是为简历服务的。

写在最后

回头看这五种姿势:ReAct 是直觉型选手,计划-执行是流程型选手,反思是完美主义者,编排-执行是小包工头,多智能体是开公司。同一个大脑,不同的组织方式,就长出完全不同的能力形状。

选型其实没那么玄:先看任务长什么样,再决定给它配一副什么骨架。

顺带一提:这套东西我搬进了大模型课上,让学生拿五种架构分别实现同一个任务,对比效果和成本——踩一遍”杀鸡用牛刀”的坑,比听十节课都管用。如果你的学校或企业也想落地一个 Agent 应用,又怕架构选错、成本失控,欢迎找我聊——从单 Agent 到多智能体这一路的坑,我踩得比这篇文章长。