下面这张图把 AI Agent 从接收用户提问到最终返回结果的完整链路拆成了 20 个具体步骤,六个核心角色分别是用户、智能体(Agent)、Agent Skills(技能)、大模型(LLM)、MCP(模型上下文协议)和工具。整体流程可以划分为五个阶段。

第一阶段:请求接入与背景准备(Step 1-3)
一切从用户的提问开始(Step 1)。请求发出后,智能体(Agent)作为总调度员会先接到这个请求(Step 2)。为了不“失忆”,Agent 不会立刻盲目作答,而是先回头翻一下历史对话和长期记忆(Step 3),为后面的理解补上上下文。
第二阶段:大脑思考与任务规划(Step 4-6)
拿到背景信息后,流程进入“大脑”思考环节。大模型(LLM)会对用户输入做意图识别,并把复杂任务拆成若干子任务(Step 4),然后生成一份详细的执行计划(Step 5)。计划生成后交回给 Agent,由 Agent 接收并准备后续调度(Step 6)。
第三阶段:能力匹配与参数准备(Step 7-11)
拿到执行计划后,Agent 要判断这次任务是否需要借助外部能力(Skills)或工具(Step 7)。如果确实需要,Agent 会通过路由机制,精准匹配到最合适的 Agent Skill(Step 8)。被选中的 Skill 先读取当前上下文和自身能力配置(Step 9),再整理出调用策略与参数草案(Step 10)。草案还不够具体,于是 Skill 把它交给 LLM,由 LLM 补全具体调用参数(Step 11)。
第四阶段:通过 MCP 调用并执行工具(Step 12-16)
参数就绪后,Agent 通过 Skill 正式发起调用请求(Step 12)。这时,MCP(模型上下文协议)作为标准化工具网关登场:它先在系统中发现并选择最合适的工具(Step 13),再调用工具的 API(Step 14)。外部工具(如搜索引擎、计算器或数据库)接到指令后开始干活(Step 15),并把原始结果回传给 MCP(Step 16)。
第五阶段:结果清洗、整合与最终回复(Step 17-20)
工具返回的原始数据往往比较杂乱。流程回到 Skill,由 Skill 对这些结果做解析、校验和格式化(Step 17)。清洗后的数据交回给 Agent,Agent 再把它和当前上下文做深度整合(Step 18)。随后,这份信息交给 LLM 做最后的语言润色,生成符合人类阅读习惯的回答(Step 19)。最后,Agent 把结果呈现给用户(Step 20),一次请求从发出到返回的完整闭环就此完成。
|