什么是智能体?

简单的定义:

  • hello-agents in Github: 在人工智能领域,智能体被定义为任何能够通过传感器(Sensors)感知其所处环境(Environment),并自主地通过执行器(Actuators)采取行动(Action)以达成特定目标的实体。
  • google:AI 智能体是使用 AI 来实现目标并代表用户完成任务的软件系统。其表现出了推理、规划和记忆能力,并且具有一定的自主性,能够自主学习、适应和做出决定。

传统视角下的智能体(before LLM):

  • 结构最简单的反射智能体,经典的自动恒温器便是如此:若传感器感知的室温高于设定值,则启动制冷系统
  • 基于模型的反射智能体,比如行驶中的自动驾驶汽车,它的内部模型依然会维持对那辆车存在、速度和预估位置的判断。这个内部模型让智能体拥有了初级的“记忆”,使其决策不再仅仅依赖于瞬时感知,而是基于一个更连贯、更完整的世界状态理解。
  • 基于目标的智能体(Goal-Based Agent),比如GPS导航系统,输入你的目的地,根据路径算法给出最优路线。
  • 基于效用的智能体(Utility-Based Agent),接着上面的GPS例子,不仅希望到达目的地,还希望时间最短、路程最省油并且避开拥堵。Utility-Based Agent为每一个可能的世界状态都赋予一个效用值,这个值代表了满意度的高低,智能体的核心目标不再是简单地达成某个特定状态,而是最大化期望效用。
  • 学习型智能体(Learning Agent),例子:Alpha Zero。不依赖人类经验,通过经验自我进化的学习者。

大语言模型(LLM)驱动的新范式

先理解大语言模型,也称为 LLM,是基于大量数据进行预训练的超大型深度学习模型。底层转换器是一组神经网络,这些神经网络由具有自注意力功能的编码器和解码器组成。编码器和解码器从一系列文本中提取含义,并理解其中的单词和短语之间的关系。

LLM 智能体可以直接处理高层级、模糊且充满上下文信息的自然语言指令。

以一个“智能旅行助手”为例来说明,在 LLM 智能体出现之前,规划旅行通常意味着用户需要在多个专用应用(如天气、地图、预订网站)之间手动切换,并由用户自己扮演信息整合与决策的角色。而一个 LLM 智能体则能将这个流程整合起来。当接收到“规划一次厦门之旅”这样的模糊指令时,它的工作方式体现了以下几点:

  • 规划与推理:智能体首先会将这个高层级目标分解为一系列逻辑子任务,例如:[确认出行偏好] -> [查询目的地信息] -> [制定行程草案] -> [预订票务住宿]。这是一个内在的、由模型驱动的规划过程。
  • 工具使用:在执行规划时,智能体识别到信息缺口,会主动调用外部工具来补全。例如,它会调用天气查询接口获取实时天气,并基于“预报有雨”这一信息,在后续规划中倾向于推荐室内活动。
  • 动态修正:在交互过程中,智能体会将用户的反馈(如“这家酒店超出预算”)视为新的约束,并据此调整后续的行动,重新搜索并推荐符合新要求的选项。整个“查天气 → 调行程 → 订酒店”的流程,展现了其根据上下文动态修正自身行为的能力。

我们正从开发专用自动化工具转向构建能自主解决问题的系统。核心不再是编写代码,而是引导一个通用的“大脑”去规划、行动和学习。

智能体的运行方式

智能体并非一次性完成任务,而是通过一个持续的循环与环境进行交互,这个核心机制被称为 智能体循环 (Agent Loop)

感知-思考-行动-观察,形成了一个持续的闭环。行动会对环境施加具体的操作,如智能旅行助手中,LLM思考用户需要了解指定城市的天气,做出调用查询天气工具的行动,天气工具返回结果(通常是一小段自然语言“北京天气小雨,微风”),结果作为Observation反馈给LLM作为下一轮思考的主要输入。

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注