Files
ai-agent-book/cursor-chats/20250912_231224_####_LLM_Agent的开放动作空间.md
liqiang b119135836
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
2026-08-20 13:12:50 +00:00

8.7 KiB
Raw Permalink Blame History

Cursor Chat: ai-agent-book

Metadata

  • Project: ai-agent-book
  • Path: /Users/boj
  • Date: 2025-09-12 23:12:24
  • Session ID: cd4f8fb5-2d28-44e4-a32a-761814701905

Conversation

👤 You

LLM Agent的开放动作空间

现代基于LLM的Agent带来了动作空间设计的革命性变化。与传统RL的封闭、有限动作空间不同,LLM Agent展现出前所未有的开放性。

最重要的创新是将思考(Thinking)作为一种特殊的动作纳入动作空间。这个概念的重要性怎么强调都不为过。在传统RL中,Agent只能执行外部动作——移动、攻击、拾取等改变环境状态的操作。而在现代LLM Agent中,内部思考成为了动作空间的核心组成部分

这种内部思考动作具有独特的特性:

  • 无即时奖励:思考本身不产生环境奖励,只有后续的工具调用才可能获得奖励
  • 几乎不限次数:Agent可以进行多轮深度思考而不受环境约束
  • 成本较低:相比实际的工具调用,思考的成本一般较小

在传统RL框架中,这种"没有即时奖励、几乎不限次数"的动作是极难训练的。但基于LLM的先验知识,Agent天然理解思考的价值。通过强化学习,LLM可以进一步强化那些在模拟(rollout)中成功的思考-执行路径,从而学会利用内部思考来完成任务。

除了内部思考,现代LLM Agent的动作空间在工具参数的多样性上也展现出开放性:

  • 自然语言查询:搜索工具可以接受任意复杂的自然语言描述作为参数
  • 程序代码:代码解释器可以执行Agent动态生成的任意Python、SQL等代码
  • 复杂数据结构:API调用可以构造嵌套的JSON对象、动态生成的查询条件
  • 多模态内容:可以生成和处理图像描述、音频转录、视频分析指令

这种参数级别的开放性使得即使只有少数几个工具,Agent的实际动作空间也接近无限。例如,一个代码解释器工具理论上可以执行任何可计算的任务,一个搜索工具可以探索整个互联网的信息空间。

现代Agent在各个领域展现出这种开放性。网页搜索Agent在互联网环境中进行开放式API调用,构建任意复杂的自然语言查询。代码执行Agent在开发环境中可以生成和执行任意复杂度的代码,每次执行的代码都可以是全新的、创造性的解决方案。Computer Use Agent在图形界面环境中不仅执行预定义的点击操作,还能理解屏幕内容并生成复杂的操作序列。

从封闭到开放的动作空间演进反映了AI Agent范式的根本转变。传统RL通过大量试错在有限空间中寻找最优策略,而现代LLM-based Agent利用预训练知识在开放空间中进行创造性探索。这种转变带来了新的机遇:Agent可以处理前所未见的任务,通过组合基础工具解决复杂问题,在与人类交互中不断扩展能力边界;同时也带来了新的挑战:如何在无限的动作空间中高效搜索,如何评估和保证生成动作的安全性,如何在开放环境中定义和优化奖励函数。

LLM带来的先验知识革命

与传统MDP Agent从零开始不同,LLM+RL Agent站在巨人的肩膀上。通过预训练Pre-training)获得的海量知识成为强大的先验,使Agent能够继承世界知识、常识推理和语言理解能力。这种零样本泛化Zero-shot Generalization)能力让Agent能够理解和执行从未见过的指令,通过极少的示例就能掌握新任务,展现出少样本适应Few-shot Adaptation)的特性。

LLM带来的最重要变化是将推理Reasoning)作为Agent的核心能力。传统Agent的动作选择是简单的策略查询,而LLM Agent的动作选择包含了复杂的推理过程。Agent首先思考当前状态和应该采取的行动,制定计划将目标分解为步骤,然后基于思考和计划执行动作。这种推理能力让Agent能够理解任务的深层含义而非仅仅匹配模式,进行假设推理和反事实思考,将复杂问题分解为子问题,利用常识填补信息空白。

-- 这一段里,将推理Reasoning)作为Agent的核心能力跟前面的思考作为特殊动作是重复的,应该放在前面。LLM带来的先验知识革命 这一小节应该去掉,整体移动到LLM Agent的开放动作空间里面,保持语言流畅


🤖 Cursor Assistant

我来帮你重新组织这部分内容,将重复的部分合并,并把先验知识的内容整合到开放动作空间的讨论中。


👤 You

别修改了,告诉我新的内容


🤖 Cursor Assistant

根据你的要求,我建议将内容重新组织如下:

LLM Agent的开放动作空间

现代基于LLM的Agent带来了动作空间设计的革命性变化。与传统RL的封闭、有限动作空间不同,LLM Agent展现出前所未有的开放性。

最重要的创新是将思考(Thinking)作为一种特殊的动作纳入动作空间。这个概念的重要性怎么强调都不为过。在传统RL中,Agent只能执行外部动作——移动、攻击、拾取等改变环境状态的操作。而在现代LLM Agent中,内部思考和推理成为了动作空间的核心组成部分

传统Agent的动作选择是简单的策略查询,而LLM Agent的动作选择包含了复杂的推理过程。Agent首先思考当前状态和应该采取的行动,制定计划将目标分解为步骤,然后基于思考和计划执行动作。这种推理能力让Agent能够理解任务的深层含义而非仅仅匹配模式,进行假设推理和反事实思考,将复杂问题分解为子问题,利用常识填补信息空白。

这种内部思考动作具有独特的特性:

  • 无即时奖励:思考本身不产生环境奖励,只有后续的工具调用才可能获得奖励
  • 几乎不限次数:Agent可以进行多轮深度思考而不受环境约束
  • 成本较低:相比实际的工具调用,思考的成本一般较小

在传统RL框架中,这种"没有即时奖励、几乎不限次数"的动作是极难训练的。但这正是LLM带来的根本性变革——与传统MDP Agent从零开始不同,LLM+RL Agent站在巨人的肩膀上。通过预训练Pre-training)获得的海量知识成为强大的先验,使Agent能够继承世界知识、常识推理和语言理解能力。Agent天然理解思考的价值,通过强化学习,LLM可以进一步强化那些在模拟(rollout)中成功的思考-执行路径,从而学会更好地利用内部思考来完成任务。

这种零样本泛化Zero-shot Generalization)能力让Agent能够理解和执行从未见过的指令,通过极少的示例就能掌握新任务,展现出少样本适应Few-shot Adaptation)的特性。

除了内部思考,现代LLM Agent的动作空间在工具参数的多样性上也展现出开放性:

  • 自然语言查询:搜索工具可以接受任意复杂的自然语言描述作为参数
  • 程序代码:代码解释器可以执行Agent动态生成的任意Python、SQL等代码
  • 复杂数据结构:API调用可以构造嵌套的JSON对象、动态生成的查询条件
  • 多模态内容:可以生成和处理图像描述、音频转录、视频分析指令

这种参数级别的开放性使得即使只有少数几个工具,Agent的实际动作空间也接近无限。例如,一个代码解释器工具理论上可以执行任何可计算的任务,一个搜索工具可以探索整个互联网的信息空间。

现代Agent在各个领域展现出这种开放性。网页搜索Agent在互联网环境中进行开放式API调用,构建任意复杂的自然语言查询。代码执行Agent在开发环境中可以生成和执行任意复杂度的代码,每次执行的代码都可以是全新的、创造性的解决方案。Computer Use Agent在图形界面环境中不仅执行预定义的点击操作,还能理解屏幕内容并生成复杂的操作序列。

从封闭到开放的动作空间演进反映了AI Agent范式的根本转变。传统RL通过大量试错在有限空间中寻找最优策略,而现代LLM-based Agent利用预训练知识在开放空间中进行创造性探索。这种转变带来了新的机遇:Agent可以处理前所未见的任务,通过组合基础工具解决复杂问题,在与人类交互中不断扩展能力边界;同时也带来了新的挑战:如何在无限的动作空间中高效搜索,如何评估和保证生成动作的安全性,如何在开放环境中定义和优化奖励函数。


Exported from Cursor View