Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
98 lines
8.7 KiB
Markdown
98 lines
8.7 KiB
Markdown
# Cursor Chat: ai-agent-book
|
||
|
||
## Metadata
|
||
- **Project**: ai-agent-book
|
||
- **Path**: `/Users/boj`
|
||
- **Date**: 2025-09-12 23:12:24
|
||
- **Session ID**: `cd4f8fb5-2d28-44e4-a32a-761814701905`
|
||
|
||
## Conversation
|
||
|
||
### 👤 You
|
||
|
||
#### LLM Agent的开放动作空间
|
||
|
||
现代基于LLM的Agent带来了动作空间设计的革命性变化。与传统RL的封闭、有限动作空间不同,LLM Agent展现出前所未有的开放性。
|
||
|
||
最重要的创新是**将思考(Thinking)作为一种特殊的动作**纳入动作空间。这个概念的重要性怎么强调都不为过。在传统RL中,Agent只能执行外部动作——移动、攻击、拾取等改变环境状态的操作。而在现代LLM Agent中,**内部思考成为了动作空间的核心组成部分**。
|
||
|
||
这种内部思考动作具有独特的特性:
|
||
- **无即时奖励**:思考本身不产生环境奖励,只有后续的工具调用才可能获得奖励
|
||
- **几乎不限次数**:Agent可以进行多轮深度思考而不受环境约束
|
||
- **成本较低**:相比实际的工具调用,思考的成本一般较小
|
||
|
||
在传统RL框架中,这种"没有即时奖励、几乎不限次数"的动作是极难训练的。但基于LLM的先验知识,Agent天然理解思考的价值。通过强化学习,LLM可以进一步强化那些在模拟(rollout)中成功的思考-执行路径,从而学会利用内部思考来完成任务。
|
||
|
||
除了内部思考,现代LLM Agent的动作空间在**工具参数的多样性**上也展现出开放性:
|
||
- **自然语言查询**:搜索工具可以接受任意复杂的自然语言描述作为参数
|
||
- **程序代码**:代码解释器可以执行Agent动态生成的任意Python、SQL等代码
|
||
- **复杂数据结构**:API调用可以构造嵌套的JSON对象、动态生成的查询条件
|
||
- **多模态内容**:可以生成和处理图像描述、音频转录、视频分析指令
|
||
|
||
这种参数级别的开放性使得即使只有少数几个工具,Agent的实际动作空间也接近无限。例如,一个代码解释器工具理论上可以执行任何可计算的任务,一个搜索工具可以探索整个互联网的信息空间。
|
||
|
||
现代Agent在各个领域展现出这种开放性。**网页搜索Agent**在互联网环境中进行开放式API调用,构建任意复杂的自然语言查询。**代码执行Agent**在开发环境中可以生成和执行任意复杂度的代码,每次执行的代码都可以是全新的、创造性的解决方案。**Computer Use Agent**在图形界面环境中不仅执行预定义的点击操作,还能理解屏幕内容并生成复杂的操作序列。
|
||
|
||
从封闭到开放的动作空间演进反映了AI Agent范式的根本转变。传统RL通过大量试错在有限空间中寻找最优策略,而现代LLM-based Agent利用预训练知识在开放空间中进行创造性探索。这种转变带来了新的机遇:Agent可以处理前所未见的任务,通过组合基础工具解决复杂问题,在与人类交互中不断扩展能力边界;同时也带来了新的挑战:如何在无限的动作空间中高效搜索,如何评估和保证生成动作的安全性,如何在开放环境中定义和优化奖励函数。
|
||
|
||
#### LLM带来的先验知识革命
|
||
|
||
与传统MDP Agent从零开始不同,LLM+RL Agent站在巨人的肩膀上。通过**预训练**(Pre-training)获得的海量知识成为强大的先验,使Agent能够继承世界知识、常识推理和语言理解能力。这种**零样本泛化**(Zero-shot Generalization)能力让Agent能够理解和执行从未见过的指令,通过极少的示例就能掌握新任务,展现出**少样本适应**(Few-shot Adaptation)的特性。
|
||
|
||
LLM带来的最重要变化是将**推理**(Reasoning)作为Agent的核心能力。传统Agent的动作选择是简单的策略查询,而LLM Agent的动作选择包含了复杂的推理过程。Agent首先思考当前状态和应该采取的行动,制定计划将目标分解为步骤,然后基于思考和计划执行动作。这种推理能力让Agent能够理解任务的深层含义而非仅仅匹配模式,进行假设推理和反事实思考,将复杂问题分解为子问题,利用常识填补信息空白。
|
||
|
||
|
||
--
|
||
这一段里,将**推理**(Reasoning)作为Agent的核心能力跟前面的思考作为特殊动作是重复的,应该放在前面。LLM带来的先验知识革命 这一小节应该去掉,整体移动到LLM Agent的开放动作空间里面,保持语言流畅
|
||
|
||
---
|
||
|
||
### 🤖 Cursor Assistant
|
||
|
||
我来帮你重新组织这部分内容,将重复的部分合并,并把先验知识的内容整合到开放动作空间的讨论中。
|
||
|
||
---
|
||
|
||
### 👤 You
|
||
|
||
别修改了,告诉我新的内容
|
||
|
||
---
|
||
|
||
### 🤖 Cursor Assistant
|
||
|
||
根据你的要求,我建议将内容重新组织如下:
|
||
|
||
#### LLM Agent的开放动作空间
|
||
|
||
现代基于LLM的Agent带来了动作空间设计的革命性变化。与传统RL的封闭、有限动作空间不同,LLM Agent展现出前所未有的开放性。
|
||
|
||
最重要的创新是**将思考(Thinking)作为一种特殊的动作**纳入动作空间。这个概念的重要性怎么强调都不为过。在传统RL中,Agent只能执行外部动作——移动、攻击、拾取等改变环境状态的操作。而在现代LLM Agent中,**内部思考和推理成为了动作空间的核心组成部分**。
|
||
|
||
传统Agent的动作选择是简单的策略查询,而LLM Agent的动作选择包含了复杂的推理过程。Agent首先思考当前状态和应该采取的行动,制定计划将目标分解为步骤,然后基于思考和计划执行动作。这种推理能力让Agent能够理解任务的深层含义而非仅仅匹配模式,进行假设推理和反事实思考,将复杂问题分解为子问题,利用常识填补信息空白。
|
||
|
||
这种内部思考动作具有独特的特性:
|
||
- **无即时奖励**:思考本身不产生环境奖励,只有后续的工具调用才可能获得奖励
|
||
- **几乎不限次数**:Agent可以进行多轮深度思考而不受环境约束
|
||
- **成本较低**:相比实际的工具调用,思考的成本一般较小
|
||
|
||
在传统RL框架中,这种"没有即时奖励、几乎不限次数"的动作是极难训练的。但这正是LLM带来的根本性变革——与传统MDP Agent从零开始不同,LLM+RL Agent站在巨人的肩膀上。通过**预训练**(Pre-training)获得的海量知识成为强大的先验,使Agent能够继承世界知识、常识推理和语言理解能力。Agent天然理解思考的价值,通过强化学习,LLM可以进一步强化那些在模拟(rollout)中成功的思考-执行路径,从而学会更好地利用内部思考来完成任务。
|
||
|
||
这种**零样本泛化**(Zero-shot Generalization)能力让Agent能够理解和执行从未见过的指令,通过极少的示例就能掌握新任务,展现出**少样本适应**(Few-shot Adaptation)的特性。
|
||
|
||
除了内部思考,现代LLM Agent的动作空间在**工具参数的多样性**上也展现出开放性:
|
||
- **自然语言查询**:搜索工具可以接受任意复杂的自然语言描述作为参数
|
||
- **程序代码**:代码解释器可以执行Agent动态生成的任意Python、SQL等代码
|
||
- **复杂数据结构**:API调用可以构造嵌套的JSON对象、动态生成的查询条件
|
||
- **多模态内容**:可以生成和处理图像描述、音频转录、视频分析指令
|
||
|
||
这种参数级别的开放性使得即使只有少数几个工具,Agent的实际动作空间也接近无限。例如,一个代码解释器工具理论上可以执行任何可计算的任务,一个搜索工具可以探索整个互联网的信息空间。
|
||
|
||
现代Agent在各个领域展现出这种开放性。**网页搜索Agent**在互联网环境中进行开放式API调用,构建任意复杂的自然语言查询。**代码执行Agent**在开发环境中可以生成和执行任意复杂度的代码,每次执行的代码都可以是全新的、创造性的解决方案。**Computer Use Agent**在图形界面环境中不仅执行预定义的点击操作,还能理解屏幕内容并生成复杂的操作序列。
|
||
|
||
从封闭到开放的动作空间演进反映了AI Agent范式的根本转变。传统RL通过大量试错在有限空间中寻找最优策略,而现代LLM-based Agent利用预训练知识在开放空间中进行创造性探索。这种转变带来了新的机遇:Agent可以处理前所未见的任务,通过组合基础工具解决复杂问题,在与人类交互中不断扩展能力边界;同时也带来了新的挑战:如何在无限的动作空间中高效搜索,如何评估和保证生成动作的安全性,如何在开放环境中定义和优化奖励函数。
|
||
|
||
---
|
||
|
||
|
||
*Exported from [Cursor View](https://github.com/saharmor/cursor-view)* |