Files
ai-agent-book/cursor-chats/20251014_211646_视频编辑_Agent_的例子,用户的自然语言需求和验收标准,改成用户找一段自己运动或旅行的视频进行剪辑,例如,把冲浪部分剪.md
T
liqiang b119135836
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
2026-08-20 13:12:50 +00:00

5.3 KiB
Raw Blame History

Cursor Chat: ai-agent-book

Metadata

  • Project: ai-agent-book
  • Path: /Users/boj
  • Date: 2025-10-14 21:16:46
  • Session ID: dd6830e9-f0de-44fe-a328-9a1980d068ef

Conversation

👤 You

视频编辑 Agent 的例子,用户的自然语言需求和验收标准,改成用户找一段自己运动或旅行的视频进行剪辑,例如,把冲浪部分剪出来


🤖 Cursor Assistant

我来帮你修改视频编辑 Agent 的例子,先让我看看当前的内容。


🤖 Cursor Assistant

我看到了视频编辑 Agent 的内容。让我将其修改为更个性化的场景,用户剪辑自己的运动或旅行视频。


🤖 Cursor Assistant

已经完成修改!我将视频编辑 Agent 的例子改为了更个人化的场景:

主要修改内容:

1. 技术方案中增加了具体场景描述:

  • 用户提供运动或旅行视频(包含冲浪、徒步、滑雪等多个场景)
  • 给出了具体的自然语言需求示例:
    • "把冲浪部分剪出来"
    • "提取前10分钟的徒步片段并加入背景音乐"
    • "剪辑出滑雪跳跃的精彩瞬间,添加慢动作效果"

2. 技术实现细节更贴近实际场景:

  • Agent 需要先用 Vision LLM 分析视频识别不同场景
  • Critic Agent 的反馈示例更具体,如"裁剪起始点过早,遗漏了冲浪准备动作"

3. 验收标准(原来是空白)现在包括:

  • 能准确识别视频中的不同场景(冲浪、徒步、滑雪等)
  • 起始和结束点位置准确(误差不超过3秒)
  • 支持特效要求(慢动作、转场、字幕)
  • Render-Critique 机制能检测剪辑错误
  • 最终视频格式正确、可正常播放

修改后的例子更贴近真实用户场景,符合您提出的"用户找自己运动或旅行视频进行剪辑"的需求。


👤 You

首先使用 Vision LLM 分析视频内容 需要稍微详细一点:agent 需要有截图并调用 VLM 识别语义的工具,agent 先要求每 10 秒截一张图,根据这些图找到相关的片段,然后 agent 再对这个片段每秒截一张图并找到精确的位置


👤 You

首先使用 Vision LLM 分析视频内容 需要稍微详细一点:agent 需要有截图并调用 VLM 识别语义的工具,并且 prompt 里面说明,例如 agent 先要求每 10 秒截一张图,根据这些图找到相关的片段,然后 agent 再对这个片段每秒截一张图并找到精确的位置


🤖 Cursor Assistant

我来详细展开 Vision LLM 分析视频内容的部分,说明两步定位策略。


🤖 Cursor Assistant

完成修改!我详细展开了 Vision LLM 分析视频内容的过程,具体包括:

主要增加的内容:

1. 明确工具配备

  • Agent 配备视频截图工具和 Vision LLM 调用能力

2. 两步定位策略

第一步:粗粒度定位(每10秒)

  • Agent 调用截图工具,每10秒提取一帧
  • 将关键帧+用户需求一起输入 Vision LLM
  • LLM 识别场景内容(如"海滩准备"、"冲浪中"、"上岸休息"
  • 确定目标场景的大致时间范围(如"30秒到120秒"

第二步:精细粒度定位(每1秒)

  • 在识别出的时间范围内,每秒提取一帧
  • 再次使用 Vision LLM 分析密集关键帧
  • 精确识别起始点和结束点(如"第34秒站上冲浪板,第98秒落水")

3. 策略优势说明

  • 效率:避免对整个视频密集采样
  • 精度:在目标区域内精确找到边界

这种先粗后细的两步策略符合实际工程实践,既节省了 Vision LLM 调用成本,又保证了剪辑的精确度。


👤 You

视频截图工具和 Vision LLM 需要是一个 sub-agent,主 agent 只决定开始和结束时间,以及截图间隔,以及要回答的问题(比如冲浪开始时间、冲浪结束时间),让 sub-agent(其实就是个简单 workflow-based agent)先截图,再调用 VLM 输出


🤖 Cursor Assistant

我来修改这部分,说明视频分析是通过 sub-agent 来实现的。


🤖 Cursor Assistant

完成修改!我已经将视频分析改为通过 Sub-Agent 来实现,体现了更清晰的架构设计。

主要改进:

1. 引入视频分析 Sub-Agent

  • 明确说明这是一个 workflow-based agent
  • 执行固定流程:先截图,后调用 VLM

2. 明确主从 Agent 的职责分工

主 AgentEditor Agent)的职责

  • 决策层面:确定时间范围、截图间隔、提出问题
  • 第一步传入:视频路径、0秒到结尾、每10秒、"哪些时间段出现冲浪?"
  • 第二步传入:视频路径、40-110秒、每1秒、"准确的开始和结束时间?"

Sub-Agent 的职责

  • 执行层面:按固定流程工作
  • 使用 ffmpeg 截图
  • 调用 Vision LLM 分析
  • 返回结构化结果

3. 具体示例更清晰

  • 第一步返回:"30-40秒:海滩准备,40-110秒:冲浪中,110-120秒:上岸休息"
  • 第二步返回:"冲浪开始:第44秒,冲浪结束:第98秒"

4. 架构优势说明

  • 关注点分离:主 Agent 专注决策,Sub-Agent 专注执行
  • 主 Agent 无需关心截图和 VLM 调用的底层实现细节

这种设计符合第四章讨论的 Agent 协作模式,是一个更工程化、更易维护的架构。


Exported from Cursor View