# Советы по обучению ← [К оглавлению](README.md) ### Ключевая идея: Агент = Модель + Контекст + Инструменты Основа книги — формула **Агент = Модель + Контекст + Инструменты**. Эти три компонента совместно реализуют разумное поведение агента: - **Модель**: мозг агента, дающий понимание, рассуждение и принятие решений. - **Контекст**: операционная система агента, включающая системные инструкции, историю диалога, процессы рассуждения, записи взаимодействий с инструментами и т. д. - **Инструменты**: руки агента, позволяющие воспринимать среду, выполнять действия и взаимодействовать с внешним миром. ### Путь обучения Путь обучения глава за главой соответствует всей книге, слой за слоем раскрываясь вокруг трёх опор: - **Глава 1 · Основы**: Выстраивает целостную когнитивную рамку агентных систем — понять определение агента в RL, сравнить различия в эффективности выборки между традиционным RL и парадигмой LLM+RL, освоить новую парадигму «модель как агент» и базовую формулу **Агент = Модель + Контекст + Инструменты**. **Ключевой вывод**: важность априорного знания превосходит алгоритмы и среды. - **Главы 2–3 · Контекст**: Контекст — операционная система агента. Глава 2 охватывает системные промпты, дружественный к KV Cache дизайн, сжатие контекста и абляции инженерии промптов. Глава 3 — пользовательскую память, плотный/разреженный/гибридный поиск, агентный RAG, контекстное извлечение и структурированное извлечение знаний. **Ключевой вывод**: полный контекст включает системные инструкции, историю диалога, процессы рассуждения, записи взаимодействий с инструментами, память пользователя и внешние знания. - **Главы 4–5 · Инструменты**: Инструменты — мост взаимодействия агента с миром. Глава 4 охватывает три типа MCP-инструментов (восприятие/исполнение/сотрудничество), событийные триггеры и асинхронную архитектуру. Глава 5 подробно разбирает полную реализацию промышленного кодинг-агента. **Ключевой вывод**: инструменты стоит проектировать универсально (интерпретатор кода лучше калькулятора); код — это мета-способность создавать новые инструменты. - **Главы 6–7 · Модель**: Как измерять и усиливать интеллект. Глава 6 охватывает бенчмарки оценки — Terminal-Bench, SWE-bench, GAIA, OSWorld, Tau2-Bench. Глава 7 — техники постобучения: SFT, RL, RLHF и эффективность выборки. **Ключевой вывод**: независимый сигнал проверки надёжнее, чем «попросить модель подумать ещё раз»; «модель как агент» через RL внедряет вызов инструментов как врождённую способность. - **Глава 8 · Самоэволюция**: Позволяет агентам расти на опыте без изменения весов — обучение на опыте, экстернализация рабочих процессов в инструменты, дистилляция промптов и наблюдений в параметры. **Ключевой вывод**: обучение на опыте — ключ к переходу агента от «умного» к «умелому». - **Главы 9–10 · Расширение и сотрудничество**: Глава 9 расширяет восприятие и действие с текста на речь, GUI и физический мир. Глава 10 использует разделение труда между агентами для сложных задач. **Ключевой вывод**: каждое проектное решение в мультиагентной системе находит аналог в трёх элементах одиночного агента. ## Разделение текста и экспериментов Книга не является пошаговым руководством по одному SDK. Короткий псевдокод и скелеты показывают поток состояния, точки остановки и границы проверки; эксперименты содержат полные реализации, адаптеры, тесты, журналы и доказательства. | Уровень | Сначала прочитать | Пока пропустить | На какой вопрос отвечает | | :--: | --- | --- | --- | | **Starter** | README проекта: цель, минимальная команда и критерии приёмки; соответствующий skeleton в тексте | учётные данные, интерфейс, адаптеры провайдеров и длинные необработанные журналы | Какой механизм должен показать этот эксперимент? | | **Builder** | точка входа, основной цикл, схема состояния/сообщений, инструменты и проверяющий модуль | слои совместимости и развёртывания, не относящиеся к механизму | Какая переменная изменила поведение? | | **Maintainer** | тесты, обработка сбоев, формат доказательств, manifest/hash и путь отката | детали сторонних компонентов, нужные только при изменении эксперимента | Воспроизводим ли результат и честно ли записаны сбои? | ### Уровни сложности - **Начальный** (главы 1–2): для новичков, понимание базовых понятий. - **Средний** (главы 3–4): нужна база в программировании, затрагивает интеграцию систем. - **Продвинутый** (главы 5–6): нужны сильные навыки программирования, сложное проектирование систем. - **Экспертный** (главы 7–8): нужен опыт глубокого обучения и обучения/самоэволюции. - **Прикладной** (главы 9–10): комплексное применение предыдущих знаний для создания практических приложений. ### Практические советы 1. **Практика руками**: каждый проект рассчитан на самостоятельный запуск. Рекомендуется запускать и модифицировать код самому. 2. **Совмещайте с книгой**: читайте соответствующие главы в каталоге [`book-ru/`](../../book-ru/) (русский) или [`book/`](../../book/) (китайский оригинал) этого репозитория, чтобы понять связь теории и практики. 3. **Сравнение экспериментов**: многие проекты включают абляции и сравнительные эксперименты. Углубляйте понимание через сравнение. 4. **Постепенное обучение**: начинайте с простых проектов и постепенно углубляйтесь в сложные системы. 5. **Внимание к протоколам**: проект MCP-сервера в главе 4 демонстрирует стандартизированные протоколы инструментов — ключ к построению масштабируемых агентов.