Files
ai-agent-book/chapter8/README.ru.md
T
liqiang b119135836
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
2026-08-20 13:12:50 +00:00

49 lines
8.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Глава 8 · Постобучение модели
> Четыре части — предобучение, Mid-training, SFT и RL: программа длинного контекста и данные, закрепление протокола через SFT, среды и награды RL, эффективность выборки от одного раунда к многим.
← [К оглавлению](../docs/ru/README.md) · 📖 [Читать главу](../book-ru/chapter8.md)
## Как читать эксперименты
В основном тексте короткие скелеты механизмов объясняют поток управления; в каталогах экспериментов находятся полные адаптеры SDK, журналы, тесты и приёмочные доказательства. Читать каждый файл построчно не требуется.
- **Starter:** Начните с цели, минимальной команды и условий приёмки; начните с [cot-distillation](cot-distillation/);
- **Builder:** Проследите точку входа, основной цикл, схему состояния/сообщений, инструменты и проверяющий модуль.
- **Maintainer:** Затем изучите тесты, манифесты доказательств, обработку сбоев, откат и адаптеры провайдеров.
При первом чтении можно пропустить ключи, слой представления и совместимость провайдеров; вернитесь при воспроизведении чисел.
## Сопутствующие проекты
| Эксп. | Проект | Тип | Описание |
| :--: | --- | :--: | --- |
| 7-1, 7-2 | [learning-from-experience](../chapter1/learning-from-experience/) | ✅ | Запускает Q-learning и LLM-агента в одной среде поиска сокровищ для обучения на опыте. |
| 7-8 | [prompt-distillation](../chapter8/prompt-distillation/) | ✅ | Дистиллирует примеры учителя в prompt ученика и сравнивает качество и стоимость. |
| 7-3, 7-4 | [MiniMind-pretrain](MiniMind-pretrain/) | 📖 | Предобучает малую языковую модель с нуля, чтобы понять полный процесс предобучения и ключевые технологии. |
| 7-5 | [continued-pretraining](continued-pretraining/) | ✅ | Выполняет продолженное предобучение на доменных данных для повышения качества модели в целевой области. |
| 7-6 | [sesame](sesame/) | ✅ | Sesame CSM speech SFT: дообучение 1B TTS-модели методом LoRA, управление выразительностью паралингвистическими тегами `<laugh>`, `<sigh>` |
| 7-6 | [orpheus](orpheus/) | ✅ | Orpheus 3B speech SFT: дообучение TTS-модели методом LoRA, клонирование голоса по референсному аудио с сохранением тембра между фразами |
| 7-7 | [MultilingualReasoning](MultilingualReasoning/) | ✅ | Обучает рассуждения модели в многоязычной среде, повышая качество на кросс-язычных задачах. |
| 7-9 | [cot-distillation](cot-distillation/) | ✅ | Дистиллирует CoT-траектории из передовых моделей вроде Claude через OpenRouter; проверяет правилами и превращает в данные для SFT (сопровождает эксперимент 7-9). |
| 7-10 | [AdaptThink](AdaptThink/) | 📖 | Учит рассуждающие модели адаптивно выбирать режим рассуждения (Thinking или NoThinking) в зависимости от сложности задачи. Через оптимизацию с ограничениями и importance sampling значительно снижает стоимость рассуждений (45–69%) при росте точности. На базе модели DeepSeek-R1-Distill-Qwen, обучение алгоритмом DAPO. |
| 7-11 | `SFTvsRL/` | 📖 | Систематически сравнивает эффективность обучения с учителем (SFT) и обучения с подкреплением (RL) на разных задачах, анализируя сильные и слабые стороны и подходящие сценарии обоих методов. |
| 7-12 | [SpatialReasoning](SpatialReasoning/) | 📖 | Сфокусирован на обучении пространственных рассуждений модели для задач с пространственными отношениями — положением, направлением, расстоянием. |
| 7-13 | [SimpleVLA-RL](SimpleVLA-RL/) | 📖 | Объединяет зрение, язык и действие в обучении с подкреплением, позволяя моделям понимать визуальный вход и выполнять соответствующие действия. |
| 7-14 | [retool](retool/) | 📖 | Использует многораундовый диалог и песочницу кода для усиления математических рассуждений больших языковых моделей. Через двухэтапное обучение SFT и RL модель учится применять среду исполнения кода при решении математических задач. На базе Qwen2.5-32B-Instruct, обучение на AIME 2024 алгоритмом DAPO и песочницей SandboxFusion. |
| 7-15 | `AWorld/` · [AWorld-train](AWorld-train/) | 📖 | Обучает воплощённых агентов на базе фреймворка AWorld, позволяя им выполнять сложные задачи в виртуальной среде и учиться на опыте. |
| 7-16 | [RLVP](RLVP/) | 📖 | Исследование постобучения по принципу «награждаем результат, штрафуем путь» (RLVP) (сопровождает эксперимент 7-16); полный код обучения/оценки находится в отдельном репозитории статьи `19PINE-AI/rlvp`, его нужно клонировать самостоятельно |
| 7-17 | [premature-completion-dpo](premature-completion-dpo/) | ✅ | DPO-исправление bad case преждевременного завершения на GPU. |
| 7-18 | [curly-quote-sft](curly-quote-sft/) | ✅ | Аудированный scope-sensitive SFT китайских кавычек: 1024/256/256 train/holdout/boundary, 10 типов статей и 9 языков программирования; Qwen3-8B даёт exact 96,9%/97,7% и 100% сохранения защищённых областей на GPU. |
| 7-19 | [exact-copy-sft](exact-copy-sft/) | ✅ | Аудированный byte-exact SFT специальных строк: 1024/256/256 примеров; Qwen3-8B даёт 78,9% holdout и 80,1% boundary, с аудитом токенизаторов Qwen3/Qwen2.5/Mistral. |
| — | `verl/` | 📖 | verl — эффективный фреймворк обучения с подкреплением, специально созданный для RLHF-обучения больших языковых моделей, поддерживает алгоритмы PPO, GRPO, DAPO и др. |
| — | [Intuitor](Intuitor/) | ✅ | Обучает интуитивные рассуждения модели, позволяя ей делать быстрые обоснованные суждения без развёрнутой цепочки рассуждений. |
| — | `tinker-cookbook/` | 📖 | Собирает практические приёмы и лучшие практики обучения моделей. |
## Типы проектов
| Значок | Тип | Значение |
| :--: | --- | --- |
| ✅ | **Автономный** | Полный код в этом репозитории, запускается после настройки API-ключа |
| 📖 | **Гайд по воспроизведению** | Подробный документ, зависящий от **внешних репозиториев** через `git clone` |
| 🚧 | **Проектный документ** | Только архитектура/план реализации, рабочий код ещё в разработке |