Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
49 lines
11 KiB
Markdown
49 lines
11 KiB
Markdown
# Глава 7 · Оценка агентов
|
||
|
||
> Превращает качество агента в сравнимые сигналы. Охватывает среды оценки, дизайн наборов данных, системы метрик, статистическую значимость, наблюдаемость, выбор на основе оценки, а также промышленные внутренние среды оценки и симуляции.
|
||
|
||
← [К оглавлению](../docs/ru/README.md) · 📖 [Читать главу](../book-ru/chapter7.md)
|
||
|
||
## Как читать эксперименты
|
||
|
||
В основном тексте короткие скелеты механизмов объясняют поток управления; в каталогах экспериментов находятся полные адаптеры SDK, журналы, тесты и приёмочные доказательства. Читать каждый файл построчно не требуется.
|
||
|
||
- **Starter:** Начните с цели, минимальной команды и условий приёмки; начните с [tau2-bench-eval](tau2-bench-eval/);
|
||
- **Builder:** Проследите точку входа, основной цикл, схему состояния/сообщений, инструменты и проверяющий модуль.
|
||
- **Maintainer:** Затем изучите тесты, манифесты доказательств, обработку сбоев, откат и адаптеры провайдеров.
|
||
|
||
При первом чтении можно пропустить ключи, слой представления и совместимость провайдеров; вернитесь при воспроизведении чисел.
|
||
|
||
## Сопутствующие проекты
|
||
|
||
| Эксп. | Проект | Тип | Описание |
|
||
| :--: | --- | :--: | --- |
|
||
| 6-1 | `tau2-bench/` | 📖 | Фокусируется на оценке способности агента использовать инструменты для сложных рассуждений, включая сценарии вычислений, поиска и обработки данных. |
|
||
| 6-2 | `tau2-bench/` | 📖 | Ручное выполнение градуированных задач τ²-bench с записью траекторий. |
|
||
| 6-3 | [user-memory-evaluation](../chapter3/user-memory-evaluation/) | ✅ | Применяет четырёхуровневую рубрику к 180 структурированным оценкам с доказательствами и запретом галлюцинаций. |
|
||
| 6-4 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | Запускает 60 случаев на трёх системах с полным учётом стоимости. |
|
||
| 6-5 | [user-memory-policy-eval](user-memory-policy-eval/) | ✅ | Запускает 11 негативных случаев с префиксами траекторий для представлений памяти в JSON, Markdown и Python-подобном формате, с реальными вызовами OpenRouter и детерминированными проверками политик. |
|
||
| 6-11 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | Полная матрица 4×3×2×60 сохранила 1 440/1 440 реальных траекторий без ошибок и неучтённого использования, с полными метриками поиска и задач, анализом взаимодействия и успешно пройденной независимой проверкой. |
|
||
| 6-13 | [openvla-robotwin2-eval](openvla-robotwin2-eval/) | ✅ | Официальный запуск на одной GPU завершил по 256 эпизодов в каждой группе: chunk 1 — 0/256, chunk 25 — 26/256; сохранены хэши 512 rollout. |
|
||
| 6-2 | `terminal-bench/` | 📖 | Terminal-Bench — бенчмарк для проверки качества ИИ-агентов в реальных терминальных средах. От компиляции кода до обучения моделей и настройки серверов — оценивает, как агенты справляются с реальными сквозными задачами. Включает набор из ~100 задач и фреймворк исполнения, поддерживая разные реализации агентов. |
|
||
| 6-2 | `SWE-bench/` | 📖 | SWE-bench — бенчмарк для оценки способности больших языковых моделей решать реальные GitHub-issue. По кодовой базе и описанию проблемы модель должна сгенерировать патч, устраняющий проблему. Включает несколько версий: SWE-bench, SWE-bench Lite, SWE-bench Verified и SWE-bench Multimodal. |
|
||
| 6-2 | `GAIA/` | 📖 | GAIA нацелен на оценку LLM нового поколения (с дополнением инструментами, эффективным промптингом, доступом к поиску и т. д.). Содержит 450+ нетривиальных вопросов, требующих разной степени использования инструментов и автономности, с однозначными ответами. Разделён на 3 уровня сложности. |
|
||
| 6-2 | `OSWorld/` | 📖 | Оценивает способность агентов выполнять сложные задачи в полноценной среде операционной системы, включая управление файлами, работу с приложениями и настройку системы. |
|
||
| 6-2, 6-12 | `android_world/` | 📖 | Оценивает качество агента в мобильной среде Android: навигация по приложениям, взаимодействие с UI и выполнение задач (внешний репозиторий бенчмарка). |
|
||
| 6-6 | [tts-quality-eval](tts-quality-eval/) | ✅ | Синтезирует один и тот же набор сложных текстов разными конфигурациями TTS (модель/голос/скорость), затем через мультимодальный LLM-as-a-Judge оценивает каждое измерение (чёткость, естественность и т. д.) по рубрике, агрегируя результаты в воспроизводимую сравнительную таблицу конфигураций. |
|
||
| 6-7 | [elo-leaderboard](elo-leaderboard/) | ✅ | Реализует таблицу лидеров агентов на основе рейтинговой системы ELO, оценивая относительные способности разных агентов через попарные сравнения. |
|
||
| 6-8 | [model-action-threshold](model-action-threshold/) | ✅ | Сравнивает GPT-5.6-sol и Claude Sonnet 5 в момент перехода от исследования к первой правке при одном и том же нейтральном Coding Harness; все 18/18 ячеек завершены без ошибок API, а [манифест](model-action-threshold/results/exp6-7-action-threshold-20260731-v1/manifest.json) связывает траектории и сводки проверяемыми хешами. |
|
||
| 6-9 | [agent-cost-analysis](agent-cost-analysis/) | ✅ | Делает сквозную декомпозицию стоимости для типичной многораундовой задачи агента (возврат в поддержке): с помощью собственной лёгкой системы трассировки записывает входные/выходные/кэш-токены, задержку и стоимость каждого вызова LLM, агрегирует, чтобы найти «самый дорогой шаг», а затем A/B-тестами количественно оценивает реальную экономию от дружественного к KV-кэшу дизайна и сжатия контекста. |
|
||
| 6-10 | [model-benchmark](model-benchmark/) | 🚧 | Проводит горизонтальный бенчмарк нескольких OpenAI-совместимых провайдеров LLM API. Через потоковый интерфейс точно измеряет время до первого токена (TTFT), рассчитывает перцентили сквозной задержки (p50/p95), пропускную способность и долю успеха при конкурентности. Одной командой строит многомерную сравнительную таблицу, показывая, что выбор модели — это многогранный компромисс, а не просто взгляд на таблицу лидеров. |
|
||
| 6-12 | [android-world](android-world/) | 📖 | Внутрирепозиторные отчёт и разбор ошибок T3A на AndroidWorld (старт эксперимента 6-12; не исходники бенчмарка). |
|
||
| — | [public-health-reporting-eval](public-health-reporting-eval/) | ✅ | На синтетических агрегированных данных в стиле DHIS2 объективно оценивает вызовы инструментов, точность вычислений, цитирование доказательств и неподтверждённые утверждения у агента отчётности в общественном здравоохранении. |
|
||
|
||
> Внешние бенчмарки в обратных кавычках нужно клонировать отдельно. [`android-world/`](android-world/) (через дефис) — **аналитические заметки T3A** в этом репозитории (см. [README](android-world/README.md)), это не тот же путь, что внешний `android_world/`.
|
||
## Типы проектов
|
||
|
||
| Значок | Тип | Значение |
|
||
| :--: | --- | --- |
|
||
| ✅ | **Автономный** | Полный код в этом репозитории, запускается после настройки API-ключа |
|
||
| 📖 | **Гайд по воспроизведению** | Подробный документ, зависящий от **внешних репозиториев** через `git clone` |
|
||
| 🚧 | **Проектный документ** | Только архитектура/план реализации, рабочий код ещё в разработке |
|