# Глава 7 · Оценка агентов > Превращает качество агента в сравнимые сигналы. Охватывает среды оценки, дизайн наборов данных, системы метрик, статистическую значимость, наблюдаемость, выбор на основе оценки, а также промышленные внутренние среды оценки и симуляции. ← [К оглавлению](../docs/ru/README.md) · 📖 [Читать главу](../book-ru/chapter7.md) ## Как читать эксперименты В основном тексте короткие скелеты механизмов объясняют поток управления; в каталогах экспериментов находятся полные адаптеры SDK, журналы, тесты и приёмочные доказательства. Читать каждый файл построчно не требуется. - **Starter:** Начните с цели, минимальной команды и условий приёмки; начните с [tau2-bench-eval](tau2-bench-eval/); - **Builder:** Проследите точку входа, основной цикл, схему состояния/сообщений, инструменты и проверяющий модуль. - **Maintainer:** Затем изучите тесты, манифесты доказательств, обработку сбоев, откат и адаптеры провайдеров. При первом чтении можно пропустить ключи, слой представления и совместимость провайдеров; вернитесь при воспроизведении чисел. ## Сопутствующие проекты | Эксп. | Проект | Тип | Описание | | :--: | --- | :--: | --- | | 6-1 | `tau2-bench/` | 📖 | Фокусируется на оценке способности агента использовать инструменты для сложных рассуждений, включая сценарии вычислений, поиска и обработки данных. | | 6-2 | `tau2-bench/` | 📖 | Ручное выполнение градуированных задач τ²-bench с записью траекторий. | | 6-3 | [user-memory-evaluation](../chapter3/user-memory-evaluation/) | ✅ | Применяет четырёхуровневую рубрику к 180 структурированным оценкам с доказательствами и запретом галлюцинаций. | | 6-4 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | Запускает 60 случаев на трёх системах с полным учётом стоимости. | | 6-5 | [user-memory-policy-eval](user-memory-policy-eval/) | ✅ | Запускает 11 негативных случаев с префиксами траекторий для представлений памяти в JSON, Markdown и Python-подобном формате, с реальными вызовами OpenRouter и детерминированными проверками политик. | | 6-11 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | Полная матрица 4×3×2×60 сохранила 1 440/1 440 реальных траекторий без ошибок и неучтённого использования, с полными метриками поиска и задач, анализом взаимодействия и успешно пройденной независимой проверкой. | | 6-13 | [openvla-robotwin2-eval](openvla-robotwin2-eval/) | ✅ | Официальный запуск на одной GPU завершил по 256 эпизодов в каждой группе: chunk 1 — 0/256, chunk 25 — 26/256; сохранены хэши 512 rollout. | | 6-2 | `terminal-bench/` | 📖 | Terminal-Bench — бенчмарк для проверки качества ИИ-агентов в реальных терминальных средах. От компиляции кода до обучения моделей и настройки серверов — оценивает, как агенты справляются с реальными сквозными задачами. Включает набор из ~100 задач и фреймворк исполнения, поддерживая разные реализации агентов. | | 6-2 | `SWE-bench/` | 📖 | SWE-bench — бенчмарк для оценки способности больших языковых моделей решать реальные GitHub-issue. По кодовой базе и описанию проблемы модель должна сгенерировать патч, устраняющий проблему. Включает несколько версий: SWE-bench, SWE-bench Lite, SWE-bench Verified и SWE-bench Multimodal. | | 6-2 | `GAIA/` | 📖 | GAIA нацелен на оценку LLM нового поколения (с дополнением инструментами, эффективным промптингом, доступом к поиску и т. д.). Содержит 450+ нетривиальных вопросов, требующих разной степени использования инструментов и автономности, с однозначными ответами. Разделён на 3 уровня сложности. | | 6-2 | `OSWorld/` | 📖 | Оценивает способность агентов выполнять сложные задачи в полноценной среде операционной системы, включая управление файлами, работу с приложениями и настройку системы. | | 6-2, 6-12 | `android_world/` | 📖 | Оценивает качество агента в мобильной среде Android: навигация по приложениям, взаимодействие с UI и выполнение задач (внешний репозиторий бенчмарка). | | 6-6 | [tts-quality-eval](tts-quality-eval/) | ✅ | Синтезирует один и тот же набор сложных текстов разными конфигурациями TTS (модель/голос/скорость), затем через мультимодальный LLM-as-a-Judge оценивает каждое измерение (чёткость, естественность и т. д.) по рубрике, агрегируя результаты в воспроизводимую сравнительную таблицу конфигураций. | | 6-7 | [elo-leaderboard](elo-leaderboard/) | ✅ | Реализует таблицу лидеров агентов на основе рейтинговой системы ELO, оценивая относительные способности разных агентов через попарные сравнения. | | 6-8 | [model-action-threshold](model-action-threshold/) | ✅ | Сравнивает GPT-5.6-sol и Claude Sonnet 5 в момент перехода от исследования к первой правке при одном и том же нейтральном Coding Harness; все 18/18 ячеек завершены без ошибок API, а [манифест](model-action-threshold/results/exp6-7-action-threshold-20260731-v1/manifest.json) связывает траектории и сводки проверяемыми хешами. | | 6-9 | [agent-cost-analysis](agent-cost-analysis/) | ✅ | Делает сквозную декомпозицию стоимости для типичной многораундовой задачи агента (возврат в поддержке): с помощью собственной лёгкой системы трассировки записывает входные/выходные/кэш-токены, задержку и стоимость каждого вызова LLM, агрегирует, чтобы найти «самый дорогой шаг», а затем A/B-тестами количественно оценивает реальную экономию от дружественного к KV-кэшу дизайна и сжатия контекста. | | 6-10 | [model-benchmark](model-benchmark/) | 🚧 | Проводит горизонтальный бенчмарк нескольких OpenAI-совместимых провайдеров LLM API. Через потоковый интерфейс точно измеряет время до первого токена (TTFT), рассчитывает перцентили сквозной задержки (p50/p95), пропускную способность и долю успеха при конкурентности. Одной командой строит многомерную сравнительную таблицу, показывая, что выбор модели — это многогранный компромисс, а не просто взгляд на таблицу лидеров. | | 6-12 | [android-world](android-world/) | 📖 | Внутрирепозиторные отчёт и разбор ошибок T3A на AndroidWorld (старт эксперимента 6-12; не исходники бенчмарка). | | — | [public-health-reporting-eval](public-health-reporting-eval/) | ✅ | На синтетических агрегированных данных в стиле DHIS2 объективно оценивает вызовы инструментов, точность вычислений, цитирование доказательств и неподтверждённые утверждения у агента отчётности в общественном здравоохранении. | > Внешние бенчмарки в обратных кавычках нужно клонировать отдельно. [`android-world/`](android-world/) (через дефис) — **аналитические заметки T3A** в этом репозитории (см. [README](android-world/README.md)), это не тот же путь, что внешний `android_world/`. ## Типы проектов | Значок | Тип | Значение | | :--: | --- | --- | | ✅ | **Автономный** | Полный код в этом репозитории, запускается после настройки API-ключа | | 📖 | **Гайд по воспроизведению** | Подробный документ, зависящий от **внешних репозиториев** через `git clone` | | 🚧 | **Проектный документ** | Только архитектура/план реализации, рабочий код ещё в разработке |