# Bab 7 ยท Evaluasi Agent > Mengubah performa menjadi sinyal yang dapat dibandingkan melalui lingkungan evaluasi, dataset, metrik, observabilitas, dan pemilihan berbasis evaluasi. โ† [Kembali ke README utama](../docs/id/README.md) ยท ๐Ÿ“– [Baca bab](../book-id/chapter7.md) ## Cara Membaca Eksperimen Teks utama memakai skeleton mekanisme singkat untuk menjelaskan alur kontrol; direktori eksperimen berisi adapter SDK lengkap, log, pengujian, dan bukti penerimaan. Anda tidak perlu membaca setiap berkas baris demi baris. - **Starter:** Mulai dari tujuan, perintah minimum, dan syarat penerimaan; awali dengan [tau2-bench-eval](tau2-bench-eval/); - **Builder:** Telusuri titik masuk, loop inti, skema status/pesan, alat, dan verifier. - **Maintainer:** Terakhir, baca pengujian, manifest bukti, penanganan kegagalan, rollback, dan adapter provider. Pada pembacaan pertama, lewati kredensial, presentasi, dan kompatibilitas provider; kembali saat mereproduksi angka. ## Proyek Pendamping | Eksperimen | Proyek | Jenis | Deskripsi | | :--: | --- | :--: | --- | | 6-1 | `tau2-bench/` | ๐Ÿ“– | Menjalankan evaluasi multi-putaran dual-control ฯ„ยฒ-bench dan membandingkannya dengan ฯ„-bench. | | 6-2 | `tau2-bench/` | ๐Ÿ“– | Menyelesaikan sampel tugas ฯ„ยฒ-bench secara manual dan mencatat trajectory. | | 6-2 | `terminal-bench/` | ๐Ÿ“– | Menguji tugas end-to-end pada lingkungan terminal nyata. | | 6-2 | `SWE-bench/` | ๐Ÿ“– | Mengevaluasi penyelesaian Issue GitHub nyata dengan patch yang dapat diuji. | | 6-2 | `GAIA/` | ๐Ÿ“– | Mengevaluasi pencarian, penggunaan tool, dan otonomi pada soal bertingkat. | | 6-2 | `OSWorld/` | ๐Ÿ“– | Mengevaluasi operasi file, aplikasi, dan konfigurasi pada lingkungan OS lengkap. | | 6-2, 6-12 | `android_world/` | ๐Ÿ“– | Mengevaluasi navigasi aplikasi dan interaksi UI pada Android. | | 6-3 | [user-memory-evaluation](../chapter3/user-memory-evaluation/) | โœ… | Menjalankan Rubric memori multi-dimensi dengan bukti untuk setiap penilaian. | | 6-4 | [user-memory-system-evaluation](user-memory-system-evaluation/) | โœ… | Membandingkan JSON Cards, RAG, dan sistem hibrida pada kumpulan kasus yang sama. | | 6-5 | [user-memory-policy-eval](user-memory-policy-eval/) | โœ… | Menjalankan 11 kasus buruk awalan trajectory pada representasi memori JSON, Markdown, dan bergaya Python dengan panggilan OpenRouter nyata serta pemeriksaan kebijakan deterministik. | | 6-6 | [tts-quality-eval](tts-quality-eval/) | โœ… | Membandingkan konfigurasi TTS menggunakan LLM multimodal sebagai juri berbasis Rubric. | | 6-7 | [elo-leaderboard](elo-leaderboard/) | โœ… | Membuat papan peringkat Agent berdasarkan perbandingan berpasangan dan rating ELO. | | 6-8 | [model-action-threshold](model-action-threshold/) | โœ… | Membandingkan GPT-5.6-sol dan Claude Sonnet 5 saat beralih dari eksplorasi ke edit pertama di bawah Coding Harness netral yang sama; seluruh 18/18 sel selesai tanpa error API, dan [manifest](model-action-threshold/results/exp6-7-action-threshold-20260731-v1/manifest.json) mengikat trajectory serta ringkasan dengan hash yang dapat diverifikasi. | | 6-9 | [agent-cost-analysis](agent-cost-analysis/) | โœ… | Mengurai biaya end-to-end dan mengukur penghematan desain ramah cache serta kompresi. | | 6-10 | [model-benchmark](model-benchmark/) | ๐Ÿšง | Mengukur TTFT, latensi, throughput, reliabilitas, dan biaya model; kampanye panjang belum selesai. | | 6-11 | [user-memory-system-evaluation](user-memory-system-evaluation/) | โœ… | Matriks penuh 4ร—3ร—2ร—60 menyimpan 1.440/1.440 trajectory nyata tanpa error atau penggunaan tanpa harga, lengkap dengan metrik retrieval dan tugas, analisis interaksi, serta verifikator independen yang lulus. | | 6-12 | [android-world](android-world/) | ๐Ÿ“– | Laporan evaluasi T3A dan analisis kegagalan AndroidWorld di dalam repositori. | | 6-13 | [openvla-robotwin2-eval](openvla-robotwin2-eval/) | โœ… | Kampanye resmi satu GPU menyelesaikan 256 episode per lengan; chunk 1 mendapat 0/256 dan chunk 25 mendapat 26/256, dengan hash untuk seluruh 512 rollout. | | โ€” | [public-health-reporting-eval](public-health-reporting-eval/) | โœ… | Mengevaluasi panggilan tool, kalkulasi, sitasi, dan klaim laporan kesehatan publik. | > Benchmark dengan nama berformat kode harus dikloning secara terpisah. `android-world/` adalah catatan analisis lokal, bukan sumber benchmark `android_world/`. ## Jenis Proyek | Ikon | Jenis | Arti | | :--: | --- | --- | | โœ… | **Mandiri** | Kode lengkap tersedia di repositori dan dapat dijalankan setelah API Key dikonfigurasi. | | ๐Ÿ“– | **Panduan Reproduksi** | Memerlukan repositori eksternal yang harus di-`git clone`. | | ๐Ÿšง | **Dalam Proses** | Implementasi atau bukti penerimaan belum lengkap. |