Files
ai-agent-book/chapter7/README.ta.md
T
liqiang b119135836
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
2026-08-20 13:12:50 +00:00

50 lines
16 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# அத்தியாயம் 7 · ஏஜென்ட் மதிப்பீடு
> ஏஜெண்டின் செயல்திறனை ஒப்பிடக்கூடிய சமிக்ஞைகளாக மாற்றுகிறது. மதிப்பீட்டுச் சூழல்கள், தரவுத்தொகுப்பு வடிவமைப்பு, அளவுகோல் அமைப்பு முதல் புள்ளியியல் முக்கியத்துவம், கண்காணிப்புத்தன்மை, மதிப்பீடு-இயக்கப்படும் தேர்வு வரை, மேலும் உற்பத்தி-தர உள் மதிப்பீடு மற்றும் உருவகப்படுத்துதல் சூழல்கள் வரை விவரிக்கிறது.
← [முக்கிய README க்குத் திரும்பு](../docs/ta/README.md) · 📖 [அத்தியாய உரையைப் படி](../book-ta/chapter7.ta.md)
## சோதனைகளை எப்படிப் படிப்பது
முதன்மை உரை குறுகிய mechanism skeleton-களால் control flow-ஐ விளக்குகிறது; முழு SDK adapters, logs, tests, acceptance evidence ஆகியவை experiment கோப்பகத்தில் உள்ளன. ஒவ்வொரு கோப்பையும் வரி வரியாகப் படிக்க வேண்டியதில்லை.
- **Starter:** இலக்கு, குறைந்தபட்ச கட்டளை, ஏற்றுக்கொள்ளும் நிபந்தனைகளில் தொடங்குங்கள்; முதலில் [tau2-bench-eval](tau2-bench-eval/);
- **Builder:** நுழைவுப் புள்ளி, மையச் சுழற்சி, state/message schema, கருவிகள், verifier ஆகியவற்றைப் பின்தொடருங்கள்.
- **Maintainer:** பின்னர் tests, evidence manifest, தோல்வி கையாளல், rollback பாதை, provider adapter ஆகியவற்றைப் படியுங்கள்.
முதல் வாசிப்பில் credentials, UI, provider-compatibility அடுக்குகளைத் தவிர்க்கலாம்; முடிவுகளை மீண்டும் உருவாக்கும்போது திரும்பிப் பாருங்கள்.
## துணை திட்டங்கள்
| சோதனை | Project | Type | Description |
| :--: | --- | :--: | --- |
| 6-1 | `tau2-bench/` | 📖 | கணிப்பு, தேடல் மற்றும் தரவுச் செயலாக்கம் போன்ற சூழ்நிலைகள் உட்பட, கருவிகளைப் பயன்படுத்தி ஏஜென்ட் சிக்கலான பகுத்தறிவு மேற்கொள்ளும் திறனை மதிப்பீடு செய்வதில் கவனம் செலுத்துகிறது. |
| 6-2 | `tau2-bench/` | 📖 | தரப்படுத்தப்பட்ட τ²-bench பணிகளை கைமுறையாக முடித்து trajectory-களை பதிவு செய்கிறது. |
| 6-3 | [user-memory-evaluation](../chapter3/user-memory-evaluation/) | ✅ | 180 கட்டமைக்கப்பட்ட மதிப்பீடுகளில் நான்கு-நிலை rubric-ஐ ஆதாரங்களுடனும் hallucination veto-வுடனும் இயக்குகிறது. |
| 6-4 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | முழுமையான செலவுக் கணக்கீட்டுடன் மூன்று அமைப்புகளில் 60 cases-ஐ இயக்குகிறது. |
| 6-5 | [user-memory-policy-eval](user-memory-policy-eval/) | ✅ | JSON, Markdown மற்றும் Python போன்ற நினைவகப் பிரதிநிதித்துவங்களில் 11 trajectory-prefix தவறான cases-ஐ உண்மையான OpenRouter அழைப்புகளுடனும் நிர்ணயிக்கப்பட்ட policy சோதனைகளுடனும் இயக்குகிறது. |
| 6-11 | [user-memory-system-evaluation](user-memory-system-evaluation/) | ✅ | முழு 4×3×2×60 matrix-ல் 1,440/1,440 உண்மையான trajectory-கள் பிழையோ விலையிடப்படாத பயன்பாடோ இன்றி சேமிக்கப்பட்டுள்ளன; retrieval/task அளவீடுகள், interaction analysis மற்றும் சுயாதீன சரிபார்ப்பு நிறைவேறியுள்ளன. |
| 6-13 | [openvla-robotwin2-eval](openvla-robotwin2-eval/) | ✅ | ஒற்றை GPU அதிகாரப்பூர்வ இயக்கம் ஒவ்வொரு action-chunk குழுவிலும் 256 episode-களை முடித்தது; chunk 1: 0/256, chunk 25: 26/256, மேலும் 512 rollout hash-கள் சேமிக்கப்பட்டன. |
| 6-2 | `terminal-bench/` | 📖 | Terminal-Bench என்பது உண்மையான முனையச் சூழலில் AI ஏஜென்ட்டின் செயல்திறனைச் சோதிக்கும் ஒரு தரநிர்ணயம் ஆகும். குறியீட்டைத் தொகுப்பதில் இருந்து மாதிரிகளைப் பயிற்றுவித்தல், சேவையகங்களை அமைத்தல் வரை, ஏஜென்ட் உண்மையான end-to-end பணிகளை எவ்வாறு கையாள்கிறது என்பதை மதிப்பீடு செய்கிறது. சுமார் 100 பணிகள் கொண்ட தரவுத்தொகுப்பு மற்றும் செயல்படுத்தும் கட்டமைப்பை உள்ளடக்கியது, பல ஏஜென்ட் செயலாக்கங்களை ஆதரிக்கிறது. |
| 6-2 | `SWE-bench/` | 📖 | SWE-bench என்பது பெரிய மொழி மாதிரிகள் உண்மையான GitHub சிக்கல்களைத் தீர்க்கும் திறனை மதிப்பீடு செய்யும் ஒரு தரநிர்ணயம் ஆகும். குறியீட்டுத் தளமும் சிக்கல் விளக்கமும் கொடுக்கப்பட்டால், மாதிரி சிக்கலைத் தீர்க்கக்கூடிய ஒரு பேட்சை உருவாக்க வேண்டும். SWE-bench, SWE-bench Lite, SWE-bench Verified மற்றும் SWE-bench Multimodal உட்படப் பல பதிப்புகளைக் கொண்டுள்ளது. |
| 6-2 | `GAIA/` | 📖 | GAIA என்பது அடுத்த தலைமுறை LLM-களை (கருவி மேம்பாடு, திறமையான அறிவுறுத்தல், தேடல் அணுகல் போன்ற திறன்கள் கொண்ட LLM-கள்) மதிப்பீடு செய்வதை நோக்கமாகக் கொண்டது. வெவ்வேறு அளவிலான கருவிகள் மற்றும் தன்னாட்சி தேவைப்படும் 450+ எளிதல்லாத கேள்விகளைக் கொண்டுள்ளது, பதில்கள் தெளிவானவை மற்றும் இருபொருளற்றவை. 3 சிரம நிலைகளாகப் பிரிக்கப்பட்டுள்ளது. |
| 6-2 | `OSWorld/` | 📖 | முழுமையான இயக்க முறைமைச் சூழலில் ஏஜென்ட் சிக்கலான பணிகளைச் செயல்படுத்தும் திறனை மதிப்பீடு செய்கிறது, கோப்பு மேலாண்மை, பயன்பாட்டுச் செயல்பாடுகள் மற்றும் கணினி கட்டமைப்பு ஆகியவை உட்பட. |
| 6-2, 6-12 | `android_world/` | 📖 | Android மொபைல் சூழலில் ஏஜென்ட்டின் செயல்திறனை மதிப்பீடு செய்கிறது, பயன்பாட்டு வழிசெலுத்தல், UI தொடர்பு மற்றும் பணி நிறைவு திறன் ஆகியவை உட்பட (வெளிப்புற benchmark களஞ்சியம்). |
| 6-6 | [tts-quality-eval](tts-quality-eval/) | ✅ | பல TTS கட்டமைப்புகளை (வெவ்வேறு model/voice/speed) பயன்படுத்தி ஒரே சவாலான உரைத் தொகுப்பை ஒலியாக்கி, பின்னர் மல்டிமோடல் LLM-as-a-Judge மூலம் Rubric இன்படி ஒவ்வொரு பரிமாணத்திற்கும் (தெளிவுத்தன்மை/இயற்கைத்தன்மை போன்றவை) மதிப்பெண் வழங்கி, மீண்டும் உருவாக்கக்கூடிய கட்டமைப்பு ஒப்பீட்டு அட்டவணையாகத் தொகுக்கிறது. |
| 6-7 | [elo-leaderboard](elo-leaderboard/) | ✅ | ELO மதிப்பீட்டு அமைப்பின் அடிப்படையில் ஏஜென்ட் செயல்திறன் தரவரிசைப் பட்டியலைச் செயல்படுத்துகிறது, ஜோடிவரிசைப் போட்டிகள் மூலம் வெவ்வேறு ஏஜென்ட்டுகளின் ஒப்பீட்டுத் திறன்களை மதிப்பீடு செய்கிறது. |
| 6-8 | [model-action-threshold](model-action-threshold/) | ✅ | ஒரே நடுநிலையான Coding Harness-இல் GPT-5.6-sol மற்றும் Claude Sonnet 5 ஆகியவை ஆராய்ச்சியிலிருந்து முதல் திருத்தத்துக்கு நகரும் நுழைவுநிலையை ஒப்பிடுகிறது; 18/18 செல்களும் API பிழையின்றி நிறைவடைந்தன, மேலும் [manifest](model-action-threshold/results/exp6-7-action-threshold-20260731-v1/manifest.json) செயல்தடங்களையும் சுருக்கங்களையும் சரிபார்க்கக்கூடிய hash-களால் இணைக்கிறது. |
| 6-9 | [agent-cost-analysis](agent-cost-analysis/) | ✅ | ஒரு பொதுவான பல-சுற்று ஏஜென்ட் பணிக்கு (வாடிக்கையாளர் சேவை பணம் திரும்பப்பெறுதல்) முழு-சங்கிலி செலவுப் பிரிவை மேற்கொள்கிறது: சுயமாக உருவாக்கிய இலகுரக tracing மூலம் ஒவ்வொரு LLM அழைப்பின் உள்ளீடு/வெளியீடு/கேச் டோக்கன்கள், தாமதம் மற்றும் செலவைப் பதிவு செய்து, "எந்தப் படி அதிக செலவாகிறது" என்பதைத் தொகுத்தறிந்து, பின்னர் A/B சோதனைகள் மூலம் KV-cache நட்பு வடிவமைப்பு + சூழல் சுருக்கம் ஆகியவற்றால் கிடைக்கும் உண்மையான சேமிப்பை அளவிடுகிறது. |
| 6-10 | [model-benchmark](model-benchmark/) | 🚧 | பல OpenAI-இணக்கமான LLM API வழங்குநர்களுக்கு கிடைமட்ட ஒப்பீட்டுத் தரநிர்ணயம் நடத்துகிறது, நீரோட்ட இடைமுகம் மூலம் முதல் டோக்கன் தாமதத்தை (TTFT) துல்லியமாக அளவிடுகிறது, இணையான சுமையின் கீழ் end-to-end தாமத குவான்டைல்கள் (p50/p95), செயலாக்க விகிதம் (throughput) மற்றும் வெற்றி விகிதம் ஆகியவற்றை அளவிடுகிறது, ஒரே கட்டளையில் பல்-பரிமாண ஒப்பீட்டு அட்டவணையை உருவாக்குகிறது, மேலும் மாதிரி தேர்வு என்பது தரவரிசைப் பட்டியலை மட்டும் பார்ப்பதல்ல, பல்-பரிமாணச் சமநிலை என்பதை விளக்குகிறது. |
| 6-12 | [android-world](android-world/) | 📖 | இந்தக் களஞ்சியத்தில் உள்ள AndroidWorld மீதான T3A மதிப்பீட்டு அறிக்கை மற்றும் தோல்வி பகுப்பாய்வு குறிப்புகள் (சோதனை 6-12 தொடக்கம்; benchmark மூலக் குறியீடு அல்ல). |
| — | [public-health-reporting-eval](public-health-reporting-eval/) | ✅ | செயற்கையான DHIS2-பாணி ஒருங்கிணைந்த தரவைப் பயன்படுத்தி, பொது சுகாதார அறிக்கையிடல் ஏஜென்ட்டின் கருவி அழைப்புகள், கணக்கீட்டுத் துல்லியம், ஆதார மேற்கோள்கள் மற்றும் ஆதாரமற்ற கூற்றுகளைப் புறநிலையாக மதிப்பீடு செய்கிறது. |
> 📖 Backtick குறியில் உள்ள வெளிப்புற benchmark-களை தனியாக clone செய்ய வேண்டும். [`android-world/`](android-world/) (hyphen) என்பது இந்தக் களஞ்சியத்தின் **T3A மதிப்பீட்டு பகுப்பாய்வுக் குறிப்புகள்** (அதன் [README](android-world/README.md) பார்க்க); இது வெளிப்புற `android_world/` benchmark மூலக் குறியீட்டுப் பாதை அல்ல.
## திட்ட வகைகள்
| சின்னம் | வகை | பொருள் |
| :--: | --- | --- |
| ✅ | **தனித்து இயங்கும்** | முழு குறியீடு இந்த களஞ்சியத்தில், API Key உள்ளமைத்தவுடன் இயங்கும் |
| 📖 | **மறு உருவாக்க வழிகாட்டி** | **வெளிப்புற களஞ்சியங்களை** `git clone` செய்ய வேண்டிய விரிவான ஆவணம் |
| 🚧 | **வடிவமைப்பு ஆவணம்** | கட்டமைப்பு/செயலாக்கத் திட்டம் மட்டும், இயங்கும் குறியீடு இன்னும் WIP |