Files
ai-agent-book/chapter8/README.ta.md
T
liqiang b119135836
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s
ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
2026-08-20 13:12:50 +00:00

13 KiB

அத்தியாயம் 8 · மாதிரி பிந்தைய பயிற்சி

முன்-பயிற்சி, Mid-training, SFT, RL என்ற நான்கு பகுதிகள்: நீண்ட சூழல் curriculum மற்றும் தரவு அமைப்பு, SFT protocol, RL சூழல் மற்றும் reward, ஒற்றைச் சுற்றிலிருந்து பல சுற்று வரை sample efficiency.

முக்கிய README க்குத் திரும்பு · 📖 அத்தியாய உரையைப் படி

சோதனைகளை எப்படிப் படிப்பது

முதன்மை உரை குறுகிய mechanism skeleton-களால் control flow-ஐ விளக்குகிறது; முழு SDK adapters, logs, tests, acceptance evidence ஆகியவை experiment கோப்பகத்தில் உள்ளன. ஒவ்வொரு கோப்பையும் வரி வரியாகப் படிக்க வேண்டியதில்லை.

  • Starter: இலக்கு, குறைந்தபட்ச கட்டளை, ஏற்றுக்கொள்ளும் நிபந்தனைகளில் தொடங்குங்கள்; முதலில் cot-distillation;
  • Builder: நுழைவுப் புள்ளி, மையச் சுழற்சி, state/message schema, கருவிகள், verifier ஆகியவற்றைப் பின்தொடருங்கள்.
  • Maintainer: பின்னர் tests, evidence manifest, தோல்வி கையாளல், rollback பாதை, provider adapter ஆகியவற்றைப் படியுங்கள்.

முதல் வாசிப்பில் credentials, UI, provider-compatibility அடுக்குகளைத் தவிர்க்கலாம்; முடிவுகளை மீண்டும் உருவாக்கும்போது திரும்பிப் பாருங்கள்.

துணை திட்டங்கள்

சோதனை Project Type Description
7-1, 7-2 learning-from-experience அனுபவத்திலிருந்து கற்க ஒரே treasure-hunt சூழலில் Q-learning மற்றும் LLM Agent-ஐ இயக்குகிறது.
7-8 prompt-distillation ஆசிரியர் எடுத்துக்காட்டுகளை மாணவர் prompt-ஆக distill செய்து தரம் மற்றும் செலவை ஒப்பிடுகிறது.
7-3, 7-4 MiniMind-pretrain 📖 பூஜ்ஜியத்திலிருந்து சிறிய மொழி மாதிரிகளை முன்-பயிற்றுவித்து, முன்-பயிற்சியின் முழுமையான செயல்முறையையும் முக்கிய தொழில்நுட்பங்களையும் புரிந்துகொள்ளுங்கள்.
7-5 continued-pretraining குறிப்பிட்ட களத் தரவுகளில் தொடர்ச்சியான முன்-பயிற்சியை மேற்கொண்டு, இலக்குக் களத்தில் மாதிரியின் செயல்திறனை மேம்படுத்துகிறது.
7-6 sesame Sesame CSM குரல் SFT: 1B TTS மாதிரியை LoRA முறையில் நுண்சரிவு செய்து, <laugh>, <sigh> போன்ற துணைமொழிக் குறிச்சொற்களால் வெளிப்பாட்டைக் கட்டுப்படுத்துதல்
7-6 orpheus Orpheus 3B குரல் SFT: TTS மாதிரியை LoRA முறையில் நுண்சரிவு செய்து, குறிப்பு ஒலியை இணைத்து வாக்கியங்களுக்கு இடையே ஒரே குரல் ஒலித்தன்மையுடன் குரல் நகலெடுப்பு
7-7 MultilingualReasoning பல மொழிச் சூழல்களில் மாதிரியின் பகுத்தறிவுத் திறனைப் பயிற்றுவித்து, குறுக்கு-மொழிப் பணிகளில் செயல்திறனை மேம்படுத்துகிறது.
7-9 cot-distillation OpenRouter வழியாக Claude போன்ற முன்னணி மாதிரிகளிலிருந்து CoT பாதைகளை திரட்டி, விதி சரிபார்ப்பாளரால் வடிகட்டி SFT தரவை உருவாக்குகிறது (சோதனை 7-9 துணை).
7-10 AdaptThink 📖 பகுத்தறிவு மாதிரிகள் கேள்வியின் சிரமத்திற்கு ஏற்ப பகுத்தறிவு முறையை (Thinking vs NoThinking) தகவமைப்புடன் தேர்ந்தெடுக்கக் கற்றுக்கொடுக்கிறது. கட்டுப்படுத்தப்பட்ட உகப்பாக்கம் மற்றும் முக்கியத்துவ மாதிரியெடுப்பு மூலம், பகுத்தறிவு செலவை (45-69%) பெரிதும் குறைத்த அதே வேளையில் துல்லியத்தையும் மேம்படுத்துகிறது. DeepSeek-R1-Distill-Qwen மாதிரியை அடிப்படையாகக் கொண்டு, DAPO அல்காரிதம் மூலம் பயிற்றுவிக்கப்பட்டது.
7-11 SFTvsRL/ 📖 வெவ்வேறு பணிகளில் மேற்பார்வையிடப்பட்ட நுண்-சரிப்படுத்தல் (SFT) மற்றும் வலுவூட்டல் கற்றல் (RL) ஆகியவற்றின் விளைவுகளை முறையாக ஒப்பிட்டு, இரண்டு முறைகளின் நன்மை தீமைகளையும் பொருந்தும் சூழ்நிலைகளையும் பகுப்பாய்வு செய்கிறது.
7-12 SpatialReasoning 📖 இருப்பிடம், திசை, தூரம் போன்ற இடவியல் உறவுகளை உள்ளடக்கிய கேள்விகளைக் கையாள்வதற்காக மாதிரியின் இடவியல் பகுத்தறிவுத் திறனைப் பயிற்றுவிப்பதில் கவனம் செலுத்துகிறது.
7-13 SimpleVLA-RL 📖 பார்வை, மொழி மற்றும் செயலை இணைக்கும் வலுவூட்டல் கற்றல் பயிற்சி, பார்வை உள்ளீடுகளைப் புரிந்துகொண்டு தொடர்புடைய செயல்களைச் செயல்படுத்த மாதிரியைச் செய்கிறது.
7-14 retool 📖 பல-சுற்று உரையாடல்கள் மற்றும் குறியீடு மணல் பெட்டியைப் பயன்படுத்தி பெரிய மொழி மாதிரிகளின் கணிதப் பகுத்தறிவுத் திறனை மேம்படுத்துகிறது. SFT மற்றும் RL என்ற இரண்டு-கட்டப் பயிற்சி மூலம், கணிதக் கேள்விகளைத் தீர்ப்பதற்கு உதவும் வகையில் குறியீடு செயல்படுத்தும் சூழலைப் பயன்படுத்த மாதிரி கற்றுக்கொள்கிறது. Qwen2.5-32B-Instruct ஐ அடிப்படையாகக் கொண்டு, AIME 2024 தரவுத்தொகுப்பில் பயிற்றுவிக்கப்பட்டது, DAPO அல்காரிதம் மற்றும் SandboxFusion மணல் பெட்டியைப் பயன்படுத்துகிறது.
7-15 AWorld/ · AWorld-train 📖 AWorld கட்டமைப்பின் அடிப்படையில் உடல்சார் ஏஜென்ட்டுகளைப் பயிற்றுவித்து, ஏஜென்ட்டுகள் மெய்நிகர் சூழலில் சிக்கலான பணிகளைச் செயல்படுத்தவும் அனுபவத்திலிருந்து கற்றுக்கொள்ளவும் செய்கிறது.
7-16 RLVP 📖 முடிவுக்கு வெகுமதியும் பாதைக்கு தண்டனையும் (RLVP) அளிக்கும் பிந்தைய பயிற்சி ஆராய்ச்சி (சோதனை 7-16 துணை); முழுமையான பயிற்சி/மதிப்பீட்டுக் குறியீடு தனித்த ஆய்வுக் கட்டுரை களஞ்சியமான 19PINE-AI/rlvp-இல் உள்ளது, நீங்களே clone செய்ய வேண்டும்
7-17 premature-completion-dpo GPU மூலம் premature-completion bad case DPO திருத்தம்.
7-18 curly-quote-sft தணிக்கை செய்யப்பட்ட scope-sensitive சீன வளைந்த மேற்கோள் SFT: 10 கட்டுரை வகைகள், 9 நிரலாக்க மொழிகளில் train/holdout/boundary 1024/256/256; Qwen3-8B exact 96.9%/97.7%, பாதுகாக்கப்பட்ட பகுதி 100%.
7-19 exact-copy-sft தணிக்கை செய்யப்பட்ட byte-exact சிறப்பு சரம் நகல் SFT: 1024/256/256 மாதிரிகள்; Qwen3-8B holdout 78.9%, boundary 80.1%, Qwen3/Qwen2.5/Mistral tokenizer தணிக்கையுடன்.
verl/ 📖 verl என்பது பெரிய மொழி மாதிரி RLHF பயிற்சிக்காகப் பிரத்யேகமாக வடிவமைக்கப்பட்ட திறமையான வலுவூட்டல் கற்றல் கட்டமைப்பாகும், PPO, GRPO, DAPO உட்படப் பல அல்காரிதங்களை ஆதரிக்கிறது.
Intuitor மாதிரியின் உள்ளுணர்வுப் பகுத்தறிவுத் திறனைப் பயிற்றுவித்து, விரிவான சிந்தனைச் சங்கிலி தேவையில்லாமலேயே மாதிரி விரைவாக நியாயமான தீர்ப்புகளை வழங்கச் செய்கிறது.
tinker-cookbook/ 📖 பல்வேறு மாதிரி பயிற்சிக்கான நடைமுறை நுட்பங்கள் மற்றும் சிறந்த நடைமுறைகளைத் தொகுக்கிறது.

திட்ட வகைகள்

சின்னம் வகை பொருள்
தனித்து இயங்கும் முழு குறியீடு இந்த களஞ்சியத்தில், API Key உள்ளமைத்தவுடன் இயங்கும்
📖 மறு உருவாக்க வழிகாட்டி வெளிப்புற களஞ்சியங்களை git clone செய்ய வேண்டிய விரிவான ஆவணம்
🚧 வடிவமைப்பு ஆவணம் கட்டமைப்பு/செயலாக்கத் திட்டம் மட்டும், இயங்கும் குறியீடு இன்னும் WIP