ai-agent-book 精选快照(<2MB 代码与文档,来自 github.com/bojieli/ai-agent-book)
Build latest book artifacts / build (push) Canceled after 0s
dependency resolution / resolve (3.11) (push) Canceled after 0s
dependency resolution / resolve (3.13) (push) Canceled after 0s
deploy-pages / build (push) Canceled after 0s
deploy-pages / deploy (push) Canceled after 0s
i18n consistency check / check (push) Canceled after 0s
provider adoption tests / test (chapter2/context-compression) (push) Canceled after 0s
provider adoption tests / test (chapter2/prompt-injection) (push) Canceled after 0s
provider adoption tests / test (chapter2/system-hint) (push) Canceled after 0s
provider adoption tests / test (chapter3/log-sanitization) (push) Canceled after 0s
web-search-agent tests / test (push) Canceled after 0s
web-search-agent tests / agentbook (push) Canceled after 0s

This commit is contained in:
2026-08-20 13:12:50 +00:00
commit b119135836
10275 changed files with 3284984 additions and 0 deletions
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
File diff suppressed because it is too large Load Diff
@@ -0,0 +1,101 @@
{
"experiment": "exact-copy-sft",
"model": "Qwen/Qwen3-8B",
"model_open_weight": true,
"hardware": "NVIDIA RTX PRO 6000 Blackwell Workstation Edition",
"data_sha256": {
"boundary.jsonl": "25a1dab24c0ead98ba773648abb99143abdba21d2403127210656ba65417ccf7",
"eval.jsonl": "3ad8d96b12fc9c5bb1f0e3b040619be2b87b6d686027e13eed8783fb85598709",
"train.jsonl": "a56d5acc6cd24b8f6180f1043e01c84ff9d5d1351dfb3a323615fe442c8103ad"
},
"training_receipt": "validation/train_20260808T035121Z/training_receipt.json",
"evaluations": {
"eval_adapted_boundary.json": {
"label": "adapted",
"split": "boundary",
"count": 256,
"byte_exact": 0.80078125,
"mean_first_diff_byte": 54.19921875
},
"eval_adapted_eval.json": {
"label": "adapted",
"split": "eval",
"count": 256,
"byte_exact": 0.7890625,
"mean_first_diff_byte": 54.01953125
},
"eval_base_eval.json": {
"label": "base",
"split": "eval",
"count": 256,
"byte_exact": 0.375,
"mean_first_diff_byte": 29.015625
}
},
"tokenizer_audit": {
"probe_count": 512,
"tokenizers": {
"Qwen/Qwen3-8B": {
"vocab_size": 151669,
"roundtrip_rate": 0.80078125,
"mean_tokens": 34.603515625,
"failures": [
"eval-004",
"eval-009",
"eval-014",
"eval-019",
"eval-024",
"eval-029",
"eval-034",
"eval-039",
"eval-044",
"eval-049",
"eval-054",
"eval-059",
"eval-064",
"eval-069",
"eval-074",
"eval-079",
"eval-084",
"eval-089",
"eval-094",
"eval-099"
]
},
"Qwen/Qwen2.5-0.5B-Instruct": {
"vocab_size": 151665,
"roundtrip_rate": 0.80078125,
"mean_tokens": 34.603515625,
"failures": [
"eval-004",
"eval-009",
"eval-014",
"eval-019",
"eval-024",
"eval-029",
"eval-034",
"eval-039",
"eval-044",
"eval-049",
"eval-054",
"eval-059",
"eval-064",
"eval-069",
"eval-074",
"eval-079",
"eval-084",
"eval-089",
"eval-094",
"eval-099"
]
},
"mistralai/Mistral-7B-v0.1": {
"vocab_size": 32000,
"roundtrip_rate": 1.0,
"mean_tokens": 39.26171875,
"failures": []
}
}
},
"manual_audit": "validation/manual_audit.md"
}
@@ -0,0 +1,10 @@
# 特殊字符串合成数据人工抽查记录
本轮扩容后按 `tool_json``decoy_copy``verbatim` 三类任务、10 种语言上下文和 8 种文章体裁分层抽查 train/eval/boundary 的样本(每类每 split 至少 4 条,共 36 条)。逐条检查:
1. `source` 与直接复述任务的 `target` 是否完全一致;
2. `tool_json` 的 JSON 是否可解析,且 `old_string` 是否与 `source` 完全相同;
3. 空格、换行、字面量 `\\n`/`\\t`、Unicode `é`、组合字符、中文和零宽字符是否按原样保存;
4. decoy 是否与 TARGET 等长但内容不同,避免模型靠长度捷径作答。
抽查未发现目标字符串漂移、JSON 结构错误或 decoy 标记歧义。全量确定性断言见 `tests/`,跨 tokenizer 的 encode→decode 结果见 [`tokenizer_audit.json`](tokenizer_audit.json)。
@@ -0,0 +1,65 @@
{
"probe_count": 512,
"tokenizers": {
"Qwen/Qwen3-8B": {
"vocab_size": 151669,
"roundtrip_rate": 0.80078125,
"mean_tokens": 34.603515625,
"failures": [
"eval-004",
"eval-009",
"eval-014",
"eval-019",
"eval-024",
"eval-029",
"eval-034",
"eval-039",
"eval-044",
"eval-049",
"eval-054",
"eval-059",
"eval-064",
"eval-069",
"eval-074",
"eval-079",
"eval-084",
"eval-089",
"eval-094",
"eval-099"
]
},
"Qwen/Qwen2.5-0.5B-Instruct": {
"vocab_size": 151665,
"roundtrip_rate": 0.80078125,
"mean_tokens": 34.603515625,
"failures": [
"eval-004",
"eval-009",
"eval-014",
"eval-019",
"eval-024",
"eval-029",
"eval-034",
"eval-039",
"eval-044",
"eval-049",
"eval-054",
"eval-059",
"eval-064",
"eval-069",
"eval-074",
"eval-079",
"eval-084",
"eval-089",
"eval-094",
"eval-099"
]
},
"mistralai/Mistral-7B-v0.1": {
"vocab_size": 32000,
"roundtrip_rate": 1.0,
"mean_tokens": 39.26171875,
"failures": []
}
}
}
@@ -0,0 +1,21 @@
{
"experiment": "8-19-exact-copy-sft",
"run": "train_20260808T035121Z",
"model": "Qwen/Qwen3-8B",
"data_sha256": "a56d5acc6cd24b8f6180f1043e01c84ff9d5d1351dfb3a323615fe442c8103ad",
"train_examples": 1024,
"config": {
"model": "Qwen/Qwen3-8B",
"epochs": 2,
"lr": 0.0001,
"batch_size": 2,
"grad_accum": 4,
"max_length": 768,
"seed": 719,
"output": "/home/ubuntu/ai-agent-book/chapter8/exact-copy-sft/output/adapter"
},
"cuda": "NVIDIA RTX PRO 6000 Blackwell Workstation Edition",
"started_at": "2026-08-08T03:51:21.085606+00:00",
"finished_at": "2026-08-08T03:53:11.442422+00:00",
"final_loss": 1.6291709243887453e-06
}