接进来到底有没有用
这个库能不能让一个 AI Agent 把 CPA 题做对得更多?我们把它接进 DeepSeek Harness,跟同一个模型出厂自带的联网搜索正面比了一次。 预注册实验 —— 假设、样本、指标与判读规则在跑之前定死,跑完不得改。
执行 2026-08-16 ~ 08-17 · 审计 79 题 + 会计 198 题 · 四臂各 6 轮 · 档位 max · 评测窗口内知识库内容全程冻结(212 部文书 / 10,013 单元)
95% CI [+1.0, +9.2],Holm 校正后 p = 0.013。
这是两条预注册确证性假设之一,成立。
同一批题重复跑六轮,出厂联网搜索的成绩在 78.7% 和 86.8% 之间晃; 查条级原文稳得多。探索性观察,不在预注册指标里。
区间 [−1.7, +3.3] 跨零。企业会计准则全网都搜得到, 这个库在那儿没有信息优势。
增益只在一个地方发生:当内容是搜索引擎够不到的时候。
审计准则应用指南散在中注协官网的 PDF 附件里,没有全文索引,通用搜索抓不到正文 ——
我们把它做成了 7,672 个可引用单元,实测审计线的 C 臂取到的正是
csa-1141-ag / csa-1211-ag 这类应用指南段落。
而企业会计准则原文全网都是,我们在那里提供的是可核性,不是正确率。
四个臂分别是什么
| 臂 | 能用什么 | 它回答的问题 |
|---|---|---|
| A0 | 什么都不给,纯靠模型记忆 | 基线在哪儿 |
| A1 | 出厂自带的 web_search |
诚实的外部对手 —— 不装我们的东西,用搜索引擎能做到多好 |
| B | 本库的十个 MCP 工具,不加载 skill | 光把库递给它,够不够 |
| C | 工具 + 查证纪律 skill | 完整插件的效果 |
B 与 C 的唯一差别是那份 skill,它只讲一件事:查证是用来核对的,不是用来改答案的 —— 别因为翻到一条相关条文就把本来对的结论推翻。
各臂考了多少分
审计线
79 题 × 6 轮 · 主指标 mcqp多选按 CPA 考试口径给部分分,单选 0/1。四个臂逐级加能力,只有装了完整插件的 C 越过了出厂联网搜索。
会计线
198 题 × 6 轮 · 主指标 soft会计线没有跑 A1 臂(预算取舍,见下方「不能说的话」),A0 只跑两轮作漂移锚。 所以这一科不能声称「比出厂联网搜索强」,只能比较 B 与 C。
差多少,以及这个差是不是噪声
配对比较与 95% 置信区间
题级跨轮均分 · 配对 bootstrap 20,000 次点是差值,横线是 95% 置信区间。只有区间整段落在零的一侧,方向才算测出来了; 压到零上的一律当"测不出",不当"没差别",也不当"有差别"。 标了「确证性」的两条是预注册假设,做了 Holm 多重比较校正;其余为探索性,未校正,不作结论。
审计线 C − A1 = +4.9pp 的可检出下限是 5.8pp —— 实测效应比它小,
却仍拿到了不含零的区间,这是因为配对设计(同一批题、同一轮次两两比)比独立比较灵敏得多。
收益来自哪一层:两科的答案正好相反
从纯记忆到完整插件,两段增量各贡献多少
同轮实测 · 单位 pp把 C − A0 拆成两段:裸给工具拿到多少(B−A0),
再加上查证纪律拿到多少(C−B)。两科的分布几乎是镜像的。
审计科:收益几乎全在第一段 —— 库里有了模型完全不知道的新内容,
光把工具递过去就能捞到大部分。
会计科:第一段跨零(裸给工具没收益,因为库里没有新信息),
收益全在第二段 —— 唯一能贡献的就是纪律。
这也解释了上一轮为什么「四臂打平」:上一轮只跑会计科、且用的是旧 skill,
恰好是两种收益都不成立的那一格。
逐轮成绩:查条级原文的答案更稳
审计线各臂六轮成绩
横带即该臂的跨轮极差同一批题、同一个模型、同一个档位,只是重跑。出厂联网搜索晃得最厉害 —— 同一道题,这次搜到一篇解读答对了,下次搜到另一篇就答错。 这条不在预注册指标里,属于额外观察;但对"能不能拿去交付"这件事,稳定性可能比那几个百分点更要紧。
代价:多花多少换来的
每题读入 token 与主指标
审计线 · 6 轮均值横轴是每题读进模型的 token,纵轴是分数。不做双轴 —— 两个量纲不同的度量摊成两根轴,才是它本来的样子。那条浅灰折线只是把「逐级加能力」的路径连起来,不代表趋势。
C 的读入 token 是纯记忆臂的 9.7 倍、是出厂联网搜索的 2.9 倍,每题慢约 24 秒 —— 这是那 4.9 个百分点的价钱。方案里定的 30,000 token 警戒线未被突破 (审计线 19,783 / 会计线 21,724)。值不值得看场景:只看分数性价比,这个交换比不算划算; 如果在意的是"答案有出处可核",那 skill 顺带把引用规范也管住了。
分题型
上一轮会计科出现过一个坏模式:装了 skill 的 C 在每一个题型上都比 B 低 1–2pp, 像是"查完条文反而把对的答案改坏了"。这一轮加了答案保护规则之后,它不再是全局性的。
| 审计线题型 | 题数 | A0 | A1 | B | C |
|---|---|---|---|---|---|
| 多选 | 53 | 79.6% | 80.3% | 82.7% | 84.8% |
| 单选 | 26 | 82.7% | 87.8% | 94.2% | 93.6% |
| 会计线题型 | 题数 | A0 | B | C | C − B |
|---|---|---|---|---|---|
| 单选 | 89 | 94.4% | 94.8% | 96.3% | +1.5pp |
| 多选 | 58 | 85.8% | 83.6% | 87.7% | +4.1pp |
| 数值 | 20 | 67.9% | 80.9% | 79.7% | −1.2pp |
| 分录 | 22 | 81.8% | 82.9% | 81.8% | −1.1pp |
| 综合 | 9 | 90.5% | 86.1% | 87.9% | +1.8pp |
不能说的话
以下每一条都是这次实验没有证明的,写在这里以免被引用错
- 不能说「这个插件让 AI 在 CPA 题上更强」。 会计线没有跑出厂联网搜索臂,那一科的对外命题根本没测。审计科可以说,会计科不能。
- 不能说「补库让分数提高了」。 会计线的 B 臂同样跑在新库上,跨轮变化 +0.0pp [−2.2, +2.2] —— 实测把"补库"对会计科的贡献钉成了零。
- 不能把审计科的
C − B跨零说成「skill 没用」。 它测的是查证纪律的边际价值,不是 skill 整体:skill 里"告诉模型库里新增了审计准则"那部分, 是 B 和 C 都能够到新层的前提。 - 不能把三合一的改动拆到单条。 这一轮同时改了库、改了 skill 的两块内容,要彻底分离归因还需要一个只做其中一半的臂,本轮没跑。
- 不能拿「引用可核」当增益证据。 那是我们按自己的设计定义的口径,用它自证等于同义反复。这一轮只认答对率。
- 不能拿难题子集的绝对分数跟主榜比。 审计线做过一次敏感性分析(28 题多路复核子集),方向与主榜全部一致,但那是难题子集,绝对分不可比。
方法与自检
| 项 | 做法 |
|---|---|
| 预注册 | 假设、样本量、主指标、判读规则在开跑前写死;执行中的每一处偏离单独记账 |
| 主指标 | 审计 mcqp(多选按 CPA 考试口径部分分,单选 0/1);会计 soft(客观题部分分 + 主观题 partial)。严格口径同时报 |
| 区间 | 题级跨轮均分做配对 bootstrap,20,000 次重抽样 |
| 多重比较 | 两条确证性假设做 Holm 校正;其余全部标注为探索性,不作确证结论 |
| 臂完整性 | 每轮跑完立刻自检:A0 零工具、A1 只有 web_search 零知识库调用、B/C 零 web_search、零 429 限流。12 轮全绿;因限流污染或部署中断作废重跑的 4 轮全部单独记账 |
| 题目剔除 | 审计预注册 83 题,按规则剔除 4 道甲类争议题(全是多选),实跑 79 题;数据集冻结并留 SHA |
| 检索稀释回归 | 补库往全文索引加了 10,013 个单元,实测会计题的检索结果仍以准则原文与判断步骤为主(78.2%),未构成问题 |
一个如实记录:先导阶段(20 题)有一条判据判定"审计科也是能力瓶颈、补库不会提分",形式上不通过。 全量结果否定了它。原因不是判据设计错,而是它建立在 4 道错题上,95% 区间约 [19%, 99%] —— 那一格根本没有分辨力。先导实验能有效验证接线,但不适合用来预判效应。
这个实验也直接指出了下一步该往哪补库:去补那些通用搜索够不到的层 —— 税收公告层、监管指引、应用案例,而不是继续加固已经全网可得的会计准则原文。 发现内容错误或想参与复核,欢迎联系 niuniu869@foxmail.com。