账面Quaesto 开放平台

接进来到底有没有用

这个库能不能让一个 AI Agent 把 CPA 题做对得更多?我们把它接进 DeepSeek Harness,跟同一个模型出厂自带的联网搜索正面比了一次。 预注册实验 —— 假设、样本、指标与判读规则在跑之前定死,跑完不得改。

执行 2026-08-16 ~ 08-17 · 审计 79 题 + 会计 198 题 · 四臂各 6 轮 · 档位 max · 评测窗口内知识库内容全程冻结(212 部文书 / 10,013 单元)

审计题 · 相对出厂联网搜索
+4.9pp

95% CI [+1.0, +9.2],Holm 校正后 p = 0.013。 这是两条预注册确证性假设之一,成立。

答案的跨轮波动
8.1 → 5.1pp

同一批题重复跑六轮,出厂联网搜索的成绩在 78.7% 和 86.8% 之间晃; 查条级原文稳得多。探索性观察,不在预注册指标里。

会计题 · 裸给工具的收益
+0.7pp

区间 [−1.7, +3.3] 跨零。企业会计准则全网都搜得到, 这个库在那儿没有信息优势。

增益只在一个地方发生:当内容是搜索引擎够不到的时候。

审计准则应用指南散在中注协官网的 PDF 附件里,没有全文索引,通用搜索抓不到正文 —— 我们把它做成了 7,672 个可引用单元,实测审计线的 C 臂取到的正是 csa-1141-ag / csa-1211-ag 这类应用指南段落。 而企业会计准则原文全网都是,我们在那里提供的是可核性,不是正确率。

四个臂分别是什么

能用什么它回答的问题
A0什么都不给,纯靠模型记忆基线在哪儿
A1出厂自带的 web_search 诚实的外部对手 —— 不装我们的东西,用搜索引擎能做到多好
B本库的十个 MCP 工具,加载 skill光把库递给它,够不够
C工具 + 查证纪律 skill完整插件的效果

B 与 C 的唯一差别是那份 skill,它只讲一件事:查证是用来核对的,不是用来改答案的 —— 别因为翻到一条相关条文就把本来对的结论推翻。

各臂考了多少分

审计线

79 题 × 6 轮 · 主指标 mcqp

多选按 CPA 考试口径给部分分,单选 0/1。四个臂逐级加能力,只有装了完整插件的 C 越过了出厂联网搜索。

会计线

198 题 × 6 轮 · 主指标 soft

会计线没有跑 A1 臂(预算取舍,见下方「不能说的话」),A0 只跑两轮作漂移锚。 所以这一科不能声称「比出厂联网搜索强」,只能比较 B 与 C。

差多少,以及这个差是不是噪声

配对比较与 95% 置信区间

题级跨轮均分 · 配对 bootstrap 20,000 次

点是差值,横线是 95% 置信区间。只有区间整段落在零的一侧,方向才算测出来了; 压到零上的一律当"测不出",不当"没差别",也不当"有差别"。 标了「确证性」的两条是预注册假设,做了 Holm 多重比较校正;其余为探索性,未校正,不作结论。

审计线 C − A1 = +4.9pp 的可检出下限是 5.8pp —— 实测效应比它小, 却仍拿到了不含零的区间,这是因为配对设计(同一批题、同一轮次两两比)比独立比较灵敏得多。

收益来自哪一层:两科的答案正好相反

从纯记忆到完整插件,两段增量各贡献多少

同轮实测 · 单位 pp

C − A0 拆成两段:裸给工具拿到多少(B−A0), 再加上查证纪律拿到多少(C−B)。两科的分布几乎是镜像的。

审计科:收益几乎全在第一段 —— 库里有了模型完全不知道的新内容, 光把工具递过去就能捞到大部分。
会计科:第一段跨零(裸给工具没收益,因为库里没有新信息), 收益全在第二段 —— 唯一能贡献的就是纪律。
这也解释了上一轮为什么「四臂打平」:上一轮只跑会计科、且用的是旧 skill, 恰好是两种收益都不成立的那一格。

逐轮成绩:查条级原文的答案更稳

审计线各臂六轮成绩

横带即该臂的跨轮极差

同一批题、同一个模型、同一个档位,只是重跑。出厂联网搜索晃得最厉害 —— 同一道题,这次搜到一篇解读答对了,下次搜到另一篇就答错。 这条不在预注册指标里,属于额外观察;但对"能不能拿去交付"这件事,稳定性可能比那几个百分点更要紧。

代价:多花多少换来的

每题读入 token 与主指标

审计线 · 6 轮均值

横轴是每题读进模型的 token,纵轴是分数。不做双轴 —— 两个量纲不同的度量摊成两根轴,才是它本来的样子。那条浅灰折线只是把「逐级加能力」的路径连起来,不代表趋势。

C 的读入 token 是纯记忆臂的 9.7 倍、是出厂联网搜索的 2.9 倍,每题慢约 24 秒 —— 这是那 4.9 个百分点的价钱。方案里定的 30,000 token 警戒线未被突破 (审计线 19,783 / 会计线 21,724)。值不值得看场景:只看分数性价比,这个交换比不算划算; 如果在意的是"答案有出处可核",那 skill 顺带把引用规范也管住了。

分题型

上一轮会计科出现过一个坏模式:装了 skill 的 C 在每一个题型上都比 B 低 1–2pp, 像是"查完条文反而把对的答案改坏了"。这一轮加了答案保护规则之后,它不再是全局性的。

审计线题型题数A0A1BC
多选5379.6%80.3%82.7%84.8%
单选2682.7%87.8%94.2%93.6%
会计线题型题数A0BCC − B
单选8994.4%94.8%96.3%+1.5pp
多选5885.8%83.6%87.7%+4.1pp
数值2067.9%80.9%79.7%−1.2pp
分录2281.8%82.9%81.8%−1.1pp
综合990.5%86.1%87.9%+1.8pp

不能说的话

以下每一条都是这次实验没有证明的,写在这里以免被引用错

方法与自检

做法
预注册假设、样本量、主指标、判读规则在开跑前写死;执行中的每一处偏离单独记账
主指标审计 mcqp(多选按 CPA 考试口径部分分,单选 0/1);会计 soft(客观题部分分 + 主观题 partial)。严格口径同时报
区间题级跨轮均分做配对 bootstrap,20,000 次重抽样
多重比较两条确证性假设做 Holm 校正;其余全部标注为探索性,不作确证结论
臂完整性每轮跑完立刻自检:A0 零工具、A1 只有 web_search 零知识库调用、B/C 零 web_search、零 429 限流。12 轮全绿;因限流污染或部署中断作废重跑的 4 轮全部单独记账
题目剔除审计预注册 83 题,按规则剔除 4 道甲类争议题(全是多选),实跑 79 题;数据集冻结并留 SHA
检索稀释回归补库往全文索引加了 10,013 个单元,实测会计题的检索结果仍以准则原文与判断步骤为主(78.2%),未构成问题

一个如实记录:先导阶段(20 题)有一条判据判定"审计科也是能力瓶颈、补库不会提分",形式上不通过。 全量结果否定了它。原因不是判据设计错,而是它建立在 4 道错题上,95% 区间约 [19%, 99%] —— 那一格根本没有分辨力。先导实验能有效验证接线,但不适合用来预判效应

这个实验也直接指出了下一步该往哪补库:去补那些通用搜索够不到的层 —— 税收公告层、监管指引、应用案例,而不是继续加固已经全网可得的会计准则原文。 发现内容错误或想参与复核,欢迎联系 niuniu869@foxmail.com