# PolicyTrace：预先固定的 10 例合成对照

题目文件 `frozen-cases-v2-20260930.json` 在首次模型调用前计算 SHA-256：`5fe3db86c9e86ab8c7ee9b04c8c24ddb69a66bf4290ad0329d4eb7f8689ebb60`。有效原始结果为 `frozen-comparison-20260930T003533Z.json`。同一轮只读 Sanity Context（KB `kbuLoYcmxK7A`）得到 6 条结构化记录，来源正文指纹 `eff1a8422012d1343b26feabe854fff3a067ff950c7b47a76b40e56710973c9e`。三个方法均用 SiliconFlow `Qwen/Qwen3-8B`、`temperature=0`、关闭思考模式，每题每方法只调用一次。

| 方法 | 完整通过 | 失败集中点 |
|---|---:|---|
| 全量资料直接问模型 | 1/10 | 混淆普通与特殊客户费用；在要求补信息时仍给出金额；有时返回约定之外的决策标签。 |
| 简单关键词检索 Top 3 再问同一模型 | 0/10 | 截掉关键政策或澄清；出现错误分流、金额与输出格式。 |
| PolicyTrace：模型路由、完整来源、规则核验与引用确认 | 10/10 | 本组无失败；不代表生产无误。 |

题目覆盖 7 月 1 日和 8 月 1 日政策边界、6 月旧账单、普通与特殊客户、两类减免、两类客户身份未核实以及政策生效范围之前的账单。评分要求决策、金额或空值、非伪造且不重复的来源编号、无交易执行四项同时满足。模型基线的来源评分仅检查编号存在且不重复，**没有要求其列齐所有适用来源**。

这组案例由开发者编写并在运行前固定，不是独立第三方盲测。PolicyTrace 专门实现了日期、身份、冲突与授权规则；简单检索是明确的关键词 Top 3，不能代表最好的 RAG。两种基线的通用提示与完整输入筛选逻辑在 `scripts/compare_holdout.py`，运行与文件指纹在 `scripts/compare_frozen_suite.py`，标准答案字段未传入模型。结果仅支持这 10 个虚构场景下的差异，不支持生产准确率或获奖概率推断。没有真实账户、银行操作或奖金收入验证。

早期 4 例探索实验与其中一轮作废记录单独保留，见 `HOLDOUT_COMPARISON_2026-09-30.md`；不与本轮合并计算。
