方法与成绩
我们对着人工金标跑过哪些评测、每一次跑出什么数、这些数够不够格 把结论当定论说。页面上每个数字都是此刻从库里数出来的, 没有写死的值;跑得不好的那几项也在这一页上,位置和好的一样大。 想看判定口径怎么定的去 算法说明, 想看流水线此刻在不在跑去 系统中心。
判定准确率 对着人工金标抽检出来的
准确率算不出来——它要人工金标,所以这个数只认
make audit_stance GOLD=1 真跑一次写出的那份结果文件,
和算法说明页、全站角标是同一个出处,全站只有这一个准确率。
一个总的 56.5% 看不出它是均匀地不准、还是某一层特别差。 逐层拆开才知道该去改哪儿——占比最大的两层恰恰是最差的两层。
| 判定层 | 金标条数 | 判对 | 本层准确率 | 占全库比例 |
|---|---|---|---|---|
| 正向 | 19 | 10 | 52.6% | 38.5% |
| 中性 | 15 | 6 | 40.0% | 30.5% |
| 无法判断 | 12 | 9 | 75.0% | 23.4% |
| 负向 | 10 | 8 | 80.0% | 5.5% |
| 弃判 | 1 | 1 | 100.0% | 2.0% |
评测运行记录 三项评测,各跑过多少次、每次什么数
三张表不合并:它们量的东西完全不同(车型报告跑不跑得通 / 引用站不站得住 / 合成样本抓不抓得到),并排塞进一张表只会逼你自己去分辨 哪一列对哪一行有意义。灰底那几行是口径说明—— 指标为 0 有两种含义,「真的一个都没抓到」和「压根没有样本可抓」, 后者那个 0 是恒等式不是成绩,必须当面说清。
车型报告回归评测 共跑过 32 次,列出最近 8 次
| 运行时间 | 车型数 | 通过 | 失败 | 通过率 | 平均耗时 |
|---|---|---|---|---|---|
| 2026-08-11 08:50 | 10 | 10 | 0 | 100.0% | 13 ms |
| 2026-08-10 20:59 | 10 | 10 | 0 | 100.0% | 34 ms |
| 2026-08-09 14:13 | 12 | 12 | 0 | 100.0% | 13 ms |
| 2026-08-08 14:16 | 12 | 12 | 0 | 100.0% | 34 ms |
| 2026-08-08 08:12 | 12 | 12 | 0 | 100.0% | 19 ms |
| 2026-08-07 14:09 | 12 | 12 | 0 | 100.0% | 12 ms |
| 2026-08-07 08:28 | 12 | 12 | 0 | 100.0% | 14 ms |
| 2026-08-06 23:16 | 12 | 12 | 0 | 100.0% | 12 ms |
这一项量的是「跑不跑得通」不是「判得准不准」:热/温/冷三档车型各出一份报告, 检查流程不报错、字段齐全、耗时正常。全绿只说明管道没断。
引用核验评测 共 0 期
make cite_eval 后出现。红蓝对抗 共 9 轮
| 轮次 | 运行时间 | 合成样本 | 检出 | 漏检 | 检出率 | 负样本 | 误报 |
|---|---|---|---|---|---|---|---|
| 第 9 轮 | 2026-08-10 21:23 | 5 | 5 | 0 | 100.0% | 5 | 0 |
| 第 8 轮 | 2026-08-10 20:14 | 0 | 0 | 0 | — | 5 | 0 |
| 这一轮一个样本都没合成,检出率 0% 是空集上的恒等式,不是成绩 | |||||||
| 第 7 轮 | 2026-08-10 20:08 | 0 | 0 | 0 | — | 5 | 0 |
| 这一轮一个样本都没合成,检出率 0% 是空集上的恒等式,不是成绩 | |||||||
| 第 6 轮 | 2026-07-29 19:04 | 5 | 5 | 0 | 100.0% | 5 | 0 |
| 第 5 轮 | 2026-07-29 18:43 | 5 | 5 | 0 | 100.0% | 5 | 0 |
| 第 4 轮 | 2026-07-29 18:22 | 5 | 5 | 0 | 100.0% | 5 | 0 |
| 第 3 轮 | 2026-07-28 00:00 | 5 | 3 | 2 | 60.0% | 0 | 0 |
| 这一轮没有负样本,「误报 0」的分母是 0——没测过误报,不等于没有误报 | |||||||
| 第 2 轮 | 2026-07-27 20:24 | 5 | 4 | 1 | 80.0% | 0 | 0 |
| 这一轮没有负样本,「误报 0」的分母是 0——没测过误报,不等于没有误报 | |||||||
对抗样本是我们自己合成的,所以这个绕过率只说明「我们想得到的那几种改写骗不过检测」, 不说明真实世界里没有别的改写方式能绕过去。样本量(30 条) 也远不足以给出一个能写进结论的数——摆出来是为了让这条曲线有个起点,不是为了报喜。
看这些评测所在流水线此刻的状态 →事件聚类评测 对着作者标定的金标准,算两两配对的 P / R / F1
口径是两两配对:把「同一件事」表示成文章的两两组合,算法判为同一事件的配对
和金标准的配对比对。这个数和 make eval_cluster 打出来的必然一样——
页面跑的就是那条命令的同一份代码,不是抄的公式。
上面那个 P 好看,但它只在被金标覆盖的 147 篇上成立,
全库还有一千多篇没被这把尺量过——不说覆盖率,这个数就是在暗示全库都对。
金标现有 62 组正例、161 组易混负例;
关键词按标题唯一命中来解析,库一涨就会有几个不再唯一,本次有
9 个没能唯一命中被跳过,所以这些组数会随库变、
别当常量抄进论文。
另一件相关的事:全库并进了多家报道的只有
264 篇(19.7%),其余是单家独报——
交叉验证、核验章、事件脉络这些功能只在那 19.7% 上成立。
标注集现状 标了多少、几个人标的、一致性够不够、有多少真能用
「标了 0 条」和「0 条里 0 条能进数据集」是两个数,这里都给。 只报前一个就是在虚报数据资产规模——而被闸掉的那一半,闸的理由 恰恰是这一页最该让人看见的东西。
标注一致性 κ 两位标注人对同一批稿判得一不一致
| 维度 | 这一维在量什么 | κ | 重叠样本 | 门槛 0.6 |
|---|---|---|---|---|
| 兼容三分类 | 把上面两维折成一维的旧口径,给早期评测和模型继续用 | 算不出 | 0 条 | 重叠样本不足 |
| 正文维度 | 正文本身是客观报道还是宣传性稿件 | 算不出 | 0 条 | 重叠样本不足 |
| 标题维度 | 标题与正文相符 / 夸张但有支撑 / 严重不符 | 算不出 | 0 条 | 重叠样本不足 |
κ 衡量的是「扣掉瞎猜也能蒙对的部分之后,两个人还剩多少一致」。
现在这个数就是随机水平——说明两个人量的根本不是同一把尺。
后果写在这里:口径对齐之前不扩大标注量(按现在的尺标到 3000 条就是
3000 条噪声),也不拿这批标注去训模型(测试集只能是人工标注,
尺没校准就量不出模型好坏)。这个数和 make kappa 打出来的是同一个。
人工覆盖留痕 质量分被人改过几条
这一节回答的是「你们会不会偷偷改数」。答案不能是一句「不会」, 只能是一个可以点进去数的计数器——而它现在是 0。0 也照印:「一条都没改过」是可核对的事实, 「我们从不改」是空话。
本页数据生成于 2026-08-29 17:47,缓存 5 分钟。 发现哪个数字对不上?告诉我们。