算法说明
想看「收集了哪几项数据、干什么用、存多久、怎么删」,去 隐私政策; 使用规则见 用户协议。
个性化推荐算法
原理:基于你关注的车型和浏览历史,优先展示相关品牌/车型的新闻。推荐逻辑:
- 你关注的车型 → 该车型/品牌的最新报道
- 你近期浏览过的新闻 → 同栏目、同品牌的相关内容
- 每条推荐附带理由(如"因为你关注了小米SU7"),可查可验。这句理由是规则拼出来的,不是 AI 写的——按你关注/浏览过的车型品牌套固定句式(见
news/recommend.py),所以它不带 AI 标识
数据范围:仅使用你在本站的关注和浏览行为,不采集站外数据,不画像。
不做什么:不按流量/点击率排序(高点击≠高质量),不做信息茧房式推荐。
登录后可一键关闭个性化推荐
统计结论的样本门槛
所有会被读作结论的均值、比例和综合判断都把分母写成 n=。质量分均值、质量标签占比和车型体检结论至少需要 n=10;未达到时页面显示「样本不足,暂不下结论」,只保留原始记录数。
已有专项门槛继续从严执行:媒体×品牌表述倾向每格至少 5 条有效判定;月报需当月 n≥30,且至少 3 家媒体达到上榜门槛;报道覆盖观察至少 5 家符合基线条件的媒体。不同指标的分母含义不同,页面会在数字旁说明。
信息质量分算法
原理:从 100 分基线开始逐维扣分,两条打分路并存——规则启发式(v1,词表和阈值全公开,验稿器上未登录跑的就是它,可逐句复算)与 AI 主编(登录后验稿、批量入库走这条,按读感给各维定扣分)。站内现有的质量分绝大多数由 AI 主编打出,所以下面每一维都要分清「规则量到的」和「主编判的」:
- 标题夸张表述:夸张词匹配 + 标点堆叠(如"震惊!!!"),每命中扣分
- 营销维度扣分:规则口径量的是营销词密度(如"遥遥领先/重新定义",命中数每千字超过阈值)加信源是否具名;AI 主编按读感给这一维扣分、不计算密度。所以标签只说「这一维扣了分」——只有真量到密度的那些稿,详情页才会另外把「X 次/千字」印在同一行上
- 情绪化检测:主观断言词密度(如"毫无疑问/简直")
满分要挣,不是默认值:只按「100 − 扣分」算的话,一篇干净但空洞的厂商宣传稿——没有标题党、没有情绪化、没有套话——会因为「找不到罪证」自动拿满分。所以还有一层正面证据决定这一篇的分数上限:每挣到一条,上限抬 5 分,0 条最高 85 分,三条齐了才够得着 100。
- 具名信源:正文里有说得出名字的机构,或「职务+姓名」的人(「相关负责人」「业内人士」不算)
- 信源多元:至少两个不同信源主体,且不全是车企自己——一家之言凑两个部门不算
- 数字有出处:价格/销量/百分比这类关键数字,至少有一处和出处写在同一句里
这三条全部由本站代码本地判定,不经过模型:判据、词表和天花板公式都公开,任何人拿着原文都能自己数一遍。这一层只压上限、不额外扣分——攒够正面证据也洗不白标题党。详情页和验稿器会把命中的和没命中的一起列出来,因为读者真正要问的是「差在哪」。
可解释:每条扣分理由可展开查看命中词和原文位置,不是黑箱。
局限:规则口径有误判(如车企正式名含"旗舰"),AI 主编则可能判错读感。详情页和验稿器都会印一句"仅供参考",而且跟着这一篇实际走的那条打分路——主编打的印"AI 判断仅供参考",规则打的印"规则判断仅供参考",不替规则分冒认 AI(#185)。管理员可人工覆盖误判并留痕。
演进:学期将升级为 LoRA 微调模型(自建 3000 条标注集),与规则版做对比实验。
看一份完整的
上面讲的是尺子,这里是用这把尺子跑出来的东西:智能体从选题、取证、交叉验证到成文 走完一整条管道,每条结论下面挂着它依据的原始材料——包括站外可核对的 总局召回公告地址,点开能当场比对编号和数量。 不需要登录,跑完的调查任何人都能看。
打开这份报告:吉利 银河 2026-08-10 跑完 · 更多在智能体驾驶舱自己算一遍 · 不用信我们
下面这段计算完全在你的浏览器里跑,不联网、不上传、不需要登录——
用的就是左边这份词表和阈值(从代码里直接传下来的,不是另抄的一份)。
贴一段文字进去,每个命中的词都会标出来。
只算规则层:这一层是确定性计算,同样的输入必然同样的输出,所以可复算。
AI 主编那一层复算不了,我们也不假装它能。
当前口径版本 quality-rules-v1+3e8acca1e74a —— 每条判决书底部的「这个分怎么自己复算」里印着它出自哪一版; 版本不同就不是同一把尺,分数对不上是正常的。
检测准确率 · 我们判得准不准
不达标就照实说。达标线是按层加权后的总准确率 ≥ 80.0%, 没过线之前,站内所有倾向结论一律挂着「AI 判定 · 抽检中」的牌子,不摘。
拆开看每一层(层 = 模型预测的类别,按它在全库的占比加权还原):
| 层 | 金标数 | 判对 | 层准确率 | 全库占比 |
|---|---|---|---|---|
| 正向 | 19 | 10 | 52.6% | 38.5% |
| 中性 | 15 | 6 | 40.0% | 30.5% |
| 无法判断 | 12 | 9 | 75.0% | 23.4% |
| 负向 | 10 | 8 | 80.0% | 5.5% |
| 弃判 | 1 | 1 | 100.0% | 2.0% |
怎么抽的:按模型预测分层抽样、正负两层各保底 10 条(负向在库里只占几个百分点, 裸随机抽 50 条会一条负例都没有,那道门就白设了);段内早晚各一半等距取; 标注人只看标题、正文和依据句,拿不到模型的答案(盲测); 每一轮换一批新样本,与历史金标零重叠——拿标过的复验等于拿考题当答案。
两栏都对才算对:倾向判对,且依据句撑得住。子串校验挡得住编造,挡不住模型挑一句 真实但答非所问的话——本轮有 1 条属于「倾向判对了但依据句撑不住」, 这类按错计。
这个数的性质:57 条的统计功效有限(真值 80% 时观测值的 95% 区间约 ±11 个点),
它是冒烟测试不是严谨验收。当前判定版本 glm-4-flash/stance-v4.1,
抽检于 2026-08-09。
本节数字来自最近一次 audit_stance --gold 的真实运行结果,页面不手抄、不缓存旧值;
逐轮记录与错误分析存档在仓库 docs/质量抽检/。
智驾话术检测
检测稿件是否将 L2 级辅助驾驶系统宣传为"自动驾驶"等违规用语。
依据:工信部 2025.4 装备工业一司会议明确禁止 L2 使用"自动驾驶/无人驾驶/脱手"宣传;GB 47955-2026《智能网联汽车 自动驾驶功能通用技术要求》2027.1.1 施行。
方式:关键词匹配(非 AI),分红灯词(直接违规)和黄灯词(L2 语境下易误导)两级。
合规声明
- 来源可溯:所有新闻标注原始来源和原文链接,爬取稿只展示 AI 摘要+原文回链
- 遵守 robots 协议:爬虫严格遵守各源站 robots.txt
- AI 内容已标识:模型生成的内容一律带 AI 生成 标识,逐处点名—— 新闻详情页的一句话总结与 AI 提炼要点、首页/列表卡片上的 AI 摘要、事件页的「一句话说清这件事」、 每日早报里由模型写的那几条、验稿器与详情页的 AI 主编评审、质量分的三视角判定、 Agent 调查报告正文/结构化声明/审稿争论记录、承诺兑现的 AI 判定; 早报的语音播报另标 合成语音(《标识办法》管音频,不只管文本)。 依据《人工智能生成合成内容标识办法》(2025.9.1 施行)
- 不是 AI 的,一律不冒充 AI:推荐理由(规则拼句,见上)、智驾话术检测(关键词匹配)、
智能体驾驶舱整页的数字与摘要、车型体检报告、Agent 调查报告那排数据条(报道数/事件数/来源数,都是代码统计 + 模板句)都不带 AI 标识;
一句话总结、早报摘要、验稿器评分、承诺判定、Agent 调查报告正文这五处模型不可用时会退回规则版或只剩检索结果,
退回的那些改挂灰色角标(如 规则生成)写明这一次实际是什么,不留白也不冒领。
还有两处可能由模型判定、但库里不存来路,所以不逐条署名:栏目分类那枚 chip(车辆/行业/政策,配了模型 key 就由模型定、失败退关键词规则,见
news/nlp/classify.py,News.section只存结果不存是谁定的)和质量分那个数字本身(分数由哪条路打出来记在quality_reasons.method里,但列表页的分数徽章只印数字、没有摆角标的位置;点进详情页那句"仅供参考"会说清这一篇是主编判的还是规则判的)。 这两处只印中性结果、不印模型直出的自由文本,所以按《标识办法》不逐条加标,但也一样在这里点名交代,不含糊过去 - 最小必要收集:仅记录站内浏览/关注行为,不采集设备信息、位置、生物识别等敏感个人信息;注册只需用户名+密码,手机号为选填(仅用于找回账号,不做短信验证、不对外提供)
- 算法可关闭:个性化推荐可一键关闭(见上方开关),依据《互联网信息服务算法推荐管理规定》
- 可查可删:收集了哪几项、存多久、怎么删,逐项写在 隐私政策; 浏览历史和账号都能在设置页自助清空/注销