每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
数据规模
这一页的原始数字可以下载自己复算: 每日收录 CSV · 品牌声量 CSV · 质量分分布 CSV
1342
累计收录新闻
115
事件卡
209
车型档案
0
注册用户
今日车市温度 · 三分量合成指数
样本不足,暂不下结论(近 7 天 n=0;阈值 10)。
这个数字怎么来的
热度 50%(近 24h 报道量 ÷ 近 30 天日均)+ 降价 30%(近 7 天降价类报道占比)+ 质量 20%(近 7 天平均质量分)
近 24h n=0(日均 14.7)·
近 7 天降价类 0/n=0
信息重复率下降 · 事件聚类降噪实测
11.1%
1342 篇报道折叠成 1193 张事件卡,信息流少刷 149 条
口径:分母 = 已归入事件的报道数(1342),分子 = 折叠后的事件数(1193,只数至少有一篇报道的), 重复率下降 = 1 − 事件数 ÷ 报道数。数字在你打开本页时实时统计(2026-08-29 17:47), 与 cluster_events 命令行输出调用同一个函数,两处必然一致。 该口径衡量的是「折叠掉了多少条」,随聚类阈值变化;「聚得准不准」另有人工标定的 P/R/F1。
曲线要攒够两天的记录才画得出来(每跑一次事件聚类落一个点)。
每日收录趋势
质量分分布 · 已评 1342 篇
营销扣分 255 篇 · 标题夸张词命中 4 篇
语料结构 · 为什么还要继续扩源
一个事件里有几篇报道
1 篇
1078 90.4%
2 篇
88 7.4%
3 篇
22 1.8%
4 篇及以上
5 0.4%
一个事件有几家独立信源报过
1 家
1112 93.2%
2 家
67 5.6%
3 家
13 1.1%
4 家及以上
1 0.1%
算法没问题,是料不够。 聚类在人工金标上 F1 93.3%、误并为 0;但信源少,同一件事常常只有一家报道, 「多源交叉验证」就没有素材可展示。 首页头条上那枚「已核验」章的门槛就是3 家以上独立来源交叉—— 目前只有 14 个事件够格, 所以那枚章现在很少出现。这不是 bug:宁可没有章,不许有假章。 扩源在做(#418):这是数据问题,不是算法问题,分清楚才知道该往哪使劲。
品牌声量河流 · 河道越宽当天报道越多
品牌热度榜 · 近 14 天走势
- 1 比亚迪 0 篇
- 2 特斯拉 0 篇
- 3 大众 0 篇
- 4 小米 0 篇
- 5 理想 0 篇
- 6 蔚来 0 篇
按累计收录排位,走势线只看最近 14 天(按源站发布时间);累计篇数见下方柱状图。