每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
媒 体 星 图
MEDIA SIMILARITY MAP · 位置是算出来的
同一片语料的另一个切面:事件宇宙问的是「一件事有几家在说」,
这一张问的是「这些媒体,写的东西有多像」。
每家媒体的全部收录稿件先算成一个内容画像(字符 bigram 的 TF-IDF 向量),
两两取余弦相似度,再用力导向布局把这张相似度矩阵铺到平面上——
相似度越高的两家,图上离得越近。所以图上的每一段距离都是量出来的,
不是我们摆的。这一页不给媒体打分、不排名,
媒体档案那条纪律在这里同样有效。
当前:静态表格版
回到星图版 →
报道内容最接近的几对
- 和讯汽车 × 第一电动 文本相似度 69%
- 太平洋汽车 × 第一电动 文本相似度 62%
- 和讯汽车 × 太平洋汽车 文本相似度 61%
- 和讯汽车 × 汽车之家 文本相似度 51%
- 和讯汽车 × 新华网汽车 文本相似度 51%
相似度高不等于抄袭。 两家媒体的报道内容高度同质,最常见的原因是它们在转述同一份官方通告、 同一场发布会或同一组公开数据——用词自然会大面积重合。 这个数字只说明「两家的文本有多少重合」,不指向任何一方,也不构成任何定性。 要判断某两篇具体的稿子是什么关系,请点进各自的媒体档案逐篇核对原文。
表格版 · 同一份数据
按本站收录篇数排序。收录量多少不代表任何褒贬,只代表它更新得勤。 「内容最相似的三家」是同一套 TF-IDF 余弦相似度算出来的,与上图完全一致。 (表格可左右滑动查看完整列)
| 媒体 | 收录 | 已评分 | 质量分均值 | 报道内容最相似的三家(文本相似度) |
|---|---|---|---|---|
| 汽车之家 | 435 | 435 | 98.1 | 和讯汽车 51% 第一电动 50% 太平洋汽车 49% |
| 和讯汽车 | 380 | 379 | 97.7 | 第一电动 69% 太平洋汽车 61% 汽车之家 51% |
| 新浪汽车 | 255 | 254 | 91.4 | 第一电动 48% 和讯汽车 48% 太平洋汽车 47% |
| 第一电动 | 157 | 157 | 96.4 | 和讯汽车 69% 太平洋汽车 62% 汽车之家 50% |
| 太平洋汽车 | 116 | 116 | 89.0 | 第一电动 62% 和讯汽车 61% 汽车之家 49% |
| 电池网 | 60 | 59 | 97.7 | 和讯汽车 45% 第一电动 44% 新华网汽车 36% |
| 36氪 | 48 | 48 | 99.4 | 和讯汽车 39% 第一电动 32% 太平洋汽车 27% |
| 新华网汽车 | 40 | 38 | 90.2 | 和讯汽车 51% 太平洋汽车 49% 第一电动 49% |
| 汽车之心 | 38 | 38 | 81.2 | 新华网汽车 48% 太平洋汽车 47% 第一电动 45% |
| 爱卡汽车 样本较少 | 10 | 10 | 83.5 | 汽车之家 38% 汽车之心 35% 太平洋汽车 35% |
| 每日经济新闻 样本较少 | 9 | 9 | 100.0 | 和讯汽车 41% 第一电动 32% 太平洋汽车 26% |
这张图是怎么算出来的
- 取语料。只取本站爬取收录的公开报道,每篇取标题 + 正文前 600 字。 全站共 28 个来源署名, 其中 11 家有独立媒体档案页; 另外 17 家是演示种子或一两篇的零星署名, 没有档案页可点,所以不进这张图——画一颗点开是 404 的星, 比不画更糟。
- 建内容画像。每篇稿切成字符 bigram,按 TF-IDF 加权成向量并归一化, 再对同一家媒体的所有稿件取平均(质心)。 先归一化再平均这一步是关键:否则发稿量最大的那家会跟谁都「最像」, 那量到的是体量不是内容。 词表两道闸:出现在超过 25% 文章里的词(全站共有的套话) 和只出现在 3 篇以下的词(错别字、一次性专名)都剔除。 本次词表 34022 个 bigram, 语料 1548 篇。
- 两两算余弦相似度。11 家共 55 对。 连线只画 ≥40% 的那些, 另外 35 对相似度较低没画—— 这张图不是全部关系,全部数值在上面的表格里。
- 铺到平面上。把相似度矩阵交给一个力导向布局:每一对之间连一根弹簧, 理想长度 = 1 − 相似度(越像拉得越近),同时所有点互相排斥以免叠在一起, 迭代 600 步收敛。 初始位置是固定的均匀圆环、全程不用随机数,所以同一批数据每次跑出来是同一张图。
- 已知性质,必须说明。覆盖题材越广的媒体,它的内容画像越靠近全站平均, 于是跟谁都偏像、在图上偏中央。那是这个算法真实的几何,不是它「在跟所有人发一样的东西」。 同理,样本越少的媒体画像越不稳,所以少于 20 篇的 在图上打虚线环、表里标「样本较少」。
- 不用向量大模型。这一层刻意只用 TF-IDF —— 它的每一个数字读者都能拿纸笔复算, 而这一页的全部说服力就建立在「你可以自己验」上面。
本次结果计算于 2026-08-29 19:09,耗时 1117 毫秒, 离线预计算后缓存供页面读取(页面打开时不做任何相似度计算)。