AutoNews 新闻检测站 NEWS INSPECTION STATION
信源
数据
营销词
情绪
标题
0 累计已检 · 检测线就绪
每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
问一句

开放数据集 · 数据卡

下载内容与页面数字实时取自同一数据库
OPEN DATA · SCHEMA 1.0

这些数字,你可以整个拿走

CSV 适合表格复算 · JSON 保留嵌套记录
DATA 01

预测判定结果

逐条公开封存预测、预先写定的判据、到期后的判定与对证链接。

DATA 02

媒体档案

按档案页同一口径导出收录量、评分覆盖、更正记录与调查归档。

DATA 03

月度封存批

导出批次根哈希、Git/TSA 锚点、封存文件及逐批机器可读清单入口。

数据卡

字段说明

预测判定结果 · 15 个字段

逐条公开封存预测、预先写定的判据、到期后的判定与对证链接。

字段含义
id 站内记录 ID
batch_code 所属月度封存批次号
seq 批次内序号
record_url 站内判定详情页相对地址
content 封存时写下的预测正文
criterion 封存时预先写定的判定标准
confidence 封存时置信度,范围 0~1
sha256 预测正文的 SHA-256 指纹
sealed_at 封存时间,ISO 8601
due_at 到期日期,YYYY-MM-DD
opened_at 拆封时间;未拆封时为空
verdict 判定代码:pending / hit / miss / partial
verdict_note 判定说明;未判定时可为空
evidence_url 判定所用对证链接;可为空
question_type 题型代码;other 表示未细分
媒体档案 · 13 个字段

按档案页同一口径导出收录量、评分覆盖、更正记录与调查归档。

字段含义
source 来源媒体名称
dossier_url 站内媒体档案页相对地址
created_at 建档时间,ISO 8601
updated_at 档案最后更新时间,ISO 8601
archived_news_count 纳入档案口径的累计收录篇数
recent_count 最近窗口内的收录篇数
recent_days 最近窗口天数
scored_count 已有质量分的收录篇数
average_quality_score 已评分稿件质量分均值;已评分篇数不足 10 篇时为空(与媒体档案页同口径:样本不足不下结论,#620)
corrections_count 在档更正记录数
corrections 更正记录数组;CSV 中为 JSON 字符串
archive_entries_count 调查员归档记录数
archive_entries 调查员归档数组;CSV 中为 JSON 字符串
月度封存批 · 11 个字段

导出批次根哈希、Git/TSA 锚点、封存文件及逐批机器可读清单入口。

字段含义
code 批次号
sealed_at 封存时间,ISO 8601
prediction_count 批内预测条数
merkle_root 批次 Merkle 根哈希
git_commit Git 时间戳锚定提交;可为空
tsa_serial RFC 3161 时间戳编号;可为空
tsa_time TSA 签发时间;可为空
tsa_file TSA 回执文件相对路径;可为空
source_file 封存原始文件相对路径;可为空
note 批次说明;可为空
manifest_url 逐条哈希清单的站内相对地址

采集方法

新闻只取公开页面,先守 robots.txt、限速、去重并保留原文回链;入库后再生成摘要、实体标签与质量评分。 媒体档案只统计本站实际爬回且在前台展示的稿件;预测在封存时写定正文、判据和哈希,到期后人工登记判定与证据。 完整抓取频率、源清单和处理流水线见本页后半部分,所有数量均从数据库现算。

已知局限

  • 这是本站收录样本,不代表整个汽车媒体市场;来源接入、补抓历史稿和去重规则都会影响覆盖范围。
  • 判定为 pending 的记录尚未到期或尚未完成核验,不能当作已经发生的事实;空字段表示尚无记录,不等于数值为零。
  • 媒体档案的均值只针对已评分稿件,不能外推为媒体主体的可信度;样本量与最近窗口已随记录一起给出。
  • CSV/JSON 是请求当刻的实时快照;除带哈希和时间锚的封存批外,后续抓取与更正会改变下载内容。
  • 原文链接可能失效或变更;本站不在数据集中转载第三方文章全文和图片。

使用许可

本站编制与字段结构可用于研究、教学、比赛展示和可复现评测。再分发时须保留来源链接、AutoNews 署名与本数据卡地址, 不得把不确定或待判定记录表述为已核实事实,并须遵守原网站条款与适用法律。第三方原文、标题和图片的权利归原权利人, 不因本数据集告知而改变;数据按现状提供,不作无误或持续可用保证。

引用格式

建议引用:AutoNews 新闻检测站(2026):《AutoNews 开放数据集》,Schema 1.0,访问日期 2026-08-29,https://www.chejianlu.cn/data/

1342
累计收录(条)
10
已接入新闻源
519
近 30 天新增(有入库的 9 天,日均 57.7)
1318
带原文链接可回溯

累计收录与 数据总览 用的是同一句查询,两页永远对得上。

一、数据来自哪

抓取频率:每日 07:00、19:00 各跑一轮,班次写在仓库的 deploy/crontab.txt 里,可以直接去核对。

单轮上限:定时任务每跑一轮,每个源最多入库 40 条(crawl --limit 的默认值),只取增量、不重复回抓。按 10 个源、每天 2 轮算,定时抓取的日增上限是 800 条

实际入库:近 30 天共 519 条,分布在有入库的 9 天里(日均按这 9 天算 = 57.7 条;拿 30 天当分母会把还没建站的日子也算进去,那个「日均」不诚实)。 其中最多的一天是 2026-07-31 的 96 条。 逐日曲线见 数据总览,这一段的数字都取自同一批入库时间,对得上。

源清单:下表直接读自爬虫的源注册表(news/crawler/sources.py),加源、改源这页自动跟上,不靠手抄。

来源 接入方式 主要栏目 本站收录 最近入库
汽车之家
https://www.autohome.com.cn/news/
列表页 车辆 397 2026-08-11
和讯汽车
https://auto.hexun.com/
列表页 行业 340 2026-08-11
新浪汽车
https://auto.sina.com.cn/news/
列表页 车辆 234 2026-08-09
第一电动
https://www.d1ev.com/news
列表页 车辆 128 2026-08-11
太平洋汽车
https://www.pcauto.com.cn/news/
列表页 车辆 103 2026-08-11
新华网汽车
https://www.news.cn/auto/
列表页 行业 20 2026-08-11
电池网
https://www.itdcw.com/news/
列表页 行业 20 2026-08-11
汽车之心
https://www.autobit.xyz/
列表页 行业 18 2026-08-11
爱卡汽车
https://news.xcar.com.cn/
列表页 车辆 10 2026-08-11
每日经济新闻
https://www.nbd.com.cn/columns/3
列表页
仅收汽车相关条目
行业 5 2026-08-11

以上各源合计 1275 条;另有 67 条的来源不在当前源注册表内(含建站初期录入的样例,以及曾接入、现已从注册表移除的来源),一并计入累计收录 1342 条。 其中 1318 条标记为爬取稿,详情页只出摘要与原文回链。

二、怎么抓的

  • 守 robots.txt:每个域名先取 robots.txt 再决定能不能抓,不允许的地址一条都不请求。robots.txt 取不到时(5xx 或网络失败)按全站禁抓处理——对方站正脆弱的时候,我们宁可这一轮空跑。
  • 老实标明身份:请求头用固定 UA CarNewsBot/0.1 (educational; +https://github.com/YixiaooWang/car-news-site),不伪装成普通浏览器逃避识别。
  • 限速:同一域名两次请求之间强制间隔;源站在 robots.txt 里声明了 Crawl-delay 就服从更慢的那个——守 robots 不只是守 Disallow。
  • 只抓公开页:只走各源公开的新闻列表页与文章详情页,不登录、不绕付费墙、不碰任何需要授权才能看的内容;单个响应超过体积上限直接丢弃。
  • 注明出处并可点回:入库即写下来源站点名与原文链接,链接在文章页是可点的「阅读原文」按钮。当前 1318 条带可回溯原文链接。
  • 失败不硬闯:robots 不允许或请求失败,跳过这一条继续下一条,不重试压站。

三、怎么处理的

入库前(抓取环节内完成):

  1. 去重:在列表页拿到链接和标题时就先查重——原文链接全库唯一,标题相似度达到 82% 视为同一篇转载。重复的连详情页都不去请求,既不重复入库也不白占源站带宽。
  2. 正文抽取:从详情页 HTML 里定位正文容器,剔掉版权声明、责任编辑、引导关注这类噪声段。抽不出正文时,退回该条在 RSS/列表页上自带的摘要(源站自己给的原话,不是我们编的);两者都凑不满 80 个字(列表页误入、付费墙、页面结构变了)才丢弃,不入半成品。
  3. 相关性过滤:泛科技源用 60 个汽车关键词把关,标题与正文都不沾汽车的稿子不放进信息流。

入库后(每日定时流水线里抓取之后的步骤,顺序即下表,读自 daily_cron 的步骤表):

  1. 正文抽取纠错:复查正文抽得对不对:疑似抽错(过短、抽成导航或别篇正文)的重抓一遍,脏正文会顺着摘要、标签、聚类一路扩散。
  2. 回填爬取标记+摘要:给新入库的爬取稿补上「爬取稿」标记与结构化摘要,确保详情页只出摘要不出全文。
  3. 预热一句话摘要:离线生成详情页顶部的一句话摘要(请求里不调用大模型,页面才不会卡在等 AI)。
  4. 实体标签:从标题和正文里认出品牌、车型,挂成可点的标签,车型时间线靠它串起来。
  5. 官图同步+回填:把车企官方媒体库里拿到编辑授权的图入库,按品牌/车型配到没有配图的报道上;源站自带的配图一律不转存、不展示,配不上授权图的报道就照实留白。
  6. 栏目分类:判定栏目(车辆/行业/政策),源站栏目提示缺失或对不上时以此为准。
  7. 表述倾向判定:判每篇报道对涉及品牌用的是正向、中性还是负向表述,并从正文里摘一句原话作依据;依据对不上原文的一律记「无法判断」,不硬给结论。车型页的表述风向曲线用它画。
  8. 质量打分:打信息质量分:标题夸张表述、营销维度扣分、情绪词偏多各自扣分,扣分理由逐条留档可展开。
  9. ARG 三视角理由:再请大模型从常识、文风、事实三个角度各判一次,把判定理由逐条记下来;详情页「为什么是这个分」先看这三条理由,再看规则命中的词。
  10. 事件聚类:把同一件事的多家报道并成一张事件卡,看得见谁先发、谁跟发、说法差在哪。
  11. 事件摘要:给多家报道并成的事件卡写一段综述,把各家说法的分歧点摆在一起。
  12. 避坑面抽取:从稿子里抽出买车会踩的坑(配置缩水、交付跳票、上市后官降),挂到对应车型的避坑面上。
  13. 召回公告增量:取国家市场监督管理总局缺陷产品召回技术中心公开发布的汽车召回公告,只留公告标题、日期、涉及数量、缺陷描述与原文链接,公告里的联系方式一概不存;对得上库内车型的挂到该车型名下,对不上的照原样留档,不据此新建车型。
  14. 承诺抽取:把厂商公开做出的承诺(续航、交付时间、OTA 排期)抽成一条条带期限的记录。
  15. 承诺到期核查:到期的承诺逐条回查兑现了没有,结果写回承诺记录,兑现与打脸都留档。
  16. 生成早报:挑出当日重点稿,汇成每日早报。
  17. 早报播客:把早报合成语音版播客。
  18. 哨兵巡检:巡检异常信号(某品牌声量突变、同期多源集中报道),异常写进值守记录。
  19. 预警邮件推送:把已经产生的站内预警按人汇总成一封邮件推送给订阅者;开关默认关闭、只推用户自己勾选的动态类型,同一条不重复推。
  20. 收尸卡死调查:回收异常中断后卡在 planned/running/reviewing 的调查。
  21. 源文改删回访:按 3/7/30 天梯度回访已收录的原文链接,只存正文校验哈希,不留源站历史全文;链接失效、或连续两次抽到同一个跟本站记录对不上的指纹,才留一条可复核记录。
  22. 媒体档案建档:给每家媒体结算档案:收录量、质量分均值、标签分布、首末收录日,全是从库里数出来的。
  23. 媒体星图预计算:按各家媒体近期报道的用词算两两文本相似度,把它们铺成一张图:写法相近的自然靠在一起。只呈现相似度数值和对应原文,不由此推断原因。
  24. 线索分诊:把用户报上来的线索认出车型、立案;该车型有了完成的体检报告就归档挂上。认不出车型的留在队列里等补充,不自动驳回。
  25. 媒体公信力月报:每月把上个月各家媒体、各个品牌的表述倾向结算成一期月报,每条结论都附回链原文和依据原句。月报出一次就定稿,之后即使全库重新判定也不改写已经发布的那一期;样本不够的月份照实写「本月不出榜」。
  26. 申诉队列检查:每天清点申诉复检队列:还有几条没处理、最久的等了多久,超过 7 天没处理就报警。收到申诉不会让内容自动下线,一律人工逐条复核后再决定维持还是更正。
  27. 分层回归评测:拿固定车型题库跑一遍报告生成,记下当天的通过率——退化了逐日曲线上当天就看得见。
  28. 上一期封存:把上一期收录的每篇稿按「id/入库日/来源/标题/质量分/质量标签」算 SHA-256,两两配对成一个 Merkle 根,清单存进仓库公开。之后任何一篇的分被改过,重算的根都会对不上——首页头版那颗「本期已封存」指的就是它。

处理覆盖情况:已生成结构化摘要 1317 条 · 已挂品牌/车型标签 1096 条 · 已打质量分 1342 条 · 已聚成事件卡 115 张。

栏目分布:车辆 883 条 · 行业 455 条 · 政策 4 条。

摘要、标签、质量分、事件归并全部由程序生成,评分口径与局限见 算法说明与隐私

四、不做什么

  • 不转载全文:1318 条爬取稿的详情页只展示 AI 提炼的要点摘要和「阅读原文」入口,要读全文请回原站。
  • 不改动原文:不改标题、不改说法、不做立场加工。本站新增的只有摘要、标签、质量分这些外挂信息,且 AI 生成的内容一律带 AI 生成 标识。
  • 不隐藏出处:每条都写明来源站点,取自源站的封面图另行署名、版权归原作者所有。
  • 不抓非公开内容:不登录、不破解、不抓需要付费或授权才能看的页面。
  • 不牟利转载:本站为学生作品,收录仅用于新闻聚合与信息质量研究,不售卖内容、不基于转载投放广告。

若您是内容权利人,希望本站停止收录某个来源或撤下某条内容,请到 论坛 留言告知,我们会尽快处理。

问一句 行情
选车库 尺寸对比 3D 算钱计算器 召回查询
媒体
媒体档案 媒体星图 媒体月报
封存馆
封存馆 承诺账本 成绩单 自己验
方法
方法与成绩 判定口径与准确率 数据浏览器 开放数据集 数据总览 设计系统 系统中心
登录 注册
Esc
输入关键词,边打边出结果;↑↓ 选中,回车直达