可信度的来源
方法论
本站是一本参考书,不是资讯流。每一个数字如何被采集、抽取、校验与审核, 以及它为什么可以被引用——都在此页说明。
v2026.1 · 数据截至 2026-04-30
数据源白名单
白名单之外的任何来源不得入库:不采集第三方资讯站,不采集招聘平台,不维护任何登录态。
| 来源 | 用途 |
|---|---|
| 巨潮资讯网 cninfo.com.cn | 上市机构定期报告的法定披露渠道,本站年报 PDF 的主要来源 |
| 港交所披露易 hkexnews.hk | H 股披露文件 |
| 机构官网投资者关系页 | 未上市机构年报及补充披露 |
| 机构科技子公司官网 | 科技子公司归并至母行时的佐证材料 |
| 人民银行 / 金融监管总局 / 证监会官网 | 监管政策时间线(规划中) |
构建流水
全程构建期批处理,无常驻采集进程;年报季发布大版本,重大事件驱动单页增补。
- 采集从巨潮资讯检索 API 定位并下载披露 PDF,登记来源 URL、发布日期与文件哈希; 同一文件重复运行自动跳过。
- 章节定位程序按目录与关键词窗口(金融科技 / 信息科技 / 数字化转型等)圈定相关章节, 仅相关章节进入抽取,全程带页码。
- 结构化抽取大模型按固定模式抽取数据点、具名举措与战略表述;要求逐字摘录原文、只抄不算, 每一项必须附页码与原文引文。
- 程序硬校验四道自动闸门(见下);任一不过即转入人工审核队列,绝不静默入库。
- 逐条审核审核员逐条对照 PDF 原文接受、修正或剔除,全部决策与理由写入只增审计日志; 仅审核通过的数据进入发布库。
- 聚合与发布排名、占比等聚合产物在构建期生成;站点为纯静态页面,发布后不再有任何运行时数据处理。
防幻觉硬校验
大模型抽取的每一项,必须先通过以下程序校验:
| 闸门 | 规则 |
|---|---|
| 引文存在性 | 抽取项附带的原文摘录,必须能在来源 PDF 对应页逐字找到(忽略空白与全角差异) |
| 数字一致性 | 抽取的数字必须以完整数值形式出现在引文之中,杜绝改写与拼接 |
| 单位换算 | 亿元/万元/万人/% 等原文单位由程序查表换算为规范单位,未知单位一律转人工 |
| 置信度门槛 | 模型自报置信度低于 0.8 的抽取项强制进入人工审核队列 |
三级标注与展示规则
| 标注 | 定义 | 展示 |
|---|---|---|
| FACT | 年报原文直接陈述的数字或表述 | 公开展示,附完整证据链 |
| DERIVED | 跨文档计算所得(如 投入 ÷ 营收),附计算公式与分子分母来源 | 公开展示,标注 DERIVED |
| INFERENCE | 推断性结论 | 不对外展示 |
口径原则:各行“科技投入”“科技人员”统计口径不同(本行 / 本公司 / 集团), 口径原文与数字同行呈现,排名页附口径差异脚注;本站不对口径做归一化处理。
审核机制与当前版本说明
v2026.1 为 P0 先导版:样本为 3 家机构 × FY2025 年报, 共 102 项抽取经逐条对照原文审核(69 项通过、32 项剔除、1 项口径修正), 审核记录完整留痕。发布前随机抽样人工比对 PDF 原文,准确率达标后方可上线。
局限性
- 样本仅 3 家先导机构,排名与占比不代表行业全貌;P1 版本将扩展至 18 家银行。
- 当前仅覆盖 FY2025 单一财年年报,跨年度趋势与措辞演变待多年数据回溯后上线。
- 章节定位基于关键词窗口,机构在非常规章节披露的信息存在遗漏可能。
- 各行口径差异未做归一,任何精确对比请以原文口径为准。