企业数据资源信息披露(FinBERT2模型测度)
「企业数据资源信息披露(FinBERT2模型测度)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 24 个变量,样本量约 69,680。 参考罗进辉等(2026,财会月刊)的方法,以上市公司年度报告全文为文本基础构建企业数据资源信息披露指标。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 24 |
| 样本量 | 69,680 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告对应的报告年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NSentence [年报语句总数] — 参考罗进辉等(2026,财会月刊)的方法,年度报告全文经噪音清洗与语句切分后参与统计的语句数量。切分以句号、感叹号、问号为终止符,清洗环节删除页眉页脚、目录、版权声明等格式化文本以及具有表格特征的文本,并剔除字数大于1000字与小于5字的语句。用作数据资源信息披露各比值指标的分母
- NCandidate [命中数据资源词集的语句数] — 参考罗进辉等(2026,财会月刊)的方法,含数据资源相关词集中任一词汇的语句数量。该词集以“数字”“数据”“信息”“网络”四个种子词经词向量模型扩展并经人工复核筛选得到,共93个词汇,用于从全部语句中初步识别与数据资源相关的表述
- NDataSentence [数据资源语句数] — 参考罗进辉等(2026,财会月刊)的方法,由微调后的金融领域预训练语言模型对命中词集的语句逐句判定,反映企业持有、使用或经营数据资源的语句数量
- NSelfUseSentence [自用型数据资源语句数] — 参考罗进辉等(2026,财会月刊)的方法,判定为自用型数据资源的语句数量。自用型数据资源指服务于企业内部业务流程和经营决策、不对外提供的数据资源
- NTradeSentence [交易型数据资源语句数] — 参考罗进辉等(2026,财会月刊)的方法,判定为交易型数据资源的语句数量。交易型数据资源指用于对外服务或销售、具有市场化属性的数据资源
- NInternalSentence [内部型数据资源语句数] — 参考罗进辉等(2026,财会月刊)的方法,判定为内部型数据资源的语句数量。内部型数据资源指原始数据来源于企业内部、由企业自身业务活动产生的数据资源
- NExternalSentence [外部型数据资源语句数] — 参考罗进辉等(2026,财会月刊)的方法,判定为外部型数据资源的语句数量。外部型数据资源指原始数据来源于企业外部、由企业通过外部购买、采集、合作方提供等方式取得的数据资源
- DataResRatio [数据资源信息披露水平] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:数据资源语句数/年报语句总数。用作研究变量,越大代表企业数据资源信息披露的相对水平越高
- DataResNum [数据资源信息披露规模] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:ln(1+数据资源语句数)。用作研究变量,越大代表企业数据资源信息披露的绝对规模越大
- SelfUseRatio [自用型数据资源信息披露水平] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:自用型数据资源语句数/年报语句总数。用作研究变量,越大代表企业对服务于内部业务流程和经营决策的数据资源披露越多
- TradeRatio [交易型数据资源信息披露水平] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:交易型数据资源语句数/年报语句总数。用作研究变量,越大代表企业对用于对外服务或销售的数据资源披露越多
- InternalRatio [内部型数据资源信息披露水平] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:内部型数据资源语句数/年报语句总数。用作研究变量,越大代表企业对源自自身业务活动的数据资源披露越多
- ExternalRatio [外部型数据资源信息披露水平] — 参考罗进辉等(2026,财会月刊)的方法,计算公式为:外部型数据资源语句数/年报语句总数。用作研究变量,越大代表企业对源自外部获取的数据资源披露越多
常见问题
- 「企业数据资源信息披露(FinBERT2模型测度)」是什么数据集?
- 企业数据资源信息披露(FinBERT2模型测度),隶属数字化转型与人工智能。参考罗进辉等(2026,财会月刊)的方法,以上市公司年度报告全文为文本基础构建企业数据资源信息披露指标。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 24 个变量。核心指标包括:年报语句总数、命中数据资源词集的语句数、数据资源语句数、自用型数据资源语句数、交易型数据资源语句数、内部型数据资源语句数、外部型数据资源语句数、数据资源信息披露水平、数据资源信息披露规模、自用型数据资源信息披露水平、交易型数据资源信息披露水平、内部型数据资源信息披露水平、外部型数据资源信息披露水平。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,680 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在数字经济时代,数据已成为与土地、劳动力、资本、技术并列的生产要素,企业拥有的数据资源及其价值成为企业界、市场投资者与政策部门共同关注的问题。然而,受制于数据确权、计量与制度适配等方面的现实约束,通过表内科目正式确认数据资源的公司数量在整个市场中仍属少数,绝大部分企业选择以表外非结构化的文本形式披露其拥有的数据资源,年度报告因而成为观察企业数据资源状况的主要窗口。既有研究多以"数据资源""数据资产"等词汇为种子构建词典并统计词频,但这类做法受词典设定质量的影响较大,也难以处理上下文语境——同一词汇既可能出现在企业对自身数据资源的实质性陈述中,也可能只是宏观形势描述、政策引用或名称罗列。本指标遵循罗进辉等(2026)的思路,改以金融领域预训练语言模型对年报语句作语义判别,在语句层面识别企业对数据资源的持有、使用与经营,从而降低纯词频方法的测度噪声。 指标构建以上市公司年度报告全文为文本基础。年报内容全面、格式规范,能够较为系统地反映企业在数据资源获取、管理、应用与战略规划等方面的信息,且具有较强的可比性与连续性,便于刻画数据资源信息披露的分布与演变特征。文本预处理分为切分与清洗两步:以句号、感叹号、问号等主要终止符为依据将全文切分为语句;对文本中的噪音内容加以识别与清洗,删除页眉页脚、目录、版权声明等格式化文本以及具有表格特征的文本,并依据文本长度剔除过长(字数大于 1000 字)与过短(字数小于 5 字)的语句。设企业 $i$ 在第 $t$ 年年报中经上述处理后保留的语句数为 $N{it}$,它构成后续各相对指标的分母。由于跨行断开与页眉粘连在版式转换后的文本中普遍存在,清洗以单份年报为单位统计高频重复的短行来动态识别页眉页脚与表头,不依赖任何公司名称的硬编码,从而在逐年重建时保持一致。 考虑到年报中大多数语句与数据资源无关,识别分两阶段进行。第一阶段以数据资源相关词集作初步筛选:以"数字""数据""信息""网络"四个与数据资源高度相关的词为种子,利用 Skip-gram 词向量模型在年报语料中获取与种子词高度相似的词,再经人工复核与筛选,得到包含 93 个词汇的词集,命中其中任一词汇的语句进入候选集合。第二阶段由语言模型对候选语句逐句判别。用于判别的模型是在大规模中文金融语料上继续预训练的 BERT 架构编码器,相较通用中文预训练模型,它对金融会计文本中的专业术语与专属词汇有更充分的表示,因而更适合年报语境下的数据资源文本识别。 模型的任务适配通过微调完成。从候选语句中随机抽取 6000 条作为标注样本,由生成式大语言模型按同一判定口径逐条标注:判断该语句是否反映企业持有、使用或经营的数据资源,反映者取 1,否则取 0。其中,企业对数据的采集、存储、管理、治理、保护、共享、流通、分析、挖掘、应用、交易与运营,以及为承载上述活动而建设、投入或使用的数据平台、数据中心、数据库、信息系统与网络基础设施,均视为企业持有、使用或经营数据资源的体现;主体并非本企业、仅陈述宏观形势与产业政策、以及目录标题、表格残渣、人员履历与名称罗列等情形则取 0。标注样本按 8∶1∶1 划分为训练集、验证集与测试集,训练批大小设定为 16,学习率设定为 0.00002,训练轮次设定为 3;受编码器输入窗口限制,超过 512 个词元的语句保留前 512 个词元。以正确率、精确度、召回度与 F1 值衡量分类性能,最终用于全样本判别的轮次按验证集 F1 择优确定。 记 $D{ijt}$ 为企业 $i$ 第 $t$ 年年报中第 $j$ 条语句的判别结果,取 1 表示该语句反映企业持有、使用或经营的数据资源。企业数据资源信息披露的相对水平以数据资源语句数占年报语句总数的比重衡量: $$DARATIO{it}=\frac{\sum{j}\mathbb{1}\{D{ijt}=1\}}{N{it}}$$ 其绝对规模则以句频加 1 取自然对数衡量: $$DANUM{it}=\ln\left(1+\sum{j}\mathbb{1}\{D{ijt}=1\}\right)$$ 两者分别刻画数据资源信息披露在年报叙事中所占的比例,以及披露的绝对体量。前者对年报总体篇幅的逐年增长不敏感,适合跨年度比较;后者保留了披露规模的信息,适合与企业规模等变量一同使用。 在企业数据资产化的过程中,明确数据资源的原始数据来源与用途,是数据资源合规确权、有效管理与价值实现的关键前提。据此进一步构建四个分项指标。按用途,自用型数据资源指服务于企业内部业务流程和经营决策、不对外提供的数据资源,交易型数据资源指用于对外服务或销售、具有市场化属性的数据资源;按形成数据资源的原始数据来源,内部型数据资源的原始数据来源于企业内部、由企业自身业务活动产生,外部型数据资源的原始数据来源于企业外部、由企业通过外部购买、采集、合作方提供等方式取得。四个子分类标签在同一批标注样本上标注,并各自微调一个同架构的分类器,判别方式与主指标一致。各分项披露水平同样以相应语句出现次数与年报语句总数量的比值衡量,例如自用型数据资源的披露水平为: $$SelfUse{it}=\frac{\sum{j}\mathbb{1}\{D^{self}{ijt}=1\}}{N{it}}$$ 交易型、内部型与外部型分项的构造方式与此相同,仅将分子替换为相应类别的语句数。除比值形式的指标外,数据集同时给出年报语句总数、命中词集的候选语句数以及各类判定语句的原始计数,便于使用者按自身需要改用其他归一化方式或直接以计数形式建模。 补充说明 - 样本口径:覆盖语料中全部可得的年报报告年度,不预先施加剔除金融业、剔除 ST 公司、要求连续存在年数等回归样本限制,也未作缩尾——全部字段为计数、对数计数或比值。使用者应按各自的研究设计自行设定样本筛选与极值处理规则。数据资源相关表述在早期年份的年报中近乎不存在,早年取值集中于零属真实现象而非缺失。 - 两阶段识别的取舍:语言模型只对命中词集的候选语句作判别,未命中的语句直接计零,分母仍为年报语句总数。这样处理的原因是标注语料全部抽自含词集词汇的语句,分类器在完全不含相关词汇的语句上属于分布外推断,其误判不受测试集性能的约束。代价是指标对"未使用词集内任何词汇却仍在陈述数据资源"的语句不敏感。词集由种子词经词向量扩展得到,不含"数据资源""大数据"等裸词,抽样复算显示未命中语句中约三分之一会被分类器判为数据资源,且捕获率随企业披露水平上升——低披露企业的捕获率明显低于高披露企业。因此企业间排序高度稳定(秩相关约 0.9),但取值基数被非等比例压缩:本指标适合作排序型或相对型代理变量,取零不等同于"完全未披露",据此设定二元选择模型或把零当作角点解并不合适。 - 会计准则模板的处理:候选语句中出现频次最高的若干条均为预期信用损失的会计准则模板(以历史数据计算账龄坏账率、识别影响信用风险的经济指标等)。这类表述描述的是准则规定的计量方法而非企业自身的数据资源,且其出现频率在新金融工具准则实施年份翻倍,若计入会制造一个与数据要素政策窗口重合的结构性断点。标注环节已明确将其排除。使用者若以准则实施前后作为识别策略,仍建议核查该类表述的残余影响。 - 标注环节的差异:原文由两个商用生成式大语言模型分别标注、判断不一致处再作人工复核;本数据集以单一本地部署的生成式大语言模型按同一判定口径标注,判定温度取零以保证可复现。缺少双模型交叉验证会使标注噪声高于原文,该噪声经训练集传导至分类器,方向不定。原文提示词中要求模型"一步步思考"的指令未予采用——该指令要求模型先输出推理过程,与本数据集采用的单次结构化输出方式不兼容,会使相当比例的应答无法解析且失败集中在长语句上;提示词中界定判定对象的部分逐字保留。 - 子分类与主判定的关系:四个分项的判定只在已被判定为数据资源的语句上进行,未被判定为数据资源的语句其四个分项一律计零。这一约束来自构念本身——不反映数据资源的语句不可能属于某一类型的数据资源。同一语句在两个维度内可能同时命中两类,也可能因线索不足而在某一维度上两类均不计入,因此两个分项之和与主指标并不恒等。 - 分项指标的相对可靠性:四个分项是四个独立的二元判别,并不构成对数据资源语句的划分——同一语句可同时归入两类,也可能因线索不足而在某一维度上两类皆不归入,故两个分项之和既可能超过也可能不足于数据资源语句总数,不应假定其加总等于总量或彼此互斥。外部型在标注样本中的正例比例远低于其余三类,可供学习的正例数量有限,其分类器的召回明显偏低,指标取值会系统性偏小;该分项仅适合作探索性用途,不建议进入主回归。交易型的正例比例同样偏低,性能介于两者之间,建议作稳健性检验时以自用型与内部型的结果作为参照。自用型与内部型的分类性能与主判定相当,是四个分项中较为可靠的两个。 - 两个主指标不可互换:相对水平以年报语句总数为分母,篇幅更长的年报会稀释比值;绝对规模未作长度标准化,与年报篇幅正相关。二者对企业规模呈现的梯度方向并不相同,同时报告两者并据此声称结论稳健是有风险的。建议用相对水平作主回归时控制年报语句总数的对数,用绝对规模时控制年报长度;数据集同时给出分子与分母的原始计数,也可直接以计数模型建模并将语句总数取对数作为暴露项。 - 样本前段的语句基数:早年部分年报在版式转换时丢失全部中文标点,无法切分出语句,其判定字段为缺失而非零;另有少量企业年语句数偏低。取零的企业年在样本前段占绝对多数并随年份下降,使用者应据此选择样本起点,并考虑剔除语句数过少的企业年。 - 企业主体的连续性:股票代码在两处不连续——北交所代码于近年整体迁移,同一主体在迁移前后表现为两个代码;B 股代码单独成行,少数企业年与对应 A 股代码并存。此外少量企业年不在公司档案中而缺地理与行业标识。做主体固定效应或滞后项时需自行拼接主体。 - 其他局限:原文规定剔除字数超过一千字的语句,版式转换后财务报表科目常连成无句读的长串,该规则丢弃的主体是表格残留,但与表格相邻的正文叙述会被一并丢弃,分子与分母同时缩水只能部分抵消;清洗规则按通用特征识别而非逐份人工校验;语料中混有繁体文本,已在切句前统一转换为简体;超过输入窗口的长语句只保留前段,出现在句尾的数据资源表述可能不被识别。 参考文献 - 罗进辉,王毓泽,易炫彤,等.企业数据资源信息披露现状与测度——基于大语言模型的指标构建[J].财会月刊,2026,47(9):8-19. - 何瑛,陈丽丽,杜亚光.数据资产化的企业价值效应研究——来自数据资产入表新规颁布的经验证据[J].中国工业经济,2024(8):164-179. - Devlin J, Chang M W, Lee K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 2019: 4171-4186.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。