数据资产披露(自用型与交易型词频)

「数据资产披露(自用型与交易型词频)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 67,320。 衡量上市公司数据资产化水平。

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数21
样本量67,320
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • FreqODA [自用型数据资产词频] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,自用型数据资产161个关键词在年报全文中出现的总次数。单位:次
  • FreqDDA [交易型数据资产词频] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,交易型数据资产59个关键词在年报全文中出现的总次数。单位:次
  • FreqDA [数据资产总词频] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:自用型数据资产词频 + 交易型数据资产词频。单位:次
  • TotalChars [全文总字符数] — 年报全文中文字符总数。单位:个
  • DA [数据资产化程度] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:ln(数据资产总词频 + 1),用作研究变量,越大代表企业数据资产化程度越高
  • ODA [自用型数据资产化程度] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:ln(自用型数据资产词频 + 1),用作研究变量,越大代表企业自用型数据资产化程度越高
  • DDA [交易型数据资产化程度] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:ln(交易型数据资产词频 + 1),用作研究变量,越大代表企业交易型数据资产化程度越高
  • DARatio [数据资产化词频占比] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:数据资产总词频 / 全文总字符数 * 100(百分比)
  • ODARatio [自用型词频占比] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:自用型数据资产词频 / 全文总字符数 * 100(百分比)
  • DDARatio [交易型词频占比] — 参考何瑛, 陈丽丽, 杜亚光(2024, 中国工业经济)的方法,计算公式为:交易型数据资产词频 / 全文总字符数 * 100(百分比)

常见问题

「数据资产披露(自用型与交易型词频)」是什么数据集?
数据资产披露(自用型与交易型词频),隶属数字化转型与人工智能。衡量上市公司数据资产化水平。
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 21 个变量。核心指标包括:自用型数据资产词频、交易型数据资产词频、数据资产总词频、全文总字符数、数据资产化程度、自用型数据资产化程度、交易型数据资产化程度、数据资产化词频占比、自用型词频占比、交易型词频占比。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,320 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集旨在衡量中国上市公司的数据资产化程度,其核心方法是通过文本分析技术,从上市公司年度报告全文中识别与数据资产相关的关键词,并基于其出现频率构建量化指标。该方法参考了何瑛等(2024)的研究,将数据资产区分为自用型数据资产(ODA)和交易型数据资产(DDA)两类。自用型数据资产主要涉及企业内部运营的数字基础设施、数据管理与处理、信息技术应用等场景;交易型数据资产则聚焦于数据交易平台、数据共享流通、网络服务等外部交易场景。研究首先以“信息”、“网络”、“数字”、“数据”四个种子词为基础,通过Word2Vec模型扩展得到共计220个关键词,其中161个属于自用型,59个属于交易型。在统计词频时,为避免因关键词之间存在子串包含关系(共39组)而导致重复计数,采用了AC自动机算法进行两遍最长匹配去重处理。 基于上述关键词词典,对每家上市公司每年的年报全文进行扫描,得到三个基础词频变量:自用型数据资产词频($FreqODA$)、交易型数据资产词频($FreqDDA$)以及两者之和构成的数据资产总词频($FreqDA$)。同时,记录年报全文的总中文字符数($TotalChars$)。为构建可用于实证研究的主要变量,对词频进行对数变换以缓解其偏态分布,得到数据资产化程度($DA$)、自用型数据资产化程度($ODA$)和交易型数据资产化程度($DDA$)三个核心指标。此外,为控制年报文本长度的影响,还计算了各词频占总字符数的百分比,得到数据资产化词频占比($DARatio$)、自用型词频占比($ODARatio$)和交易型词频占比($DDARatio$)。 核心指标的计算公式如下: $$DA = \ln(FreqDA + 1)$$ $$ODA = \ln(FreqODA + 1)$$ $$DDA = \ln(FreqDDA + 1)$$ 其中$FreqDA$为数据资产总词频,$FreqODA$为自用型数据资产词频,$FreqDDA$为交易型数据资产词频。 词频占比指标的计算公式为: $$DARatio = \frac{FreqDA}{TotalChars} \times 100$$ $$ODARatio = \frac{FreqODA}{TotalChars} \times 100$$ $$DDARatio = \frac{FreqDDA}{TotalChars} \times 100$$ 其中$TotalChars$为年报全文总中文字符数。 参考文献 - 何瑛, 陈丽丽, 杜亚光. 数据资产化能否缓解"专精特新"中小企业融资约束[J]. 中国工业经济, 2024.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。