企业数智能化程度(68个数智化关键词)

「企业数智能化程度(68个数智化关键词)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 67,245。 参考刘凌冰等(2024,会计研究)的方法,基于上市公司年度报告全文,统计68个数智化关键词(涵盖数字化与智能化两个维度)的总词频,取ln(词频+1)度量企业数智

时间跨度1992-2025 年
数据频率年度
层级上市公司
变量数14
样本量67,245
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • DigiIntelWordCount [数智化关键词总词频] — 参考刘凌冰等(2024,会计研究)的方法,计算公式为:企业年度报告全文中68个数智化关键词出现次数的总和,该词库涵盖数字化与智能化两个维度。用作研究变量,越大代表年报中数智化相关技术与应用的提及越多。
  • TotalChars [年报中文字符数] — 年度报告全文中文字符(Unicode区间U+4E00至U+9FFF)总数,用作数智化词频测度的文本规模基线,不参与核心指标计算。低于5000字符的截断或残缺报告已剔除。
  • DigiIntelLevel [数智化程度] — 参考刘凌冰等(2024,会计研究)的方法,计算公式为:ln(数智化关键词总词频+1),对右偏的关键词词频做加1取自然对数处理,刻画企业数智化(数字化与智能化)整体程度。用作研究变量,越大代表企业数智化程度越高。

常见问题

「企业数智能化程度(68个数智化关键词)」是什么数据集?
企业数智能化程度(68个数智化关键词),隶属数字化转型与人工智能。参考刘凌冰等(2024,会计研究)的方法,基于上市公司年度报告全文,统计68个数智化关键词(涵盖数字化与智能化两个维度)的总词频,取ln(词频+1)度量企业数智
该数据集的时间范围是?
覆盖 1992-2025 年。
包含哪些变量/指标?
共 14 个变量。核心指标包括:数智化关键词总词频、年报中文字符数、数智化程度。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,245 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业数智化是指数字与智能双重驱动下企业经营管理场景变革与重塑的过程:数字化侧重数据的采集、传递与存储,智能化则是在数字化基础上对数据的智能分析与管理,二者共同作用于组织能力的获得与提升。参考刘凌冰等(2024)的方法,本数据集通过对上市公司年度报告全文的文本分析,构建企业数智化程度的整体指标。 测度的基础是一套涵盖数字化与智能化两个维度的数智化关键词词库,共计68个关键词(如人工智能、大数据、云计算、区块链、物联网、工业互联网、智能制造相关技术与商业应用等),该词库参照人工智能与企业数智化转型相关权威报告整理而成。对每一份年度报告全文,统计上述全部关键词出现次数的总和,记为数智化关键词总词频 $WordCount$。 由于词频数据具有典型的右偏分布特征,对其进行加一后取自然对数的处理,得到刻画企业数智化程度的核心指标: $$\text{DigiIntelLevel} = \ln\!\left(WordCount + 1\right)$$ 其中 $WordCount$ 为该公司当年年度报告全文中68个数智化关键词出现次数的总和。该指标在公司—年份层面度量企业数智化的整体水平,取值越大表示企业年报中对数智化相关技术与应用的提及越密集,数智化程度越高。 关键词匹配采用多模式字符串匹配算法,对报告全文一次扫描即完成全部关键词计数,英文缩写类关键词统一转为小写后匹配以兼顾大小写。词频口径下对所有出现次数直接加总,不对存在包含关系的关键词(如"移动互联"与"移动互联网")作最长匹配去重,以忠实复现原始文献的词频测度。本数据集同时保留中间变量数智化关键词总词频 $WordCount$ 与文本规模基线年报中文字符数,供研究者在机制分析或稳健性检验中使用。 补充说明 - 统计范围为年度报告全文(而非管理层讨论与分析等单一章节)。 - 为保证文本测度可靠,对中文字符数低于5000的截断或残缺报告文件予以剔除,避免其产生失真的数智化取值。 - 本数据集覆盖全行业、全样本,未复刻原始文献为回归识别所做的金融保险业、ST及上市未满特定年限等子样筛选;研究者可依据自身设计自行设定样本与缩尾处理。指标为原始未缩尾值,与文献经验分布对照时,其中位数与原始文献高度一致,均值因全样本覆盖且未缩尾而略偏高。 参考文献 - 刘凌冰,王语形,耿会欣.企业数智化与量化预算目标信息披露行为[J].会计研究,2024(11):63-78. - 单宇,许晖,周连喜,等.数智赋能:危机情境下组织韧性如何形成?——基于林清轩转危为机的探索性案例研究[J].管理世界,2021,37(3):84-104+7.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。