企业数字化转型(TF-IDF法)
「企业数字化转型(TF-IDF法)」,覆盖 1992-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 69,561。 参考韩峰、姜竹青(2023,管理世界)的词频-逆文本频率方法测算的企业数字化转型程度。
| 时间跨度 | 1992-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 21 |
| 样本量 | 69,561 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年报对应的会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- NReportsYear [当年年报文本总数] — 参考韩峰、姜竹青(2023,管理世界)的方法,当年纳入测算的上市公司年报文本总份数,是逆文本频率公式中的分子,供使用者自行核算各关键词当年的逆文本频率权重
- NKeywordHit [命中数字化关键词种类数] — 在年报全文中至少出现过1次的数字化关键词种类数,计算公式为:对全部75个数字化关键词逐一判断其词频大于0并求和,取值范围为0至75。用作研究变量,越大代表企业年报涉及的数字技术门类越广
- FreqTotal [数字化关键词总词频] — 参考吴非等(2021,管理世界)的数字化词库,计算公式为:人工智能技术、大数据技术、云计算技术、区块链技术、数字技术运用五大类共75个关键词在年报全文中出现次数的加总
- TotalChars [年报全文中文字数] — 年报全文的中文字符总数,用于控制年报披露篇幅对词频类指标的机械影响
- MDAWords [管理层讨论与分析字数] — 年报中管理层讨论与分析章节的中文字符数,该章节提取失败时记为缺失
- MDAFreq [管理层讨论与分析内数字化词频] — 计算公式为:75个数字化关键词在管理层讨论与分析章节内出现次数的加总,该章节提取失败时记为缺失
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功从年报中提取管理层讨论与分析章节(0=否,1=是),取0时该年报的管理层讨论与分析字数、章节内数字化词频及数字化关键词词频占比均记为缺失
- DigitalTFIDF [企业数字化转型程度(TF-IDF法)] — 参考韩峰、姜竹青(2023,管理世界)的方法,计算公式为:对75个数字化关键词逐一计算该词在年报全文中词频加1的自然对数,乘以当年年报总份数除以当年提及该词的年报份数再加1的自然对数,最后跨全部关键词加总。逆文本频率逐年独立计算,赋予稀缺关键词更高权重,以降低通用词汇过多带来的低估。用作研究变量,越大代表企业数字化转型程度越高
- LnDigitalTFIDF [企业数字化转型程度的自然对数] — 参考韩峰、姜竹青(2023,管理世界)的方法,计算公式为:企业数字化转型程度(TF-IDF法)的自然对数,为该文回归模型所采用的变量形式;企业年报未提及任何数字化关键词时该值无定义,记为缺失
- DigitalFreqRatio [数字化关键词词频占比] — 参考韩峰、姜竹青(2023,管理世界)稳健性检验的方法,计算公式为:管理层讨论与分析章节内数字化关键词词频加总除以该章节中文字数,用于剔除各企业披露篇幅差异对词频的影响
常见问题
- 「企业数字化转型(TF-IDF法)」是什么数据集?
- 企业数字化转型(TF-IDF法),隶属数字化转型与人工智能。参考韩峰、姜竹青(2023,管理世界)的词频-逆文本频率方法测算的企业数字化转型程度。
- 该数据集的时间范围是?
- 覆盖 1992-2025 年。
- 包含哪些变量/指标?
- 共 21 个变量。核心指标包括:当年年报文本总数、命中数字化关键词种类数、数字化关键词总词频、年报全文中文字数、管理层讨论与分析字数、管理层讨论与分析内数字化词频、是否成功提取管理层讨论与分析章节、企业数字化转型程度(TF-IDF法)、企业数字化转型程度的自然对数、数字化关键词词频占比。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,561 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 以年报文本中数字化关键词的出现频次来度量企业数字化转型程度,是数字经济微观研究中的主流做法。但简单的词频加总隐含一个假设:所有关键词同等重要。现实并非如此——"大数据""互联网"这类词在绝大多数企业的年报中都会出现,其边际信息量很低;而"类脑计算""多方安全计算"这类词只有真正涉足相关技术的企业才会写入年报,一旦出现就是极强的信号。若对二者一视同仁地计数,通用词汇的高频出现会稀释稀缺词汇的识别力,使真正深度转型的企业与仅在年报中泛泛提及数字化概念的企业难以区分。 本指标采用"词频—逆文本频率"(TF-IDF)加权来纠正这一偏差。其思路源自财务文本分析中的加权词频传统:一个词在单份文档中出现得越频繁,越能说明该文档与之相关;但该词在整个语料库中出现得越普遍,其区分能力越弱。将二者相乘,便得到兼顾"文档内强度"与"语料库内稀缺度"的权重。 具体构建分为三步。 第一步,统计关键词词频。关键词库涵盖人工智能技术、大数据技术、云计算技术、区块链技术与数字技术运用五个方面,合计七十五个细分关键词,直接采用数字化转型研究中广为使用的既有词库,不作增删。对每一份年报全文,逐一统计每个关键词的出现次数,记第 $k$ 个关键词在企业 $i$ 第 $t$ 年年报中的词频为 $h^k{it}$。词库中存在前缀包含关系的词对(例如"移动互联"与"移动互联网"),按匹配起始位置只保留最长的那个匹配,使文本中的同一处表述只归属于一个关键词,避免重复计数。 第二步,计算逆文本频率。设 $Qt$ 为第 $t$ 年纳入测算的年报文本总份数,$q^kt$ 为第 $t$ 年提及过第 $k$ 个关键词的年报份数,则该关键词当年的逆文本频率为 $\ln(Qt/q^kt+1)$。这一权重逐年独立计算:某个关键词在全部年报中越普遍($q^kt$ 越接近 $Qt$),其权重越接近下限;反之,只被少数企业提及的关键词将获得显著更高的权重。 第三步,加权求和得到企业数字化转型程度: $$\kappa{it}=\sum{k}\Big[\ln\big(h^k{it}+1\big)\times\ln\big(Qt/q^kt+1\big)\Big]$$ 其中词频一侧取 $\ln(h+1)$ 的对数形式,既压缩了个别企业反复重复同一词汇带来的影响,也保证了未提及该词时($h=0$)该项贡献恰为零。因此,企业当年年报若未命中任何数字化关键词,$\kappa$ 取零,其经济含义为年报中不存在可识别的数字化表述。实证研究中通常使用其自然对数形式 $\ln\kappa$,本数据集一并给出;由于零值取对数无定义,该列在 $\kappa=0$ 时为缺失。 作为替代口径,本数据集还提供数字化关键词词频占比 $DigitalFreqRatio$,即管理层讨论与分析章节内数字化关键词词频加总除以该章节的中文字数。设置这一口径是因为不同企业的披露篇幅差别很大,词频绝对数在一定程度上会随篇幅同向变动,用同一文本单元内的相对频率可以剥离篇幅差异。为使分子分母口径自洽,该比率的分子与分母均取自管理层讨论与分析章节,与主口径基于年报全文有所不同。 数据集同时输出计算过程中的构件字段:当年年报文本总份数、命中的关键词种类数、全文关键词总词频、年报全文中文字数、管理层讨论与分析章节字数与章节内词频,以及该章节的提取成功标志。使用者可据此自行核算权重、构造替代口径,或在回归中控制披露篇幅。 补充说明 - 样本口径:覆盖全部可获得年报文本的上市公司年度观测,不预先剔除金融业、ST 与退市样本,输出为未缩尾的原始值,研究者可按需自行筛选与缩尾。仅剔除两类记录:非股票发行主体(如债券)的年度报告,以及文本转换后中文正文缺失(全文中文字符数低于五百)的文件——后者若放行会被误记为"未提及任何数字化关键词"。 - 逆文本频率逐年计算:这是原文公式的规定形式,但由此带来一个使用者必须知晓的性质——权重结构随词汇在语料库中的扩散而逐年改变。同一份文本在不同年份会得到不同的取值:早年稀缺、后来普及的关键词(如大数据、人工智能)权重会持续下降。因此该指标的跨年绝对水平不宜直接比较,建议在模型中加入年份固定效应,或在需要跨期可比时改用本数据集提供的原始词频字段自行构造。 - 零值的性质:年报未提及任何关键词的观测取零,这类观测并非随机分布,而是集中于传统制造与资源类行业中披露篇幅较短的公司。使用 $\ln\kappa$ 会使这部分观测因取对数无定义而退出样本,截断发生在解释变量自身之上;建议同时报告基于全样本原始值的结果,或对零值单独设置指示变量。 - 披露篇幅的影响:词频类指标与年报篇幅同向变动,而年报平均篇幅在样本期内呈上升趋势,故时间趋势中含有披露规范演变的成分。数据集已输出全文中文字数与章节字数,建议在回归中一并控制。 - 文本方法的固有性质:关键词直接在原文上匹配,未作分词。部分较短的关键词会命中语义相近但并非原指的表述(如"网联"会命中"智能网联汽车"),部分命中来自合并报表附注中的子公司名称与高管履历而非业务描述。这是词典法的共同特征,词库按原文献原样使用、不作删改;使用者若关注业务层面的表述,可用章节内词频字段自建管理层讨论与分析口径。 - 与原文描述统计的关系:原文附录报告的该变量描述统计(均值 0.2510、最小值 0.0186、最大值 0.4011)与公式本身的量级不相容——按上式跨七十五个关键词求和的结果远高于此,且该表所报标准差 0.3426 已超过其全距的一半,同表其他变量亦存在类似不相容之处,表明该表存在排版错误。本数据集忠实实现原文公式的字面表述,未作任何缩放以迁就该表数值,故绝对水平不应与之对标;变量的相对排序、行业差异与时间趋势不受影响。 - 其他局限:早期年份纳入测算的年报份数很少,逆文本频率在这些年份的估计不稳定,且个别早年语料存在整字丢失,建议将样本起点设在本世纪初之后;近年个别年份的年报覆盖存在缺口,缺失偏向小盘与次新股;管理层讨论与分析章节的抽取在早年成功率偏低,且其篇幅口径随年报格式准则改版存在年际波动,相关字段与比率口径更适合用于横截面而非时间序列比较。 参考文献 - 韩峰, 姜竹青. 集聚网络视角下企业数字化的生产率提升效应研究[J]. 管理世界, 2023, 39(11): 54-73. - 吴非, 胡慧芷, 林慧妍, 任晓怡. 企业数字化转型与资本市场表现——来自股票流动性的经验证据[J]. 管理世界, 2021, (7): 130-144+110.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。