企业数字化转型(ERNIE模型)
「企业数字化转型(ERNIE模型)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 28 个变量,样本量约 69,679。 复现金星晔等(2024,经济研究)基于大语言模型的企业数字化转型测度方法。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 28 |
| 样本量 | 69,679 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年度报告的管理层讨论与分析章节(0=否,1=是)。取0时该企业年的语句计数与全部数字化转型指标均置为缺失,因为章节定位失败时可用文本退化为整份年报,与章节口径不可比
- Section1Extracted [是否成功提取目录释义及重大风险提示章节] — 是否成功定位年度报告的目录、释义及重大风险提示章节(0=否,1=是)。该章节是年报披露准则修订后才普遍采用的结构,早期年份的年报基本不含该章节,取0时文本范围退化为仅管理层讨论与分析
- NSentTotal [参与分类的语句总数] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:年度报告的管理层讨论与分析、目录释义及重大风险提示两章节文本删除空格与换行符后,按句号和分号全部分割所得的语句数量(仅计入长度不小于5个字符且含中文字符的语句)
- DigiSentCount [数字技术语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年参与分类的语句中,被句子分类模型判定为企业正在使用大数据、人工智能、移动互联、云计算、物联网、区块链六类数字技术之一的语句数量之和
- BigDataSentCountSupp [大数据语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用大数据技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- AISentCountSupp [人工智能语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用人工智能技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- MobileInternetSentCountSupp [移动互联语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用移动互联技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- CloudComputingSentCountSupp [云计算语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用云计算技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- IoTSentCountSupp [物联网语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用物联网技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- BlockchainSentCountSupp [区块链语句数量] — 参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年被句子分类模型判定为企业正在使用区块链技术的语句数量。本字段为原文未使用的补充字段,原文明确未按语句数量或比例构造转型程度的连续变量
- IsDigiTech [是否数字化转型] — 是否进行数字化转型(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年只要使用了大数据、人工智能、移动互联、云计算、物联网、区块链六类数字技术中的任意一种则取1,反之为0;技术使用与否由微调后的句子分类模型对年报语句逐句判定,可排除否定表述、表述为未来计划、描述行业背景而非企业自身行动这三类虽提及关键词但实际未使用技术的情形。用作研究变量,取1代表该企业当年已进行数字化转型
- IsBigData [是否使用大数据] — 是否使用大数据技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了大数据技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用大数据技术
- IsAI [是否使用人工智能] — 是否使用人工智能技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了人工智能技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用人工智能技术
- IsMobileInternet [是否使用移动互联] — 是否使用移动互联技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了移动互联技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用移动互联技术
- IsCloudComputing [是否使用云计算] — 是否使用云计算技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了云计算技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用云计算技术
- IsIoT [是否使用物联网] — 是否使用物联网技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了物联网技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用物联网技术
- IsBlockchain [是否使用区块链] — 是否使用区块链技术(0=否,1=是)。参考金星晔等 (2024, 经济研究)的方法,计算公式为:该企业当年年报的管理层讨论与分析、目录释义及重大风险提示两章节中,至少有一条语句被句子分类模型判定为企业使用了区块链技术则取1,否则取0。用作研究变量,取1代表该企业当年已使用区块链技术
常见问题
- 「企业数字化转型(ERNIE模型)」是什么数据集?
- 企业数字化转型(ERNIE模型),隶属数字化转型与人工智能。复现金星晔等(2024,经济研究)基于大语言模型的企业数字化转型测度方法。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 28 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、是否成功提取目录释义及重大风险提示章节、参与分类的语句总数、数字技术语句数量、大数据语句数量、人工智能语句数量、移动互联语句数量、云计算语句数量、物联网语句数量、区块链语句数量、是否数字化转型、是否使用大数据、是否使用人工智能、是否使用移动互联、是否使用云计算、是否使用物联网、是否使用区块链。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,679 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业数字化转型是企业借助数字技术改造其生产经营系统、管理模式与核心业务流程的过程。既有研究在测度这一构念时大多采用词典法,即先构建一个包含各种数字技术的关键词词典,再统计这些关键词在年报"管理层讨论与分析"部分出现的次数或比例,其隐含假设是"提及了某种数字技术的关键词就表明企业进行了数字化转型"。金星晔等(2024)指出该假设会同时引发两类错误:第一类错误是企业确实应用了数字技术,但所用词语未被收录进词典因而未被识别,例如以"云+API""光学字符识别""小语种识别""图像识别"等表述出现的技术应用;第二类错误是文本中虽出现关键词,企业实际并未使用该技术,典型情形有三种——句子采用否定表述、企业表示将在未来而非当下进行转型、企业描述的是行业发展背景而非自身行动。本数据集复现该文提出的测度方法,以微调后的大语言模型对年报语句逐句分类,从而同时缓解上述两类错误。 测度的文本基础是上市公司年度报告中的"管理层讨论与分析"与"目录、释义及重大风险提示"两个章节。前者披露企业报告期内的经营情况、未来发展战略与所面临的风险,是既有文献计算数字技术词频的通行来源;后者之所以纳入,是因为部分公司选择在该章节披露其面临的风险状况,其中同样可能包含数字化转型的相关信息。两章节文本在删除空格与换行符后拼接,并按句号和分号全部分割为句子,构成待预测句库。 在语句分类模型的训练环节,首先需要一个规模可控且信息密度较高的待标记句库。为此先依据政策口径与业界定义把数字技术划分为大数据、人工智能、移动互联、云计算、物联网、区块链六种类型,并整理出一个包含 311 个数字技术关键词的词典。该词典只用于缩小阅读与标注范围,不参与最终指标的判定。待标记句库由两部分构成:一是从包含 10 个及以上不同关键词的年报中取出的含关键词语句,二是随机抽取的年报所分割出的语句,后者用于提升模型对不含关键词语句的判别能力。由于上市公司总数逐年增加,直接随机标注会使被标注语句过度集中于近期年份,因此在合并去重后按年份分组等量抽取,再从中不放回随机抽样,最终得到 38994 条待标记语句。 标注环节对每条语句判断企业是否使用以及使用何种数字技术,把语句归入八个标签之一:六种新型数字技术,加上"非新型数字技术"与"非数字技术"。其中"非新型数字技术"指语句只出现传统数字技术或数字技术的泛称,例如互联网、平台经济、数字化、数字技术、智能化一类提法,而未指向六类中的某项具体技术。判定时严格执行前述第二类错误的三条排除规则:否定表述、表述为未来计划、描述行业背景而非企业自身行动,均不计为该企业使用了数字技术。难以确定标签的语句不纳入训练集。 标注完成后的语料按 8:1:1 划分为训练集、测试集与验证集,用于微调 ERNIE 语句分类模型。模型性能在"是否属于数字技术"这一二元口径上评估:精确度(Precision)度量模型判定为数字技术的语句中真实标签也是数字技术的比例,召回率(Recall)度量全部真实的数字技术语句中被模型找出的比例,二者的调和平均为 $F1$。考虑到年报中往往有多处语句表明企业使用了数字技术,正确分类的能力相对更重要,因此还计算赋予 Precision 更大权重的 $F{0.8}$: $$F{\beta}=\frac{(1+\beta^{2})\cdot \text{Precision}\cdot \text{Recall}}{\beta^{2}\cdot \text{Precision}+\text{Recall}},\qquad \beta=0.8$$ 并依 $F{0.8}$ 最优的准则选取最终用于全量预测的模型。原文报告其 ERNIE 模型在测试集上的 Precision、Recall、Accuracy、$F1$ 与 $F{0.8}$ 分别为 81.1%、70.0%、92.9%、75.1% 与 76.4%,并据 $F{0.8}$ 在所比较的七类模型中选定 ERNIE。 最后用微调后的模型对待预测句库中的每一条语句预测其标签。需要一并处理的是,年报文本中存在大段缺少句号与分号的情形(早期年份的年报尤为常见),按上述规则切分后会产生远超模型长度上限的语句;若把这类语句整条送入模型,超出长度上限的部分会被截断丢弃,其承载的信息无法进入判定。因此对超长语句先按固定长度分段,逐段分类后再聚合回该语句:片段中出现过六类数字技术的,取出现次数最多的那一类,这与"一句同时体现多种技术时取最主要的一种"的单标签设定一致;没有技术片段时,若存在非新型数字技术的片段则记为非新型数字技术,否则记为非数字技术。该处理不改变语句的切分口径,只使模型能读到语句的全部内容。 记企业 $i$ 在第 $t$ 年两章节中参与分类的语句集合为 $S{i,t}$,语句 $s$ 的预测标签为 $\hat{y}{s}$,六种数字技术的集合为 $K=\{\text{大数据},\text{人工智能},\text{移动互联},\text{云计算},\text{物联网},\text{区块链}\}$。对每一种技术 $k\in K$,其使用哑变量定义为该企业当年是否至少有一条语句被判定为使用了该技术: $$\text{Is}^{k}{i,t}=\mathbb{I}\Big(\sum{s\in S{i,t}}\mathbb{I}(\hat{y}{s}=k)\ \ge\ 1\Big)$$ 企业数字化转型哑变量则定义为六种技术中任意一种被使用: $$\text{IsDigiTech}{i,t}=\mathbb{I}\Big(\sum{k\in K}\text{Is}^{k}{i,t}\ \ge\ 1\Big)$$ 即公司在当年只要使用了大数据、人工智能、移动互联、云计算、物联网和区块链中的任意一种技术,指标赋值为 1,反之为 0。除上述七个哑变量外,本数据集还给出参与分类的语句总数、被判定为使用六类数字技术的语句总数,以及各章节是否成功定位的标志,用以说明指标的计算过程。 补充说明 - 计数字段的性质:以 $\text{Supp}$ 结尾的六个字段给出各类数字技术各自的命中语句数量,属本数据集补充提供、原文未使用的字段。原文明确说明未根据数字技术相关语句的数量或比例构造连续变量,理由是企业在年报中多次提及某项技术,在表意为真的前提下只能说明其正在进行数字化转型,而难以据此测度转型的程度。七个核心哑变量的构造不依赖这些计数;若将计数用作转型程度的连续度量,属超出原文方法的用法。 - 标注者与模型版本:原文由多位研究人员分组交叉标注并对分歧集体讨论定夺,本数据集改由大语言模型依固定提示词标注,提示词逐条落实原文的六类技术定义与三条排除规则;语句分类模型使用公开可得的 ERNIE 中文预训练权重的较新版本,与原文同属一个模型族。原文未公布微调超参数,本实现自行设定,但选取模型的准则仍为原文的 $F{0.8}$ 最优。需要说明的是,标注目标由单一模型依固定规则产生,其内部一致性高于多人标注,分类模型因而更易拟合该目标,故本数据集分类模型在测试集上的各项指标不宜与原文报告值直接比较高低;指标的构念效度取决于标注提示词对原文技术定义与排除规则的落实程度。 - 文本章节的可得性:"目录、释义及重大风险提示"是年报披露准则修订后才普遍采用的章节结构,早期年份的年报基本不含该章节,此时文本对象退化为仅"管理层讨论与分析",早期样本的文本范围因而窄于原文设定。 - 样本口径:覆盖语料可得的全部年份与全部上市公司,不预先剔除金融业与 ST 公司——原文在构造指标时同样使用全样本,仅在其后的回归分析中才施加这些限制。语料目录中混入的极少数非股票代码文件(债券代码段)已在输出前剔除。使用者可按各自的研究设计自行筛选,并建议加入行业与年份固定效应。 - 时间可比性:样本量受年报文本语料的入库进度影响,早期年份所覆盖的上市公司比例低于近期年份,且未被覆盖的多为规模较小的公司;同时年报披露篇幅逐年增长,而"任一语句命中即赋值为 1"的定义会使指标随企业可用文本量的增加而上升。因此跨年份的水平差异同时包含了技术采纳与披露篇幅两种来源。做时间趋势分析或双重差分时,建议控制参与分类的语句总数(本数据集已提供该字段),并辅以"命中语句数达到更高阈值"的稳健性设定。 - 分技术哑变量的精度:总哑变量只要求判断语句是否涉及六类技术中的任意一种,分技术哑变量还要求判定具体归属哪一类,后者的判定难度更高、噪声更大;跨界表述(如智能制造、工业互联网)在单标签设定下归入哪一类,对各分技术的绝对水平影响明显,而对总哑变量没有影响。此外相当比例的分技术正例仅由一条语句支撑,区块链尤为突出。因此六个分技术哑变量更适合作为探索性或稳健性用途,跨技术之间的水平比较应当谨慎。 - 其他局限:管理层讨论与分析章节定位失败的企业年,其计数与指标字段置为缺失,因为此时可用文本会退化为整份年报,与章节口径不可比;参与分类的语句要求长度不小于 5 个字符且含中文字符,用以排除页码、编号、表格残片等无语义片段,这类片段本就不会被判定为使用技术,该门槛仅影响语句总数的口径;构建待标记句库时"随机抽取部分年报"的数量原文未给出,本实现按年份等量抽取,该步骤只影响训练语料中不含关键词语句的比例,不影响指标定义;一条语句同时体现多种数字技术时只归入最主要的一种,这与原文将每条语句归入八个标签之一的单标签设定一致;统计一份年报含多少个"不同关键词"以决定其是否进入待标记句库来源时,词典内互为子串的词条会在同一处文本上同时计入,使该计数略偏高、略多的年报越过门槛,该门槛不参与指标定义。 参考文献 - 金星晔,左从江,方明月,等.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,(3):34-53. - Sun Y, Wang S, Feng S, et al. ERNIE 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation[J]. arXiv preprint arXiv:2107.02137, 2021.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。