数智技术(ERNIE模型)
「数智技术(ERNIE模型)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 28 个变量,样本量约 69,679。 复现张帅和史恩义(2026,华东经济管理)的数智技术测度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 28 |
| 样本量 | 69,679 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- MDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年度报告的管理层讨论与分析章节(0=否,1=是)。取0时该企业年的语句计数与全部数智技术指标均置为缺失,因为章节定位失败时可用文本退化为整份年报,与章节口径不可比
- NSentTotal [参与分类的语句总数] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:年度报告的管理层讨论与分析章节文本删除空格与换行符后,按句号和分号全部分割所得的语句数量(仅计入长度不小于5个字符且含中文字符的语句)
- BigDataSentCountSupp [大数据语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用大数据技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- CloudComputingSentCountSupp [云计算语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用云计算技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- BlockchainSentCountSupp [区块链语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用区块链技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- AISentCountSupp [人工智能语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用人工智能技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- IoTSentCountSupp [物联网语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用物联网技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- MobileInternetSentCountSupp [互联网+语句数量] — 参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年被句子分类模型判定为企业应用互联网+技术的语句数量。本字段为原文未使用的补充字段,原文未按语句数量或比例构造应用程度的连续变量
- IsBigData [是否应用大数据技术] — 是否应用大数据技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了大数据技术则取1,否则取0,大数据属于数智技术中的数字化技术。用作研究变量,取1代表该企业当年已应用大数据技术
- IsCloudComputing [是否应用云计算技术] — 是否应用云计算技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了云计算技术则取1,否则取0,云计算属于数智技术中的数字化技术。用作研究变量,取1代表该企业当年已应用云计算技术
- IsBlockchain [是否应用区块链技术] — 是否应用区块链技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了区块链技术则取1,否则取0,区块链属于数智技术中的数字化技术。用作研究变量,取1代表该企业当年已应用区块链技术
- IsAI [是否应用人工智能技术] — 是否应用人工智能技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了人工智能技术则取1,否则取0,人工智能属于数智技术中的智能化技术。用作研究变量,取1代表该企业当年已应用人工智能技术
- IsIoT [是否应用物联网技术] — 是否应用物联网技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了物联网技术则取1,否则取0,物联网属于数智技术中的智能化技术。用作研究变量,取1代表该企业当年已应用物联网技术
- IsMobileInternet [是否应用互联网+技术] — 是否应用互联网+技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年年报的管理层讨论与分析章节中,至少有一条语句被句子分类模型判定为企业应用了互联网+技术则取1,否则取0,互联网+属于数智技术中的智能化技术,其判定采用移动互联的技术边界,涵盖移动搜索、移动操作系统、移动通信网络、移动支付、移动电子商务等互联网技术与业务活动结合的应用。用作研究变量,取1代表该企业当年已应用互联网+技术
- IsDigitalTech [是否应用数字化技术] — 是否应用数字化技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年应用了大数据、云计算、区块链三类数字化技术中的任意一类则取1,三类均未应用则取0。用作研究变量,取1代表该企业当年已应用数字化技术
- IsIntelligentTech [是否应用智能化技术] — 是否应用智能化技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年应用了人工智能、物联网、互联网+三类智能化技术中的任意一类则取1,三类均未应用则取0。用作研究变量,取1代表该企业当年已应用智能化技术
- IsDigitalIntelligentTech [是否应用数智技术] — 是否应用数智技术(0=否,1=是)。参考张帅和史恩义 (2026, 华东经济管理)的方法,计算公式为:该企业当年同时应用了数字化技术(大数据、云计算、区块链三类中任一)与智能化技术(人工智能、物联网、互联网+三类中任一)则取1,未同时具备这两类技术的应用则取0;各类技术是否应用由大语言模型对年报语句逐句分类判定,可排除虽提及技术词语但企业实际并未应用的情形。数智技术是数字化与智能化的有机融合,故要求两类技术同时具备。用作研究变量,取1代表该企业当年已应用数智技术
常见问题
- 「数智技术(ERNIE模型)」是什么数据集?
- 数智技术(ERNIE模型),隶属数字化转型与人工智能。复现张帅和史恩义(2026,华东经济管理)的数智技术测度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 28 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、参与分类的语句总数、大数据语句数量、云计算语句数量、区块链语句数量、人工智能语句数量、物联网语句数量、互联网+语句数量、是否应用大数据技术、是否应用云计算技术、是否应用区块链技术、是否应用人工智能技术、是否应用物联网技术、是否应用互联网+技术、是否应用数字化技术、是否应用智能化技术、是否应用数智技术。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 69,679 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 数智技术是数字化与智能化的有机融合,可以理解为"数字化+智能化",即在数字化的基础上融合应用机器学习、人工智能等智能技术的过程。相比投入成本高且运行风险较大的整体数字化转型,数智技术的应用通常聚焦于企业特定生产经营环节,是对企业业务流程和关键环节的局部优化,具有成本低、见效快、风险低的特点。对于在实物流、信息流、资金流等关键环节存在卡点、痛点、堵点的中小企业而言,数智技术有助于其在外部不利冲击下应急调整、提升韧性,因而成为衡量企业技术赋能水平的重要变量。 按照本数据集所复现文献的设定,数智技术划分为两个大类共六种具体技术:数字化技术包括大数据、云计算与区块链三类,智能化技术包括人工智能、物联网与互联网+三类。数字化技术解决的是数据的采集、存储与流通问题,智能化技术解决的是在数据基础上的感知、决策与协同问题,两者互为条件——只有数据基础而无智能应用,或只有智能应用而无数据支撑,都不构成"数智"意义上的技术融合。这一构念上的要求直接决定了核心指标的构造方式。 指标的文本基础是上市公司年度报告中的"管理层讨论与分析"章节。该章节分析了企业在报告期内的经营情况、描述未来的发展战略并披露公司所面临的风险状况,是企业主动披露自身技术应用情况的主要载体。将该章节文本删除空格与换行符后,按句号和分号全部分割为语句,构成待预测句库;长度不足五个字符或不含中文字符的片段(页码、编号、表格残片等)不参与分类。 对语句是否体现企业应用了某类数智技术的判定,采用大语言模型的文本分类方法,而非传统的关键词词典匹配。词典法存在两类系统性错误:一是企业确实应用了某项技术,但其在年报中使用的技术词语未被词典收录,导致漏识别;二是文本中出现了技术关键词,但企业实际并未应用该技术——例如否定式表述、把技术应用表述为未来计划、或描述的是行业发展背景而非企业自身行动。逐句语义判定能够同时缓解这两类错误,从而提高指标表意的真实性。具体做法是先构建带标签的语句语料库,将语句标注至六类数智技术以及不属于数智技术的负类之下,再按 8:1:1 的比例划分训练集、测试集与验证集,微调预训练语言模型得到句子分类器,最后用该分类器对全部待预测语句逐句预测。 在企业—年度层面,若某企业当年的管理层讨论与分析章节中至少有一条语句被判定为应用了某类技术,则该类技术的应用哑变量取 1,否则取 0。设 $BD{it}$、$CC{it}$、$BC{it}$ 分别为企业 $i$ 在第 $t$ 年应用大数据、云计算、区块链的哑变量,$AI{it}$、$IoT{it}$、$MI{it}$ 分别为应用人工智能、物联网、互联网+的哑变量,则两个技术大类的应用哑变量为 $$Digital{it}=\mathbb{I}\left(BD{it}+CC{it}+BC{it}0\right),\qquad Intelligent{it}=\mathbb{I}\left(AI{it}+IoT{it}+MI{it}0\right)$$ 核心指标数智技术要求企业在同一年度同时具备两个大类的技术应用: $$DITech{it}=\mathbb{I}\left(Digital{it}=1 \ \text{且} \ Intelligent{it}=1\right)$$ 即企业在某一年同时应用了数字化技术(大数据、云计算、区块链)和智能化技术(人工智能、物联网、互联网+)时,变量取值为 1;若未同时具备这两类技术的应用,则变量值设为 0。这一合取规则是数智技术区别于一般数字化转型度量的关键:后者通常只要求企业使用任意一种数字技术即可赋值为 1,而数智技术强调数字化与智能化的融合,单独具备其中一类不足以构成数智技术的应用。 补充说明 - 样本口径:覆盖语料可得年份的全部 A 股上市公司,不预先剔除金融业、ST 与 PT 公司,也不限定于专精特新企业——原文的这些限制属回归样本设计而非指标定义。原文样本另含新三板企业,本数据集语料以 A 股为主,故无法完整重建原文的观测数;因专精特新企业的技术应用水平高于上市公司总体,本数据集全样本均值低于原文报告值。 - 2021 年测量窗口不连续(重要):年报格式准则自 2021 年起将原"公司业务概要"章(所处行业情况、主要业务与经营模式、核心竞争力分析)并入"管理层讨论与分析"章,文本范围扩大使指标水平出现一次性抬升。章节定位在各年都指向年报中该名称的章节,原文亦以该章节为文本对象且样本区间跨越该年,故本数据集未作调整;使用时建议加入年份固定效应,不宜以 2021 年前后作为冲击做双重差分或事件研究。 - 指标水平与章节篇幅正相关:在"至少一句命中即赋 1"的规则下,该章节写得越长越容易命中。这一关系并非纯粹机械——技术语句的占比同样随篇幅上升,且在同一公司规模档内完整存在,而企业规模本身与指标几乎无关;建议把参与分类的语句总数(已随数据集发布)作为控制变量,或加入企业固定效应。 - 合取约束主要来自数字化技术一侧:智能化技术在年报中的披露普遍多于数字化技术,已应用数字化技术的企业绝大多数同时满足智能化条件,故合取规则相对"仅数字化技术"额外剔除的观测有限,核心指标与数字化技术哑变量高度一致。这是原文构念在中国上市公司数据上的真实表现,但使用者不宜认为它相对数字化技术哑变量提供了大量独立信息。 - 测量噪声与建议样本区间:各技术哑变量的命中有相当部分由单独一条语句触发,分类器的个别误判即可使哑变量由 0 翻为 1;以技术概念普及之前的年份作安慰剂观察,词义边界清晰的区块链几乎不出现误判,而词表涵盖早已存在技术的移动互联在早年仍有一定命中。相邻年之间的取值回退明显高于技术采纳应有的不可逆性,建议样本区间与原文一致,取 2013 年及以后。 - 分类模型与词典:原文由研究人员分组人工标注,该环节不可复现;本数据集分类器的训练标签由大语言模型按固定提示词生成,提示词逐条落实了六类技术的定义与前述"提及但未应用"的排除情形。原文的特征词词典用于缩小人工阅读范围、构建待标注语料,不参与全量分类,故其构成不改变指标取值;原文未公布该词表,本实现采用其所引用文献公开的完整词表,另一来源文献将物联网归入云计算维度、与本文六类不能一一对应,拆分重组属自行归类故未采用。"互联网+"的边界采用"移动互联"词表界定,两者内涵高度重叠而后者外延略窄。 - 与"企业数字化转型(LLM测度)"的关系:两个数据集使用同一句子分类器,六类技术哑变量高度一致;本数据集的增量信息在于把"六类任一"的并集规则换成"两类技术兼备"的合取规则。两者不可互为独立的稳健性来源。 - 语句计数字段的性质:以 Supp 结尾的六个计数字段为原文未使用的补充字段,仅用于提高计算过程的透明度;原文及其方法来源均未以语句数量或比例构造连续变量,将其用作应用强度的度量属于超出原文方法的用法。 - 其他局限:章节定位失败时可用文本会退化为整份年报全文,此类企业年的全部字段置为缺失并以标志字段标识,该失败率在银行等章节编号体例特殊的行业明显更高;少量企业年章节定位成功但内容被截断而指标为零,可借语句总数字段自行过滤;地理与证券简称字段存在少量缺失(B 股与新三板代码段未进入公司基本信息表)。一条语句同时体现多种技术时只归入最主要的一类,与原文单标签设定一致;超长语句先分段、逐段分类再聚合回原语句,以免内容被截断丢弃。 参考文献 - 张帅,史恩义.数智技术对专精特新企业韧性的提升作用——来自大语言模型的证据[J].华东经济管理,2026,40(1):74-84. - 金星晔,左从江,方明月,等.企业数字化转型的测度难题:基于大语言模型的新方法与新发现[J].经济研究,2024,59(3):34-53. - Sun Y, Wang S, Feng S, et al. ERNIE 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation[J]. arXiv preprint arXiv:2107.02137, 2021.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。