智能制造水平(温素彬词频法)
「智能制造水平(温素彬词频法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,236。 衡量上市公司智能制造实践与关注度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 67,236 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年报对应年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- FreqAI [人工智能技术词频] — 参考温素彬等(2022,会计研究)的方法,人工智能技术维度(含人工智能、智能制造、机器学习等20词)在MD&A部分的出现次数。单位:次
- FreqInternet [互联网技术词频] — 参考温素彬等(2022,会计研究)的方法,互联网技术维度(含工业互联网、物联网、云计算等11词)在MD&A部分的出现次数。单位:次
- FreqBigData [大数据技术词频] — 参考温素彬等(2022,会计研究)的方法,大数据技术维度(含大数据、数据挖掘、虚拟现实等10词)在MD&A部分的出现次数。单位:次
- FreqValueChain [价值链智造技术词频] — 参考温素彬等(2022,会计研究)的方法,价值链智能制造技术维度(含计划调度、生产执行、智能仓储等12词)在MD&A部分的出现次数。单位:次
- FreqTotal [总词频] — 参考温素彬等(2022,会计研究)的方法,计算公式为:4个维度53个智能制造特征词在MD&A部分的总出现次数。单位:次
- TotalChars [MDA总字符数] — MD&A部分中文字符总数,用作词频占比的分母。单位:个
- IntelMfg [智能制造水平] — 参考温素彬等(2022,会计研究)的方法,三步测算:(1)计算词频占比=特征词总频次/MD&A总字符数;(2)计算公司占比与同年份同行业组所有公司总占比的比值,制造业按轻工业/重工业/其他工业三大类分组,非制造业按CSRC首位代码分组;(3)乘以100。用作研究变量,越大代表企业智能制造水平越高。单位:%
- MDAExtracted [MDA提取标志] — 是否成功提取年报管理层讨论与分析章节(0=否,1=是)
常见问题
- 「智能制造水平(温素彬词频法)」是什么数据集?
- 智能制造水平(温素彬词频法),隶属数字化转型与人工智能。衡量上市公司智能制造实践与关注度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:人工智能技术词频、互联网技术词频、大数据技术词频、价值链智造技术词频、总词频、MDA总字符数、智能制造水平、MDA提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,236 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在度量中国上市公司的智能制造水平,其核心方法是基于上市公司年报中“管理层讨论与分析”(MD&A)部分的文本内容,通过统计特定智能制造相关特征词的出现频率来构建指标。该方法参考了温素彬等(2022)的研究,认为企业在MD&A中披露智能制造相关词汇的频率,能够反映其在智能制造领域的关注度与实践水平。 首先,从年报MD&A章节中提取中文文本,并统计其总字符数($TotalChars$)。同时,使用多模式匹配算法,在文本中识别并统计四个维度共计53个智能制造特征词的出现次数。这四个维度及其对应的词频变量分别为:人工智能技术($FreqAI$)、互联网技术($FreqInternet$)、大数据技术($FreqBigData$)以及价值链智能制造技术($FreqValueChain$)。四个维度的词频之和即为总词频($FreqTotal$)。 为消除文本长度差异的影响,计算公司的智能制造词频占比($Ratio$): $$Ratio = \frac{FreqTotal}{TotalChars}$$ 为控制行业和时间趋势的影响,对词频占比进行行业调整。具体分组规则为:对于制造业(中上协行业分类C类),依据《中国统计年鉴》进一步划分为轻工业、重工业和其他工业三大类;对于非制造业,则按中上协行业分类的门类首位代码(如A、B、D等)分组。在每一年度($Year$)内,计算每个行业组内所有公司的词频占比之和($\sum{i \in Group} Ratioi$)。公司的智能制造水平($IntelMfg$)定义为该公司词频占比与其所在年份-行业组总词频占比的比值,并乘以100进行标准化: $$IntelMfg = \frac{Ratio}{\sum{i \in Group} Ratioi} \times 100$$ 该指标值越大,表明企业在同行业组内的智能制造相关文本披露强度越高,即智能制造水平相对越高。 补充说明 - 样本覆盖全部A股上市公司。 - 仅当成功提取到MD&A章节文本(即MDAExtracted标志为1)时,才进行后续的词频统计与指标计算。 - 行业分组依据中上协行业分类,其中制造业(C类)按《中国统计年鉴》标准细分为轻工业、重工业和其他工业三大类,非制造业则按门类首位代码分组。 参考文献 - 温素彬, 张金泉, 焦然. 智能制造、市场化程度与企业运营效率——基于A股制造业上市公司年报的文本分析[J]. 会计研究, 2022.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。