企业高管AI认知(MacBERT模型测度)
「企业高管AI认知(MacBERT模型测度)」,覆盖 2007-2025 年,频率 年度,上市公司层级,含 21 个变量,样本量约 61,311。 基于上市公司年度报告管理层讨论与分析章节的语句级文本测度。
| 时间跨度 | 2007-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 21 |
| 样本量 | 61,311 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- IsMDAExtracted [是否成功提取管理层讨论与分析章节] — 是否成功定位年度报告中的管理层讨论与分析章节(0=否,1=是)。取0时该企业年的其余各项指标均为缺失,因为定位失败时文本范围退化为年报全文,其语句构成与本章节不可比
- NSentences [管理层讨论与分析语句总数] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,对管理层讨论与分析章节先做版面清洗与折行还原,再经句子边界模型分句后得到的语句条数,是各类认知语句数的规模基数
- NAICognitionSentences [高管人工智能应用认知语句数] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,管理层讨论与分析章节中经分类器判定为体现高管对人工智能应用之认知的语句条数
- NStrategicSentences [战略认知语句数] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,在高管人工智能应用认知语句中,体现战略层面认知(战略定位、发展方向、转型目标与长期布局)的语句条数;一条语句可同时归属多个维度,故三个维度的语句条数之和可超过高管人工智能应用认知语句数
- NImplementationSentences [落地认知语句数] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,在高管人工智能应用认知语句中,体现落地层面认知(研发进度、业务场景赋能、商业化进展,以及数据资产、算力设施与算法人才等资源投入)的语句条数;一条语句可同时归属多个维度,故三个维度的语句条数之和可超过高管人工智能应用认知语句数
- NGovernanceSentences [治理认知语句数] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,在高管人工智能应用认知语句中,体现治理层面认知(数据合规与数据安全、隐私保护、算法治理与算法偏见、技术伦理及相关风险防控)的语句条数;一条语句可同时归属多个维度,故三个维度的语句条数之和可超过高管人工智能应用认知语句数
- EAC [高管AI认知] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,计算公式为:ln(1+高管人工智能应用认知语句数)。用作研究变量,越大代表高管对人工智能应用的认知水平越高
- EAC_S [高管AI战略认知] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,计算公式为:ln(1+战略认知语句数)。用作研究变量,越大代表高管越倾向于把人工智能置于企业战略层面加以认识
- EAC_I [高管AI落地认知] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,计算公式为:ln(1+落地认知语句数)。用作研究变量,越大代表高管对人工智能的认识越多地落到具体业务应用与资源投入层面
- EAC_G [高管AI治理认知] — 参考汤锦锋和胡日东(2026, 研究与发展管理)的方法,计算公式为:ln(1+治理认知语句数)。用作研究变量,越大代表高管越关注人工智能应用带来的合规、安全与伦理风险及其治理
常见问题
- 「企业高管AI认知(MacBERT模型测度)」是什么数据集?
- 企业高管AI认知(MacBERT模型测度),隶属董监高数据。基于上市公司年度报告管理层讨论与分析章节的语句级文本测度。
- 该数据集的时间范围是?
- 覆盖 2007-2025 年。
- 包含哪些变量/指标?
- 共 21 个变量。核心指标包括:是否成功提取管理层讨论与分析章节、管理层讨论与分析语句总数、高管人工智能应用认知语句数、战略认知语句数、落地认知语句数、治理认知语句数、高管AI认知、高管AI战略认知、高管AI落地认知、高管AI治理认知。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 61,311 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 高层梯队理论认为,企业的战略选择是高管认知基础的外化。在人工智能逐步成为企业数智化转型主要方向的背景下,高管是否把人工智能纳入自身的注意力配置,直接决定了企业在数据、人才与技术等配套资源上的建设与投入,进而决定人工智能能否从技术概念转化为实际的应用能力。年度报告中的"管理层讨论与分析"章节由高管以自身口径向市场陈述经营状况、经营成果与未来安排,是观察管理层注意力投向的直接文本载体。因此,该章节中凡是涉及企业与人工智能及相关技术之关系的表述,均可视为高管人工智能认知的外化。本数据集即以该章节的语句为分析单元,度量高管对人工智能应用的认知水平及其结构。 测度分三步完成。 第一步是构造语句级样本。先从年度报告全文中定位"管理层讨论与分析"章节,再对该章节文本分句。年报文本由版式文件转换而来,含页眉页脚、纯页码行、披露模板勾选项等版面元素,且一句话常因排版被切成数行,因此在分句之前先做版面清洗,并按"行末为句末标点即闭合、行首为章节号或条目号则该行独立成段、其余换行视为版面折行"的规则把文本还原为逻辑段落,再用 HanLP 的 EOS 句子边界模型完成分句。分句结果中超过 200 字符仍未被切开的片段按分号二次切分,最终保留汉字数不少于 5 的语句,以滤除页码、序号与表格残片等无语义碎片。记企业 $i$ 在第 $t$ 年的语句总数为 $Text{it}$。语料中少数年度报告为繁体文本,简体语料训练的语言模型在其上识别能力会下降,故在分句前用探针法检出繁体文本并整篇转换为简体,该处理对简体文本幂等。 第二步是判定每条语句是否体现高管对人工智能应用的认知。这一判定采用"大语言模型打标 + 监督学习分类器"的两阶段方案:先由大语言模型按统一的判定规则对抽样语句逐条打标,构造正负各半的平衡标注数据集;再以该数据集按 8:1:1 划分训练集、验证集与测试集,对 MacBERT 中文预训练模型做全参数微调并设置早停以抑制过拟合。相比词典法或规则匹配,有监督机器学习能更好地捕捉上下文语义特征,尤其适用于"企业人工智能"这类语境依赖性强的抽象概念识别;而 MacBERT 在中文语义理解上较普通 BERT 更有优势。判定所依据的技术范围取该领域的通行口径,涵盖机器学习、深度学习、自然语言处理、计算机视觉、语音与生物识别、知识图谱、数据挖掘与大数据分析、智能芯片与算力设施、机器人流程自动化、自动驾驶,以及各类智能化应用场景,并显式纳入近年出现的大语言模型、生成式人工智能、多模态模型与具身智能等同类议题。由于正类语句在全部年报语句中占比很低,标注样本池按四层构造:全库无偏随机层用于估计全库正类先验并提供无偏的性能评估,人工智能关键词词典层提供高密度正例,新兴技术词层补入词典覆盖不到的议题以及最易误判的边界负例,治理议题层则定向补充治理维度的样本(要求语句同时命中治理议题词与人工智能技术词,以免捞进与人工智能无关的通用信息安全与内控合规表述)。分层只作用于训练样本的构造,推理阶段仍对全部语句逐句判定,不施加任何词表前置过滤。 记企业 $i$ 在第 $t$ 年被判定为体现高管人工智能应用认知的语句条数为 $N^{AI}{it}$,高管人工智能认知指标定义为该条数加一后取自然对数: $$EAC{it}=\ln\left(1+N^{AI}{it}\right)$$ 取对数是为了压缩语句计数的右偏分布,加一则保证当年未出现任何相关表述的企业取值为零而非无定义。该指标取值越大,表明高管在年度报告中围绕人工智能的表述越多,对人工智能应用的认知水平越高。 第三步是刻画认知的结构。外部关注与市场压力并不会均衡地作用于高管认知的各个层面:认知的深化沿着战略规划、业务落地与风险治理的逻辑逐步推进,其中与业务实施和资源配置直接相关的认知更新最为敏捷,而涉及制度安排、风险控制与组织协调的治理认知,其形成和调整具有更强的渐进性。据此把上述人工智能认知语句进一步划分为三个维度:战略认知指把人工智能提升为关乎未来竞争力的核心战略目标,涵盖战略定位、发展方向、转型目标与长期布局;落地认知指注意力从技术概念下沉到实质性的业务应用,涵盖研发进度、技术攻关、产品与业务场景赋能、商业化进展,以及为此在底层数据资产、智能算力基础设施与专业算法人才上的资源倾斜;治理认知指在推进智能化的同时构建数据合规、隐私保护与数字责任的防火墙,涵盖数据安全、算法治理与算法偏见、技术伦理,以及智能化相关的内部控制与风险防控安排。维度判定由一个多标签分类器给出,训练与评估流程同上。记三个维度的语句条数分别为 $N^{S}{it}$、$N^{I}{it}$、$N^{G}{it}$,三个维度指标与核心指标同一形式: $$EAC^{S}{it}=\ln\left(1+N^{S}{it}\right),\quad EAC^{I}{it}=\ln\left(1+N^{I}{it}\right),\quad EAC^{G}{it}=\ln\left(1+N^{G}{it}\right)$$ 数据集同时给出语句总数 $Text{it}$ 与各类语句条数,便于使用者按自身需要改用占比口径或施加其他变换。 补充说明 - 样本口径:数据集覆盖年报语料所含的全部企业年,起始年取年报"管理层讨论与分析"章节格式趋于稳定的 2007 年,覆盖范围宽于原文所用的样本区间与主体范围(原文限于 A 股,本数据集的主体范围以年报语料为准绳)。不预先剔除金融保险类企业、不剔除特别处理状态的企业、不做缩尾处理,也不施加关键变量非缺失的限制,这些均属回归样本的选择,留给使用者按研究设计自行决定。 - 章节定位失败的企业年:未能定位到"管理层讨论与分析"章节的企业年,其文本构成与该章节不可比,若强行按全文计算会系统性抬高语句数,故这些企业年的各项指标均为缺失,并以标志列标识,使用者可据此判断样本可用性。 - 多维度可共现:年报语句常在一句之内既陈述战略定位又陈述具体落地,故三个维度采用多标签口径,一条语句可同时计入多个维度。因此三个维度的语句条数之和可以超过人工智能认知语句总数,三个维度指标之间不构成分解关系,回归中同时纳入三者需注意其相关性。 - 分句预处理:还原逻辑段落这一步会把因排版折行而断开的语句重新接合,相对不做接合的做法,语句数下降而语义完整性提高。由于该处理对全部企业年一致施加,它同向影响全体企业的取值水平,不改变企业间的相对排序。 - 标注环节的实现差异:原始方法在打标环节调用两个大语言模型交叉验证并对不一致的样本作人工复核,本实现受离线环境限制由单一本地大语言模型完成同一角色,缺少交叉验证层意味着标注噪声相对更高,方向上同时带来漏判与误判;判定的核心问句与三个维度的界定均取自原文表述,未自行增设维度或改变维度划分。 - 治理维度的过采样:治理认知在年报里本就稀少,仅按前三层抽样时该维度的训练正例过少,分类器召回明显偏低。故增设治理议题层定向补充该维度样本,使其识别表现提升到与其余两个维度可比的水平。代价是训练集中治理类的占比高于全库真实占比,属对稀有类的常规过采样;推理口径不受影响。 - 其他局限:原文披露了训练集划分比例与早停设置,但未披露学习率、批大小与训练轮数,这些取中文预训练模型分类任务的常规配置;年报文本由版式文件转换而来,表格文字在转换后可能形成无语义的字符片段并计入语句总数;语句计数类指标对年报篇幅与披露详略敏感,建议在回归中控制企业规模与年份固定效应。 参考文献 - 汤锦锋,胡日东.投资者—上市公司AI议题互动与企业人工智能应用水平提升——来自大语言模型和机器学习的证据[J/OL].研究与发展管理,1-15[2026-08-13].https://doi.org/10.13581/j.cnki.rdm.20252011. - 姚加权,张锟澎,郭李鹏,等.人工智能如何提升企业生产效率?——来自劳动力技能结构调整的视角[J].管理世界,2024(2):101-116.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。