投资者AI议题互动(MacBERT模型测度)
「投资者AI议题互动(MacBERT模型测度)」,覆盖 2010-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 55,622。 判别投资者在深交所互动易与上证e互动平台上向上市公司提出、且已获公司回复的提问是否体现其对企业人工智能及相关技术的关注,以企业-年被回答的AI相关提问数量加一后
| 时间跨度 | 2010-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 19 |
| 样本量 | 55,622 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 投资者提问发生的年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- AnsweredQuestionTotal [被回答提问总数] — 当年投资者在深交所互动易与上证e互动平台向该企业提出并获得公司回复的提问总条数,用于刻画该企业当年互动总量的规模
- AIQuestionCount [AI相关提问数] — 参考汤锦锋和胡日东 (2026, 研究与发展管理)的方法,当年被公司回复、且经MacBERT文本分类器判定为涉及人工智能及相关技术的投资者提问条数,判定范围涵盖机器学习、自然语言处理、计算机视觉、神经网络、大数据、云计算、智能芯片、自动驾驶及各类智能化应用场景,并包含大模型、生成式人工智能、算力等新兴议题
- IAE [投资者AI议题互动] — 参考汤锦锋和胡日东 (2026, 研究与发展管理)的方法,计算公式为:ln(1+当年被回答的AI相关提问数)。用作研究变量,越大代表投资者与该企业围绕人工智能议题的互动水平越高
- AIQuestionCountThr [AI相关提问数(F1最优阈值口径)] — 参考汤锦锋和胡日东 (2026, 研究与发展管理)的方法,以使验证集F1达到最大的分类概率阈值重新判定后,当年被回答的AI相关提问条数,用于缓解人工智能类别占比较低带来的类不平衡与校准偏差
- IAEThr [投资者AI议题互动(F1最优阈值口径)] — 参考汤锦锋和胡日东 (2026, 研究与发展管理)的方法,计算公式为:ln(1+按验证集F1最优阈值重新判定的AI相关提问数)。用作研究变量的稳健性替代口径,越大代表AI议题互动水平越高
- AIQuestionCountDict [AI相关提问数(AI词典口径)] — 参考姚加权等 (2024, 管理世界)的方法,以73个人工智能关键词构成的词典在提问原文上直接做关键词匹配,当年被回答提问中命中任一关键词的条数,作为不依赖机器学习模型的对照口径
- IAEDict [投资者AI议题互动(AI词典口径)] — 参考姚加权等 (2024, 管理世界)的人工智能关键词词典,计算公式为:ln(1+当年命中该词典的被回答提问数)。用作研究变量的稳健性替代口径,越大代表AI议题互动水平越高
- IAEWord [投资者AI议题互动(互动字数口径)] — 参考汤锦锋和胡日东 (2026, 研究与发展管理)的方法,计算公式为:ln(1+当年全部AI相关提问的提问字数与所获回复字数之和)。从互动强度而非互动频次角度度量,用作研究变量的稳健性替代口径,越大代表AI议题互动的深度越高
常见问题
- 「投资者AI议题互动(MacBERT模型测度)」是什么数据集?
- 投资者AI议题互动(MacBERT模型测度),隶属信息环境。判别投资者在深交所互动易与上证e互动平台上向上市公司提出、且已获公司回复的提问是否体现其对企业人工智能及相关技术的关注,以企业-年被回答的AI相关提问数量加一后
- 该数据集的时间范围是?
- 覆盖 2010-2025 年。
- 包含哪些变量/指标?
- 共 19 个变量。核心指标包括:被回答提问总数、AI相关提问数、投资者AI议题互动、AI相关提问数(F1最优阈值口径)、投资者AI议题互动(F1最优阈值口径)、AI相关提问数(AI词典口径)、投资者AI议题互动(AI词典口径)、投资者AI议题互动(互动字数口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 55,622 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 在"人工智能+"行动持续推进的背景下,企业能否有效采纳并应用人工智能技术,日益成为影响其技术进步与组织变革的关键议题。交易所设立的投资者互动平台为投资者与上市公司之间围绕人工智能议题展开沟通提供了公开、留痕、可追责的制度化渠道:投资者围绕企业的智能化战略、研发进度、应用场景与商业化前景提问,上市公司则需按监管要求安排专人作出回应。因此,围绕人工智能议题的问答并不只是单纯的信息披露行为,而是投资者信息需求、企业信息供给与外部治理压力共同作用的过程。持续出现的人工智能相关提问会提高该议题在公司战略讨论中的显著性,使资本市场对前沿技术趋势的关注更容易进入管理层决策视野,进而推动企业将人工智能纳入更具实质性的战略规划。本数据集据此刻画投资者与上市公司在人工智能议题上的互动水平。 指标构建的第一步是判别每一条投资者提问是否体现其对企业人工智能及相关技术的关注。以往研究多依托互动总量或简单关键词匹配,前者无法区分互动内容的主题,后者则受限于语义复杂性:同一含义可通过同义替换或行业表达实现,词频统计也难以充分识别否定、转折与隐含态度,因而难以识别针对公司特定战略的互动内容。为此,本数据集采用大语言模型辅助标注与监督学习算法相结合的方法。具体而言,先调用大语言模型对提问逐条初筛,依据统一的判定规则给出该提问是否涉及人工智能议题的二元标签;再由已标注语料训练文本分类器,对平台上的全部提问自动分类。判定规则的技术边界以人工智能领域的通行口径界定,涵盖机器学习、深度学习、自然语言处理、计算机视觉、神经网络、知识图谱、大数据分析、云计算与边缘计算、物联网、增强现实与虚拟现实、智能芯片、机器人流程自动化、自动驾驶,以及智能客服、智慧金融、智能医疗、智能制造等各类智能化应用场景,并一并纳入近年出现的同类议题,如大语言模型、生成式人工智能、算力与智算中心、具身智能等。规则同时明确了若干边界情形:提问指向企业是否布局某项人工智能技术的,即使企业实际尚未涉足,仍判定为涉及;仅将人工智能作为行业背景或新闻由头提及而所问事项为股价、订单或分红的,判定为不涉及;企业名称或产品名称中含"智能""科技"字样但提问本身不谈相关技术的,判定为不涉及。 承担全量分类任务的是在中文语义理解上具有优势的 MacBERT 预训练模型。相比词典法或规则匹配,有监督机器学习能更好地捕捉上下文语义特征,尤其适用于"企业人工智能"这类语境依赖性强的抽象概念识别。由于人工智能类提问在平台全部提问中占比很低,直接对随机样本标注难以获得类别均衡的训练数据,因此标注环节采用分层设计:一层为全库无偏随机抽样,用于估计总体的正类先验并提供无偏的性能评估基准;一层为命中人工智能关键词的提问,用于提高正例密度;另一层为未命中关键词但含新兴或易混技术表述的提问,用于覆盖关键词方案的盲区并提供最易误判的边界负例。三层标注完成后,从正负两类中各随机抽取等量样本,构造出规模为 6000 条的平衡数据集,并按 8:1:1 划分为训练集、验证集与测试集,微调全部参数并设置早停以抑制过拟合,模型选择以验证集 $F1$ 为准。文本统一做空白字符规范化处理,截断长度取 256 个字符,足以覆盖绝大多数提问全文。 在逐条判别的基础上,核心指标以企业当年被回答的人工智能相关提问数量加一后取自然对数构造。之所以限定在获得公司回复的提问上,是因为该口径同时包含了投资者的信息需求与企业的信息供给:只有得到回应的提问才构成一次完整的双向互动。记企业 $i$ 在第 $t$ 年被回答且被判定为人工智能议题的提问条数为 $N^{AI}{i,t}$,则投资者人工智能议题互动水平为 $$IAE{i,t}=\ln\left(1+N^{AI}{i,t}\right)$$ 取对数既缓解了计数变量的右偏分布,也使该指标在企业间可比;加一的处理保证当年没有相关互动的企业取值为零而非缺失。深交所与上证两个平台的提问合并计数。 数据集另提供三个替代口径以供稳健性检验。第一个口径针对类别不平衡可能带来的校准偏差:人工智能类提问在总体中占比较小,分类器在默认判定阈值下的查准与查全未必达到最优平衡,因此在验证集上对判定概率做网格搜索,取使 $F1$ 最大的阈值重新分类,并据此重构互动指标。第二个口径改用词典匹配替代模型判别,采用既有文献中包含 73 个人工智能关键词的词典,沿用该文献"直接在原文上匹配、不依赖分词"的做法,提问命中任一词条即计为人工智能相关,同样以相关提问数加一取对数。第三个口径从互动强度而非互动频次的角度切入:对每一条被判定为人工智能议题的提问,累加其提问正文字数与所获回复的字数,再将总字数加一后取自然对数,记 $\Omega^{AI}{i,t}$ 为企业 $i$ 在第 $t$ 年的人工智能相关提问集合,$L^{Q}{q}$ 与 $L^{A}{q}$ 分别为提问 $q$ 的提问字数与回复字数,则 $$IAE^{word}{i,t}=\ln\left(1+\sum{q\in\Omega^{AI}{i,t}}\left(L^{Q}{q}+L^{A}{q}\right)\right)$$ 与三个对数指标并列给出的还有两个计数型变量:企业当年被回答的提问总条数,以及被判定为人工智能议题的提问条数。前者刻画该企业在平台上互动总量的规模,后者是核心指标取对数之前的原始计数,两者便于研究者自行构造占比、更换函数形式或在回归中控制互动规模。 补充说明 - 样本口径:数据集覆盖全部 A 股企业-年,不预先剔除金融保险类公司、处于特殊处理状态的公司或关键变量缺失的样本,也不做缩尾处理,这些均属回归样本限制,交由使用者按研究设计自行施加。当年在平台上没有被回答提问的企业-年,各计数列取零、各对数列相应取零。 - 标注模型与原始方法的差异:提出该测度的文献在标注环节调用两个大语言模型交叉判断,一致时直接赋标签、不一致的交人工复核;本数据集在离线环境下由单一大语言模型完成同一环节,没有双模型交叉验证与人工复核两道过滤。这意味着训练语料的标注噪声高于原始方法,分类器在留出测试集上的 $F1$ 也低于原文报告值,误差在方向上同时表现为漏判与误判。 - 词典口径的时代局限:作为对照的 73 词词典是为年报文本构建且成型较早,对近年出现的大模型、算力、生成式人工智能等表述覆盖不足,实测其在投资者提问上的命中率明显低于模型判别口径,且在样本期后段偏低更多。该口径宜作为对照而非替代,使用时建议与主口径并列报告。 - 指标的规模属性:核心指标依定义随企业在平台上的互动总量增长,其变异有相当一部分来自该公司互动活跃度本身而非人工智能议题的独特成分。使用建议:回归中同时控制被回答提问总数的对数,或改用相对形式;互动字数口径与提问条数口径高度相关,其相对核心指标的独立信息在于篇均长度。 - 跨年可比性:人工智能议题在样本期内的占比呈明显上升趋势,这既反映资本市场关注的真实变化,也使指标的绝对水平不宜跨年度直接比较。使用建议:加入年份固定效应。 - 其他局限:平台上确有提问但落在企业上市当年之前或退市之后的记录不进入输出,以保证行集合与既有的投资者问答年度统计一致;上证平台晚于深交所平台数年上线,样本期前段沪市公司的零值更多反映平台尚未覆盖而非投资者不关注该议题,可按被回答提问总数大于零筛选。 参考文献 - 汤锦锋,胡日东.投资者—上市公司AI议题互动与企业人工智能应用水平提升——来自大语言模型和机器学习的证据[J/OL].研究与发展管理,1-15[2026-08-13].https://doi.org/10.13581/j.cnki.rdm.20252011. - 姚加权,张锟澎,郭李鹏,等.人工智能如何提升企业生产效率?——来自劳动力技能结构调整的视角[J].管理世界,2024(2):101-116.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。