高管大数据思维(LM修正词频法)

「高管大数据思维(LM修正词频法)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 69,115。 参考唐雪松等(2026,会计研究)的方法,基于年报管理层讨论与分析(MD&A)文本,采用Loughran & McDonald(2011)修正词频权重(tf.

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数16
样本量69,115
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • BDMFreq [大数据思维词频] — 参考唐雪松等(2026,会计研究)的方法,为管理层讨论与分析(MD&A)文本中38个大数据思维词典词汇出现的总频数,计算公式为:所有词典词在MD&A中的词频之和;是高管大数据思维的词频形式替代度量,用作研究变量,越大代表高管大数据思维相关表述越多
  • MDAWordCount [MD&A总字数] — 管理层讨论与分析(MD&A)部分的中文字符数,计算公式为:MD&A文本中汉字的个数;用作Loughran & McDonald(2011)修正词频权重算法的分母(文档长度标准化项)
  • MDAExtracted [是否成功提取MDA] — 是否成功从年报中提取到管理层讨论与分析(MD&A)章节(0=否,1=是);取值为0表示提取失败并回退全文,多为银行/券商年报特殊格式所致,会使指标偏高,建议研究时剔除取值为0的观测
  • BDM [高管大数据思维] — 参考唐雪松等(2026,会计研究)的方法,基于MD&A文本采用Loughran & McDonald(2011)修正词频权重(tf.idf)算法对大数据思维词典词汇计算所得,计算公式为:BDM等于各词典词得分之和,其中每个词的得分Score=(1+ln(该词在MD&A中的词频))÷(1+ln(MD&A中文字数))×ln(有效MD&A文档总数÷含该词的文档数)(词频≥1时计算,否则为0);用作研究变量,越大代表高管大数据思维(全样思维/相关思维/容错思维)越强
  • BDMAdj [高管大数据思维(行业调整)] — 参考唐雪松等(2026,会计研究)的方法,为高管大数据思维BDM减去同年度同行业(中上协大类分组)BDM均值后的行业调整值,计算公式为:BDMAdj=BDM-同年度同行业BDM均值;用作稳健性检验替代变量

常见问题

「高管大数据思维(LM修正词频法)」是什么数据集?
高管大数据思维(LM修正词频法),隶属董监高数据。参考唐雪松等(2026,会计研究)的方法,基于年报管理层讨论与分析(MD&A)文本,采用Loughran & McDonald(2011)修正词频权重(tf.
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 16 个变量。核心指标包括:大数据思维词频、MD&A总字数、是否成功提取MDA、高管大数据思维、高管大数据思维(行业调整)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 69,115 条观测。
数据是如何测算/获取的?
指标定义与计算方法 伴随大数据技术的发展与完善,企业管理者逐渐形成大数据思维能力,即能够有效获取、分析并利用数据进行科学决策的认知方式。参考唐雪松等(2026, 会计研究)的方法,大数据思维主要包含三个维度:全样思维(以总体性视角获取与分析信息,不依赖小样本推断)、相关思维(以关联性视角看待事物,重视相关规律而非固化的因果链条)与容错思维(接受数据的纷繁复杂,以代表性替代单点精确性)。根据高层梯队理论,高管的认知与思维特征会映射在企业战略与决策中;而心理语言学研究表明,语言的使用能够反映难以直接观测的个人认知特质。公司年报中的管理层讨论与分析(MD&A)集中展现了管理层对公司经营状况、风险机遇与战略规划的个性化阐述,其表述选择空间较大,能够有效体现管理层的个人思维风格。因此本指标沿"公司信息披露—高管语言表述—高管认知思维"的逻辑,以 MD&A 文本作为语料来源构建高管大数据思维的衡量指标。 大数据思维词典。 基于大数据思维经典文献对其内涵的阐述,挑选出最能体现大数据思维的种子词汇,包括"全样""全面""整体性""容错""纷繁""关联""相关性"。鉴于中文表达高度灵活、"一义多词"现象普遍,采用 Word2Vec(Skip-Gram 模型)先在通用中文知识库语料上训练、再在财经年报语料上进行第二次训练,通过词向量余弦相似度找出与种子词语义相近的词汇扩充基础词库,最后由资深学者人工核验筛选,形成最终的大数据思维词典。该词典的种子词与机器学习扩展词去重后共 $38$ 个词汇。 核心指标 BDM。 在获得词典后,借鉴 Loughran & McDonald (2011) 的修正词频权重算法为词典中每个词赋权,计算其 tf.idf 得分。对第 $i$ 份 MD&A 文本、词典中第 $j$ 个词: $$ \text{Score}{i,j}= \begin{cases} \dfrac{1+\ln\left(tf{i,j}\right)}{1+\ln\left(ai\right)}\cdot\ln\left(\dfrac{N}{dfj}\right), & tf{i,j}\geq 1\\[2mm] 0, & tf{i,j}=0 \end{cases} $$ 其中 $tf{i,j}$ 为词 $j$ 在第 $i$ 份 MD&A 中出现的次数,$ai$ 为第 $i$ 份 MD&A 的总字数(取中文字符数),$N$ 为全部有效 MD&A 文档总数,$dfj$ 为至少包含词 $j$ 一次的 MD&A 文档数。式中第一项通过对数变换降低高频词的影响,第二项则依据词的通用性(逆文档频率)修正其影响力。将各词典词的得分加总即得高管大数据思维指标: $$ \text{BDM}i=\sum{j}\text{Score}{i,j} $$ BDM 数值越大,表明公司高管的大数据思维(全样思维、相关思维、容错思维)越强。 词频形式与行业调整。 作为稳健替代度量,词频形式指标 $\text{BDMFreq}=\sumj tf{i,j}$ 直接以词典词在 MD&A 中出现的总频数衡量大数据思维;行业调整指标 $\text{BDMAdj}=\text{BDM}-\overline{\text{BDM}}{\text{同年度同行业}}$ 为 BDM 减去同年度同行业均值,其中行业按大类分组(制造业取行业代码前两位,非制造业取首字母)。此外报告 MD&A 的中文字数($ai$,即加权算法的分母)与 MD&A 章节是否成功提取的标志,供研究者控制文本长度并筛选样本。 补充说明 - 分词采用中文分词工具,并将词典词加入分词器以保证多字词整体切分、长词优先,从而在词典存在前缀包含关系(如"关联"是"关联性""相关联"的前缀,"全面"是"全面性"的前缀)时按词元精确匹配、避免子串重复计数。 - 样本覆盖全部行业、全部有报告年份的公司-年(原文以剔除金融、特殊处理及信息技术等行业的子样本为研究对象,此处按数据集通用规范全行业覆盖,供研究者自行筛选)。仅纳入 MD&A 中文字数达到最小阈值的有效文档。 - 本指标水平存在若干需在使用时注意的固有特征:其一,词典以通用管理词汇为主,指标在一定程度上反映年报管理术语的表述密度,作为解释变量宜控制年报文本长度并辅以稳健性检验;其二,指标年度均值随时间明显上升,部分源于年报文本的逐年膨胀,使用时须加入公司与年份固定效应,且不宜将时间趋势直接解读为思维的演化;其三,大数据思维概念于 2013 年后方逐渐形成,早年取值语义较弱,建议研究样本起点不早于 2013 年;其四,MD&A 章节提取失败而回退全文的观测(提取标志为 0,多为特殊格式年报)指标偏高,建议研究时予以剔除或对相关行业单独处理;其五,指标绝对水平依赖语料的逆文档频率基准与样本构成,不宜跨数据集直接比较,宜配合固定效应用于组内相对比较。 参考文献 - 唐雪松,廖强,李闻,等.高管大数据思维与企业创新水平——基于机器学习的研究[J].会计研究,2026(5):107-119. - Loughran T, McDonald B. When is a liability not a liability? Textual analysis, dictionaries, and 10-Ks[J]. The Journal of Finance, 2011, 66(1): 35-65.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。