企业诚信文化(Qwen大模型标注)

「企业诚信文化(Qwen大模型标注)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 67,314。 基于上市公司年报管理层讨论与分析(MD&A)文本,参考田子方等(2025,金融研究)以67个诚信文化关键词筛选候选句、大语言模型逐句判定的方法,构建企业诚信文化

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数19
样本量67,314
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 报告年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • MDAExtracted [是否成功提取MD&A] — 是否成功提取管理层讨论与分析(MD&A)章节(0=否,回退全文;1=是)
  • MDATotalChars [MD&A总字数] — 当年MD&A的中文字符总数,作为trust_length的分母
  • MDATotalSents [MD&A总句数] — 当年MD&A按。!?切分得到的句子总数,作为trust_num的分母
  • CandidateSentCount [诚信候选句数] — 含67个诚信文化关键词任一的候选句数量(进入大语言模型逐句判定的待确认集),参考田子方等(2025,金融研究)附录诚信文化词典
  • IntegritySentCount [诚信文化句子数] — 经大语言模型逐句判定为体现企业诚信文化的句子数量,作为trust_num的分子,参考田子方等(2025,金融研究)的方法
  • IntegritySentChars [诚信文化句子字数] — 经大语言模型判定为诚信文化句子的中文字数之和,作为trust_length的分子(亦即原文稳健性所用诚信相关句字数绝对值)
  • trust_length [诚信文化句子字数占比] — 参考田子方等(2025,金融研究)的方法,计算公式为:经大语言模型判定为诚信文化的句子字数/当年MD&A总字数。用作研究变量,越大代表企业诚信文化越强(MD&A句数<=3的退化样本置空)
  • trust_num [诚信文化句子数量占比] — 参考田子方等(2025,金融研究)的方法,计算公式为:经大语言模型判定为诚信文化的句子数/当年MD&A总句数。用作研究变量,越大代表企业诚信文化越强(MD&A句数<=3的退化样本置空)

常见问题

「企业诚信文化(Qwen大模型标注)」是什么数据集?
企业诚信文化(Qwen大模型标注),隶属信息环境。基于上市公司年报管理层讨论与分析(MD&A)文本,参考田子方等(2025,金融研究)以67个诚信文化关键词筛选候选句、大语言模型逐句判定的方法,构建企业诚信文化
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:是否成功提取MD&A、MD&A总字数、MD&A总句数、诚信候选句数、诚信文化句子数、诚信文化句子字数、诚信文化句子字数占比、诚信文化句子数量占比。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 67,314 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业诚信文化刻画上市公司在年度报告"管理层讨论与分析(MD&A)"中对自身诚信、守信、合规与质量承诺的表达强度。诚信文化属于难以用传统结构化数据度量的非正式制度特征,本指标参考田子方等(2025)的方法,以 MD&A 文本为载体,采用"诚信文化词典筛选候选句 + 大语言模型逐句语义判定"两环节构建,并以 Li et al.(2023)生成式人工智能度量企业文化、Li et al.(2021)机器学习度量企业文化为方法渊源。 第一环节为候选句筛选。先以一套由 word2vec 种子词扩展并经人工筛选得到的 67 个诚信文化关键词(涵盖诚信、守信、诚实信用、合规、遵纪守法、规范、行为准则、信誉、质量第一、合法经营等,词表取自田子方等(2025))对 MD&A 逐句做多模式匹配,凡含其中任一关键词的句子即进入待判定集。需要说明的是,该词表在窄义"诚信"之外较多覆盖治理-合规与质量规范类词语,故本指标在语义上偏向"诚信-合规治理文化",而非纯粹的狭义诚信,使用时宜据此理解其构念边界。 第二环节为逐句语义判定。词典法无法区分否定表述(如"不披露虚假信息"实为正面承诺)、一词多义以及描述对象非企业自身(如描述行业、政府、客户或供应商信用)等情形,故对待判定集中的每一句,使用开源大语言模型(在零温度下确定性输出)依据固定判定准则判断该句是否真正体现"企业重视自身诚信文化",输出二值结果。判定准则明确:企业对产品质量的重视可计为诚信表现;而描述个人或社会、描述客户/供应商信用、描述企业自身信誉评级、以及仅泛泛承担社会责任而无直接诚信内容者,均不计入。 基于逐句判定结果,对每个企业-年度构建两个并列代理指标。记该年度 MD&A 经判定为诚信文化的句子集合为 $S$,则 $$\text{trust\length}=\frac{\sum{s\in S}\text{len}(s)}{\text{MD\&A 总字数}},\qquad \text{trust\num}=\frac{|S|}{\text{MD\&A 总句数}}$$ 其中 $\text{len}(s)$ 为句子 $s$ 的中文字数。trust\length 反映诚信表达在篇幅上的占比,trust\num 反映其在句数上的占比,二者数值越大代表企业诚信文化越强。数据集同时保留中间量 MDATotalChars、MDATotalSents、CandidateSentCount、IntegritySentCount、IntegritySentChars 以支持机制分析与稳健性检验,其中 IntegritySentChars 即原文稳健性所用的诚信相关句字数绝对值。 补充说明 样本为全部 A 股上市公司,覆盖年报文本可得的全部年度;MDAExtracted 标志位记录 MD&A 章节是否成功提取(成功率约 98%),未能定位 MD&A 章节而回退全文的少量观测可据此标志剔除。切句以句号、感叹号、问号为界(分号作句内成分保留),单句长度设上限以避免无标点段落形成异常长句。对 MD&A 切分句数不超过 3 句的极少数提取退化观测(约占 0.8%),其句子级比率不可靠,trust\length 与 trust\num 置为缺失。 两点需在使用中注意。其一,受年报披露格式在不同年代的演变影响(MD&A 对应章节在历史上由"董事会报告"逐步演变为"经营情况讨论与分析""管理层讨论与分析",所涵盖内容不同),指标在 2015 年前后存在水平上的结构性变化,做跨年度面板或时间趋势分析时建议纳入年份固定效应,或限定较一致的研究区间。其二,原文最优判定模型为参数规模更大的开源大语言模型,本数据集受算力约束改用本机可承载的同族较小模型,逐句判定提示词与口径与原文保持一致;经分行业核验,判定为正的比率在各行业间分布均匀,金融业指标显著高于非金融业主要源于其 MD&A 中合规-诚信类语句密度更高这一真实差异,而非模型偏差。 参考文献 - 田子方,左从江,李涛,赵宣凯.诚信文化与金融企业社会责任承担[J].金融研究,2025(09):152-169. - Li K, Mai F, Shen R, et al. Dissecting corporate culture using generative AI: insights from analyst reports[R/OL]. SSRN Electronic Journal, 2023. - Li K, Mai F, Shen R, Yan X. Measuring corporate culture using machine learning[J]. The Review of Financial Studies, 2021, 34(7): 3265-3315.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。