企业文化(5维度)
「企业文化(5维度)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 24 个变量,样本量约 67,856。 衡量企业在创新、道德、质量、勤勉与合作五个维度的文化强度。
| 时间跨度 | 1991-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 24 |
| 样本量 | 67,856 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 股票代码
- StkName [证券简称] — 证券简称
- Year [年份] — 年报对应年度
- Province [省份] — 公司注册所在省份
- ProvinceCode [省份代码] — 省份行政区划代码(6位)
- City [城市] — 公司注册所在城市
- CityCode [城市代码] — 城市行政区划代码(6位)
- County [区县] — 公司注册所在区县
- CountyCode [区县代码] — 区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码
- IndustryName [行业名称] — 中上协行业分类名称
- InnovationScore [创新文化得分] — 参考Li et al. (2021, RFS)及潘健平等(2019, 金融研究)的方法,使用Word2Vec扩展创新维度种子词(创新/创造/研发等12个)构建词典,计算公式为:WFIDF加权词频,即对每个词w:(1+log(tf_w))*log(N/df_w)后求和。用作研究变量,越大代表创新文化越强
- IntegrityScore [道德文化得分] — 参考Li et al. (2021, RFS)的方法,使用Word2Vec扩展道德维度种子词(诚信/正直/廉洁等12个)构建词典,计算公式为:WFIDF加权词频。用作研究变量,越大代表道德文化越强
- QualityScore [质量文化得分] — 参考Li et al. (2021, RFS)的方法,使用Word2Vec扩展质量维度种子词(质量/品质/精益等11个)构建词典,计算公式为:WFIDF加权词频。用作研究变量,越大代表质量文化越强
- DiligenceScore [勤勉文化得分] — 参考Li et al. (2021, RFS)及潘健平等(2023, 经济科学)的中国适配方法,使用Word2Vec扩展勤勉维度种子词(勤奋/敬业/奋斗等12个)构建词典,计算公式为:WFIDF加权词频。用作研究变量,越大代表勤勉文化越强
- CooperationScore [合作文化得分] — 参考Li et al. (2021, RFS)及潘健平等(2019, 金融研究)的方法,使用Word2Vec扩展合作维度种子词(合作/团结/协同等14个)构建词典,计算公式为:WFIDF加权词频。用作研究变量,越大代表合作文化越强
- CultureTotal [文化强度总分] — 参考Li et al. (2021, RFS)的方法,计算公式为:5个维度WFIDF得分之和。用作研究变量,越大代表企业文化整体强度越高
- InnovationFreq [创新词频] — 创新维度扩展词典中所有词在MD&A中出现的原始次数。单位:次
- IntegrityFreq [道德词频] — 道德维度扩展词典中所有词在MD&A中出现的原始次数。单位:次
- QualityFreq [质量词频] — 质量维度扩展词典中所有词在MD&A中出现的原始次数。单位:次
- DiligenceFreq [勤勉词频] — 勤勉维度扩展词典中所有词在MD&A中出现的原始次数。单位:次
- CooperationFreq [合作词频] — 合作维度扩展词典中所有词在MD&A中出现的原始次数。单位:次
- TotalWords [MD&A总词数] — jieba分词后MD&A文本的有效词数。单位:个
- MDAExtracted [MD&A提取标志] — 是否成功提取MD&A章节(0=否,1=是)。提取失败时回退使用全文
常见问题
- 「企业文化(5维度)」是什么数据集?
- 企业文化(5维度),隶属公司治理。衡量企业在创新、道德、质量、勤勉与合作五个维度的文化强度。
- 该数据集的时间范围是?
- 覆盖 1991-2025 年。
- 包含哪些变量/指标?
- 共 24 个变量。核心指标包括:创新文化得分、道德文化得分、质量文化得分、勤勉文化得分、合作文化得分、文化强度总分、创新词频、道德词频、质量词频、勤勉词频、合作词频、MD&A总词数、MD&A提取标志。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 67,856 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 本数据集旨在度量中国上市公司在五个维度上的企业文化强度,其方法主要基于Li等(2021)提出的文本分析框架,并结合潘健平等(2019)针对中国情境的适配。核心思路是利用公司年报的“管理层讨论与分析”(MD&A)文本,通过自然语言处理技术,量化企业在创新、道德、质量、勤勉和合作五个方面的文化倾向。具体计算过程分为词典构建与文本评分两个阶段。 首先,为每个文化维度构建一个专属的扩展词典。以Li等(2021)及潘健平等(2019)研究中的种子词为基础(例如,创新维度的种子词包括“创新”、“创造”、“研发”等),利用预训练的Word2Vec词向量模型(CBOW架构,维度为200,窗口大小为5)计算每个种子词与语料库中所有其他词的余弦相似度。对于每个维度,选取与所有种子词平均相似度最高的前100个词,形成初始的扩展词列表。随后进行跨维度去重,若一个词出现在多个维度的扩展词列表中,则将其分配给余弦相似度最高的那个维度,以确保词典间的互斥性。其中,勤勉维度(Diligence)是对Li等(2021)原始框架中“尊重”(Respect)维度的中国化替代,更符合中国企业强调“勤奋”、“敬业”、“奋斗”的文化特征。 其次,基于构建好的五个扩展词典,计算每个维度的文化强度得分。对每家公司在特定年份的MD&A文本进行分词处理后,统计各扩展词典中所有词出现的原始词频。为降低常见词的影响并突出特征词的重要性,采用WF-IDF(Word Frequency-Inverse Document Frequency)加权方法将原始词频转化为标准化得分。以创新维度为例,其计算公式为: $$InnovationScore = \sum{w \in D{innovation}} (1 + \log(tfw)) \times \log(\frac{N}{dfw})$$ 其中$D{innovation}$代表创新维度扩展词典,$tfw$为词典中词$w$在当期MD&A文本中出现的词频,$dfw$为词$w$在全部公司-年度样本中出现的文档频率,$N$为总文档数。其他四个维度(道德、质量、勤勉、合作)的得分计算遵循相同的WF-IDF加权逻辑。最终,企业文化强度总分(CultureTotal)为五个维度WF-IDF得分之和,用以衡量企业文化的整体强度。各维度的原始词频(如InnovationFreq)也一并提供,供研究者参考。 补充说明 - 文本来源优先使用年报的“管理层讨论与分析”(MD&A)部分。若无法成功提取MD&A章节,则回退使用年报全文进行分析,并通过MDAExtracted字段标识。 - 文本分析基于中文分词处理,TotalWords字段记录了分词后MD&A文本的有效词数。 参考文献 - Li K, Mai F, Shen R, et al. Measuring corporate culture using machine learning[J]. The Review of Financial Studies, 2021, 34(7): 3265-3315. - 潘健平, 潘越, 马奕涵. 以"合"为贵?合作文化与企业创新[J]. 金融研究, 2019.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。