文本融资约束(Hoberg余弦残差法)

「文本融资约束(Hoberg余弦残差法)」,覆盖 2001-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 65,976。 衡量企业面临的融资约束程度。

时间跨度2001-2025 年
数据频率年度
层级上市公司
变量数19
样本量65,976
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 财务年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • FC [文本融资约束指数] — 参考姜付秀等(2017, 管理世界)的方法,适配Hoberg & Maksimovic (2015, RFS)文本分析框架,计算公式为:融资约束原始得分对董事会得分和行业相似度得分回归的OLS残差,越大代表融资约束越严重
  • ConstrainedScore [融资约束原始得分] — 参考姜付秀等(2017, 管理世界)的方法,计算公式为:cos_sim(firm_vec, constrained_centroid),即公司MD&A文本向量与融资约束样本集质心向量的余弦相似度
  • ConstrainedFlag [融资约束文本标记] — 是否被正则表达式标记为含有融资约束信息的MD&A文本(0=否,1=是),参考姜付秀等(2017, 管理世界)的方法
  • BoardScore [董事会得分] — 董事会治理得分,基于文本分析计算的融资约束指标。单位:分
  • IndustryScore [行业相似度得分] — 参考Hoberg & Maksimovic (2015, RFS)的模板控制方法,计算公式为:cos_sim(firm_vec, industry_centroid),即公司MD&A文本向量与所属行业(中上协)质心向量的余弦相似度
  • MDAExtracted [MDA提取标志] — 参考Hoberg & Maksimovic (2015, RFS)。是否成功提取管理层讨论与分析章节(0=否,1=是),MDA提取标志=0时人工智能水平-MDA基于全文计算
  • MDAWordCount [MDA词数] — 参考Hoberg & Maksimovic (2015, RFS)。MD&A章节jieba分词后的词数。单位:个
  • FC_Zscore [文本融资约束指数_年度标准化] — 参考Hoberg & Maksimovic (2015, RFS)。计算公式为:FC在年度内的Z-score标准化值(FC - 年度均值) / 年度标准差,消除FC跨年方差差异,越大代表融资约束越严重

常见问题

「文本融资约束(Hoberg余弦残差法)」是什么数据集?
文本融资约束(Hoberg余弦残差法),隶属资本结构。衡量企业面临的融资约束程度。
该数据集的时间范围是?
覆盖 2001-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:文本融资约束指数、融资约束原始得分、融资约束文本标记、董事会得分、行业相似度得分、MDA提取标志、MDA词数、文本融资约束指数_年度标准化。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 65,976 条观测。
数据是如何测算/获取的?
指标定义与计算方法 本数据集采用文本分析方法构建衡量中国上市公司融资约束程度的连续指标。该方法借鉴了Hoberg和Maksimovic (2015) 提出的文本分析框架,并参考姜付秀等 (2017) 的研究,从上市公司年报的“管理层讨论与分析”(MD&A)章节中提取与融资约束相关的文本信息。核心思想是,MD&A文本中关于融资困难、资金紧张等词汇的使用频率和模式,能够反映公司面临的融资约束状况。为了控制不同板块和行业在信息披露语言风格上的系统性差异(即“模板化语言”),该方法通过计算文本向量与板块及行业质心的相似度,并利用回归残差来提取公司特有的融资约束信息。 首先,对每家公司的MD&A文本进行预处理和分词,并使用词频统计方法构建文本向量。随后,计算三个核心的余弦相似度得分:融资约束原始得分($ConstrainedScore$)、板块相似度得分($BoardScore$)和行业相似度得分($IndustryScore$)。其中,$ConstrainedScore$是公司文本向量与一个由正则表达式预先标记的“融资约束样本集”质心向量之间的余弦相似度,该标记变量为$ConstrainedFlag$。$BoardScore$和$IndustryScore$则分别是公司文本向量与其所属交易所板块质心向量、以及按中上协行业分类(制造业取二级代码前两位,其他行业取门类首位)分组后的行业质心向量之间的余弦相似度。 最终的文本融资约束指数($FC$)通过以下回归模型的残差获得: $$FC = \epsilon = ConstrainedScore - (\hat{\beta}0 + \hat{\beta}1 \times BoardScore + \hat{\beta}2 \times IndustryScore)$$ 其中,$ConstrainedScore$为融资约束原始得分,$BoardScore$为板块相似度得分,$IndustryScore$为行业相似度得分,$\epsilon$为普通最小二乘法(OLS)回归的残差。$FC$值越大,表明公司在剔除板块和行业通用语言模式后,其文本中反映的融资约束程度越严重。 为便于跨年度比较,进一步计算年度标准化指标$FC\Zscore$,其计算公式为: $$FC\Zscore = \frac{FC - \overline{FC{year}}}{\sigma(FC{year})}$$ 其中,$\overline{FC{year}}$和$\sigma(FC{year})$分别为$FC$在当年所有样本中的均值和标准差。$FC\Zscore$越大,同样代表融资约束越严重。 补充说明 - 数据构建基于上市公司年报的MD&A章节文本。若成功提取MD&A章节,则$MDAExtracted$标志为1;否则为0。 - 文本处理包括使用正则表达式进行融资约束信息标记,以及使用分词工具进行分词并统计词数($MDAWordCount$)。 - 行业分类依据中上协行业分类标准进行分组以计算行业质心。 参考文献 - Hoberg G, Maksimovic V. Redefining financial constraints: A text-based analysis[J]. Review of Financial Studies, 2015, 28(5): 1312-1352. - 姜付秀, 王运通, 田园, 等. 多个大股东与企业融资约束——基于文本分析的经验证据[J]. 管理世界, 2017(12): 61-74.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。