企业员工流失风险感知(双词表同句共现)

「企业员工流失风险感知(双词表同句共现)」,覆盖 1991-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 66,996。 基于上市公司年报管理者讨论与分析(MD&A)文本,用员工类与招聘流失类双词表同句交叉匹配度量企业对员工流失风险的感知程度,相关句频数加1取自然对数;参考皮淑雯等

时间跨度1991-2025 年
数据频率年度
层级上市公司
变量数16
样本量66,996
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 证券简称
  • Year [年份] — 年报对应的会计年度
  • Province [省份] — 公司注册所在省份
  • ProvinceCode [省份代码] — 省份行政区划代码(6位)
  • City [城市] — 公司注册所在城市
  • CityCode [城市代码] — 城市行政区划代码(6位)
  • County [区县] — 公司注册所在区县
  • CountyCode [区县代码] — 区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码
  • IndustryName [行业名称] — 中上协行业分类名称
  • MobilitySentCount [员工流失风险相关句数] — 参考皮淑雯等(2026,南开管理评论)的方法,计算公式为:年报管理者讨论与分析(MD&A)中,按句号/问号/感叹号/分号切分后,同一句子内同时出现员工类词(员工、雇员、人力资源、人力资本、人才、职工)与招聘流失类词(招聘、招募、吸引、引进、留住、留任、流失、流出、离职、跳槽等)的句子数(先掩除客户/供应商挽留型混淆短语)。用作核心指标FLabor_Mobility的分子,越大代表年报中讨论员工流失风险的句子越多
  • TotalSentCount [MD&A总句数] — 管理者讨论与分析(MD&A)章节按句号/问号/感叹号/分号/换行切分后、长度大于5个字符的句子总数,作为企业员工流失风险讨论的基数/文本暴露规模
  • MDAExtracted [MD&A提取标志] — 是否成功提取到管理者讨论与分析(MD&A)章节(0=否,1=是)。为0时回退用年报全文计算,该口径可能混入财报附注等噪声,建议研究中筛选MDAExtracted=1
  • FLabor_Mobility [员工流失风险感知] — 参考皮淑雯等(2026,南开管理评论)的方法,计算公式为:ln(MD&A中员工流失风险相关句频数 + 1)。基础关键词经Word2Vec(余弦相似度≥0.70)相似词扩展并人工剔噪。用作核心研究变量,越大代表企业对员工流失风险的感知程度越高
  • FLabor_Mobility_Base [员工流失风险感知-基础词表] — 参考皮淑雯等(2026,南开管理评论)的方法,计算公式为:ln(仅用22个基础关键词的同句共现句频数 + 1)。未做相似词扩展的对照口径(与扩展口径FLabor_Mobility的相关系数为0.9997),用于关键词表稳健性检验

常见问题

「企业员工流失风险感知(双词表同句共现)」是什么数据集?
企业员工流失风险感知(双词表同句共现),隶属信息环境。基于上市公司年报管理者讨论与分析(MD&A)文本,用员工类与招聘流失类双词表同句交叉匹配度量企业对员工流失风险的感知程度,相关句频数加1取自然对数;参考皮淑雯等
该数据集的时间范围是?
覆盖 1991-2025 年。
包含哪些变量/指标?
共 16 个变量。核心指标包括:员工流失风险相关句数、MD&A总句数、MD&A提取标志、员工流失风险感知、员工流失风险感知-基础词表。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 66,996 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业对员工流失风险的感知,刻画的是企业管理层对核心人力资源可能流失这一不确定性的关注程度。其测度逻辑在于:当企业预期员工流失的可能性较高时,更有可能在年度报告"管理者讨论与分析"部分出现与招聘、吸引、保留和维持员工相关的表述。沿着这一思路,本指标对"管理者讨论与分析"文本中与员工流失风险讨论相关的句子进行频数统计,并将相关句子频数加 1 后取自然对数,得到核心代理变量 $FLabor\Mobility$: $$FLabor\Mobility{i,t} = \ln\left(N^{turnover}{i,t} + 1\right)$$ 其中 $N^{turnover}{i,t}$ 为企业 $i$ 在第 $t$ 年年报"管理者讨论与分析"部分中与员工流失风险相关的句子数。 相关句子的识别采用双词表同句交叉匹配:先将"管理者讨论与分析"文本按中文句末标点(句号、问号、感叹号、分号)切分为句子,若某一句子中同时出现员工类词表与招聘流失类词表中的词语,则认定该句为与员工流失风险讨论相关的句子。员工类词表的基础词为"员工、雇员、人力资源、人力资本、人才、职工";招聘流失类词表的基础词为"招聘、招募、吸引、引进、引入、留下、留住、留任、流失、流出、离开、离去、离职、流转、挖角、跳槽"。 考虑到样本期跨度较长、年报表述风格随时间变化,本指标进一步运用词嵌入模型对基础词进行相似词扩展:在大规模年报"管理者讨论与分析"语料上训练词向量模型,对每个基础词检索其余弦相似度不低于 $0.70$ 的近义词作为候选,并经人工剔噪后纳入词表(剔除语义相反或与员工语境无关的混淆词)。在本文采用的子串匹配口径下,扩展所得的多数候选为基础词的上位复合词(如"专业人才"含"人才"),已被基础词覆盖,故扩展对最终结果的边际影响很小;为透明起见,另保留仅使用基础词、未做相似词扩展的对照口径 $FLabor\Mobility\Base$,其与主口径的相关系数高达 $0.9997$。 为避免将"吸引、维持和保留重要客户和供应商"等非员工语境的表述误计为员工流失风险句,在判定共现之前先掩除句中客户、供应商挽留型短语:若某句仅因客户或供应商挽留表述而满足双词表共现、掩除后不再同时包含两类词,则不计入相关句数;若掩除后该句仍因真实的员工招聘、保留表述而共现,则予以保留。 补充说明 - "管理者讨论与分析"章节通过版式特征自动定位,覆盖各年代年报的多种节标题格式,并以提取标志记录是否成功定位;少数定位失败的样本回退至全文计算,该口径可能混入财务报表附注等模板化文字,使用时建议筛选成功提取"管理者讨论与分析"的观测。 - 样本为沪深 A 股及北京证券交易所上市公司,剔除 B 股与无效证券代码。指标值依赖年报文本可得性,主键为公司代码与年份。 - 指标为相关句子绝对频数的对数变换,未对文本长度做标准化(与原始方法一致);由于年报篇幅随时间增长,实证使用时建议控制年份固定效应或文本长度。对于主营业务即为招聘、人力资源服务的企业,关键词可能源自业务描述而非自身留人压力,使用时可对此类行业作稳健性处理。 参考文献 - 皮淑雯, 丁凤塔, 孟佶贤, 杨晓光. 员工流失风险感知与企业劳动节约型创新[J]. 南开管理评论, 2026, 29(4): 113-124. - Qiu Y, Wang T Y. Skilled Labor Risk and Corporate Policies[J]. Review of Corporate Finance Studies, 2021, 10(3): 437-472. - Khoo J, Cheung A. Does Skilled Labor Risk Matter to Suppliers? Evidence from Trade Credit[J]. Financial Review, 2023, 58(2): 423-447. - Shen M. Skilled Labor Mobility and Firm Value: Evidence from Green Card Allocations[J]. Review of Financial Studies, 2021, 34(10): 4663-4700. - Belo F, Li J, Lin X, et al. Labor-Force Heterogeneity and Asset Prices: The Importance of Skilled Labor[J]. Review of Financial Studies, 2017, 30(10): 3669-3709.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。