研发人员操纵(高新认定门槛区间法)
「研发人员操纵(高新认定门槛区间法)」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 16 个变量,样本量约 45,340。 度量A股上市公司为达到高新技术企业认定与科创属性评价中"研发人员占职工总数比例不低于10%"的门槛而虚增研发人员数量的嫌疑。
| 时间跨度 | 2015-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 16 |
| 样本量 | 45,340 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 年度报告所属会计年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- HasRDPersonnelDisclosure [是否披露研发人员情况] — 是否在当年年度报告中披露研发人员情况(0=否,1=是),研发人员数量与研发人员占比任一可获取即取1;取0的准确含义是本数据集未能从该公司当年年度报告中取得研发人员情况,绝大多数为企业确未披露(集中在未开展研发活动的金融、房地产与批发零售等行业),少数为年度报告转换为文本时表格数值丢失。本数据集的行集合取自年度报告文本索引而非上市公司名录,少数已上市交易的企业年因语料中无该年年度报告而不在表中,不应与本字段取0混为一谈
- RDPersonnelCount [研发人员数量] — 企业在当年年度报告研发人员情况表中披露的研发人员数量,单位为人;北交所披露模板为期初与期末两列,取期末数
- RDPersonnelRatio [研发人员占比] — 企业在当年年度报告研发人员情况表中披露的研发人员数量占公司总人数的比例,单位为百分数,计算公式为:研发人员数量/公司总人数×100;本字段取企业自行披露的比例值,北交所披露模板取期末数。该比例是高新技术企业认定与科创属性评价中的关键门槛指标
- IsRDPersonnelManip [是否存在研发人员操纵] — 参考汤迪浩等 (2026, 财会通讯)的方法,度量企业是否为达到认定门槛而虚增研发人员数量,计算公式为:研发人员占比落在10%至12%的闭区间时取1,否则取0(0=否,1=是);区间下界10%为高新技术企业认定与科创属性评价对研发人员(科技人员)占职工总数比例的最低要求,占比刚好压在门槛之上的狭窄区间意味着企业存在为满足认定标准而调节研发人员数量的嫌疑。研发人员占比缺失的企业年该字段为空。用作研究变量,取1代表企业当年存在研发人员操纵嫌疑
- IsAboveRDPersonnelThreshold [是否达到研发人员占比10%门槛] — 是否达到研发人员占比10%门槛(0=否,1=是),计算公式为:研发人员占比不低于10%时取1,否则取0;10%为高新技术企业认定与科创属性评价对研发人员(科技人员)占职工总数比例的最低要求,该字段用于把门槛之下的企业与门槛之上但未压线的企业区分开。研发人员占比缺失的企业年该字段为空。注意:是否披露研发人员情况本身是企业的选择且系统性偏向门槛之下,故本字段的样本均值不能解读为全体上市公司的门槛达标率
常见问题
- 「研发人员操纵(高新认定门槛区间法)」是什么数据集?
- 研发人员操纵(高新认定门槛区间法),隶属创新与知识产权。度量A股上市公司为达到高新技术企业认定与科创属性评价中"研发人员占职工总数比例不低于10%"的门槛而虚增研发人员数量的嫌疑。
- 该数据集的时间范围是?
- 覆盖 2015-2025 年。
- 包含哪些变量/指标?
- 共 16 个变量。核心指标包括:是否披露研发人员情况、研发人员数量、研发人员占比、是否存在研发人员操纵、是否达到研发人员占比10%门槛。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 45,340 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 我国对高新技术企业的认定以及科创板对企业科创属性的评价,均把"研发人员占职工总数的比例" 设为一道明确的准入门槛,要求该比例不低于 10%。通过认定的企业可享受企业所得税税率下调、 政府补助倾斜与融资便利等实质性优惠,而门槛本身是一条非连续的分界线:比例只要差之毫厘 落在门槛之下,全部优惠随之落空。这种"全有或全无"的激励结构,使得真实研发人员占比本就 接近门槛的企业有强烈动机把该比例调节到刚好达标的位置——把非研发岗位的员工在统计上归入 研发人员,或在年末临时调整研发团队的人员编制。这类行为被文献称为研发人员操纵,最初由谢琼昕、 冯为与黎文靖等 (2022) 在科创板首次公开发行的情境下提出,与之并列的还有针对研发投入强度 门槛的研发投入操纵。 本数据集参考汤迪浩、黄欣与朱凯 (2026) 在其机制分析中的做法度量研发人员操纵。识别逻辑 建立在一个简单而稳健的判断上:若企业的研发人员占比远高于门槛,说明其研发投入的人力基础 真实充裕,没有调节的必要;若占比明显低于门槛,说明其本就不以认定资格为目标;只有当占比 恰好落在门槛之上一条狭窄的区间内时,才最可能是为了满足认定标准而人为堆到线上的结果。 据此,把研发人员占比落在 10% 至 12% 这一区间内的企业年,判定为存在研发人员操纵嫌疑。 度量所依据的基础变量直接取自企业年度报告中的研发人员情况表。记 $N{i,t}$ 为企业 $i$ 在 第 $t$ 年披露的研发人员数量,$L{i,t}$ 为公司总人数,研发人员占比定义为 $$R{i,t}=\frac{N{i,t}}{L{i,t}}\times 100\%$$ 该比例由企业在年度报告中直接列示,本数据集直接采用企业披露的比例值而非由人数另行计算; 它正是认定机关审核与投资者阅读时所看到的那个数字,因而是操纵行为直接作用的对象。核心指标研发人员操纵据此构造为一个二元变量: $$\text{IsRDPersonnelManip}{i,t}= \begin{cases} 1, & 10\% \le R{i,t} \le 12\% \\[4pt] 0, & \text{其他} \end{cases}$$ 取值为 1 表示企业当年的研发人员占比压在认定门槛之上的狭窄区间内,存在为达标而虚增研发 人员数量的嫌疑;取值为 0 表示不具备该特征,既包括占比未达门槛的企业,也包括占比充分高于 门槛、无需调节的企业。为把这两类性质截然不同的零值区分开,数据集另给出门槛达标指示 $\text{IsAboveRDPersonnelThreshold}{i,t}=\mathbb{1}(R{i,t}\ge 10\%)$,使用者可用它把 "门槛之下"与"门槛之上但未压线"分离,从而在回归中把操纵嫌疑与单纯的研发人力充裕区分开来。 数据集同时保留构造过程中的两个基础量:研发人员数量 $N{i,t}$ 与研发人员占比 $R{i,t}$。 前者是企业披露的人数原值,后者是判定所依据的连续变量,使用者既可以直接使用本数据集给出 的二元判定,也可以基于连续的占比自行设定其他区间宽度、或采用门槛处密度断点的方法做更 精细的识别。此外,数据集给出研发人员情况披露指示 $\text{HasRDPersonnelDisclosure}{i,t}$, 用以区分"企业披露了研发人员情况但占比未落在操纵区间"与"企业根本没有披露研发人员情况" 这两种在分析上不可混同的情形。 从原始披露文本还原上述基础量时,需要处理三种不同的表格排版。第一种是标签独占一个表格 单元、数值在其后逐行列示,列序为本年、上年与变动比例;第二种是标签与各列数值压在同一 行内,列序与第一种相同;这两种情形均取标签之后的第一个数值作为本年取值。第三种是北京 证券交易所使用的披露模板,其研发人员情况按学历分列期初人数与期末人数,并在表末给出 研发人员总计与研发人员占员工总量的比例,该模板取期末列的数值。三种排版以表头特征自动 识别。取值还需通过两道有效性检验:占比必须落在 0 至 100 的合理值域内;人数必须为不带 百分号的非负整数,且与同一表格行内相邻一期的人数不得相差 20 倍以上——后者用于剔除版面 页码与表格数值粘连所造成的伪值,企业研发人员数的同比变动不可能达到这一量级。 补充说明 - 样本口径:覆盖全部行业与全部交易板块,不预先施加回归分析常见的样本限制,既不剔除 特别处理股票,也不剔除营业收入规模较小的企业,且不对连续变量做缩尾。研发人员占比的 行业间差异极大,软件与信息服务业的水平远高于批发零售与房地产业,使用者在跨行业样本上 做回归时应加入行业与年份固定效应。本数据集的行集合取自年度报告文本索引而非上市公司 名录,少数已上市交易的企业年因语料中无该年年度报告而不在表中。 - 取数口径:原始文献未说明其研发人员比例的具体取数来源。本数据集取企业在年度报告中 自行披露的研发人员占比,即认定机关与投资者所见、亦即操纵行为直接作用的口径;与商业 数据库经二次加工的同名字段相比,个案上可能存在差异。原始文献表述为"处于 10% 至 12% 的区间"而未明确端点开闭,本数据集取闭区间,端点是否计入对取值分布的影响很小。原始文献 的这一机制检验只使用了披露最规范的若干个年度,本数据集不作此收窄,向前延伸至标准化的 研发人员情况表开始出现的年度、向后延伸至年度报告可得的最新年度;早期年度的披露企业数 少于近年,覆盖存在时间趋势,回归中宜控制年份固定效应。 - 指标性质与建议的稳健性检验:这是位置型代理变量而非对虚增人数的直接测量,识别力来自 门槛处的密度堆积。以门槛左侧的分箱密度外推得到反事实后,区间内属于超额堆积的观测只占 该区间全部观测的少数,其余本就会落在这一区间;用作被解释变量时系数会被稀释,不显著的 结果不宜直接解读为"不存在操纵"。建议以紧邻的 12% 至 14% 窗口构造安慰剂虚拟变量一并汇报。 此外,门槛处的超额堆积在已获认定与从未获认定的企业中都存在,且未获认定企业的相对跳升 更大:这与"处在门槛边缘、正在争取认定的企业才是堆积主体"相容,但无法排除"10% 恰好是 某类企业惯例性人员配置比例"的竞争性解释。 - 披露选择:是否披露研发人员情况本身是企业的选择,且系统性地偏向门槛之下——随后停止 披露的企业,停披之前的占比明显低于持续披露的企业且过半低于门槛。因此门槛达标指示的样本 均值不能解读为全体上市公司的达标率。同理,未能取得研发人员情况的企业年,核心变量为缺失 而非取 0,以免把"未披露"误记为"无操纵"。 - 口径与时点差异:《高新技术企业认定管理办法》修订后把门槛表述由"研发人员"改为口径 更宽的"科技人员",而科创属性评价对科创板的要求才是字面上的"研发人员占比不低于 10%"; 年度报告披露的是"研发人员",与认定口径存在系统性差异。研发人员的统计边界亦由企业自行 界定,兼职与研发辅助人员是否计入没有统一标准,这本身就是该比例可被调节的制度空间。 北京证券交易所的披露模板按期初与期末两个时点列示,本数据集取期末数;少数企业只列示 研发人员的学历结构而不给出总计与占比,其取值为缺失。 - 跨期比较与组内识别:认定门槛是法定常数,故本数据集使用固定的绝对区间;但样本期内 企业披露的占比整体上移,即便在全部年度均有取值的同一批企业中也是如此,做时间趋势分析时 可考虑同时使用占比在当年横截面中的分位数位置作为替代度量。核心变量在多数企业内部不随 时间变化,加入公司固定效应或条件 Logit 时,实际提供组内变异的企业数远少于企业总数。 - 其他局限:极少数企业自行披露的占比明显与变动比例列错位,或在披露了正数研发人员的 同时把占比填为零,本数据集如实保留企业披露值而不作外部替换与缩尾,此类取值远离操纵 区间,不影响核心变量的判定。北京证券交易所公司的证券代码在样本期内统一发生过变更, 同一主体以两个代码出现在面板中,且变更前的代码在公司档案中无记录,相应行的证券简称与 地理行业列为空;做公司固定效应前使用者需自行并码。 参考文献 - 汤迪浩,黄欣,朱凯.策略性创新溢出与企业创新效率:来自供应链层面的经验证据[J].财会通讯,2026,(17):56-60. - 谢琼昕,冯为,黎文靖,等.科创板企业IPO与研发人员操纵[J].会计研究,2022,(9):125-141.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。