企业综合创新指数
「企业综合创新指数」,覆盖 2015-2025 年,频率 年度,上市公司层级,含 25 个变量,样本量约 39,181。 参考梁婧姝和刘涛雄 (2024, 科学学研究)的方法构建的企业综合创新指数。
| 时间跨度 | 2015-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 25 |
| 样本量 | 39,181 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 财务年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- RDInvestment [研发投入总额] — 企业当年的研发投入总额,计算公式为:费用化研发费用+资本化研发支出当年增加额;其中费用化研发费用优先取利润表口径,在利润表尚未单独列示研发费用的年份回退到财务指标口径的披露值;资本化研发支出增加额按相邻年度取差且只取非负增量。单位:元
- ResearchStaff [研究人员数量] — 企业在年度报告研发人员情况表中披露的研发人员数量,用作创新投入维度中人力资源投入的度量。单位:人
- PatentApplications [专利申请数] — 企业当年提交的专利申请总数,用作创新产出维度的度量;取申请数而非授权数,因申请行为在时间上更贴近创新活动本身的发生,不受审查周期与审查结果干扰。单位:件
- RDToAssetRatio [研发投入占总资产比重] — 参考梁婧姝和刘涛雄 (2024, 科学学研究)的方法,创新投入维度的基础指标,计算公式为:研发投入总额/年末总资产×100。以总资产而非营业收入作分母,使该指标在营业收入波动剧烈或尚未形成规模收入的企业上仍然稳定。单位:%
- PatentPerLogRD [创新效率] — 参考梁婧姝和刘涛雄 (2024, 科学学研究)的方法,创新效率维度的基础指标,计算公式为:专利申请数/ln(研发投入总额)。分母取研发投入的自然对数而非原值,以压缩研发投入在企业间的量级差异;研发投入取财务报表的原始货币单位元,不作单位换算。单位:件/对数元
- RDToAssetStd [研发投入强度标准化值] — 研发投入占总资产比重的极差标准化值,计算公式为:(本指标原值-全样本最小值)/(全样本最大值-全样本最小值),即极差标准化,取值区间[0,1];标准化在全样本上一次性完成,不分年度计算
- ResearchStaffStd [研究人员数量标准化值] — 研究人员数量的极差标准化值,计算公式为:(本指标原值-全样本最小值)/(全样本最大值-全样本最小值),即极差标准化,取值区间[0,1];标准化在全样本上一次性完成,不分年度计算
- PatentAppStd [专利申请数标准化指数] — 专利申请数的极差标准化值,计算公式为:(本指标原值-全样本最小值)/(全样本最大值-全样本最小值),即极差标准化,取值区间[0,1];标准化在全样本上一次性完成,不分年度计算
- PatentPerLogRDStd [创新效率标准化值] — 创新效率的极差标准化值,计算公式为:(本指标原值-全样本最小值)/(全样本最大值-全样本最小值),即极差标准化,取值区间[0,1];标准化在全样本上一次性完成,不分年度计算
- WeightRDToAsset [研发投入强度熵权重] — 研发投入占总资产比重在熵权法中获得的权重,计算公式为:d/Σd,其中差异系数d=1-e,e为该指标的信息熵(e=-(1/ln n)Σp·ln p,p为该指标标准化值在全样本中的比重,n为样本观测数);四个基础指标的权重合计为1。熵权在全样本上一次性计算,故各行取值相同
- WeightResearchStaff [研究人员数量熵权重] — 研究人员数量在熵权法中获得的权重,计算公式为:d/Σd,其中差异系数d=1-e,e为该指标的信息熵(e=-(1/ln n)Σp·ln p,p为该指标标准化值在全样本中的比重,n为样本观测数);四个基础指标的权重合计为1。熵权在全样本上一次性计算,故各行取值相同
- WeightPatentApp [专利申请数熵权重] — 专利申请数在熵权法中获得的权重,计算公式为:d/Σd,其中差异系数d=1-e,e为该指标的信息熵(e=-(1/ln n)Σp·ln p,p为该指标标准化值在全样本中的比重,n为样本观测数);四个基础指标的权重合计为1。熵权在全样本上一次性计算,故各行取值相同
- WeightPatentPerLogRD [创新效率熵权重] — 创新效率在熵权法中获得的权重,计算公式为:d/Σd,其中差异系数d=1-e,e为该指标的信息熵(e=-(1/ln n)Σp·ln p,p为该指标标准化值在全样本中的比重,n为样本观测数);四个基础指标的权重合计为1。熵权在全样本上一次性计算,故各行取值相同
- InnovationIndex [企业综合创新指数] — 参考梁婧姝和刘涛雄 (2024, 科学学研究)的方法,计算公式为:创新投入、创新产出、创新效率三个角度共四个基础指标的极差标准化值按熵权加权求和,即Σ(w_j×z_ij),取值区间[0,1]。用作研究变量,越大代表企业在创新投入强度、创新产出规模与投入产出效率三方面综合表现出的创新水平越高
常见问题
- 「企业综合创新指数」是什么数据集?
- 企业综合创新指数,隶属创新与知识产权。参考梁婧姝和刘涛雄 (2024, 科学学研究)的方法构建的企业综合创新指数。
- 该数据集的时间范围是?
- 覆盖 2015-2025 年。
- 包含哪些变量/指标?
- 共 25 个变量。核心指标包括:研发投入总额、研究人员数量、专利申请数、研发投入占总资产比重、创新效率、研发投入强度标准化值、研究人员数量标准化值、专利申请数标准化指数、创新效率标准化值、研发投入强度熵权重、研究人员数量熵权重、专利申请数熵权重、创新效率熵权重、企业综合创新指数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 39,181 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业创新水平的度量长期面临代理变量单一的困扰。以研发投入占比衡量创新,虽然刻画了资源投入的强度,却无法回答投入能否转化为创新产出;以专利数量衡量创新,则因专利申请内容与外部法律环境的变化,使专利数量与真实创新之间的对应关系不再稳定。本数据集参考梁婧姝和刘涛雄 (2024, 科学学研究) 的做法,不依赖任何单一代理变量,而是从创新投入、创新产出、创新效率三个角度分别选取基础指标,用熵权法赋权合成一个企业综合创新指数,使投入强度、产出规模与投入产出转化效率三方面的信息同时进入同一个连续度量。 四个基础指标的设定如下。创新投入维度取两个指标:一是研发投入占总资产的比重,记为 $$\text{RDToAssetRatio}{i,t}=\frac{RD{i,t}}{TA{i,t}}\times 100$$ 其中 $RD{i,t}$ 为企业当年的研发投入总额,等于费用化的研发费用与资本化研发支出当年增加额之和,$TA{i,t}$ 为年末总资产;以总资产而非营业收入作分母,使该指标在营业收入波动剧烈或尚未形成规模收入的企业上仍然稳定。二是研究人员数量,取企业在年度报告研发人员情况表中披露的研发人员人数,它刻画的是投入到创新活动中的人力资源存量,与以货币计量的研发支出互为补充。 创新产出维度取专利申请数,即企业当年提交的专利申请总数。之所以取申请数而非授权数,是因为申请行为在时间上更贴近创新活动本身的发生,不受审查周期与审查结果的干扰。 创新效率维度取单位研发投入的专利产出,定义为 $$\text{PatentPerLogRD}{i,t}=\frac{Patent{i,t}}{\ln RD{i,t}}$$ 其中 $Patent{i,t}$ 为专利申请数。分母取研发投入的自然对数而非原值,是为了压缩研发投入在企业间的量级差异,使该效率指标不至于被少数超大规模研发支出企业的倒数效应所主导。 四个基础指标的量纲与分布形态各不相同,须先标准化再合成。对每个基础指标 $j$ 作极差标准化 $$z{ij}=\frac{x{ij}-\minj}{\maxj-\minj}$$ 四个指标均为正向指标,即取值越大代表创新水平越高,故一律采用上式的正向标准化形式,标准化后取值落在 $[0,1]$ 区间。极差的上下端点在全样本上一次性确定,不分年度计算。 权重不由研究者主观设定,而由熵权法从数据的离散程度中导出:某一指标在样本间差异越大,其携带的区分信息越多,应获得越高的权重。具体地,先把标准化值转换为指标内比重 $p{ij}=z{ij}\big/\sumi z{ij}$,再计算该指标的信息熵 $$ej=-\frac{1}{\ln n}\sum{i} p{ij}\ln p{ij}$$ 其中 $n$ 为样本观测数,并约定 $0\cdot\ln 0=0$ 以处理标准化后取值为零的观测。信息熵越大意味着该指标的取值越均匀、区分能力越弱,故以差异系数 $dj=1-ej$ 度量其信息量,归一化后得到熵权 $$wj=\frac{dj}{\sum{j} dj}$$ 企业综合创新指数即为四个标准化值的熵权加权和 $$\text{InnovationIndex}{i,t}=\sum{j=1}^{4} wj\, z{ij}$$ 取值同样落在 $[0,1]$ 区间,数值越大代表企业在投入强度、产出规模与投入产出效率三方面综合表现出的创新水平越高。四个基础指标的原值、各自的标准化值以及熵权法解出的四个权重均随指数一并给出,使用者可据此完整复算指数,也可按自身需要重新赋权。 补充说明 - 样本口径:覆盖全部板块,不按行业、ST 状态或交易周数预先筛选,亦不施加原文为其识别策略所设的创业板与季度频率限制。总资产取一般工商业类型的年报合并报表,该报表类型过滤的结构性后果是银行、保险与证券公司整体不进入样本(与原文剔除金融保险业的处理一致),但少数按行业归入金融门类而报表类型为一般工商业的公司仍在样本内,需严格剔除金融业者应按行业代码自行筛选。四个基础指标须同时可得且研发投入与总资产为正,这使未开展研发或未披露研发支出的企业年不进入样本,覆盖偏向研发活跃与规模较大的公司;披露倾向本身与创新水平相关,建议加入行业与年份固定效应,必要时报告选择方程。 - 研发投入的口径:原文未说明研发投入的具体口径,本数据集取费用化研发费用与资本化研发支出当年增加额之和;在利润表单独列示研发费用的会计准则实施之前回退到财务指标口径的披露值,两者是同一概念的不同披露来源,在同时可得的年份绝大多数观测完全相等。三点需注意:利润表研发费用在企业将前期资本化的开发支出一次性转入费用时会包含该转回金额;资本化部分由开发支出期末余额的同比增量截去负值近似,项目结转至无形资产使余额下降的企业年因而被记为零,对有资本化能力的重研发企业形成单边偏低;另有少量企业年披露的研发投入金额与其人员及专利规模不相称,会经对数分母抬高效率指标,对研发投入绝对水平敏感的研究建议自行设下限或作一致性筛查。 - 研究人员数量的口径:原文未指明"员工中研究人员数量"的来源,本数据集取年度报告研发人员情况表披露的研发人员数量。该表在年报中开始披露之前无法取得,面板起点因而晚于其余三个基础指标所能支持的年份;未能取得该项的企业年不进入样本,其中绝大多数为企业确未披露,少数为年报表格数值提取未成功,缺失并非完全随机。少数企业年披露值为零而同时有正的研发投入与专利申请,本数据集按披露值原样采信,其人员维度标准化值为零。 - 效率指标的单位:专利申请数除以研发投入对数的形式不是尺度不变的,研发投入换用不同货币单位会改变企业间的排序。本数据集统一取财务报表的原始货币单位,不作换算;研发投入总额与专利申请数的原值一并给出,使用者可自行换算复算。 - 未作极值处理:原文在样本说明中对回归模型的连续变量作上下 5% 缩尾,本数据集对四个基础指标不作缩尾,直接在原值上作极差标准化。其后果是极差的上端点由全样本最大值决定,合成指数呈明显右偏,量纲刻度对单一极值观测敏感,而缩尾与否会实质改变指数的线性取值(企业间排序受影响较小)。排序信息完整保留,建议以年度百分位排名入回归,或至少报告排名版结果作为稳健性。 - 其他局限:专利申请存在公开滞后,最近一两个申请年度的专利申请数系统性偏低并连带压低该两年的产出与效率指标,时序分析不应将末年解读为真实下降;专利申请数与单位研发投入专利产出两个指标高度相关,熵权法据离散程度逐列赋权无法识别这一重叠,产出维度因而获得合计较高的权重,指数的变异主要由专利申请数驱动;三个基础指标为绝对水平量,指数含规模成分,不宜跨行业直接比较绝对值;熵权与极差端点由样本自身决定,样本年份范围扩展后各年的标准化值与指数相应重算,四个熵权已随数据落盘以便核对口径。 参考文献 - 梁婧姝,刘涛雄.企业创新韧性及风险投资的影响:理论与实证[J].科学学研究,2024,42(1):205-215.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。