企业多样化知识外溢

「企业多样化知识外溢」,覆盖 2006-2025 年,频率 年度,上市公司层级,含 19 个变量,样本量约 61,676。 企业受到的、来自50公里空间范围内其他二位码行业上市企业的知识外溢强度,以邻近异质行业企业的技术人员规模按地理距离倒数加权求和衡量,刻画雅各布斯式多样化外部性,

时间跨度2006-2025 年
数据频率年度
层级上市公司
变量数19
样本量61,676
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • SpilloverIndustryCode [外溢行业代码] — 界定其他行业时所参照的本企业二位码行业代码(采用中国上市公司协会行业分类,按企业-年度动态匹配),同一年份中行业代码与之不同的上市公司即构成本企业多样化知识外溢的来源
  • NeighborIndustries [其他行业数] — 参考韩峰和姜竹青(2023,《管理世界》)的方法,50公里范围内出现的、不同于本企业所属二位码行业的行业数量,即多样化知识外溢公式中的其他行业数V
  • NeighborFirmsOther [其他行业邻近企业数] — 50公里范围内所属二位码行业不同于本企业的上市公司数量
  • NeighborRDPersonnelOther [其他行业邻近研发人员数] — 计算公式为:50公里范围内所属二位码行业不同于本企业的全部上市公司的技术人员数之和,不作距离加权
  • DKSpillover [多样化知识外溢] — 参考韩峰和姜竹青(2023,《管理世界》)的方法,计算公式为:对50公里范围内所属二位码行业不同于本企业的每一家上市公司,以其技术人员数除以两家企业间的地理距离(公里),再对全部此类企业求和。用作研究变量,越大代表企业受到的跨行业多样化知识外溢越强
  • LnDKSpillover [多样化知识外溢对数] — 计算公式为:ln(1+多样化知识外溢)。用作研究变量,越大代表企业受到的跨行业多样化知识外溢越强
  • DKSpillover10 [多样化知识外溢(10公里)] — 稳健性口径,计算方式与多样化知识外溢相同,但将空间范围由50公里收窄至10公里
  • DKSpillover100 [多样化知识外溢(100公里)] — 稳健性口径,计算方式与多样化知识外溢相同,但将空间范围由50公里放宽至100公里

常见问题

「企业多样化知识外溢」是什么数据集?
企业多样化知识外溢,隶属创新与知识产权。企业受到的、来自50公里空间范围内其他二位码行业上市企业的知识外溢强度,以邻近异质行业企业的技术人员规模按地理距离倒数加权求和衡量,刻画雅各布斯式多样化外部性,
该数据集的时间范围是?
覆盖 2006-2025 年。
包含哪些变量/指标?
共 19 个变量。核心指标包括:外溢行业代码、其他行业数、其他行业邻近企业数、其他行业邻近研发人员数、多样化知识外溢、多样化知识外溢对数、多样化知识外溢(10公里)、多样化知识外溢(100公里)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 61,676 条观测。
数据是如何测算/获取的?
指标定义与计算方法 集聚经济学把企业从空间集聚中获得的外部性区分为两类。一类是同行业企业扎堆带来的专业化外部性,其传递的多是易于编码、可以标准化表达的显性知识;另一类是不同行业企业在同一空间内共存带来的多样化外部性,其传递的则是复杂的、难以编码的隐性知识。隐性知识的转移高度依赖近距离的、面对面的反复接触,因而对空间邻近性的要求更为苛刻。本数据集测度的是后者:企业在其地理邻域内,从所属行业与自己不同的上市企业处获得的知识外溢强度。 测度沿用韩峰和姜竹青(2023)的设定。设企业 $i$ 所属的二位码行业为 $p$,$o$ 表示企业 $i$ 周边一定空间范围内除 $p$ 以外的其他二位码行业,$V$ 为该范围内出现的其他行业数量,$no$ 为行业 $o$ 内的企业数量,$K{jo}$ 为行业 $o$ 中企业 $j$ 的研发人员规模,$d{ij,o}$ 为企业 $i$ 与企业 $j$ 之间的地理距离。企业多样化知识外溢定义为 $$DK\Spillover{ip}=\sum{o,\,o\neq p}^{V}\ \sum{j,\,d{ij}\leq 50km}^{n{o}}\frac{K{jo}}{d{ij,o}}$$ 即:把周边 50 公里内每一家跨行业邻居企业的研发人员规模,按其与本企业地理距离的倒数加权,再全部加总。距离倒数的权重形式来自空间经济学的潜力模型,含义是知识外溢强度随空间距离衰减——同样规模的一家邻居企业,距离越近,能带给本企业的知识溢出越多。50 公里是原文通过逐圈层回归识别出的集聚网络有效空间作用边界:在此范围内集聚网络对企业生产率的促进作用显著且随距离递减,越过该边界后作用不再显著。 外层对行业 $o$ 求和、内层对行业 $o$ 内企业 $j$ 求和的双重加总,等价于"对 50 公里内所有行业代码不等于 $p$ 的企业求和",本数据集即按这一等价形式实现。由于同属行业 $p$ 的企业已被外层求和排除,企业自身自然不会计入自己的外溢来源。 行业归属采用中国上市公司协会行业分类的二位码,并按企业-年度动态匹配:一家企业在样本期内变更过行业的,各年分别按其当年实际所属行业界定"其他行业"。$K$ 取上市公司披露的员工专业构成中的技术人员数。周边企业若未披露技术人员数,其对加总的贡献计为零,但仍计入邻近企业数与其他行业数。 企业地理坐标取其注册地所在县级行政区的几何质心,两企业间距离按经纬度以大圆距离公式计算。当两家企业落在同一个县级行政区内时,质心距离为零而使距离倒数发散,此时改用引力模型文献中的区域内部距离 $d{ii}=\frac{2}{3}\sqrt{A/\pi}$,其中等效半径 $\sqrt{A/\pi}$ 由该行政区到其最邻近若干个行政区质心距离的中位数折半估计;跨行政区但质心重合的情形,取两侧内部距离的均值。 除核心指标外,本数据集一并给出计算链上的三个构件:其他行业数(即公式中的 $V$)、其他行业邻近企业数、以及未经距离加权的其他行业邻近研发人员数,供使用者分解"邻居有多少"与"邻居有多近"两条渠道。核心指标另提供对数形式 $\ln(1+DK\Spillover)$,与原文回归方程中各变量均取对数的设定一致。稳健性方面,把公式中的 50 公里阈值分别替换为 10 公里与 100 公里,得到两个不同空间尺度下的口径,其中 10 公里对应原文划分地理圈层时作用效果最强的最内层。 补充说明 - 样本口径:覆盖全部 A 股上市公司-年度,不预先剔除金融业、ST 公司或任何行业,也不作缩尾处理,输出原始口径,回归样本的限制由使用者按研究需要自行施加。周边 50 公里内没有其他行业邻居的企业取值为零,这是真实的经济状态而非缺失。 - 研发人员的代理:原文中的 $K$ 为研发人员数量,上市公司定期报告中并无独立的研发人员口径,本数据集以员工专业构成中的技术人员数代理。技术人员口径略宽于研发人员,会使指标水平整体偏高,但不改变企业间的相对排序。 - 邻居池范围:原文样本限于制造业企业,其"其他行业"只能取其他制造业行业;本数据集的邻居池为全部 A 股上市公司,"其他行业"覆盖 50 公里内所有非本行业的二位码行业,使非制造业企业同样可用。对制造业企业而言,本口径取值高于原文口径,水平不宜与原文直接对标,企业间相对排序不受影响。 - 地理精度:原文使用门牌级经纬度,本数据集受可得坐标资源限制降至县级行政区质心。由此产生三个后果:同一县级行政区内企业间的距离差异被抹平;少数企业(多为近年新设或更名的市辖区)在地名库中无县级质心,退到上级市质心,其外溢水平被系统性压低;同区县企业对的距离为几何近似,而这部分配对因距离倒数权重极大,对最终取值的贡献远高于其配对数量占比。将同区县距离替换为常数所作的敏感性检验显示,企业间的排序高度稳定,但城市之间的水平比较会有明显移动,因此本指标适合作企业间比较,跨城市的水平比较需谨慎。仅能匹配到省级质心的极少数企业不含省内区位信息,且会给真实位于该质心附近的企业制造虚假邻居,故按无坐标处理,既不产出自身取值,也不进入他人的邻居池。企业注册地为当前状态,样本期内迁址的企业沿用同一坐标。 - 知识存量披露的时间趋势:原文的样本区间早于本数据集,本数据集的起始年份受技术人员数披露的可得性约束,更早的年份无法构造知识存量因而不进入样本。在样本期内,技术人员数的披露覆盖率由低到高持续改善,缺失者按零计入加总,使早期年份的取值被系统性低估,并把这部分覆盖率补齐的机械变化混入指标的时间趋势。使用长时间窗口时应加入年份固定效应,或将研究窗口限定在披露覆盖率已趋稳定的时期。 - 变异的空间层次:受质心坐标所限,同一县级行政区、同一年份、同一二位码行业内的企业,其邻居集合完全相同,取值也几乎一致。这意味着本指标的变异主要存在于地区与行业之间,若同时加入城市或更细的地区固定效应,指标的绝大部分变异会被吸收;标准误也宜聚类到城市或区县层面而非企业层面。 - 口径之间的关系:由于权重随距离倒数衰减,把半径由 50 公里放宽到 100 公里带来的增量有限,两者高度相关,该稳健口径的区分力弱于 10 公里口径;而 10 公里口径下相当一部分企业取值为零,取对数时会在零点堆积。 - 与总集聚规模的关联:"其他行业"的企业池远大于任一单一行业的企业池,本指标在数值上接近其半径内的全部知识外溢总量,与企业周边的总集聚规模高度关联。用作多样化外部性的度量时,宜同时控制企业周边的企业总数或就业规模,以免把总集聚效应误读为多样化效应。 - 其他局限:面板骨架来自行业归属记录,含 B 股代码与新三板挂牌代码等非 A 股上市主体,这些主体无地理坐标,各项指标均为缺失,也不进入他人的邻居池,回归前按核心指标非缺失筛选即可。 参考文献 - 韩峰,姜竹青.集聚网络视角下企业数字化的生产率提升效应研究[J].管理世界,2023,39(11):54-74. - Head K, Mayer T. Non-Europe: The magnitude and causes of market fragmentation in the EU[J]. Weltwirtschaftliches Archiv, 2000, 136(2): 284-314.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。