企业异地扩张(异地城市分布熵)

「企业异地扩张(异地城市分布熵)」,覆盖 1999-2025 年,频率 年度,上市公司层级,含 17 个变量,样本量约 61,722。 参考戴一鑫、王译潇(2023,中国地质大学学报社会科学版)的方法,基于上市公司境内子公司在地级市层面的地理分布,用熵指数度量企业跨地区(异地)扩张的多元化程度。

时间跨度1999-2025 年
数据频率年度
层级上市公司
变量数17
样本量61,722
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 报告年度(子公司情况表的报告期末年份)
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • NSubDomestic [境内子公司数量] — 企业当年去重后境内(注册地在中国大陆)子公司数量,为异地扩张熵指数的计算基数。
  • NCrossCitySub [异地子公司数量] — 企业当年注册城市与母公司注册城市(地级市)不同的子公司数量,即异地子公司数,用作熵指数的计算样本。
  • NCrossCity [异地城市数量] — 企业当年异地子公司分布的不同地级市数量。
  • CityMatchRate [城市识别率] — 可成功定位到地级市的境内子公司占全部境内子公司的比例,计算公式为:可定位城市的境内子公司数/境内子公司总数,用于反映该观测异地分布度量的数据完整度(越接近1越可靠),为数据质量指示字段,非研究变量。
  • CrossRegionExpansion [企业异地扩张] — 参考戴一鑫、王译潇(2023,中国地质大学学报社会科学版)的方法,采用熵指数度量企业异地扩张的地理多元化程度,计算公式为:gd=Σ P_r×ln(1/P_r),其中P_r为企业当年注册于地级市r的异地子公司数量占其异地子公司总数的比重(异地指子公司注册城市不同于母公司注册城市)。用作研究变量,越大代表企业异地扩张的目标城市越多元、外部知识来源越广。
  • CrossRegionExpansionHHI [异地扩张(注册资本口径)] — 参考戴一鑫、王译潇(2023,中国地质大学学报社会科学版)稳健性检验的方法,基于异地子公司注册资本构建的赫芬达尔数值等价指标,计算公式为:gd^HHI=1/Σ(capital_r/S)²,其中capital_r为企业当年注册于地级市r的异地子公司注册资本之和,S为其异地子公司注册资本总和。用作异地扩张的稳健性替代度量,越大代表按注册资本加权的异地城市分布越分散;无异地子公司时取0,异地子公司注册资本全缺失时取空值。

常见问题

「企业异地扩张(异地城市分布熵)」是什么数据集?
企业异地扩张(异地城市分布熵),隶属公司治理。参考戴一鑫、王译潇(2023,中国地质大学学报社会科学版)的方法,基于上市公司境内子公司在地级市层面的地理分布,用熵指数度量企业跨地区(异地)扩张的多元化程度。
该数据集的时间范围是?
覆盖 1999-2025 年。
包含哪些变量/指标?
共 17 个变量。核心指标包括:境内子公司数量、异地子公司数量、异地城市数量、城市识别率、企业异地扩张、异地扩张(注册资本口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 61,722 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业异地扩张刻画上市公司通过在本地之外的地区设立子公司、构建跨地区投资联系网络的地理多元化程度。企业向不同地区扩张,可以借助多样的知识来源渠道,在不同城市获取差异化的资源与知识溢出,从而丰富自身的知识基础。本指标参考戴一鑫、王译潇(2023)的方法,基于上市公司境内子公司在地级市层面的地理分布,采用熵指数度量企业跨地区(异地)扩张的多元化水平。 计算的基础是识别企业的"异地子公司"。将子公司的注册地统一识别至地级市层面后,若某子公司的注册城市不同于母公司的注册城市,则视其为异地子公司。在此基础上,核心指标以熵指数刻画异地子公司在各城市间的分布多元性: $$gd = \sum{r} P{r}\,\ln\!\left(\frac{1}{P{r}}\right)$$ 其中 $r$ 遍历企业当年异地子公司所分布的各个地级市,$P{r}$ 表示企业当年注册于城市 $r$ 的异地子公司数量占其异地子公司总数的比重。该指标值越高,表明企业异地扩张的目标城市越多元化,潜在的外部知识来源就越多样。当企业没有异地子公司时,该指标取 0。为便于机制分析,同时给出计算链上的中间构件:境内子公司数量(去重后注册地在中国大陆的子公司数)、异地子公司数量(构成上式的样本)与异地城市数量(异地子公司分布的不同地级市数)。 为反映度量的数据完整度,另给出城市识别率,即可成功定位到地级市的境内子公司占全部境内子公司的比例;该字段用于评估单个观测异地分布度量的可靠性,越接近 1 越可靠,本身不作为研究变量使用。 作为稳健性替代度量,进一步基于异地子公司的注册资本构建赫芬达尔数值等价指标: $$gd^{HHI} = 1\left/\sum{r}\left(\frac{capital{r}}{S}\right)^{2}\right.$$ 其中 $capital{r}$ 为企业当年注册于城市 $r$ 的异地子公司注册资本之和,$S$ 为其异地子公司注册资本总和。该指标以注册资本而非子公司数量为权重刻画异地城市分布的分散程度,值越大表明按注册资本加权的异地城市分布越分散。无异地子公司时取 0。 补充说明 - 样本范围为注册地在中国大陆的境内子公司,剔除注册地不在中国大陆(境外及港澳台)的子公司;不剔除金融行业。子公司数据按企业—年份—子公司名称去重,避免同一子公司在同一年度快照内重复计数。 - 母公司所在城市采用其当前注册城市(静态口径)。受限于历史注册城市时序数据的缺失,无法识别并剔除样本期内母公司发生城市迁址的样本,故以当前城市近似,极少数迁址公司在迁址前后年份的异地判定可能存在偏差。 - 子公司注册地为自由文本,经全国行政区划名录统一识别至地级市。非空注册地的城市匹配率约为 91%;注册地仅精确到省级或无法定位到城市的子公司不计入熵计算,可能小幅低估指标值。早年子公司注册地披露完整度较低,城市匹配率随年份上升(约由本世纪初的五成升至 2009 年后的九成以上),因此指标的时间上升趋势部分由披露完整度改善驱动;进行时间趋势或双重差分研究时,建议加入年份固定效应或限定样本起始年份。 - 注册资本口径的稳健指标使用注册资本原值。境内子公司注册资本存在较高缺失(约 46%):当企业有异地子公司但其注册资本全部缺失时,该稳健指标记为缺失值而非 0(以区别于"无异地多元化");有部分注册资本时按可得资本的子集计算。极少数境内子公司以外币计注册资本,因该指标为同一企业内部的份额平方和(尺度自相消),影响可忽略。 - 需要说明的是,熵指数 $\sum{r}P{r}\ln(1/P{r})$ 在数学上以异地城市数量的对数为上界,就本样本而言约为 6 以内;本数据集严格按上式实现,取值区间与该数学上界一致。本数据集核心指标的样本均值略低于原文所报告的描述性统计,一方面因城市匹配率(约 91%)与本地-only 企业年的纳入,另一方面原文所报告的取值上界超出该熵公式的数学上界(不可能由该公式产生),故本数据集以数学正确的实现为准。 参考文献 - 戴一鑫,王译潇.企业异地扩张、技术获取与企业创新——基于上市公司设立子公司的经验证据[J].中国地质大学学报(社会科学版),2023,23(1):102-115.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。