子母公司技术关联度(N-gram重叠系数)

「子母公司技术关联度(N-gram重叠系数)」,覆盖 1999-2025 年,频率 年度,上市公司层级,含 14 个变量,样本量约 61,631。 参考戴一鑫、王译潇(2023)的方法,基于母公司与其全部子公司经营范围文本的N-gram重叠系数相似度,衡量子母公司业务技术关联程度(论文变量link)。

时间跨度1999-2025 年
数据频率年度
层级上市公司
变量数14
样本量61,631
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 会计年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • NSubsidiary [参与计算的子公司数量] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))的方法,计算公式为:当年(按子公司名称去重后)纳入技术关联度计算的有效子公司个数,即经营范围文本非空的子公司数量。用作规模/机制控制变量。
  • TechRelatedness [子母公司技术关联度] — 参考戴一鑫、王译潇(2023,中国地质大学学报(社会科学版))的方法(论文变量link),基于关键词匹配的N-gram方法衡量母公司与其全部子公司的业务技术关联程度。计算公式为:将母公司与每个子公司的经营范围文本分别切分为相邻两个中文字符组成的二元字符组(bigram)集合,两集合的重叠系数=交集元素个数除以较小集合的元素个数,再对当年所有子公司的重叠系数取算术平均。用作研究变量,取值越大代表子母公司业务技术关联度越高。注:受子公司经营范围源数据2014-2015年口径变化影响,该指标跨2014-2015存在向上断点,做时序分析建议控制年份固定效应。
  • TechRelatednessCos [子母公司技术关联度(余弦相似度口径)] — 本数据集在核心口径基础上提供的稳健性口径(非戴一鑫、王译潇(2023)原文指标,用于检验技术关联度结论不依赖特定文本相似度度量的选择)。计算公式为:将核心口径中的重叠系数替换为余弦相似度,即母公司与子公司经营范围bigram集合交集元素个数除以两集合元素个数乘积的平方根,再对当年所有子公司取算术平均。取值越大代表关联度越高;因母子公司经营范围文本长度差异,其绝对水平偏低,仅供稳健性参照。

常见问题

「子母公司技术关联度(N-gram重叠系数)」是什么数据集?
子母公司技术关联度(N-gram重叠系数),隶属创新与知识产权。参考戴一鑫、王译潇(2023)的方法,基于母公司与其全部子公司经营范围文本的N-gram重叠系数相似度,衡量子母公司业务技术关联程度(论文变量link)。
该数据集的时间范围是?
覆盖 1999-2025 年。
包含哪些变量/指标?
共 14 个变量。核心指标包括:参与计算的子公司数量、子母公司技术关联度、子母公司技术关联度(余弦相似度口径)。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 61,631 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业通过设立子公司进行扩张时,子公司既可能延续母公司的主营业务,也可能进入与母公司差异较大的新业务乃至新行业。母公司与子公司之间的业务技术关联程度越高,集团内部的知识溢出与技术转移越顺畅,异地扩张所能带来的创新收益也越大。参考戴一鑫、王译潇(2023)的方法,本数据集基于母公司与其子公司"经营范围"文本的相似度,构建子母公司技术关联度指标(论文变量 $link$)。 核心思想是用关键词匹配的 N-gram 方法度量两段经营范围文本的重合程度。对母公司 $i$ 与其某个子公司 $j$,先将各自的经营范围文本清洗为纯中文字符序列,再切分为由相邻两个汉字组成的二元字符组(bigram)集合,记为 $G{par,i}$ 与 $G{sub,j}$;对清洗后不足两字的极短文本,退化为单字集合,以保证该子公司仍能参与相似度计算而不被整体丢弃。二者的文本相似度采用重叠系数(overlap coefficient)度量,即两集合交集元素个数除以较小集合的元素个数: $$sim(i,j)=\frac{|G{par,i}\cap G{sub,j}|}{\min\left(|G{par,i}|,\ |G{sub,j}|\right)}$$ 之所以采用重叠系数而非 Jaccard、Dice 等其他 N-gram 集合相似度,是因为母公司经营范围通常为详尽长文本,而大量子公司的经营范围为简短的行业性表述,两者长度高度不对称;重叠系数以较短文本为分母,正对应"子公司业务在多大程度上被母公司业务所覆盖"这一技术关联含义。经与原文报告的相似度水平校准,重叠系数口径能够重现该指标 $0.20\sim0.36$ 的取值区间,而对长度差异敏感的其他度量则系统性偏低约一个数量级。 在个体—年度层面,母公司 $i$ 在第 $t$ 年的子母公司技术关联度定义为其当年全部子公司相似度的算术平均: $$link{it}=\frac{1}{N{it}}\sum{j=1}^{N{it}} sim(i,j)$$ 其中 $N{it}$ 为当年纳入计算的有效子公司个数(按子公司名称去重、经营范围文本非空),作为规模与机制控制变量一并输出。指标取值介于 $0$ 与 $1$ 之间,越大表示母公司与其子公司整体的业务技术关联度越高。 作为稳健性口径,本数据集额外提供将重叠系数替换为余弦相似度后的技术关联度(该口径为本数据集提供,并非原文指标): $$sim{cos}(i,j)=\frac{|G{par,i}\cap G{sub,j}|}{\sqrt{|G{par,i}|\cdot|G{sub,j}|}}$$ 其余步骤(对当年所有子公司取均值)与核心口径一致。该口径与核心口径从不同角度刻画文本重合,用于检验技术关联度的结论不依赖于特定文本相似度度量的选择。由于母子公司经营范围文本长度差异较大,其绝对水平偏低,宜作稳健性参照而非可独立解释的关联度水平。 补充说明 - 样本为个体—年度面板,主键为公司代码与年份;同一子公司在同一年内的重复记录按子公司名称去重后计一次;母公司或子公司经营范围文本缺失、以及清洗后为空的记录不参与计算;每个公司—年至少包含一个有效子公司;不剔除金融行业;年份范围由数据自动确定,不设固定区间。核心指标按原始值输出,不作缩尾处理。 - 时间可比性断点:子公司经营范围文本的详略程度在 2014—2015 年前后发生明显变化(文本中位长度由约 12 字降至约 4 字,简短行业性表述占比大幅上升)。由于重叠系数以较短文本为分母,短文本更易被母公司长文本完全覆盖而使相似度系统性偏高,指标因此在 2014—2015 年附近出现向上断点(对 2000—2016 年始终存在的公司构成平衡面板后趋势依然向上,说明该断点并非样本构成变化所致)。使用者在进行时间序列、双重差分或面板固定效应分析时,应控制年份固定效应、避免跨 2014—2015 断点直接解读系数,或将样本限定于 2016 年之后的口径稳定期;截面分析不受此影响。 - 度量固有性质:重叠系数使该指标与母公司经营范围文本的冗长程度存在正相关(经营范围表述越详尽,越易覆盖子公司的简短业务词),因而可能混入母公司信息披露风格与业务多元度等构念外因素;将该指标用作被解释变量时需注意这一内生纠缠。 - 母公司经营范围采用最新一期的静态文本进行匹配,逐年指标的变化仅来自子公司集合的年度变化。对早年样本而言,以当前经营范围匹配历史子公司会带来一定的前视偏误,做早年因果推断时应在方法部分予以说明。 参考文献 - 戴一鑫,王译潇.企业异地扩张、技术获取与企业创新——基于上市公司设立子公司的经验证据[J].中国地质大学学报(社会科学版),2023,23(1):102-115.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。