企业知识复杂性(IPC共现重组潜力)
「企业知识复杂性(IPC共现重组潜力)」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 15 个变量,样本量约 71,565。 基于上市公司及其子公司、合营企业与联营企业申请的发明专利,以国际专利分类号前四位小类表征知识领域,测度企业内部各知识领域之间的相互依赖程度。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 15 |
| 样本量 | 71,565 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 观测年份
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- PatentCount5Y [前五年专利数] — 参考刘凤朝等(2021,科研管理)的方法,计算公式为:观测年之前连续五个年度(不含观测年)内,该上市公司及其子公司、合营企业、联营企业作为专利权人申请的发明专利件数之和,同一件专利只计一次,仅计入标注了有效国际专利分类号的专利。反映知识复杂性所依据的专利池规模,件数过少时知识复杂性由个别专利决定
- KnowledgeFieldCount [知识领域数] — 参考刘凤朝等(2021,科研管理)的方法,计算公式为:上述五年期发明专利所标注的国际专利分类号前四位(小类)去重后的个数,一个小类代表一个知识领域,该数值即知识复杂性求和式中知识领域的个数
- FieldOccurrenceTotal [知识领域出现次数总和] — 参考刘凤朝等(2021,科研管理)的方法,计算公式为:五年期内各知识领域在发明专利中出现次数的合计数,等于每件专利所涉知识领域个数的加总,用作知识复杂性求和式中出现次数占比权重的分母
- KC [企业知识复杂性] — 参考刘凤朝等(2021,科研管理)的方法,先计算每个知识领域的重组潜力,即与该知识领域共同出现在同一件发明专利中的其他知识领域数量之和,除以包含该知识领域的专利件数;再以各知识领域出现次数占全部知识领域出现次数的比重为权重加权求和。计算公式为:知识复杂性=Σ(知识领域出现次数占比×该知识领域的重组潜力)。用作研究变量,数值越大代表企业各知识领域之间的相互依赖程度越高,改动一个知识领域越容易牵涉其他领域
常见问题
- 「企业知识复杂性(IPC共现重组潜力)」是什么数据集?
- 企业知识复杂性(IPC共现重组潜力),隶属创新与知识产权。基于上市公司及其子公司、合营企业与联营企业申请的发明专利,以国际专利分类号前四位小类表征知识领域,测度企业内部各知识领域之间的相互依赖程度。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 15 个变量。核心指标包括:前五年专利数、知识领域数、知识领域出现次数总和、企业知识复杂性。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 71,565 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 企业的知识基础并不是一堆彼此孤立的知识元素,而是一个有结构的架构:某些知识领域之间联系紧密,往往被同时调用来解决同一个技术问题;另一些则相对独立,可以单独修改而不牵动其余部分。知识复杂性刻画的正是这种领域间的相互依赖程度。依赖程度越高,企业在做技术重组时越是牵一发而动全身——对一个领域的改动可能波及多个相邻领域,配适成本上升、结果的可预测性下降;与此同时,紧密耦合也意味着企业内部特有的知识组合方式更难被外部模仿与解读。因此该指标既被用来刻画企业知识架构的固有属性,也常被用作研发合作情境下的调节变量,解释为什么同样的外部知识对不同企业产生不同的创新回报。 测度的观测单元是知识领域。本数据集以国际专利分类号的前四位(小类)作为一个知识领域,例如同一个小类下的全部技术方案视为同一知识领域。当一件专利同时被标注到两个及以上的小类时,就意味着这几个知识领域在这项发明中被共同调用,领域之间存在实际的依赖关系;反之,只标注单一小类的专利不提供任何领域间依赖的信息。指标的全部信息来源正是这种"同一件专利内的多领域共现"。 计算依据的专利池是焦点企业在观测年之前连续五个年度(不含观测年)申请的发明专利。采用申请年而非授权年,是因为申请时点更贴近研发活动实际发生的时间;采用滚动窗口而非全部历史,是为了让指标反映企业当前的知识架构而非早已弃用的技术积累;窗口不含观测年,则保证指标在解释当年结果时具有时序上的先行性。 在此基础上,先为每一个知识领域计算重组潜力。记 $E{ik}$ 为企业 $i$ 的知识领域 $k$ 的重组潜力,其定义为窗口期内与领域 $k$ 共同出现的其他知识领域的总量,除以包含领域 $k$ 的专利件数: $$E{ik}=\frac{\text{与知识领域 }k\text{ 共同出现的其他知识领域的总量}}{\text{包含知识领域 }k\text{ 的专利总量}}$$ 其中分子按专利逐件累加:每一件包含领域 $k$ 的专利,若该专利共涉及 $np$ 个知识领域,则它为分子贡献 $np-1$ 个共同出现的其他领域。因此 $E{ik}$ 可以读作"平均每一件涉及领域 $k$ 的专利,还同时牵动了多少个其他领域"。某个领域总是单独出现时其重组潜力为零,总是与多个领域捆绑出现时其重组潜力较高。 再把各领域的重组潜力加总为企业层面的指标。权重取该领域在企业专利中的出现次数占全部知识领域出现次数之和的比重,记为 $g{ik}$,即使用频繁的领域在企业知识架构中的分量更重。企业 $i$ 在第 $t$ 年的知识复杂性为: $$KC{i,t}=\sum{k} g{ik}\times E{ik},\qquad g{ik}=\frac{nk}{\sum{j} nj}$$ 其中 $nk$ 为窗口期内包含领域 $k$ 的专利件数。把两式代入并整理可得一个等价的闭式表达:由于权重的分母恰好等于各件专利所涉领域数的加总,逐领域求和的结果可以直接写成按专利聚合的形式 $$KC{i,t}=\frac{\sum{p} np\left(np-1\right)}{\sum{p} np}$$ 这一形式说明知识复杂性实质上是"每件专利额外牵动的知识领域数"的加权平均,权重与专利本身涉及的领域数成正比,因而多领域专利对指标的贡献被放大。本数据集按闭式计算,并在生产过程中对随机抽取的企业年用逐领域求和的原始形式做了逐一复核,两种算法的结果在浮点精度内完全一致。取值下界为零,对应窗口期内全部专利都只标注单一小类的情形;取值没有固定上界,理论上等于专利平均涉及领域数减一的加权版本。 这一代数结构同时界定了指标承载的信息:知识复杂性只取决于"每件专利涉及几个知识领域"的分布,而不区分共现具体发生在哪一对领域之间。两家企业只要专利的领域数分布相同,即便一家的共现集中在少数几对领域上、另一家分散在互不相交的领域对上,取值也相同。由此可推出一个容易被误读但完全正确的情形:某企业的专利覆盖了很多知识领域,但每件专利都只标注单一小类,其知识复杂性为零——这些领域从未被同时调用,领域之间的依赖确实不存在。知识领域的数量是知识多样性问题,领域之间的牵连才是复杂性问题,原文也正是把二者分设为两个变量。相应地,本指标与基于共现网络结构的分解性、耦合度一类测度刻画的是知识基的不同侧面,不能相互替代,联合使用时也不必担心共线。 数据集同时给出三个构成量,便于使用者复核与设定样本条件:窗口期内的发明专利件数、这些专利覆盖的知识领域去重个数(即上式中求和的项数),以及各知识领域出现次数的合计数(即权重的分母)。三个构成量与核心指标口径一致,均只计入标注了有效分类号的专利,极少数缺少可识别分类号的专利不进入任何一项计算。 补充说明 - 样本口径:输出为全部上市公司自上市年至退市年的年度面板,不预先剔除行业与板块,也不施加最小专利数门槛。窗口期内没有专利申请、或专利均无有效分类号的企业年,知识复杂性为缺失,三个构成量取零;使用者可按专利件数自行设定样本条件。 - 共现计数口径:原文对分子"共同出现的其他知识领域的总量"未写明是按专利逐件累加、还是跨专利去重后取集合大小。本数据集采用逐件累加:一方面它与原文"一条专利有多个技术分类号即表明领域间依赖程度较高"的文字定义直接对应;另一方面在与原文对齐的行业与区间上,逐件累加口径的指标均值与原文报告值高度接近,去重口径则明显偏低。 - 专利主体范围:原文表述为检索专利权人为上市企业的专利。考虑到相当比例的研发成果登记在集团内子公司名下,本数据集纳入上市公司本身及其子公司、合营企业与联营企业名下的发明专利。在与原文对齐的行业与区间上,该口径的指标均值与原文报告值的接近程度优于仅取上市公司本身的口径。由多家上市公司联合申请的专利会同时计入各家的专利池。需要注意的是,合营与联营企业按权益法核算、不并入合并报表,与总资产、研发支出等并表控制变量存在口径差异;少数企业的专利池以联营合营为主,剔除后取值会有可察觉的变动。涉及研发合作伙伴选择的研究尤应留意:联营企业本身常是研发合作的产物,把其专利计入焦点企业知识基可能形成机制上的循环,建议做剔除合营联营的稳健性检验。 - 专利池的最小规模:指标为比值形式,窗口期内专利极少时取值由个别专利完全决定,方差显著大于专利池充裕的企业;另有一部分企业年取值为零,对应其全部专利都只标注单一小类。原文样本为有研发合作关系的企业年,专利池普遍较大,未面临这一情形。建议在回归中控制专利规模或设定最小件数门槛。另需区分两种不同的情形:取值为零表示企业有专利但各领域从未同时出现,取值缺失表示窗口期内没有可用专利,二者含义完全不同,不应把缺失一律填充为零。 - 时间可比性:指标存在明显的上升趋势,来源是专利分类标引实践的变化而非企业知识架构的变迁——这一上升在同一批企业内部、在各个技术大部内部同步发生,且已排除专利公开滞后带来的选择性与板块构成变化。因此跨年度的水平比较没有意义;不含年度固定效应的设定会被这条趋势主导;以近十年为窗口的双重差分,指标的自然上升与"处理后时期"高度共线,须报告平行趋势检验,并辅以年内标准化(年度标准分或年内百分位秩)的稳健性结果。 - 序列相关与窗口重叠:五年滚动窗口使相邻年度的专利池高度重叠,指标的一阶自相关很高,专利池越大越接近不变,相当比例的企业年与上一年取值完全相同;双向固定效应吸收后剩余的可用变异有限。事件研究设计需要留出足够的缓冲期,否则处理前后期会通过重叠窗口相互污染。 - 与原文描述统计的对齐程度:限定为原文的行业、区间以及"窗口期内有联合申请专利即存在研发合作关系"的样本口径后,本数据集的均值与取值上界同原文报告值高度一致;离散度则低于原文报告值,且不随样本筛选条件的变化而收敛,推测与原文观测数远少于本数据集有关。使用者可以对照原文的均值与取值范围,但不宜直接对照原文回归系数的量级,自变量方差不同会系统性改变系数大小。 - 跨行业可比性:分类体系对化学、材料与医药类发明同时按物质结构和用途双重标引,此类专利天然跨越更多小类,因此化工材料类行业的取值系统性高于电子信息类行业。该差异反映分类体系的标引惯例而非技术先进程度,原文在单一行业内部使用该指标;跨行业使用时建议加入行业固定效应。 - 其他局限:专利自申请到公开存在约一年半的滞后,窗口右端年度的专利仍在回补,会小幅压低专利池规模,但因指标为比值形式且窗口不含观测年,对取值水平的影响小于对件数的影响;早期年度专利记录稀疏,窗口落在数据覆盖起点附近的企业年取值波动较大;企业上市之前的年份不出现在面板中,尽管这些年份的专利本身已被纳入其后各窗口的计算。 参考文献 - 刘凤朝,罗蕾,张淑慧.知识属性、知识关系与研发合作企业创新绩效[J].科研管理,2021,42(11):155-163. - Yayavaram S, Chen W R. Changes in firm knowledge couplings and firm innovation performance: The moderating role of technological complexity[J]. Strategic Management Journal, 2015, 36(3): 377-396.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。