企业知识搜索(内部搜索&外部搜索)

「企业知识搜索(内部搜索&外部搜索)」,覆盖 1986-2025 年,频率 年度,上市公司层级,含 20 个变量,样本量约 96,738。 复现王慧扬等(2026,科学学研究)的四个知识搜索变量:内部知识搜索(专利后向引用中的组织内自引次数)、外部技术知识搜索(合作申请专利占比)、外部市场知识搜索(

时间跨度1986-2025 年
数据频率年度
层级上市公司
变量数20
样本量96,738
是否可合并可与同主体数据集合并

字段字典

  • Symbol [股票代码] — 6位股票代码
  • StkName [证券简称] — 上市公司证券简称
  • Year [年份] — 专利申请年度与财务年度
  • Province [省份] — 公司注册地所在省份
  • ProvinceCode [省份代码] — 公司注册地省份行政区划代码
  • City [城市] — 公司注册地所在城市
  • CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
  • County [区县] — 公司注册地所在区县
  • CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
  • IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
  • IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
  • TotalApplications [专利申请总数] — 企业当年申请的专利总件数,含发明专利与实用新型,用作外部技术知识搜索指标的分母
  • InventionApplications [发明专利申请数] — 企业当年申请的发明专利件数,用于界定内部知识搜索指标的取值范围
  • MultiApplicantPatents [合作申请专利数] — 企业当年申请的专利中申请人数量超过1个的件数,用作外部技术知识搜索指标的分子
  • TopCustomerSales [前五大客户销售额] — 企业当年对前五大客户的销售额合计,单位元,用作外部市场知识搜索指标的原始值
  • HighLevelTalentStock [高层次人才存量] — 企业当年具有博士学历或中高级技术职称的员工人数,计算公式为:博士学历人数+中高级职称人数,单位人,用作人才嵌入式知识搜索指标的差分基础
  • IKS [内部知识搜索] — 参考王慧扬等(2026,科学学研究)的方法,计算公式为:企业当年申请专利的后向引用中,被引专利同属本企业的次数之和。用作研究变量,越大代表企业越倾向于挖掘组织内部的存量知识
  • ETS [外部技术知识搜索] — 参考王慧扬等(2026,科学学研究)的方法,计算公式为:当年合作申请专利数/当年专利申请总数。用作研究变量,越大代表企业与外部单位开展联合研发的广度与深度越强
  • EMS [外部市场知识搜索] — 参考王慧扬等(2026,科学学研究)的方法,计算公式为:企业当年前五大客户销售额除以1亿,单位亿元。用作研究变量,越大代表企业与核心客户之间通过市场采购关系形成的知识交互强度越高
  • EPS [人才嵌入式知识搜索] — 参考王慧扬等(2026,科学学研究)的方法,计算公式为:max(当年高层次人才存量-上年高层次人才存量,0),单位人。用作研究变量,越大代表企业通过引进高端人才获取外部知识资源的力度越大

常见问题

「企业知识搜索(内部搜索&外部搜索)」是什么数据集?
企业知识搜索(内部搜索&外部搜索),隶属创新与知识产权。复现王慧扬等(2026,科学学研究)的四个知识搜索变量:内部知识搜索(专利后向引用中的组织内自引次数)、外部技术知识搜索(合作申请专利占比)、外部市场知识搜索(
该数据集的时间范围是?
覆盖 1986-2025 年。
包含哪些变量/指标?
共 20 个变量。核心指标包括:专利申请总数、发明专利申请数、合作申请专利数、前五大客户销售额、高层次人才存量、内部知识搜索、外部技术知识搜索、外部市场知识搜索、人才嵌入式知识搜索。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
数据频率和层级是怎样的?
频率为年度,上市公司层级。
样本量有多大?
约 96,738 条观测。
数据是如何测算/获取的?
指标定义与计算方法 企业获取知识的路径可以粗分为两类:一类是向内挖掘自身已有的技术积累,把分散的研发经验重新整合、复用;另一类是向外汲取组织边界之外的新知识,以打破既有技术框架的束缚。前者能够保障技术路线的连贯性、集中资源攻克单一瓶颈,但搜索过度会形成路径锁定,使企业忽视外部涌现的技术趋势;后者能够拓宽技术视野、激活内部存量知识的潜力,但外部知识来源广泛而庞杂,筛选高价值信息本身需要付出成本。本数据集沿着这一"内生突破—外源激活"的划分,构建内部知识搜索与三种外部知识搜索共四个指标,分别刻画企业从组织内部、外部研发伙伴、下游客户与外部人才四条通道获取知识的强度。 内部知识搜索以专利的后向引用为观测窗口。专利引用被广泛视为知识流动的可追溯痕迹,一家企业在申请新专利时引用了自己名下的既有专利,即意味着它在这一次技术开发中调用了组织内部的知识存量。记企业 $i$ 在第 $t$ 年申请的专利集合为 $P{it}$,企业 $i$ 名下不限年份的全部专利集合为 $Pi$,专利 $p$ 的后向引用集合为 $BC(p)$,则 $$IKS{it} = \sum{p \in P{it}} \sum{q \in BC(p)} \mathbf{1}[\,q \in Pi\,]$$ 其中示性函数在被引专利 $q$ 同属该企业时取一、否则取零。计数按施引专利的申请年归属年度,因为知识搜索的行为发生在专利申请之时。企业名下的专利集合涵盖上市公司本身及其子公司、联营与合营企业;一件专利若同时关联多家上市公司,则向各关联主体分别计入。引用关系先按施引与被引专利的配对去重,以免同一条引用被重复累加。 外部技术知识搜索衡量企业与外部单位联合开展创新活动的程度。企业若与高校、科研机构或其他企业共同申请专利,说明其在研发环节引入了外部主体的知识与能力。以合作申请专利在当年全部专利申请中的比重表示: $$ETS{it} = \frac{\text{当年申请人数量大于一的专利件数}}{\text{当年专利申请总件数}}$$ 该比值取值于零与一之间,越大表明企业技术知识搜索的广度与深度越强。 外部市场知识搜索着眼于企业与下游客户之间通过市场采购关系形成的知识转移。企业在与核心客户的持续交易中能够获得需求信息、技术痛点与竞争动态的反馈,客户交易规模越大,这种知识交互越密集。该指标取企业当年对前五大客户的销售额合计,并折算为亿元,即 $EMS{it} = \text{前五大客户销售额} / 10^{8}$。 人才嵌入式知识搜索刻画企业通过引进高端人才把外部知识"嵌入"组织内部的力度。异质性人才带来的不仅是其本人掌握的前沿技术经验,还包括对企业既有知识潜力的激活。以企业高层次人才存量的年度净增量表示:先将企业当年具有博士学历的员工人数与具有中高级技术职称的员工人数相加,得到高层次人才存量 $HLT{it}$,再取相邻两年之差, $$EPS{it} = \max\!\left(HLT{it} - HLT{i,t-1},\; 0\right)$$ 净减员的年份取零,以使该指标只反映人才的净流入方向。存量口径在合并时做了若干去重处理:同一披露项若因多种披露来源重复出现,取其最大值;博士学历下若并列多个同义披露项,取最大值而非求和;职称若同时给出合并档与分档,以分档相加为准;博士与硕士合并计列的披露项不计入博士,否则会把硕士人数一并算进来。只有相邻两年的披露构成一致(同为仅披露博士,或同为博士与职称兼有)时才计算差分,因为披露项本身发生变化时,存量之差反映的是口径变更而非人才流动。 四个指标各自的取值范围依赖于对应的观测条件:内部知识搜索以当年是否申请发明专利为界,外部技术知识搜索以当年是否申请专利为界,外部市场知识搜索与人才嵌入式知识搜索则取决于企业是否披露客户交易与员工结构信息。 补充说明 - 样本口径:本数据集不预先施加回归样本限制,覆盖全部 A 股上市公司的企业-年观测,是否剔除金融业、限定行业或年份窗口由使用者按研究设计自行决定。面板骨架沿用项目的企业-年专利统计,包含企业上市之前的年份,以并购为识别策略或研究上市前后变化的使用者宜自行限定年份不早于上市年。 - 内部知识搜索为发明专利口径:引用数据只收录发明专利的引用关系,实用新型没有引用记录,因此该指标只反映发明专利上的内部知识搜索,其取值范围也相应以当年发明专利申请数为界——当年没有发明专利申请时记为缺失,而非记为零,以免把"没有引用记录"误读为"没有自引"。引用数据对样本期最初若干年与最近数年的覆盖明显稀疏,前者因早期引用信息录入不全,后者因专利公开与引用录入存在滞后。这一覆盖差异是乘性的,专利规模越大的企业受到的绝对影响越大,故年份固定效应无法完全吸收;建议使用者取对数后使用,并把样本窗口的上端适当前移。此外,该指标为企业层面的自引总次数,其分布尾部远高于原文报告的水平,与原文的可比性集中在横截面排序而非水平值。 - 外部技术知识搜索的分子构成:合作申请按"申请人数量大于一"认定,这是合作申请的标准定义,但其中包含同一集团内部母公司与子公司的联合申请,这部分属内部协同而非外部搜索,会使该比值相对"真实外部合作率"偏高;另一方面,本指标的绝对水平低于原文报告值,差异源于专利数据源对申请人主体的切分口径。两者方向相反,因此该指标的绝对水平不宜与原文直接对标,其横截面排序与时序变化仍可使用。当年专利申请数很小时该比值只能取到少数离散值,使用者可借助专利申请总数字段设置最小分母门槛或按专利规模加权。 - 外部市场知识搜索的量纲校验:源数据同时给出客户销售额与企业自报的占营业收入比例,两者互为印证。仅判断"销售额是否超过营业收入"只能发现金额被放大的错误,发现不了金额被整体缩小的错误,且会误删客户集中度本就接近满额的企业——前五大客户销售额为含税口径而营业收入为不含税口径,两者之比在增值税税率下本就大于一。因此本数据集改以自报占比做双向一致性校验,两者相差过大的观测记为缺失;无自报占比可校验时才退回单向判据,并为含税口径差留出容差。这是对源数据填报错误的清洗,与分布尾部的缩尾处理性质不同。 - 人才嵌入式知识搜索是代理指标:原文定义为"引进的具有中高级技术职称或博士学位的科技活动人员数量",公开披露数据无法直接提供这一数量,本数据集以全体员工中高层次人才存量的年度净增量近似。三处差异需要说明:其一,原文的"引进"是流量概念,而存量差分会同时混入内部晋升、在职学历提升与离职减员;其二,原文限定于科技活动人员,而员工结构按全体员工披露,未能限定研发岗位;其三,职称披露率远低于学历披露率,该项实际主要由博士学历人数支撑。此外,职称人数覆盖全体员工,包含会计、经济、政工等非科技岗位,在披露职称的大型企业上该指标数值显著高于原文量级,其含义更接近"高层次人才净流入"。中间字段中的高层次人才存量可供使用者判断某一企业-年的存量量级属于何种口径。 - 其他局限:一件专利同时关联多家上市公司时向各主体分别计入,这些企业的专利计数与内部知识搜索之间存在机械相关,回归时建议按企业聚类标准误。四个指标同时非缺失的观测数远小于总行数,瓶颈在人才嵌入式知识搜索,仅使用前三个指标可得的样本量要大得多;该指标的缺失还存在行业选择,研发密集行业的披露率明显更高,且其非缺失取值中相当比例为零,源于净减员年份的取零处理。使用者规划研究设计时宜先按所需变量组合核对可用样本量。 参考文献 - 王慧扬,刘建华,赵玉冰.知识搜索与科技领军企业关键核心技术突破[J].科学学研究,2026,44(6):1264-1275. - 王巍,孙笑明,崔文田,等.知识宽度与深度对内部知识搜索的影响:结构洞的调节作用[J].科技进步与对策,2019,36(23):119-128. - 余江,宋昱晓,张耀坤,等.探秘外部知识之力:如何借助外部知识推动中国集成电路企业创新?[J].科学学与科学技术管理,2025,46(2):94-108.
如何获取该数据集?
通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。