企业服务型制造技术创新
「企业服务型制造技术创新」,覆盖 1990-2025 年,频率 年度,上市公司层级,含 27 个变量,样本量约 96,712。 参考诸竹君等(2023,中国工业经济)的方法,刻画制造业企业内部服务要素投入水平的服务型制造技术创新指标组。
| 时间跨度 | 1990-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 上市公司 |
| 变量数 | 27 |
| 样本量 | 96,712 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Symbol [股票代码] — 6位股票代码
- StkName [证券简称] — 上市公司证券简称
- Year [年份] — 专利申请年度
- Province [省份] — 公司注册地所在省份
- ProvinceCode [省份代码] — 公司注册地省份行政区划代码
- City [城市] — 公司注册地所在城市
- CityCode [城市代码] — 公司注册地城市行政区划代码(6位)
- County [区县] — 公司注册地所在区县
- CountyCode [区县代码] — 公司注册地区县行政区划代码(6位)
- IndustryCode [行业代码] — 中上协行业分类代码(如C26、J66,按年度动态匹配公司当年所属行业)
- IndustryName [行业名称] — 中上协行业分类名称(按年度动态匹配公司当年所属行业)
- TotalPatentApp [专利申请总数] — 企业当年申请的专利总数(发明专利与实用新型合计,含子公司),用作服务型制造专利占比的分母
- ServicePatentCount [服务型制造专利数] — 参考诸竹君等(2023,中国工业经济)的方法,企业当年申请的服务型制造专利数量。服务型制造专利指专利摘要写明的专利目的是为制造业提供工业设计服务、供应链管理、全生命周期管理或信息增值服务之一的专利,由微调后的中文BERT语言模型逐条判读专利摘要识别
- ServicePatentStock [服务型制造专利存量] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:企业自最早申请年度起截至当年累计申请的服务型制造专利数量。服务型制造专利指专利摘要写明的专利目的是为制造业提供工业设计服务、供应链管理、全生命周期管理或信息增值服务之一的专利,由微调后的中文BERT语言模型逐条判读专利摘要识别
- IsServicePatent [是否申请服务型制造专利] — 是否当年申请了服务型制造专利(0=否,1=是),参考诸竹君等(2023,中国工业经济)的方法,对应原文的服务型制造专利虚拟变量。用作研究变量,取1代表企业当年有服务型制造技术创新产出
- LnServicePatentSum [服务型制造专利数对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年服务型制造专利申请数量加1的自然对数,刻画服务型制造技术创新的规模流量。用作研究变量,越大代表企业当年投入制造业的服务要素越多
- LnServicePatentStock [服务型制造专利存量对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:截至当年累计的服务型制造专利申请数量加1的自然对数,刻画服务型制造技术创新的规模存量。用作研究变量,越大代表企业历史累积的服务型制造技术能力越强
- ServicePatentRatio [服务型制造专利占比] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年服务型制造专利申请数除以当年专利申请总数,刻画服务型制造技术创新的相对水平,当年无专利申请的企业年度取0。用作研究变量,越大代表企业创新活动中服务型制造的强度越高
- ServicePatentPerEmployee [人均服务型制造专利数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年服务型制造专利申请数除以当年员工总数,刻画人均从业人员的服务型制造技术创新强度。员工总数缺失或披露口径断裂的年度取缺失值。用作研究变量,越大代表单位劳动力承载的服务型制造技术创新越多
- IndustrialDesignCount [工业设计服务专利数] — 参考诸竹君等(2023,中国工业经济)的方法,企业当年申请的工业设计服务类服务型制造专利数量。该类专利的目的是提升制造业的设计能力,或体现创新设计理念与新技术、新工艺、新材料在设计环节的应用
- SupplyChainMgmtCount [供应链管理专利数] — 参考诸竹君等(2023,中国工业经济)的方法,企业当年申请的供应链管理类服务型制造专利数量。该类专利的目的是合理安排工厂布局、优化生产管理流程、提高资源整合能力,涵盖共享制造、总集成总承包与生产性金融服务
- LifeCycleMgmtCount [全生命周期管理专利数] — 参考诸竹君等(2023,中国工业经济)的方法,企业当年申请的全生命周期管理类服务型制造专利数量。该类专利的目的是提供从研发设计、生产制造、安装测试到故障诊断、检验检测、回收利用的全链条服务,涵盖检验检测认证与节能环保服务
- InfoValueAddedCount [信息增值专利数] — 参考诸竹君等(2023,中国工业经济)的方法,企业当年申请的信息增值类服务型制造专利数量。该类专利的目的是综合运用第五代移动通信、互联网、人工智能、大数据等新一代信息技术,提供信息管理、信息安全与信息利用等信息价值增值服务
- LnIndustrialDesign [工业设计服务专利数对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年工业设计服务类服务型制造专利申请数量加1的自然对数,用于原文按专利类别所作的异质性检验
- LnSupplyChainMgmt [供应链管理专利数对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年供应链管理类服务型制造专利申请数量加1的自然对数,用于原文按专利类别所作的异质性检验
- LnLifeCycleMgmt [全生命周期管理专利数对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年全生命周期管理类服务型制造专利申请数量加1的自然对数,用于原文按专利类别所作的异质性检验
- LnInfoValueAdded [信息增值专利数对数] — 参考诸竹君等(2023,中国工业经济)的方法,计算公式为:当年信息增值类服务型制造专利申请数量加1的自然对数,用于原文按专利类别所作的异质性检验
常见问题
- 「企业服务型制造技术创新」是什么数据集?
- 企业服务型制造技术创新,隶属创新与知识产权。参考诸竹君等(2023,中国工业经济)的方法,刻画制造业企业内部服务要素投入水平的服务型制造技术创新指标组。
- 该数据集的时间范围是?
- 覆盖 1990-2025 年。
- 包含哪些变量/指标?
- 共 27 个变量。核心指标包括:专利申请总数、服务型制造专利数、服务型制造专利存量、是否申请服务型制造专利、服务型制造专利数对数、服务型制造专利存量对数、服务型制造专利占比、人均服务型制造专利数、工业设计服务专利数、供应链管理专利数、全生命周期管理专利数、信息增值专利数、工业设计服务专利数对数、供应链管理专利数对数、全生命周期管理专利数对数、信息增值专利数对数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,上市公司层级。
- 样本量有多大?
- 约 96,712 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 服务型制造是制造业内部生产管理流程的技术转型与创新应用,是制造业与生产性服务业融合发展所形成的专利产出。区别于以投入产出表衡量产业链关联的行业层面测算,本数据集从企业自身的专利产出出发,刻画制造业企业内部服务要素的投入程度:一项专利若其摘要写明的目的是为制造业的生产、运营与商业发展提供服务,即视为服务型制造专利。 判定标准取自十五部门《关于进一步促进服务型制造发展的指导意见》与工业和信息化部《关于开展第二批服务型制造示范遴选工作的通知》。两份文件的分类互有交叠,经归并后服务型制造专利分为四类:工业设计服务,目的在于提升制造业的设计能力,或体现创新设计理念与新技术、新工艺、新材料在设计环节的应用;供应链管理,目的在于合理安排工厂布局、优化生产管理流程、提高资源整合能力,涵盖共享制造、总集成总承包与生产性金融服务;全生命周期管理,目的在于提供从研发设计、生产制造、安装测试到故障诊断、检验检测、回收利用的全链条服务,涵盖检验检测认证与节能环保服务;信息增值,目的在于综合运用第五代移动通信、互联网、人工智能、大数据等新一代信息技术,提供信息管理、信息安全与信息利用等信息价值增值服务。 判定的唯一依据是摘要写明的专利目的,而非其所用的技术手段。一项以传感器与神经网络控制某台设备工艺参数的专利,目的仍是把产品造出来,不属服务型制造;而组织调度多台设备、车辆、人员与物料之间作业安排的方法或系统,目的是提供生产组织能力,属供应链管理。 待标注语料由两部分构成。一部分是从全部专利摘要中等概率抽取的随机样本,它服从真实分布,既提供负例,也充当后续检验识别口径是否走样的无偏基准。另一部分按四类内涵的字面表述从全库召回候选后分类抽样,用于补足正类——四个类别在全部专利中都极为稀疏,纯随机抽样得到的正例数量不足以训练一个五分类器。关键在于,字面召回只决定哪些摘要进入待标注池,每一条仍须按上述判定准则逐条作语义判读,可以推翻字面命中而判为非服务型;字面词表不进入任何标签,也不进入指标口径。 据此得到标注语料后,以该语料微调中文 BERT 预训练模型,训练集与验证集按 0.85 比 0.15 划分,学习率取 0.00001,单次传递样本量取 32,设权重衰减以防过拟合,并按早停原则在综合验证损失与准确率最优处取参数。不对类别加权——待标注池已在抽样阶段抬高了正类比重,再加权会使模型系统性多判服务型专利,进而抬高全部计数。微调所得模型对全部专利摘要作五分类(四类服务加非服务型),预测落入四类之一者即服务型制造专利;随机样本子集不参与这一放大,故可用它检验模型在全库上预测的服务型专利总量是否贴近真实总量。 在专利层完成识别后,按企业与专利申请年汇总。记企业 $i$ 在 $t$ 年申请的服务型制造专利数为 $S{i,t}$、专利申请总数为 $P{i,t}$、年末从业人员数为 $L{i,t}$,五个代理变量分别为: $$ \text{pdum}{i,t}=\mathbb{1}\{S{i,t}0\},\qquad \text{lnpsum}{i,t}=\ln(1+S{i,t}),\qquad \text{lnpstock}{i,t}=\ln\Big(1+\sum{s\le t}S{i,s}\Big) $$ $$ \text{pr}{i,t}=\frac{S{i,t}}{P{i,t}},\qquad \text{pl}{i,t}=\frac{S{i,t}}{L{i,t}} $$ 其中虚拟变量、当年数量对数与存量对数刻画服务型制造技术创新的绝对水平,前者检验是否发生,后两者分别检验规模流量与规模存量;占总专利比值与人均从业人员数量刻画相对水平,检验服务型制造的强度。存量取截至当年的累计申请数,不引入折旧参数。当年没有任何专利申请的企业年度,占比的分子与分母同时为零,取值为 0,与同一行虚拟变量取 0、数量对数取 0 的含义一致。四类专利各自的当年申请数与其加一的对数一并输出,用于按专利类别所作的异质性分析。 年度以专利申请年而非公开年或授权年计,与原文"当期(年)企业研发服务型制造专利数量"的表述一致,也使指标反映企业当年的服务要素投入决策而非事后的审查进度。五分类互斥,因此四类专利的当年申请数之和恰等于当年服务型制造专利总数。专利的企业归属含上市公司本身及其子公司、联营企业与合营企业;一项专利涉及多家上市公司时归入每一家,同一专利在同一家公司只计一次。 补充说明 - 样本口径:输出全部 A 股企业年度面板,无服务型制造专利的企业年度计数为零,不预先施加行业或样本期限制。原文样本限定制造业,而非制造业企业的取值衡量的是其主营业务的技术属性——银行的内部信息系统、快递企业的分拣调度、电力企业的设备状态监测字面上符合四类定义,实质并非制造业与生产性服务业的融合。主分析建议限制在行业代码以 C 开头的制造业子样本。 - 标注人力的替代:原文由人工对照摘要识别专利目的,标注语料与模型权重均未公开。本数据集改由大语言模型按上述四类内涵逐条判读,判定准则随包分发;BERT 架构、训练超参数与训练验证划分比例均照原文设定。绝对水平取决于标注尺度,不宜跨标注来源比较,相对排序可用。 - 识别精度与使用建议:在无偏且样本外的验证子集上,二元判定的精确率与召回率均在六成上下,预测的服务型专利总量与真实总量之比接近 1——总量校准良好是假阳性与漏判相抵的结果,不等于逐条判准。假阳性作用在全部专利上,专利越多的企业获得越多,构成与企业创新规模同向的测量误差,而非只造成向零衰减的经典测量误差;计数类字段因此与专利总数中等相关,占比口径基本免疫。建议以占比为核心口径,计数口径须同时控制企业创新规模与企业、年份双固定效应。 四类之中信息增值的验证 F1 明显低于其余三类,四个异质性字段的可靠性低于总量口径,其中信息增值一列最弱,不宜作为独立结论。 - 与原文分类构成的差异:本数据集中工业设计服务与信息增值的占比高于原文按类别检验所反映的构成,供应链管理则更低。一是语料构成:实用新型的服务型比例远低于发明专利(中国实用新型仅保护产品的形状构造,方法与系统类专利在法律上无法以实用新型申请,这一悬殊差异本身即构念效度的证据),原文样本以中小工业企业的实用新型为主,本数据集以上市公司的发明专利为主。二是标注边界:语料构成无法单独解释供应链管理被压低而信息增值被抬高,本判定准则对这两类的划界与原文人工标注者不同。经检验样本期不同不是原因。 - 人均口径的分母:原文用工业企业数据库的年末从业人数,本数据集用上市公司披露的员工总数。该字段起始年份晚于面板起点,此前年度人均口径不存在;缺失非随机,缺失年度的专利数量与服务型专利发生率均明显低于可用年度,以人均口径回归相当于系统性剔除规模较小、创新较少的企业,建议只作稳健性检验。分子含子公司专利而分母为上市公司披露口径,两端不完全对齐;个别年度披露员工数相对本企业历史水平塌陷一个数量级,属口径断裂,已置为缺失。 - 末年不完整且构成失衡(最需注意):面板覆盖到上一自然年。专利自申请到公开存在滞后,末年数据必然不完整,且不完整性在专利类型之间高度不均衡——实用新型的到位比例明显低于发明专利,使末年的专利类型构成大幅偏向发明专利。由于实用新型的服务型制造比例近乎为零而发明专利要高出两个数量级,分母构成的这一突变会机械抬高占比口径,末年的占比与四类构成因此不可与前期直接比较;计数口径因服务型制造专利绝大多数是发明专利而受影响小得多,但仍偏低;存量口径受影响最小。跨年比较或以占比为核心口径时,建议把末年单独处理或剔除。 该现象每年重复出现:每次数据刷新后新的末年都会有同样性质的构成偏差,而上一个末年会随新一批公开数据补齐而趋于完整。 - 年度趋势与面板结构:虚拟变量与数量对数的年度水平单调上升,既有文本内容的真实转向,也含企业平均专利数量增长的机械效应与发明专利占比上升的构成效应,绝对水平不可跨年解读,须含年份固定效应。面板骨架覆盖企业首个专利申请年及之后全部年度,其中相当一部分早于上市年份且按当前名称与子公司关系回填,做上市公司面板回归时建议按上市日过滤。 - 其他局限:医药制造与农林牧渔、住宿餐饮、教育、科技推广等门类中多数公司整个样本期虚拟变量恒为零(药物配方与制备工艺按判定准则本属非服务型),加企业固定效应后子样本几乎无识别力,不宜在其上做分组回归。原始输出不作缩尾处理。 参考文献 - 诸竹君,谢然成,郭志芳,余骁.服务型制造技术创新与企业劳动要素市场势力——基于BERT语言模型的微观证据[J].中国工业经济,2023,(12):135-152. - Devlin J, Chang M W, Lee K, et al. BERT: Pre-training of deep bidirectional transformers for language understanding[C]//Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Stroudsburg: Association for Computational Linguistics, 2019: 4171-4186.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。