各省技术进入与退出
「各省技术进入与退出」,覆盖 1985-2025 年,频率 年度,省级层级,含 7 个变量,样本量约 1,271。 参考马双等(2020)的方法,以相对技术优势(RTA)判定各省级行政区在各IPC技术类别上是否具备优势,比较相邻两年的优势技术组合,测度技术进入数量(上年不具备
| 时间跨度 | 1985-2025 年 |
|---|---|
| 数据频率 | 年度 |
| 层级 | 省级 |
| 变量数 | 7 |
| 样本量 | 1,271 |
| 是否可合并 | 可与同主体数据集合并 |
字段字典
- Province [省份] — 省级行政区名称
- ProvinceCode [省份代码] — 省级行政区划代码(GB/T 2260六位码)
- Year [年份] — 专利申请年
- RTATechCount [优势技术类别数] — 参考马双等(2020,地理研究)的方法,计算公式为:该省当年相对技术优势指数RTA大于等于1的IPC三位技术类别个数,其中相对技术优势指数RTA=(该省某技术类别专利件数/该省全部类别件数)/(全国该类别件数/全国全部类别件数),大于等于1记为具备优势。用作研究变量,越大代表该省具备相对技术优势的技术领域越广
- RTATechCountLag [上年优势技术类别数] — 该省上一年相对技术优势指数RTA大于等于1的IPC三位技术类别个数,即优势技术类别数的滞后一期值,为技术进入数与技术退出数提供基数参照
- TechEntry [技术进入数] — 参考马双等(2020,地理研究)的方法,计算公式为:该省上年不具备而本年具备相对技术优势的IPC三位技术类别个数,其中相对技术优势指数RTA=(该省某技术类别专利件数/该省全部类别件数)/(全国该类别件数/全国全部类别件数),大于等于1记为具备优势。用作研究变量,越大代表该省当年新增的优势技术领域越多
- TechExit [技术退出数] — 参考马双等(2020,地理研究)的方法,计算公式为:该省上年具备而本年不具备相对技术优势的IPC三位技术类别个数,其中相对技术优势指数RTA=(该省某技术类别专利件数/该省全部类别件数)/(全国该类别件数/全国全部类别件数),大于等于1记为具备优势。用作研究变量,越大代表该省当年消失的优势技术领域越多
常见问题
- 「各省技术进入与退出」是什么数据集?
- 各省技术进入与退出,隶属科技创新。参考马双等(2020)的方法,以相对技术优势(RTA)判定各省级行政区在各IPC技术类别上是否具备优势,比较相邻两年的优势技术组合,测度技术进入数量(上年不具备
- 该数据集的时间范围是?
- 覆盖 1985-2025 年。
- 包含哪些变量/指标?
- 共 7 个变量。核心指标包括:优势技术类别数、上年优势技术类别数、技术进入数、技术退出数。完整字段清单(变量名·中文名·说明)见页面「字段字典」。
- 数据频率和层级是怎样的?
- 频率为年度,省级层级。
- 样本量有多大?
- 约 1,271 条观测。
- 数据是如何测算/获取的?
- 指标定义与计算方法 区域多样化是区域增长的重要手段,其表现形式是技术组合的持续更替:一些技术领域在本地新形成竞争优势,另一些则失去既有优势。马双、曾刚与张翼鸥把这两个方向的变动分别称为技术进入与技术退出,并以相对技术优势作为"是否具备某项技术"的统一判据。本数据集按该文的方法,在省级行政区层面逐年测度技术组合的新增与消失。 测度的前提是判定一个地区在某一技术领域上是否具备优势。一个地区有专利产出的技术领域并不都构成它的技术基础,只有那些相对全国而言产出份额偏高的领域,才称得上具备相对技术优势。沿用原文的区位熵式定义,区域 $r$ 在技术类别 $i$ 上第 $t$ 年的相对技术优势为 $$RTA{r,i,t}=\begin{cases}1, & \dfrac{patents{r,i,t}\big/\sumi patents{r,i,t}}{\sumr patents{r,i,t}\big/\sumr\sumi patents{r,i,t}}\ \ge\ 1\\[2mm] 0, & \text{其他}\end{cases}$$ 其中 $patents{r,i,t}$ 为区域 $r$ 在第 $t$ 年、技术类别 $i$ 上的专利申请件数。分子是该区域内部的技术结构份额,分母是全国层面同一技术类别的份额,二者之比不小于 1 意味着该区域在这一技术上的专业化程度高于全国平均水平。这一构造与区位熵同形:它衡量的是相对专业化而非绝对规模,因此专利总量很大但高度集中于少数领域的地区,其优势技术领域数未必多于总量较小而门类均衡的地区。分子与分母均按当年的全国口径构造,逐年独立判定。技术类别依专利分类号的三位分类码划分,原文将全部专利划分为 124 类;本数据集不固定这一数目,而取样本期内实际观测到的分类码全集,以保证数据每年重新生成时不会因新分类码出现而失效。 在逐年的优势判定之上,比较相邻两年的优势技术组合即可得到两个核心指标。按原文的定义,进入技术是前一期不具备而现期进入该区域的技术类别,退出技术是前一期具备而现期不具备的技术类别,因而 $$Entry{r,t}=\big|\{\,i: RTA{r,i,t}=1 \ \text{且}\ RTA{r,i,t-1}=0\,\}\big|$$ $$Exit{r,t}=\big|\{\,i: RTA{r,i,t}=0 \ \text{且}\ RTA{r,i,t-1}=1\,\}\big|$$ 两者互为反面,共同刻画区域技术组合的更替强度。数据集同时给出当年与上一年具备相对技术优势的技术类别数,前者即原文技术复杂性测度中的技术多样性,二者为进入退出数量提供了基数参照——同样是进入十个技术领域,对优势领域本就稀少的地区与对门类齐全的地区,含义并不相同,使用者可据此自行构造标准化的进入率或退出率。 原文进一步发现,技术进入与退出在空间上呈现强烈分化,东部地区的技术动态变化远比中西部剧烈;并且二者都与技术关联性系统相关——与本地已有技术密切相关的技术更有可能进入该地区,而不具备本地技术关联的技术更有可能退出。配套的区域技术关联度数据集给出了对应的关联度测度,两者可按地区与年份直接合并使用。 补充说明 - 优势判定的时间窗口:相对技术优势基于当年专利判定,进入与退出按相邻两年比较。原文在描述空间格局时使用三个互不重叠的十年期,但其表 1 报告的是逐年的技术进入与退出数量,本数据集取可与该表直接对标的逐年口径。逐年口径反映年度波动,专利产出规模较小的地区在少量专利变动下即可能越过优势阈值,从而产生并非实质性的进入或退出。 - 专利的计数与归类:同一件专利申请在公开与授权两个阶段各有一条记录,按申请号归并后只计一件;每件专利只归入其主分类号所在的技术类别,以满足原文"保证每个专利具有相同的权重"的要求。专利归属于第一申请人所在地——若按全部申请人归属,一件跨地区合作专利会在每个地区各计一件,破坏权重相等,代价是非第一申请人所在地不计入其专利产出。 - 空间单元:原文实证在地级市层展开,本数据集为省级层实现,配套的地级市层数据集与原文一致。省级聚合度更高,优势技术类别数系统性高于市级,进入退出的年度波动则小于市级。 - 面板口径:平衡面板按主体在区域统计数据中的可得年份区间展开,而非全部主体乘以全部年份的完全笛卡尔积。部分地级市的统计数据起始年晚于样本首年,其更早年份不进入面板,用意是避免"该地当年尚无统计口径"被当成真实观测的零;省级层不受影响。 - 样本与零值:覆盖全部省级行政区与全部可得年份,不按原文的样本区间收窄,不作缩尾。首年无上一年可比,上年优势技术类别数与进入、退出三个字段记缺失。地区当年无可归属专利时,优势技术类别数记零,此时该地上一年的全部优势技术会被记为退出;对专利规模很小的地区与早期年份,这一情形可能反映数据覆盖而非真实的技术退出。 - 其他局限:专利自申请至公开存在约十八个月的滞后,最近一至两个申请年的件数尚未完整,末年专利量偏低使相对技术优势的判定更易翻转,技术进入与技术退出双双上升而优势技术类别数小幅回落,末两年不宜作趋势解读;专利的地理定位率随年份上升,早期年份可归属专利偏少,进入退出的波动偏大;用于地址匹配的登记信息在部分地区收录较薄,其定位率偏低属非随机缺失,使用时建议加入地区与年份固定效应。 参考文献 - 马双,曾刚,张翼鸥.技术关联性、复杂性与区域多样化——来自中国地级市的证据[J].地理研究,2020,39(4):865-879.
- 如何获取该数据集?
- 通过站内对应淘宝链接下单后,客服发放兑换码;在站内"兑换"页输入兑换码即可获得下载权益并下载。