一、这个主题有两个并行写法,必须取并集。「竞业限制」29,141 条、「竞业禁止」14,900 条, 交集只有 6,995 条。只认前者漏掉并集的 21.3%,只认后者漏掉 59.8%。 已发表的实证研究里,只检索单一写法的占相当比例——这是本主题最常见的系统性漏检。
二、记录数 ≠ 案件数。一个案件常有一审判决、二审判决、执行裁定多份文书, 本主题二审记录占 36.85%,重复计数尤其严重。本页所有表格同时给出记录数与相异案号数,论文里请引后者。
三、关键词共现率会被样板条款骗。「加倍支付」在本主题集共现率 47.5%,看似近半数案件涉及, 实际它在全库的出现率就有 21.35%(判决书末尾的法定告知)。第五节给出富集倍数这一列,用它而不是共现率。
一、主题定义与检索口径
「竞业限制」与「竞业禁止」在学理上有区分——前者通常指劳动合同或保密协议中的约定义务(《劳动合同法》第二十三、二十四条), 后者常被用于指公司法上董事、高管的法定竞业义务(《公司法》相关条款)。 但裁判文书并不严格遵守这一区分:同一份判决里两个词混用、或法院直接沿用当事人用语的情况很常见。 因此本页以两个写法的并集为主口径。
口径(body 短语,analyzer=ik_max_word) | 记录数 | 占并集 | 说明 |
|---|---|---|---|
| 正文含「竞业限制」 | 29,141 | 78.7% | 约定义务的主流表述 |
| 正文含「竞业禁止」 | 14,900 | 40.2% | 含公司法语境与早期文书 |
| 两者交集 | 6,995 | 18.9% | 同一份文书内混用 |
| 并集(本页主口径) | 37,046 | 100% | 相异案号约 32,339 个 |
| 只认「竞业限制」的漏检 | 7,905 | 21.3% | —— |
| 只认「竞业禁止」的漏检 | 22,146 | 59.8% | —— |
为什么不用案由字段做主口径
本库有 cause(案由)字段,但它在本主题上不可用作主口径。对并集集合做案由分布聚合可见:
排名第一的是「劳动争议」11,691 条,其次是空字符串 10,805 条,
真正标为「竞业限制纠纷」的只有 2,447 条——占并集的 6.6%。
原因有二:一是最高法《民事案件案由规定》里「竞业限制纠纷」是 2020 年修订后才单列的四级案由,
此前的案件一律归入「劳动争议」或「劳动合同纠纷」;二是部分入库批次的案由字段整体为空。
只按案由字段 cause = "竞业限制纠纷" 检索,会丢掉 93.4% 的相关文书。
本库索引侧用 ik_max_word 切词、查询侧默认 ik_smart。两边切分边界不一致时,
match_phrase 的词位校验会失败并返回 0,而这个 0 长得和「真的没有」一模一样:
| 检索词 | 默认分词器 | 指定 ik_max_word |
|---|---|---|
| 竞业禁止协议 | 0 | 3,816 |
| 离职后 | 3 | 13,714 |
| 培训服务期 | 0 | 356 |
本页所有数字均用两种分词器各查一次取较大值的口径。 凡是看到某个法律术语「检索为零」或数量小得反常,先换分词器复核再下结论。
二、逐年记录量:绝对值会骗人,归一化才不会
年份(year 字段) | 记录数 | 相异案号数 | 全库同年记录数 | 每万条中的占比 |
|---|---|---|---|---|
| 2013 | 704 | 625 | 1,762,537 | 3.99 |
| 2014 | 2,162 | 1,919 | 7,033,956 | 3.07 |
| 2015 | 2,576 | 2,236 | 9,894,747 | 2.60 |
| 2016 | 2,563 | 2,253 | 12,443,177 | 2.06 |
| 2017 | 3,111 | 2,911 | 15,147,489 | 2.05 |
| 2018 | 3,330 | 2,978 | 16,331,967 | 2.04 |
| 2019 | 2,569 | 2,230 | 12,290,542 | 2.09 |
| 2020 | 2,626 | 2,480 | 21,359,050 | 1.23 |
| 2021 | 3,599 | 3,305 | 16,548,198 | 2.17 |
| 2022 | 6,466 | 4,618 | 19,292,669 | 3.35 |
| 2023 | 2,212 | 2,118 | 6,365,236 | 3.48 |
| 2024 | 2,341 | 2,333 | 6,984,435 | 3.35 |
| 2025 | 895 | 892 | 3,818,342 | 2.34 |
本页最硬的一条结论。绝对记录数的极差是 704–6,466,9.18 倍; 归一化后极差是 1.23–3.99,3.25 倍。差出来的那部分,全是全库收录量本身的起伏。
具体到最容易被误读的 2022→2023:绝对记录数 6,466 → 2,212,跌 65.8%; 而同期全库该年收录量从 1,929 万跌到 637 万。归一化后 3.35 → 3.48,升 3.7%。 更进一步,归一化口径下 2022、2023、2024 三年(3.35 / 3.48 / 3.35)构成 2014 年以来的最高平台, 真正的低谷是 2020 年的 1.23。如果只看绝对值,会得出「竞业诉讼在 2022 年见顶、此后腰斩」的结论; 按可比口径看,恰恰相反——竞业限制争议在文书总量收缩的同时,占比反而稳定在历史高位。
⚠️ 两条必须同时写进论文的限定:一是 year 派生自 date 字段,
而库内有三个入库批次(占全库 12.37%)存的是公开日而非裁判文书落款日,
按年切片时这部分会系统性后移;二是 2025 年尚未收录完整,该年数字不可与往年直接比较。
三、地域分布:三地占四成
| 省份(两种写法已归并) | 记录数 | 占比 |
|---|---|---|
| 北京 | 5,581 | 15.28% |
| 广东 | 4,799 | 13.14% |
| 上海 | 4,279 | 11.72% |
| 江苏 | 2,904 | 7.95% |
| 山东 | 2,588 | 7.09% |
| 浙江 | 2,338 | 6.40% |
| 湖南 | 1,158 | 3.17% |
| 河南 | 1,049 | 2.87% |
| 辽宁 | 1,029 | 2.82% |
| 四川 | 991 | 2.71% |
| 湖北 | 900 | 2.46% |
| 福建 | 821 | 2.25% |
| (省份字段为空) | 2,949 | 8.08% |
北京、广东、上海合计 40.1%。这三地在全库文书总量中的占比远低于此, 因此这是真实的地域集中,不是收录偏差——与竞业限制条款主要出现在高技术、金融、互联网、 医药行业劳动合同中的一般认知一致。⚠️ 两个陷阱:一是省份两种写法(「广东省」1,049 条记为「广东」的那部分) 不归并会低估约 20%;二是该字段记录的是审理法院所在地,不是用人单位注册地或劳动者工作地, 做区域营商环境或产业分析时不能直接替换。
四、审级与文书类型
本库 procedure 字段存在三套并行编码(中文全称「民事一审」、简称「一审」、数字码「1」/「0301」),
直接做 terms 聚合会把同一审级拆成三个桶。下表已归并:
| 审级(三套编码已归并) | 记录数 | 占比 |
|---|---|---|
| 一审 | 19,938 | 53.88% |
| 二审 | 13,634 | 36.85% |
| 再审 / 审判监督 | 896 | 2.42% |
| 执行 | 496 | 1.34% |
| 特别程序(含撤销仲裁裁决) | 236 | 0.64% |
| 其他 / 管辖 / 未归类 | 359 | 0.97% |
| (字段为空) | 1,443 | 3.90% |
二审占 36.85%,是一个值得单独讨论的数字。作为参照,本主题的二审/一审比约为 0.68。 竞业限制案件的争点(协议效力、补偿金是否支付、违约金是否过高)高度依赖价值判断与自由裁量, 败诉方上诉意愿强,这与该比值相符。但请注意这不能直接读成「68% 的一审案件被上诉」—— 分子分母来自不同案件集合,且一审、二审文书的公开率本身就不同(二审由中院作出,公开率通常更高)。 要算真实上诉率,必须按案号回溯配对同一案件的一审与二审文书,那是另一套口径。
| 文书类型(按标题判定) | 记录数 | 占并集 |
|---|---|---|
| 判决书 | 30,884 | 83.37% |
| 裁定书 | 4,431 | 11.96% |
| 通知书 | 78 | 0.21% |
| 调解书 | 62 | 0.17% |
| 决定书 | 10 | 0.03% |
⚠️ 文书类型必须按标题判定,不能按正文首行,也不能用 caseType 字段。
本库最大的两个入库批次在正文开头一律写「判决书」,按正文首行判定会把裁定书整批误标;
而 caseType 字段混入了文书种类与案件类型两种语义,且「民事案件」「民事」两种写法并存。
本主题集的判决书占比 83.37% 明显高于全库平均——因为竞业限制案件极少以管辖、保全类裁定的形式出现。
五、诉请关键词:共现率会骗人,富集倍数不会
下表对并集集合做关键词共现统计,并给出富集倍数=(该词在本主题集的出现率)÷(该词在全库的出现率)。 富集倍数把「这个词在所有判决里本来就常见」这一层剥掉,只留下主题特异的信号。
| 关键词 | 主题集内 | 共现率 | 全库出现率 | 富集倍数 |
|---|---|---|---|---|
| 竞业限制期限 | 4,265 | 11.5% | 0.003% | 4,327× |
| 保密义务 | 12,277 | 33.1% | 0.02% | 1,425× |
| 离职后 | 13,714 | 37.0% | 0.09% | 423× |
| 商业秘密 | 12,180 | 32.9% | 0.11% | 288× |
| 高级管理人员 | 6,410 | 17.3% | 0.06% | 282× |
| 经济补偿 | 14,304 | 38.6% | 0.47% | 82× |
| 劳动仲裁 | 10,070 | 27.2% | 0.56% | 49× |
| 显失公平 | 2,211 | 6.0% | 0.29% | 20× |
| 违约金 | 15,436 | 41.7% | 7.36% | 5.7× |
| 加倍支付 | 17,592 | 47.5% | 21.35% | 2.2× ⚠️ |
请把最后两行和前六行对照着看。「加倍支付」的共现率 47.5% 是全表最高, 按共现率排序它会稳居第一,任何「竞业限制案件近半数涉及加倍赔偿」的结论都会由此产生—— 而它是错的。这个词在全库的出现率就有 21.35%,来源是判决书主文后几乎标配的一句法定告知 (「如果未按本判决指定的期间履行给付金钱义务,应当依照《民事诉讼法》第二百六十条之规定,加倍支付迟延履行期间的债务利息」)。 它的富集倍数只有 2.2 倍,属于样板条款噪声。「违约金」5.7 倍同理,需要打折看待。
相反,「竞业限制期限」4,327 倍、「保密义务」1,425 倍这种量级,才是本主题真正的特异标记。 其中值得单拎出来的是「经济补偿」共现率 38.6%、富集 82 倍—— 考虑到《劳动合同法》第二十三条把补偿金支付设定为竞业限制条款生效的前提条件, 这个不到四成的共现率本身就是一条可研究的线索:它可能意味着大量案件的争点恰恰在于用人单位未支付补偿金, 也可能只是文书表述方式的差异。本页只提供计数,不作因果判断——要区分这两种解释, 需要按判决理由段落做人工标注,见下方定制说明。
六、为什么这份报告不报胜诉率
这是本系列每一页都要回答的问题。对竞业限制主题,理由有三条,且都不是「做不到」而是「做了会错」:
- 分母不干净。并集里 11.96%(4,431 条)是裁定书,含管辖异议、撤销仲裁裁决、财产保全等, 它们没有实体裁判结果。放进分母会系统性稀释;剔出去则要先解决文书类型的批次级误标问题(见第四节)。
- 同一案件被重复计数。二审记录占 36.85%,一个案件常同时有一审、二审两条记录, 且二审往往改判或部分改判。按记录数统计结果分布,等于给上诉过的案件加权, 而上诉与否本身与案件特征强相关(争议金额大的更可能上诉)。
- 「支持」与「驳回」在同一份判决里同时出现是常态。竞业限制案件的典型判项是 「支持部分违约金、驳回其余诉讼请求」,或「确认协议有效但调减违约金」。 任何基于关键词的字面统计都无法区分「全部支持」「部分支持」「全部驳回」, 而这三者在法律意义上完全不同。第五节的「显失公平」6.0%、「调整违约金」1.3% 恰恰说明违约金调减是一个高频但难以自动量化的争点。
要拿到结果维度的可靠统计,唯一的路径是对判决主文做结构化抽取加人工校验,并明确定义「支持」的层级。 这不是一次全库聚合能完成的,需要按课题单独设计口径。 如果你的研究恰好需要这一层——比如按年份、地域、行业交叉的违约金调减幅度分布, 或者剔除重复案号后的一审/二审配对结果——可以直接告诉我们研究问题,我们按课题做口径设计与逐案清单,见 数据报告定制。
七、方法与局限(建议原样抄进论文的数据说明)
数据源:文书查自建裁判文书索引,共 160,291,678 条记录,来自中国裁判文书网公开生效裁判文书, 分 15 个入库批次。检索引擎 Elasticsearch 8.15,检索日 2026-09-24。以下六条是已知缺陷,请连同数字一起引用:
- 两种写法必须取并集。「竞业限制」与「竞业禁止」交集仅占并集的 18.9%, 只检索任一单一写法会漏掉 21.3% 或 59.8%。这是本主题最大的系统性误差来源。
- 案由字段不可用作主口径。并集内标为「竞业限制纠纷」的只有 2,447 条(6.6%), 另有 10,805 条案由为空字符串。该案由 2020 年才单列,此前案件归入「劳动争议」。
year字段有三个批次存的是公开日。该部分占全库 12.37%,按年切片时会系统性后移。 2025 年尚未收录完整,不可与往年直接比较。- 省份字段 8.1% 为空(2,949 条),且有「广东省 / 广东」两种写法必须归并;
该字段是审理法院所在地,不是用人单位注册地。
procedure字段有三套并行编码, 不归并会把同一审级拆成三个桶。 - 相异案号数是 HLL 近似值(
cardinality聚合,precision_threshold=40000), 不是精确去重计数,小数位不可信。记录数 ≠ 案件数:本主题 37,046 条记录对应约 32,339 个相异案号。 - 正文可用性按批次差异极大。全库有约 8.6% 的记录
body为空字符串, 另有 11,493,790 条(7.17%)的body存的不是判决内容,而是不公开事由本身 (如「以调解方式结案的」5,648,952 条、「人民法院认为不宜在互联网公布的其他情形」2,832,246 条、 「离婚诉讼或者涉及未成年子女抚养、监护的」2,262,977 条)。 ⚠️ 用exists查询无法发现这一点——实测某个正文 100% 为空的批次,exists(body)仍返回 4,414,931/4,414,931 = 100%。 本主题集因为按正文短语定义,天然排除了这些记录(占位串命中仅 4 条),但做全库口径研究时必须扣除。
抽样核验
对并集集合随机抽样 n=400,seed=20260924(random_score 指定 seed):
- 字面纯度 400/400 = 100%——每条正文确实字面含「竞业限制」或「竞业禁止」,无分词误召回。
- 文书类型分布:判决书 341、裁定书 47、其他 11、通知书 1,与全集比例一致。
- 正文长度:中位 4,211 字符,p90 8,659,最长 20,352。命中 6,000 字符截断的样本 0 条 ——该历史截断已于 2026-09 补齐,本主题集不受影响。
- 最大单一法院占比 15/400 = 3.8%(北京市第三中级人民法院), 全集 top1 法院 1,043/37,046 = 2.8%。本主题不存在批量诉讼簇污染, 这一点与股权转让纠纷主题不同(后者有两个簇占相异案号的 3.45% 并贡献 97.4% 的第三人撤销之诉,见 股权转让纠纷数据报告)。
八、附录:可复现检索式
以下检索式可直接对 Elasticsearch 执行复现本页数字。注意 analyzer 参数不可省略。
主口径:并集记录数与相异案号数
POST /judgments/_search
{
"size": 0,
"query": { "bool": { "minimum_should_match": 1, "should": [
{ "match_phrase": { "body": { "query": "竞业限制", "analyzer": "ik_max_word" }}},
{ "match_phrase": { "body": { "query": "竞业禁止", "analyzer": "ik_max_word" }}}
]}},
"aggs": { "cases": { "cardinality": {
"field": "caseNo", "precision_threshold": 40000 }}}
}
// hits.total.value = 37,046 aggs.cases.value ≈ 32,339逐年量与归一化分母
// 分子:主题集逐年
POST /judgments/_search
{ "size": 0, "query": { /* 同上并集 */ },
"aggs": { "y": { "terms": { "field": "year", "size": 200,
"order": { "_count": "desc" }},
"aggs": { "c": { "cardinality": { "field": "caseNo",
"precision_threshold": 40000 }}}}}}
// 分母:全库逐年(⚠️ order 必须用 _count desc;
// 用 _key asc + size 不足会只返回最小的若干个键,得到错误的分母)
POST /judgments/_search
{ "size": 0, "aggs": { "y": { "terms": {
"field": "year", "size": 200, "order": { "_count": "desc" }}}}}
// 2022 = 19,292,669 2023 = 6,365,236富集倍数:主题集内 vs 全库
// 分子
POST /judgments/_count
{ "query": { "bool": { "filter": [
{ /* 并集 */ },
{ "match_phrase": { "body": { "query": "保密义务",
"analyzer": "ik_max_word" }}}]}}}
// = 12,277 → 12,277 / 37,046 = 33.14%
// 分母
POST /judgments/_count
{ "query": { "match_phrase": { "body": {
"query": "保密义务", "analyzer": "ik_max_word" }}}}
// = 37,272 → 37,272 / 160,291,678 = 0.0233%
// 富集倍数 = 33.14% / 0.0233% ≈ 1,425×正文可用性核验(含 exists 假绿的复现)
// exists 会返回 100%,即使该批次正文全为空字符串
POST /judgments/_count
{ "query": { "bool": { "filter": [
{ "term": { "dataset": "2019_2" }},
{ "exists": { "field": "body" }}]}}}
// = 4,414,931 / 4,414,931 = 100% ← 假绿
// 正确做法:用 script_fields 取 _source 的实际长度后抽样统计
POST /judgments/_search
{ "size": 600, "_source": ["title"],
"script_fields": { "blen": { "script": { "source":
"params._source.body == null ? -1 : params._source.body.length()" }}},
"query": { "function_score": {
"query": { "term": { "dataset": "2019_2" }},
"random_score": { "seed": 20260924, "field": "_seq_no" },
"boost_mode": "replace" }}}
// 实测 599/600 长度为 0需要本页做不到的那一层?
违约金调减幅度分布、一审/二审按案号配对、按行业或企业性质的交叉表、剔除重复案号后的逐案清单——
这些需要按课题单独设计口径并做人工校验。告诉我们研究问题,我们出口径方案与数据。
引用与免责:本页数据由文书查于 2026-09-24 在自建裁判文书索引上现跑, 索引共 160,291,678 条记录,来源为中国裁判文书网公开生效裁判文书。 本页所有数字均为本索引在该日期上的测量值,不是对全国已公开裁判文书的普查, 也不是对任何同行语料的比较——公开文书全集的真实规模无人能给出,因此任何「占全国 X%」的说法本页都不作。 本页不统计胜诉率或诉请支持比例,原因见第六节。本页内容为数据统计,不构成法律意见。 转载或在论文中引用请注明来源与检索日期。