文书查 SinoVerdict

股权转让纠纷裁判数据报告(2013–2025)

面向写论文、做课题与建法律 AI 数据集的人。全部数字在 1.6 亿条裁判文书全库上现跑, 每个数字附检索式与检索日期,口径陷阱一条不藏。本页不报胜诉率,也不报诉请支持比例——第六节说明为什么。

255,758并集记录数
211,793相异案号数
3.45%两个批量诉讼簇占比
2026-09-21检索日期
⚠️ 先看三条边界,再看数字

一、「有多少件」这个问题没有唯一答案。案由口径 148,500 条、标题口径 238,139 条、并集 255,758 条, 三个数都对,取决于你问的是哪一路。原因见第一节——两个入库批次的案由字段 100% 为空。

二、记录数 ≠ 案件数。一个案件常有一审判决、二审裁定、执行裁定多份文书。 本页所有表格同时给出记录数与相异案号数,论文里请引后者。

三、这个案由里有两个超大批量诉讼簇。它们占全部相异案号的 3.45%, 却贡献了 97.4% 的第三人撤销之诉。做法院画像或结果预测前必须先剔除,见第五节。

一、主题定义与三种口径

「股权转让纠纷」在裁判文书里有两个互不重合的识别入口,本页把两条路都跑出来并取并集。

口径记录数相异案号数说明
案由口径(cause 字段精确等值「股权转让纠纷」)148,500124,034字面纯度 100%(keyword 精确等值,不是分词 OR)
标题口径(title 短语含「股权转让」)238,139202,441抽样纯度 40/40,见第七节
两路交集130,881—
并集(本页主口径)255,758211,793后文除特别说明外均指此口径
正文口径(body 短语含「股权转让」)619,405—含大量只是提到股权转让的其他案由,不建议作为案件集

为什么案由口径会漏掉 42% 的案件?不是数据脏,是字段缺失有批次性。 按入库批次拆开看,ws_new(59,473 条)与 2021(36,858 条)两个批次的 cause 字段 逐条为空,合计 96,331 条——占「只有标题路能捞到」那 107,258 条的 89.8%。 换句话说,只用案由字段做筛选,等于把这两个批次对应的年代整段丢掉,而这恰好是 2019 年之前与 2020–2021 的主力批次。

二、逐年记录量:绝对值会骗人,归一化才不会

股权转让纠纷逐年记录量:左图绝对记录数呈现 2023 年断崖,右图按全库同年收录量归一化后曲线基本平稳
左:绝对记录数。右:每万条全库同年记录中的股权转让记录数。同一份数据,两种读法结论完全相反。
年份(year 字段)记录数相异案号数全库同年记录数每万条中的占比
20133,2632,8291,762,53718.51
201411,67610,3427,033,95616.60
201514,02712,4779,894,74714.18
201618,19216,31412,443,17714.62
201724,45622,98815,147,48916.15
201834,27327,63516,331,96720.99
201920,38816,31312,290,54216.59
202039,28229,46121,359,05018.39
202123,30320,74216,548,19814.08
202228,34119,56619,292,66914.69
20238,8728,2456,365,23613.94
202410,1129,9676,984,43514.48
20255,4995,4873,818,34214.40

结论:2022→2023 绝对记录数跌 68.7%,归一化后只跌 5.1%。 十三年里归一化占比的极差是 13.94–20.99(1.51 倍),而绝对值的极差是 3,263–39,282(12.0 倍)。 所以「2023 年股权转让诉讼断崖式下跌」这个结论,在本库里主要是文书公开量收缩的收录效应, 而不是纠纷本身减少。任何一篇按年画折线的实证论文,如果没做这一步归一化,第一轮外审就该被问住。

⚠️ year 字段派生自 date,而 date 在 2024、2021_x、2022_x 三个批次(占全库 12.37%) 存的是发布/采集日而非落款日。所以上表既不是严格的「起诉年」,也不是严格的「裁判年」, 按落款日重分桶会让 2024 行明显变小、2021 行变大。引用时请连这句一起引。

三、地域分布

股权转让纠纷省份分布 Top 15 横向柱状图,山东、广东、上海、浙江、江苏居前
省份 Top 15(记录数)。金色两条是含已知批量诉讼簇的省份,不能直接当作「该省纠纷更多」。

三点必须说明,否则这张图会被用错:

四、审级与文书类型

审级(已归并三套编码)

procedure 字段在库里同时存在中文全称(民事一审)、中文简称(一审)、 纯数字码(1/2)与四位码(0301/0302)四种写法。只认其中一种会漏掉一半以上。

审级记录数相异案号数归并的写法
一审139,127120,213民事一审 / 一审 / 1 / 0301
二审45,17840,066民事二审 / 二审 / 2 / 0302
执行26,38322,625执行实施 / 首次执行 / 执行审查 / 执行异议 / 执行复议等
再审审查与审判监督8,6107,969民事审判监督 / 再审 / 再审审查与审判监督 / 0303 / 3
第三人撤销之诉1,876—第三人撤销之诉(其中 1,828 件来自同一原告,见第五节)
管辖类1,817—民事管辖 / 民事管辖上诉 / 民事指定管辖 / 管辖
字段为空29,843——

文书类型(按标题后缀判定)

⚠️ 这里不能用 caseType 字段:该字段把「案件类型」(民事案件/执行案件)与 「文书种类」(判决/裁定)混在同一列,且民事有 民事案件 88,455 与 民事 55,239 两种写法。 另有一个已知陷阱:部分批次的正文首行一律写「判决书」,按正文判种类会把裁定书误判成判决书,因此只信标题。

文书类型记录数占并集
裁定书124,29848.6%
判决书95,35837.3%
调解书10,4384.1%
决定书4450.2%
标题无可识别后缀25,2199.9%

裁定书比判决书多,是这个案由的结构性特征,不是数据缺陷——管辖异议、保全、撤诉、执行实施都出裁定。 这也是本页第六节拒绝报「支持率」的直接原因之一。

五、批量诉讼簇:3.45% 的案号,97.4% 的第三人撤销之诉

这是本页最该被写进论文数据说明的一节。本案由里存在两个互相关联的超大诉讼复合体:

诉讼簇记录数相异案号数占全案由案号主要法院
济南产业发展投资集团有限公司10,7794,8552.29%济南市天桥区法院 9,025、济南中院 1,725
自然人 陈宏庆6,5724,3332.05%天桥区法院 1,828、济南中院 1,725、汝州市法院 2,287、平顶山中院 717
两簇并集13,7987,3073.45%横跨山东、河南两省四家法院

为什么它比 3.45% 这个数字更危险:

抽样核验(random_score,seed=20260921):

给研究者的处理建议:做法院层面的描述统计前,先按「同一法院 × 同一当事人 × 同一年份」聚类, 把超过 200 件的簇单列出来,并在论文里说明是否剔除。本页所有非簇统计均未剔除, 因为剔除标准本身需要随研究问题而定——这也是我们把簇的规模单独量化出来的原因。

六、诉请关键词交叉,以及为什么本页不报支持率

六组诉请关键词共现

以下为并集内正文短语共现计数,组间互相重叠(一份判决可同时命中多组),不可相加。

关键词(正文短语)记录数相异案号数占并集案号
股权转让款83,10473,06734.5%
工商变更登记25,27222,48310.6%
优先购买权9,6528,6314.1%
解除股权转让7,9337,0273.3%
股权代持3,7883,3601.6%
确认股东资格1,8241,6510.8%
对赌1,0919520.4%
国有产权3172810.13%
瑕疵出资2482120.10%
🔍 分词假零:上表有两行如果用默认检索式会得到「0 条」

「优先购买权」用默认 match_phrase 检索,结果是 0 条; 「确认股东资格」是 3 条。两个数都是假的。

原因:索引侧按 ik_max_word 切词,「优先购买权」被切成 优先购买 / 优先 / 购买 / 权;查询侧默认走 ik_smart,切成 优先购买 / 权。两串 token 的位置序列对不上,短语匹配直接落空。 把查询分词器显式指定为 ik_max_word 之后,同一条件命中 9,652 条 和 1,824 条。上表用的是后者。

这意味着:在任何全文库里检索到某个法律术语「零结果」,都不能直接写成「该术语从未出现」—— 先换分词器复核,或改用词项 AND 检索取并集。这条坑同样适用于法条号(带「第」字的短语)与机构全名。

为什么本页不报诉请支持比例(也不报胜诉率)

这是刻意的取舍,不是做不出来。在本页的口径下,任何一个「支持率」都会至少踩中下面三条中的一条:

  1. 分母不干净。并集里 124,298 条是裁定书(48.6%),管辖、保全、撤诉、执行实施类裁定 根本没有实体裁判结果。放进分母会把比例系统性压低;要剔出去,又得先解决文书种类的批次级误标问题。 同一个「支持率」,按判决书做分母和按全部文书做分母,差出的不是几个百分点,是一倍以上。
  2. 分子取不全。本报告数据采集时库内正文保留前 6,000 字(该截断已于 2026-09 补齐,本报告口径未回溯重算),长判决的判决主文可能整段落在截断之外, 用正则从正文抽「本院判决如下」会在长文书上系统性失败——而长文书恰恰是争议大、标的高的那批。
  3. 簇污染。第五节那 7,307 个案号里有数千件是同一模板判决, 它们会把结果分布整体拉向一个方向,而这个方向只代表一个债权人的诉讼策略。

所以本页只做「有多少、在哪里、什么程序、诉请里提到什么」这四类可核验的计数, 把结果维度留给需要人工校验的定制统计。 需要更细的交叉与逐案清单——比如按省份 × 审级 × 诉请类型的交叉表, 或剔除批量诉讼簇之后的法院画像,或带人工复核的裁判结果归类—— 可以按研究主题定制数据报告, 交付 Word + Excel + PPT + 图表,每个数字同样附检索式。

七、方法与局限

方法

已知局限(六条,建议原样写进论文的数据说明)

  1. year 字段的语义不统一。它派生自 date,而 date 在 2024、2021_x、2022_x 三个批次(占全库 12.37%)是发布/采集日而非落款日。 第二节的逐年表因此既非严格起诉年也非严格裁判年。
  2. 2019_2 批次正文全空,本并集内涉及 8,480 条。任何基于正文的计数(第六节全部) 在这批上必然为零,属于系统性漏计而非真实缺席。
  3. 正文 6,000 字截断(采集时)。本报告采集时超长文书只保留前 6,000 字(已于 2026-09 补齐,本页数字未回溯重算),影响正文短语命中与结果抽取。
  4. 省份字段 13.67% 为空(34,972 条),且空值按批次聚集,不可视为随机缺失。
  5. 相异案号数为近似值。cardinality 是 HyperLogLog 近似算法, 在十万量级上典型误差在 1% 以内,但不是精确去重;且案号写法存在全角/半角括号差异,未做归一化前可能略有高估。
  6. 记录数 ≠ 案件数 ≠ 纠纷数。一个案件常对应多份文书;一起纠纷也可能拆成多个案号。 本页所有表格同时给出两个数,请按研究问题选择。

八、附录:检索式(可原样复现)

以下为本页全部数字的检索式(Elasticsearch Query DSL 片段,检索日 2026-09-21)。

三种口径

案由口径:  {"term": {"cause": "股权转让纠纷"}}
标题口径:  {"match_phrase": {"title": "股权转让"}}
并集口径:  {"bool": {"should": [<案由口径>, <标题口径>], "minimum_should_match": 1}}
相异案号:  "aggs": {"d": {"cardinality": {"field": "caseNo", "precision_threshold": 40000}}}

逐年与归一化

分子: <并集口径> + "aggs": {"y": {"terms": {"field": "year", "size": 20, "order": {"_key": "asc"}}}}
分母: {"range": {"year": {"gte": 2013, "lte": 2025}}} + 同一 terms 聚合
归一化 = 分子(该年) / 分母(该年) × 10000

正文短语(必须显式指定分词器)

{"match_phrase": {"body": {"query": "优先购买权", "analyzer": "ik_max_word"}}}
# 省略 analyzer 走默认 ik_smart,同一条件返回 0 条(假零)

批量诉讼簇

产发簇: <并集> ∧ {"match_phrase": {"title": {"query": "济南产业发展投资集团", "analyzer": "ik_max_word"}}}
陈宏庆簇: <并集> ∧ {"match_phrase": {"title": {"query": "陈宏庆", "analyzer": "ik_max_word"}}}
法院切片: {"terms": {"court": ["山东省济南市天桥区人民法院", "济南市天桥区人民法院"]}}
          {"terms": {"court": ["河南省汝州市人民法院", "汝州市人民法院"]}}

抽样

{"query": {"function_score": {
   "query": <目标切片>,
   "functions": [{"random_score": {"seed": 20260921, "field": "_seq_no"}}],
   "boost_mode": "replace"}}, "size": 40}

需要这个主题更细的切片,或换一个研究主题?

按研究主题在 1.6 亿全库上定制统计:逐年量、案由构成、地域审级画像、关键词交叉、裁判结果归类, 交付 Word + Excel + PPT + 图表,每个数字附检索式。基础版 ¥299 起,24–72 小时交付。

数据报告定制 → 📩 chenjiaxin@wenshucha.com

九、常见问题

库里一共有多少股权转让纠纷的文书?

取决于口径,三个数都对:按案由字段精确等值「股权转让纠纷」是 148,500 条记录;按标题短语含「股权转让」是 238,139 条;两者并集 255,758 条记录、211,793 个相异案号。差距不是数据质量问题,而是 ws_new 与 2021 两个入库批次的案由字段 100% 为空(合计 96,331 条),只能靠标题路召回。写论文时必须写明用的是哪一路,并报相异案号数而不只是记录数。检索日 2026-09-21。

股权转让纠纷是不是从 2023 年开始大幅减少了?

按绝对记录数看像是:2022 年 28,341 条、2023 年 8,872 条,跌 68.7%。但同期全库该年收录量也从 1,929 万跌到 637 万。按「每万条全库记录中的股权转让记录」归一化后,2022 年是 14.69、2023 年是 13.94,只跌 5.1%。所以这主要是文书公开量收缩造成的收录效应,不是诉讼本身崩塌。任何按年画的曲线都必须先做这一步归一化。

这份数据里有没有批量诉讼导致的偏差?

有,而且不小。两个互相关联的诉讼复合体——济南产业发展投资集团有限公司(10,779 条记录 / 4,855 个相异案号)与自然人陈宏庆(6,572 条 / 4,333 个案号,横跨山东济南与河南汝州两省四院)——并集 13,798 条记录、7,307 个相异案号,占全案由相异案号的 3.45%。更极端的是:全案由 1,876 件第三人撤销之诉里,1,828 件(97.4%)来自陈宏庆一人。用这批数据做法院画像、当事人画像或结果预测,不剔除这两簇会被严重带偏。

为什么这份报告不报诉请支持率或胜诉率?

因为在本页的口径下报不准,报了就是误导。三个原因:一是并集里 124,298 条是裁定书(含大量管辖、执行、保全裁定),它们没有实体裁判结果,放进分母会稀释、剔出去又要先解决裁定/判决的批次级误标问题;二是本报告数据采集时库内正文保留前 6,000 字(该截断已于 2026-09 补齐,本报告口径未回溯重算),长判决的主文可能落在截断之外;三是上述批量诉讼簇会把结果分布整体拉向同一模板判决。需要结果维度的统计,我们按课题单独做口径设计与人工校验,见数据报告定制。

「优先购买权」在库里检索为什么会出现 0 条?

这是分词假零,不是真的没有。索引侧按 ik_max_word 切成「优先购买/优先/购买/权」,而查询侧默认用 ik_smart 切成「优先购买/权」,短语位置对不上,match_phrase 返回 0。把查询分词器显式指定为 ik_max_word 后,同一条件命中 9,652 条记录。「确认股东资格」同理:默认 3 条,指定分词器后 1,824 条。凡是看到某个法律术语「检索为零」,先换分词器复核再下结论。

这些数字能直接写进论文吗?

可以引用,但必须连口径一起引。本页每个数字都附了检索式与检索日期(2026-09-21),并在第七节列出了六条已知缺陷:year 字段在三个批次是发布日不是落款日、2019_2 批次正文全空、正文 6,000 字截断(采集时如此,已于 2026-09 补齐)、省份字段 13.67% 为空、相异案号用 HLL 近似算法、以及一案多文书导致记录数不等于案件数。审稿人问到的通常就是这几条,建议直接把它们写进论文的数据说明。

本页为文书查基于自建裁判文书数据底座的原创统计,数据来源于中国裁判文书网公开生效裁判文书,多数文书的当事人姓名已由法院匿名处理。 文中出现的当事人名称均直接取自公开裁判文书标题与正文,仅用于说明数据分布特征,不含任何评价。 本页不统计胜诉率,也不统计诉请支持比例(原因见第六节);所有比例均为库内记录的计数占比,不代表现实世界的纠纷总量。 本页内容为数据事实呈现,不构成法律意见或诉讼建议,个案请咨询执业律师。转载引用请注明来源 wenshucha.com 及检索日期。 统计与检索日期:2026-09-21。