很多单位做私有化法律 AI,第一件在意的事是「数据别出内网」,做完私有化部署就觉得安全了。但真正让律所合规官和政法信息中心睡不着的,往往是另一个被忽略的问题:数据都在内网了,可所里谁能看谁?同一家所里,代理原告的团队和代理被告的团队之间隔着利益冲突墙;政法机关有知情范围和部门隔离。这些线下靠物理分区和流程管住的边界,一旦上了一个「全所共用、谁都能问」的 AI,就可能被 AI 的检索和生成能力一键打通——制造出线下从来不存在的泄密通道。本文把这一层讲透:为什么私有化不等于安全、权限为什么必须在数据/检索/生成/审计四层同时控住、RAG 检索为什么必须带权限过滤(不然向量库越权召回就是泄密)、逻辑隔离/物理隔离/混合三种多租户模型怎么选,以及一份可以直接照用的权限隔离架构自查清单。
一、先纠一个最危险的错觉:私有化解决的是「对外不泄」,不是「对内不越」
私有化部署解决的是一条外部边界:数据、模型、推理全在自己内网,不经过任何外部云,满足「数据不出门」的硬合规。这一步很关键,但它只管住了「对外不泄」。它没有、也不可能自动解决另一条更细的内部边界:同一个内网里,不同的人、不同的团队、不同的部门,谁有权看到什么。
对普通企业,内部边界或许没那么敏感;但律所和政法机关不一样,它们的业务本身就建立在严格的内部隔离之上:
- 律所的利益冲突墙(伦理墙):同一家所可能同时代理一桩纠纷的对立双方(经隔离安排),或先后服务存在冲突的客户。按执业规范,代理一方的团队不能接触另一方的卷宗、策略和沟通记录。这道墙线下靠物理分区、独立卷宗、访问审批管住。
- 政法机关的知情范围与部门隔离:不同部门、不同密级的材料,按「谁办案谁知情、非必要不接触」控制,涉密内容还叠加分类分级与等保要求。
现在把一个不做权限隔离的 AI 放进来会怎样?系统把全所/全机关的卷宗、案件材料一股脑灌进一个大知识库,谁登录都能问。那道原本靠物理和流程隔开的墙,就被 AI 的检索能力从底下掏穿了——一个本不该看到对方线材料的律师,只要问得「相关」,系统就可能把对立方的卷宗当成参考材料召回、生成进答案里。他没打开任何一个越权页面,信息却已经到手。这不是理论风险:它正是把线下从不存在的泄密路径,用 AI 造了出来。
一句话原则:私有化管住了「数据不出内网」,权限隔离才管住「内网里不越界」。对律所和政法机关,后者不是加分项,而是 AI 能不能上线的前置合规底座——利益冲突墙塌了,系统再好用也不能用。
二、法律 AI 的权限,为什么比传统系统更难做
传统业务系统的权限,主要挡在界面和接口那一层:没权限就打不开页面、调不到接口,数据本身静静躺着。法律 RAG AI 多了一条隐蔽得多的泄露路径——检索层。用户问一个问题,系统先去向量库和全文索引里召回「相关」文书片段,再喂给大模型生成答案。如果这一步召回不带权限过滤,系统就会把用户本无权查看的材料当成「语义相关」召回、揉进答案返回——界面上一个越权按钮都没有,信息却已经泄了。
所以法律 AI 的权限必须「往下沉」,不能只在界面藏。它要贯穿从数据到答案的四个层面,任何一层留口子,前面几层都白做:
| 层面 | 要控住什么 | 漏了会怎样 |
|---|---|---|
| ① 数据层 | 每份文书/卷宗标好归属(哪个案件组、哪个部门、什么密级),存储与索引按归属隔离、加密 | 源头没打标,后面所有权限判断都无据可依 |
| ② 检索层(最关键) | 召回时就按用户身份和案件组做行级/文档级过滤,不该看的根本不进候选集 | 越权材料被当「相关」召回进上下文=越权泄密,界面无痕 |
| ③ 生成层 | 大模型只拿到本人有权看的材料;多租户会话/缓存隔离,防上下文串味 | A 组的材料残留进 B 组的回答,利益冲突墙形同虚设 |
| ④ 审计层 | 谁在什么时候问了什么、召回了哪些文书,全程留痕可倒查 | 出了越权也查不到、说不清,过不了合规与等保 |
这张表的重点是第②层。绝大多数「私有化了还出事」的隐患,都藏在检索层——界面权限做得再严,只要 RAG 召回不带权限条件,用户就能通过提问间接读到无权查看的内容。所以选型和验收时,要把「检索召回带行级/文档级权限过滤」当成硬指标去验,而不是默认它「应该有」。
三、多租户三种落地模型:逻辑隔离 / 物理隔离 / 混合怎么选
把「不同案件组、不同部门、不同客户」这样的隔离单元叫「租户」。私有化法律 AI 的多租户,常见三种落地模型,没有绝对最好,只有更匹配你隔离强度和运维成本的:
| 模型 | 怎么隔 | 适合场景 / 代价 |
|---|---|---|
| 逻辑隔离 | 共享一套系统与库,靠租户 ID、行级权限、检索过滤把数据分开 | 部署运维最省,适合隔离要求中等、租户多而杂(如一个所几十个案件组);风险=全靠软件逻辑不出错,一处过滤漏了就串味 |
| 物理隔离 | 每个租户独立的库/实例,甚至独立机器 | 隔离最硬、最好向监管和客户证明「物理上就分开」,适合涉密部门、极敏感的对立业务线;代价=资源与运维成本高 |
| 混合(推荐) | 多数租户走逻辑隔离,少数特别敏感的单独物理隔离 | 律所/政法落地最务实:普通案件组共享,涉密或重大利益冲突的线单独隔出去,把成本花在刀刃上 |
怎么选?先问清三件事,再决定哪些走逻辑、哪些必须物理:
- 法定/执业规范要求的隔离强度:利益冲突墙有多硬、是否涉密、等保定几级、知情范围怎么定——这决定了下限,达不到就不能上。
- 租户数量与变动频率:案件组几十上百个、还常新建结项,纯物理隔离运维扛不住,逻辑隔离更现实。
- 团队运维能力:物理隔离多一套就多一份运维;团队接得住吗要诚实评估。
一个务实结论:大多数律所和政法机关最终落在「混合」——绝大部分走逻辑隔离压成本,把物理隔离这张贵牌只打在涉密和重大利益冲突这几条最敏感的线上。关键是别走极端:全物理,成本和运维压垮自己;全逻辑,一旦检索过滤出漏洞,最敏感的那条线也跟着裸奔。
四、最容易踩的坑:RAG 权限旁路
私有化法律 AI 出事,十有八九不是「黑客进了内网」,而是权限旁路——界面菜单锁得死死的,底层检索却把不该给的材料送了出去。四个最典型、务必逐条堵死:
| 旁路坑 | 怎么泄 / 怎么堵 |
|---|---|
| 向量库检索不带权限 | 按语义相似度把他人案件、他部门材料召回进上下文→答案带出越权信息。堵:检索时前置行级/文档级权限过滤,不该看的根本不进候选集 |
| 大模型上下文串味 | 多租户共用会话/缓存没隔干净,A 的材料残留进 B 的回答。堵:按租户隔离会话与缓存,单次回答只装本人有权看的材料 |
| 日志/缓存/向量成盲区 | 正文权限管住了,但检索日志、提示词缓存、embedding 向量落盘时没同等加密隔离→从侧门泄。堵:把这些副产物纳入同一套加密与隔离范围 |
| 权限变更不同步 | 案件结项、人员调岗后,向量库旧数据没按新权限重建→换组/离职的人仍能检索到。堵:权限变更触发索引重建,把「谁能检索到什么」当动态状态维护 |
验收提醒:验权限别只在界面点几下「打不开就算过」。要做提问穿透测试——用一个只属于 A 案件组的账号,反复去问 B 案件组、他部门、涉密材料里的内容,看系统会不会通过检索把答案「漏」出来。界面挡不住的,提问未必挡得住;检索层的过滤,才是真正的那道墙。
五、隔离是底座,数据是根:权限管的是「谁能用」,数据决定「值不值得用」
最后把两件事的关系摆正。权限隔离决定这套 AI 敢不敢在律所和政法机关上线——利益冲突墙、知情范围、等保这些红线过不了,系统再聪明也进不了门。但隔离只是底座,它管的是「谁能用、能用到哪部分」;真正决定这套系统值不值得用的,是里面那套数据够不够全、够不够结构化、能不能回链。
而且这两件事是咬合的:权限隔离要做得精细,前提是数据本身结构化、字段齐全——每份文书标清了案件组、部门、密级、审级、当事人,行级/文档级过滤才有据可依;数据一团散、无结构、无字段,权限过滤根本无从下手。这也是我们反复强调的:法律 AI 的护城河在数据。一套覆盖全国全量、字段齐全(法院/审级/年份/案由/当事人)、能回链原文的裁判文书数据底座,既撑得起类案检索的可用性,也撑得起权限隔离的精细度——而且数据不出内网。隔离让系统合规,数据让系统好用,两者缺一,律所和政法机关的 AI 都立不住。
六、给信息化负责人 / 合规官的一页纸权限隔离自查清单
定权限架构、或评审供应商给的多租户方案前,把这份清单逐条过一遍:
- 四层贯穿:权限是不是在数据/检索/生成/审计四层都落了,而不是只在界面藏?
- 检索带过滤:RAG 召回时是否做行级/文档级权限过滤,不该看的根本不进候选集?(最关键一条)
- 利益冲突墙:能否按案件组/对立业务线硬隔离,支持所里的伦理墙安排?
- 知情范围/密级:能否对接部门、密级、等保要求,涉密材料单独隔离?
- 多租户模型:选了逻辑/物理/混合中的哪种?最敏感的线是不是走了物理隔离?
- 防串味:多租户会话与缓存是否隔离,单次回答只装本人有权看的材料?
- 副产物不留后门:检索日志、提示词缓存、向量索引是否同等加密隔离?
- 权限变更同步:结项/调岗/离职后,向量库旧数据能否按新权限及时重建?
- 可审计:谁在何时问了什么、召回了哪些文书,是否全程留痕可倒查?
- 穿透测试:验收有没有做提问穿透测试,而不是只点界面?
把这十项做成上线前的固定动作,权限隔离这一步就从「以为私有化了就安全」变成「经得起利益冲突和等保检验的合规底座」。记住:私有化把数据关进了自己家,权限隔离才决定家里每个房间的门锁给谁——对律所和政法机关,这把锁配不齐,门就不能开。
七、常见问题
Q:私有化部署了、数据在内网,还要做权限隔离吗?
A:要,而且是前置条件。私有化管的是「数据不出内网」的外部边界,管不住「内网里谁能看谁」的内部边界。律所有利益冲突墙、政法有知情范围,一个「全所共用、谁都能问」的 AI 会用检索能力把这些墙从底下掏穿,造出线下不存在的泄密路径。权限隔离是私有化 AI 的合规底座,不是附属功能。
Q:法律 AI 的权限和传统系统有什么不一样?
A:传统系统权限挡在界面和接口;法律 RAG 多了检索层这条隐蔽泄露路径——召回不带权限过滤,越权材料会被当「相关」召回进答案,界面无痕却已泄密。所以权限必须往下沉到检索层,做行级/文档级过滤,不能只在界面藏。
Q:多租户逻辑隔离、物理隔离、混合怎么选?
A:看隔离强度和运维成本。逻辑隔离省但全靠软件不出错;物理隔离硬但贵;混合最务实——多数案件组走逻辑隔离压成本,涉密和重大利益冲突的线单独物理隔离。先定法定/执业规范要求的隔离强度、租户数量与变动、团队运维能力,再决定哪些走逻辑、哪些必须物理。
隔离架构你来定,经得起隔离的结构化数据我们来供
文书查提供 1.5 亿+ 结构化裁判文书私有化部署——法院、审级、年份、案由、当事人字段齐全,天生支撑行级/文档级权限过滤与案件组隔离,可回链原文,数据不出内网。无论你的权限架构走逻辑隔离、物理隔离还是混合,我们负责把那套覆盖全、结构化、能回链、可更新的法律数据喂进去,让利益冲突墙和知情范围既守得住、又用得起来。
📞 联系商务 Jack · 131 6872 7779或邮件 chenjiaxin@wenshucha.com · 查看 私有化方案详情 · API/MCP 定价
相关阅读:法律数据分类分级 · 数据安全审计与等保测评 · 律所数据合规与保密义务 · 律所 RAG 知识库搭建 · 向量库与检索引擎选型 · 律所 AI 私有化部署指南