把文件放进一个文件夹,不等于完成了数据治理
企业资料往往是混在一起的:官网介绍和客户合同放在同一个共享盘,历史报价和当前政策文件名相似,员工为了方便把聊天记录、名单和项目复盘一起上传。做知识库时,如果只按文件夹导入,AI 可能把本来只能给某个岗位看的内容带进普通问答,也可能把内部讨论当成对外口径。
这类问题很难靠员工临时提醒解决。员工不知道模型会检索哪些资料,使用者也未必意识到答案中混入了不该展示的内容。数据分级的意义,是在资料进入系统之前先说清楚影响范围,让后续的检索、回答、下载和执行都能沿着同一套边界运行。
分级不要只看文件名称,要看泄露和误用的后果
比较实用的分级方式,是结合公开性、敏感程度、业务影响和使用人群。公开的品牌介绍可以进入对外问答;内部流程适合员工查询;客户合同、报价和人员信息需要限定岗位;涉及身份证明、支付、账号和重大决策的资料,则需要更严格的授权和人工确认。分级不求名称听起来专业,关键是不同级别真的对应不同使用规则。
同一份资料也可能因为使用场景不同而改变风险。产品手册可以公开检索,但内部成本表不能和产品功能一起展示;合同模板可以帮助员工找条款,但不能让 AI 自动向客户承诺具体结果。先写出资料允许做什么、禁止做什么,再决定用哪个模型和哪个入口。
- 给每类资料标明可见人群、可检索范围和可导出范围。
- 把“能看到”和“能触发动作”分开设置,避免检索权限过度扩张。
- 资料调整级别时保留审批人、时间和生效范围,方便追查。
同一套 AI 里,也要有不同的使用边界
企业常问能不能把所有资料接入同一个助手。技术上可以集中管理,业务上却未必应该统一放开。更稳的做法是让用户身份、部门、项目和任务共同决定可用资料。客服查产品政策,销售查已授权的客户材料,管理者看汇总指标;当问题跨越权限时,系统提示需要申请,而不是默默返回一段不完整的答案。
输出方式也应和资料级别对应。普通内容可以直接回答,内部内容需要显示来源和使用范围,敏感内容只返回“有相关资料,请联系负责人”,高风险动作则进入审批。这样既不把 AI 做成完全不能用的闸门,也不会为了方便让所有人看到所有东西。
检索权限之外,还要管住复制、下载和工具调用
很多企业只检查 AI 有没有返回敏感文本,却忽略了后面的动作。员工可以把回答复制到外部邮件,可以下载完整文档,可以让 AI 调用客户系统修改状态,这些都可能比一次普通检索更有影响。数据分级要覆盖输入、检索、回答、引用、导出和执行,不要只停在知识库的上传页面。
对外发送和系统写入尤其需要设定二次确认。系统可以先准备草稿、标记使用的资料和提示风险,再由有权限的人决定发送。保留用户、资料版本、模型、输出和动作结果,出现争议时才有完整的处理依据。
验收要用越权问题测试,而不是只问几道标准题
上线前准备不同身份、不同项目和不同资料级别的测试账号,分别提问正常问题、跨权限问题、试图导出的问题和要求自动执行的问题。检查系统是否拒答、是否给出合适的申请路径、是否泄露片段、是否把权限错误写进日志。测试内容要包含资料名称相似、旧权限残留和用户身份变化等真实情况。
数据分级也需要随着业务变化复核。新客户、新产品、新岗位和新工具接入时,旧规则可能不再适用。把分级表、权限策略和抽检记录放进交付资料,企业才能持续知道 AI 正在使用哪些信息,以及这些信息有没有越过原定边界。
分级工作最好不要等到系统上线后才补。企业可以先选一个部门做资料盘点,找出最常用的二十到三十份文档,和员工一起判断哪些可以直接回答、哪些只能在岗位内使用、哪些只能在审批后查看。盘点过程中往往会发现,真正难处理的不是绝密文件,而是大量没有主人、没有版本和没有适用范围的普通文件。先把这部分混乱整理好,后面的权限设计会简单很多,也更容易得到使用部门的配合。
分级结果还要让员工在使用时看得懂。界面可以提示资料属于公开、内部或受限范围,并说明当前回答能否导出、转发或触发动作。提示不必每次都挡住工作,但在边界附近要给出明确理由。员工知道系统为什么拒绝,也知道怎样申请,就不容易为了完成任务去绕开平台,把资料复制到无法管理的地方。
要点总结
- 需要,规模越小越容易把资料集中在少数账号里。可以先从客户资料、合同、价格和公开内容四类开始。
- 合理分级会让结果更稳定。关键是给正常工作设计清楚的可见范围,并给越权问题提供申请或人工入口。
- 可以,但应按字段、版本和场景设置范围,不要因为多人需要就把全部内容对所有人开放。
参考来源说明
本文围绕“企业资料不是都能喂给 AI:先做数据分级,再决定检索和调用范围”展开,结合 5 份公开资料及一路凯歌在“企业 AI 服务”方向的执行经验整理,重点看它对官网可引用结构、FAQ 设计和后续获客复盘的影响。
