涉密资料不能喂给 AI?别急,先搭一套“离线 AI 工作流”
孩子哄睡了,家里终于安静下来。
你泡杯咖啡,打开电脑,准备处理今晚的副业项目。客户却递来一摞打印材料,并且反复交代:
- 不能上传 AI
- 不能让 AI 读取
- 不能传网盘
- 不能发邮箱
这时候不少人都会冒出一句吐槽:输入法天天联网,怎么不怕泄密;一提 AI,大家立刻像见了洪水猛兽?
先别急着笑。客户真正担心的,不是屏幕上有没有“AI”两个字,而是:资料离开自己的控制范围后,流向哪里、谁能访问、能不能追回。
这篇就聊透一件事:面对保密材料,怎么判断 AI 能不能用,以及怎么搭一套不靠“侥幸”的离线处理流程。🔒
一、客户说“不能用 AI”,到底在防什么?
很多甲方的要求听起来粗暴,背后通常是几类很现实的风险。
1. 数据被上传到第三方服务器
你把一份会议纪要丢进在线聊天机器人,文本往往要经过公网,发往服务商的服务器。
哪怕平台承诺不拿数据训练模型,客户也可能不接受。
因为对涉密单位、医疗机构、律所、金融项目来说,问题不只是“平台会不会作恶”,还包括:
- 数据是否跨境
- 服务端是否留存日志
- 账号是否被多人共用
- 管理员是否能调取会话
- 合同里是否允许资料进入第三方系统
客户不想研究每一家 AI 平台的隐私条款。最省事的做法,就是一句:不准上传。
2. 文件在传输环节失控
网盘、邮箱、在线文档,都是高频泄露点。
举个常见场景:你把文件发到私人邮箱,打算回家继续做。结果收件人地址自动补全,误发给同名联系人。几秒钟的手滑,后面可能要写半个月说明。
还有更隐蔽的坑:
- 网盘链接没设有效期
- 文件权限是“拿到链接即可查看”
- 邮件附件被自动备份
- 浏览器插件读取了网页内容
- 截图进了云相册同步
保密要求看着麻烦,本质上是在堵这些日常小洞。
3. 模型会“记住内容”吗?
这件事别用一句“会”或“不会”糊弄。
在线模型通常涉及两种数据问题:
- 短期留存:用于风控、故障排查、滥用检测或服务记录。
- 训练使用:部分产品可能默认、授权后或按企业协议处理用户数据。
不同平台、不同套餐、不同地区政策差别很大。普通人没必要靠猜。
只要项目要求资料不得出内网,最稳的判断标准就一句话:
资料不能离开本地设备,那就别把它粘进在线 AI 对话框。
二、输入法联网,为什么不能拿来给在线 AI “洗白”?
“搜狗输入法也联网,怕什么 AI?”这句话有情绪,但不能直接当安全结论。
输入法、网盘、邮箱、在线 AI,确实都可能涉及数据传输。可它们处理的数据类型、权限范围、留存方式、组织管理要求,并不一样。
更关键的是,风险不是非黑即白。
比如你用输入法敲一句“明天下午开会”,和你把整份项目预算、人员名单、技术方案贴进模型,让它生成分析报告,暴露面根本不是一个量级。
一个实用判断:看“数据颗粒度”
把资料按颗粒度分三档:
| 档位 | 常见内容 | 建议 | | --- | --- | --- | | 低风险 | 通用写作框架、公开政策、无身份信息的表达润色 | 可以用在线 AI | | 中风险 | 内部流程、未公开方案、可拼接还原项目的信息 | 脱敏后再用,或转本地模型 | | 高风险 | 身份证号、合同金额、客户名单、源代码、图纸、会议纪要、涉密文件 | 禁止上传,优先离线处理 |
别拿“别的软件也可能联网”给自己壮胆。
安全工作不是比谁更完美,而是减少最危险、最不该发生的暴露。
三、纸质资料怎么处理?给你一套离线方案
客户只给纸质文件,往往是在用最笨、也最直观的方式切断外传路径。
你仍然可以用 AI 辅助,只是要把工具放到本地。
方案 A:纯人工录入,适合材料很少
适用场景:
- 10 页以内
- 内容敏感度极高
- 客户不允许电子化扫描
做法很朴素:在指定电脑上手动录入,再让本地文档工具做排版、查错、格式统一。
别嫌土。对极高敏感资料来说,“慢一点”往往比“出一次事”便宜得多。
方案 B:离线 OCR + 本地大模型,适合大量文字材料
适用场景:
- 客户允许在本地扫描
- 文件页数多,人工录入会崩溃
- 需要提炼要点、整理目录、生成初稿
推荐流程:
纸质文件
↓
本地扫描为 PDF 或图片
↓
离线 OCR 提取文字
↓
人工核对姓名、金额、日期、编号
↓
本地大模型整理摘要、提纲、初稿
↓
人工复核后导出交付文件
这里有个很重要的动作:OCR 完了别急着喂模型。
OCR 最爱在这些地方翻车:
- “0”和“O”
- “1”和“I”
- 小数点、百分号
- 表格里的金额
- 公章附近的文字
- 人名、编号、日期
你可以让模型整理结构,但金额、时间、主体名称必须人工对原件逐项核验。这个环节偷懒,后面返工到怀疑人生。
四、离线 AI 工具怎么选?不想折腾就照这个思路配
本地 AI 的核心是:模型文件运行在你的电脑上,资料不需要发送到公共在线模型。
1. 本地模型运行工具
下面这些工具常被用于本地运行大语言模型:
- Ollama:安装和调用相对省心,适合想快速跑起来的人。
- LM Studio:图形界面友好,适合不想敲太多命令的同学。
- Open WebUI:适合局域网或团队内部部署,需要一点动手能力。
模型可关注:
- Qwen 系列:中文任务表现稳定,适合摘要、改写、问答。
- DeepSeek 蒸馏模型:适合需要一定推理能力的任务。
- Llama 系列:生态成熟,选择很多。
电脑配置一般怎么办?
别一上来就追求几十 B 的大模型。处理会议纪要、提炼要点、改写文案,7B 或 14B 的量化模型已经能干不少活。模型太大,电脑风扇狂转,回答半天憋不出一句,真的很劝退。
2. 离线 OCR 工具
常见思路有两种:
- 开源本地 OCR:如 PaddleOCR,适合愿意折腾环境的人。
- 支持离线识别的软件:适合追求省事的人,但要确认“离线模式”是否真的关闭云端上传。
注意,很多“扫描软件”默认会同步到云端。安装后别一路点“同意”,要检查:
- 是否开启自动备份
- 是否绑定了个人账号
- 是否同步到云盘
- 是否允许联网识别
- 扫描缓存保存在哪里
3. 隔离环境:把资料关进“小房间”
高敏感项目建议单独准备一个工作环境:
- 专用电脑,或单独创建本地账户
- 关闭云盘同步
- 关闭浏览器自动同步
- 不登录私人微信、邮箱、社交账号
- 用完清理临时文件和打印缓存
- 条件允许时断网处理
听着像有点夸张?等你遇到“文件为什么出现在我手机相册里”的时刻,就知道这点隔离有多值钱了。
五、给本地模型的提示词,别把它当“万能员工”
本地模型能帮你省时间,但你要把任务说具体。
别只扔一句:
帮我整理这份材料。
这种指令太虚。模型很容易开始自由发挥,写得像模像样,细节却一塌糊涂。
示例 1:整理会议纪要
你是项目文档助理。请根据以下文本整理会议纪要。
要求:
1. 按“议题、结论、责任人、截止时间、待确认事项”输出;
2. 原文没有明确的信息,一律标注“原文未提及”;
3. 不补充事实,不猜测责任人;
4. 日期、金额、编号必须保留原文写法;
5. 输出 Markdown 表格。
示例 2:把零散材料变成汇报提纲
请将以下材料整理成 10 分钟汇报提纲。
输出结构:
- 项目背景
- 当前进度
- 已完成事项
- 风险与阻塞点
- 需要协调的资源
- 下周计划
规则:
- 只使用原文信息;
- 每个要点不超过 35 字;
- 不确定的信息放入“待确认”栏目;
- 不要编造数据和结论。
示例 3:检查表述风险
请检查以下文稿中是否存在:
- 表述绝对化
- 时间线矛盾
- 数字前后不一致
- 主体名称不统一
- 可能引发歧义的句子
请按“原句 / 问题 / 修改建议”三列输出。
不要直接改写全文。
这类提示词有个共同点:明确边界,禁止编造,要求保留原文依据。
处理敏感资料时,模型最怕“热心过头”。它给你补的每一句话,都可能是一个坑。
六、涉密项目的避坑清单 ⚠️
下面这些事,很多人真会顺手就做,然后给自己埋雷。
- 不要把文件截图发给在线 AI 问“帮我看看”。截图也是数据。
- 不要用私人邮箱中转工作材料。
- 不要把文件丢进个人网盘“临时存一下”。临时,往往会变成永久。
- 不要默认相信软件写着“安全”。去看它是否上传、缓存、同步。
- 不要让模型直接生成最终结论。模型负责打草稿,人负责签字和判断。
- 不要忽略打印机缓存、扫描仪历史记录、回收站和下载目录。
- 不要把脱敏当成删几个名字。项目名称、日期、金额、地点拼在一起,照样可能还原身份。
脱敏也有门道
把“张三”改成“A”还不够。
更靠谱的处理方式是替换一整组可识别信息:
原文:
华东某市 XX 局计划于 2025 年 4 月采购 120 台设备,预算 380 万元。
脱敏后:
某单位计划于某时间采购一批设备,预算为某金额。
如果模型只需要帮你优化表达,保留“采购一批设备”就够了。别为了让它理解得更完整,把不该给的上下文全塞进去。
七、真正专业的人,不会拿“效率”压过保密
很多人用 AI 的姿势很像赶末班车:文件一拖、按钮一按、结果一出,爽是爽。
可碰到敏感项目,专业不是“敢不敢用 AI”,而是知道:
- 哪些资料能进在线工具
- 哪些资料只能在本地处理
- 哪些信息必须人工核验
- 哪些流程需要客户书面确认
客户说“不能上传 AI”,别急着和他辩论输入法、手机、云服务到底谁更危险。
你要做的是把问题落到执行层:
资料是否允许电子化?
是否允许在断网电脑上做 OCR?
是否允许部署本地模型辅助整理?
成品通过什么方式交付?
把边界问清楚,留好书面记录,再开工。
这比一边熬夜赶稿,一边赌“应该没事吧”,靠谱太多。
AI 可以帮你把凌晨一点的文档工作压缩到十一点半。但涉及保密材料,先把数据关在该关的地方。效率再高,也别拿客户资料去换。