把工单原文贴进对话式 AI 之前,格式脱敏为什么仍可能对回同一个客户
客服把一封投诉原样丢进对话式 AI,求它起草回复。手机号打了星号,并不等于这段文字已经无法指向同一个人。格式脱敏按电话、证件号、邮箱这类可核对的样式盖住字段;姓名、地址、订单号和「昨天下午四点那通电话」仍留在上下文里。下面把「盖得住 / 盖不住」拆开,并写出当场能对照的步骤。不是隐私清洗页的操作说明书。
先分清 盖住的是哪一层
本篇只回答「工单贴进 AI 之前,格式脱敏为什么仍可能对回同一个客户」。不是隐私清洗的表单说明,也不是某家模型厂商的完整隐私政策。
贴进去发生了 哪一层转移
这不是「问了一句怎么回复」。整段工单变成另一家处理者的输入,副本不再只存在于你的工单系统。
客服、运营和一线开发把对话式 AI 当成起草工具,已经是日常动作:粘投诉、粘日志、粘会议纪要,等一段更顺的回复。麻烦在于,粘贴框看起来还在你的浏览器里,提交之后文字已经离开当前标签页。模型厂商按自己的条款决定是否用于训练、是否写入历史、是否为安全审查再留一份。你在本机打的星号,只有在提交之前打上,才对那一次请求有效。
2023 年 4 月,三星半导体业务的工程师在大约二十天内三次把不该出门的材料贴进 ChatGPT:半导体数据库源码、设备缺陷检测代码,以及内部会议纪要。PCMag 转述《经济学人》韩文报道写过这三起;随后 Bloomberg 在 2023 年 5 月报道,公司在设备上禁止生成式 AI。这三起里,没有一起是「忘了给手机号打星号」。出门的是源码、算法和会议内容。
同一年,Cyberhaven 统计了使用其产品的约 160 万名员工的工作场所行为。2023 年 6 月左右的更新写明:自 ChatGPT 公开以来,约 4.7% 的员工至少把一份机密材料贴进去过;员工贴进 ChatGPT 的内容里,约 11% 被标成机密。原始说明在 Cyberhaven 自己的博客。这是一家安全厂商的遥测,不是全行业普查,数字也不能外推到 2026 年的每一个座席。它能核对的只有一件事:把工作原文贴进消费级对话框,在 2023 年就已经足够常见,值得单独拆开「贴之前盖住了什么」。
这和「新密钥为什么不该再发到聊天窗口」不是同一层。那篇写的是轮换之后,API Key 又被贴进可搜索的频道;见云平台环境变量被拖走之后,新密钥为什么不该再发到聊天窗口。本篇要补的是另一条日常通道:工单、邮件和日志在进 AI 之前,格式脱敏到底改变了哪一层身份,哪一层原样还在。
贴进 AI 要问的不是「模型会不会把这段话大声读给下一个用户听」,而是「这一次请求的正文里,还剩哪些能对回同一个客户的字段和情节」。星号只覆盖被规则命中的那一段。
格式脱敏 盖得住哪六类
它认的是样式,不是「这段像不像个人信息」。六类都能当场用示例对上;超出这六类,不要指望它自动动手。
UsePwd 的敏感脱敏在当前标签页做掩码,打开即用,不必注册。识别类型固定为六种:电话、证件号、银行卡、邮箱、API Key、IP。原文不作为 HTTP 请求发出,也不写入 analytics。单次文本不超过 512 KB,超过就拆开再处理。它不是自然语言理解,不会给「王敏」打分,也不会判断「示例路 12 号」是不是住址。
电话按大陆手机号、国际 + 开头数字,以及常见北美书写来抓。证件号里,18 位居民身份证会先算校验位再决定是否下手,避免把一串订单数字误判成证件;另外还认 15 位旧号、美国社会安全号的 123-45-6789 形态,以及一部分护照式字母加数字。银行卡要求 13 到 19 位数字,并走 Luhn 校验;15 位和 18 位整段会跳过,以免和证件号抢同一串。邮箱按本地部分 @ 域名抓。密钥认一批公开前缀,例如 sk-、sk_live_、sk_test_、AKIA、ghp_、github_pat_、xoxb-、Bearer 。IP 认 IPv4 和一部分 IPv6 写法。
默认是智能掩码:电话、证件、卡号留下末四位,邮箱留下本地部分第一个字符和完整域名,密钥留下前缀和末四位,IPv4 留下前两段。完全掩码则把命中段改成同样长度的星号;邮箱变成 ***@***,密钥仍保留可辨认的前缀再加 ***。两种模式都只改命中段。右侧会列出本次识别到的类型和条数,用来对照,而不是口头保证「已经匿名」。
13800138000 会变成一串星号加 8000。末四位仍是对回线索。
wangmin@example.com 变成 w***@example.com。公司邮箱的域名往往比本地部分更有指向性。
sk_test_ 还在,IPv4 前两段还在。能判断「这是哪一类东西」,不能当整段秘密已经消失。
页面上的识别开关可以关掉某一类。关掉电话后,手机号会原样留下。这是给你对照用的,不是「关得越少越安全」。外发进 AI 之前,该开的六类都开,再用下一节判断剩下的文字够不够对回客户。
留下后四位 为什么仍能对回
法律条文把「认不出是谁」和「拿掉直接标识」分成两件事。工单正文通常只做到后一件,而且还只做到一半。
《个人信息保护法》第四条写的是:个人信息是与已识别或者可识别的自然人有关的各种信息,不包括匿名化处理后的信息。中央网信办公布的全文里,第七十三条又把两个词拆开。去标识化:不借助额外信息时无法识别特定自然人。匿名化:无法识别且不能复原。工单上把手机号改成 *******8000,属于去标识化的常见手法,不是匿名化。谁手里还有完整工单、通话录音或订单库,就能把末四位、邮箱域名和投诉情节拼回去。
智能掩码故意留下末四位和域名,是为了让座席自己还能核对「改的是不是刚才那一条」,不是为了让这段文字可以安全地交给任意第三方。完全掩码去掉末四位之后,对回难度会上升,但姓名、地址、单号和情节一句都不会因此消失。把「星号变多了」读成「已经不能识别」,是把去标识化误当成匿名化。
邮箱域名常常比本地部分更危险。个人邮箱的 @example.com 指向性弱;@一家只有二十人的公司域名 加上「昨天下午四点要求退款」,在该公司内部几乎就是点名。IPv4 留下 203.0.*.* 时,对公网用户意义有限,对只在一个办公网段里排障的人,网段本身就是线索。密钥留下 sk_test_ 或 ghp_,等于告诉下游「这里曾经出现过哪一类凭证」。前缀不是密码,却是分类标签。
本文引用《个人信息保护法》只为对照「可识别 / 去标识化 / 匿名化」这三个词。UsePwd 不声称符合该法、GDPR 或等保,也不提供合规审计。脱敏页是本机辅助,重要外发仍要人看一眼。
姓名、地址、单号 盖不住
规则不读汉字姓名,也不理解「货到门口外包装破损」。这些字段往往比手机号更好用。
中文姓名两个或三个汉字,没有任何通用校验位。地址是街道、小区和门牌的组合,不是固定位数。订单号、工单号、快递单号各家自己编,今天是 WO-20260903-8842,明天是另一套前缀。对话式 AI 要起草回复,恰恰最需要这些情节:什么时候打过电话、货到了哪里、承诺过什么。格式引擎如果把它们全盖掉,草稿会变得没法用;如果不盖,身份层就还在。
所以真正要人工删的,经常不是手机号。手机号最容易被规则碰到。更值得看的是:联系人怎么称呼、有没有完整地址、有没有可检索的单号、有没有足以锁定一次通话的时间与内容。把这四项留在提交给模型的正文里,再宣称「已经脱敏」,只说明电话那一行变短了。
若你的目标只是让模型改语气、列回复要点,先把称呼改成「客户」,地址改成「配送地址」,单号改成「订单 A」,时间改成「上次通话」。规则打星号解决不了这一层。若你的目标是让模型根据真实单号去查系统,那已经超出「脱敏后外发」:模型侧会重新看到标识,本机掩码没有意义。
当场怎么 核对照掩码
目标不是证明「模型看不见任何人」,而是证明:六类字段按规则变了,姓名和情节还在,并且这次输入没有进 UsePwd 的请求体。
-
01
准备一段不真实的示例工单
不要用生产工单。例如:单号
WO-20260903-8842,联系人王敏,手机13800138000,邮箱wangmin@example.com,卡号4111111111111111(公开测试号),收货上海市浦东新区示例路 12 号。诉求写昨天下午四点录音里说好的退款未到账,订单号EX20260903001。调试备注写回调曾用sk_test_ExampleNotARealKey01,源站203.0.113.10。 -
02
打开敏感脱敏并清空输入
进入隐私清洗的敏感脱敏。页面打开即可用。需要时先清空输入框,避免和上次粘贴混在一起。六类识别保持勾选,先用默认的智能掩码。
-
03
对照命中统计和留下的字
结果统计里应出现电话、邮箱、银行卡、API Key、IP。手机号应留下
8000,邮箱应类似w***@example.com,密钥应留下sk_test_和末四位,IPv4 应类似203.0.*.*。王敏、示例路 12 号、WO-20260903-8842、EX20260903001和「昨天下午四点」应原样还在。这些还在,就说明还不能把这段当「已无法对回」的文本交给 AI。 -
04
再跑一次完全掩码对照差集
切到完全掩码。末四位和邮箱域名应不再可读。姓名、地址、单号和情节仍在。用这个差集判断:你要交给模型的,到底是「改语气」,还是「按真实单号继续查」。
-
05
打开网络面板看有没有原文
按 F12 切到网络。脱敏过程中,不应出现把整段工单当作请求正文发出的接口。生产环境可能有发往
/tj/的访问分析,载荷是页面与按钮名,例如脱敏次数,不是你粘贴的原文。本机预览不发送分析。
这组步骤和安全说明是互补的:安全说明回答明文会不会离开浏览器,本文只回答「离开之前,星号盖住了哪一层」。两页都不代替清洗页上的表单。工单里若还带着活动链接,同一页的干净链接可先去掉 utm_* 和 click ID;那是另一层,见二次转发活动链接时,UTM 和 click_id 会把什么身份一起带出门。
脱敏 挡不住 的几件事
把「打了星号」读成「贴进 AI 一定匿名」,会漏掉几条同样能核对的边界。
OpenAI 的 Temporary Chat 说明把「不出现在历史、不用于训练」和「为安全目的最多保留 30 天」写在同一页。「如何用你的数据改进模型」则写明:个人服务上的内容可能用于训练,除非退出。其他厂商条款不同,不要把一家的按钮理解成所有对话框的同一保证。共同的、能当场看见的事实只有:提交之后,正文已经不在你这台电脑的唯一控制下。
适合先脱敏再交给模型的,是你只需要改语气、列要点、检查错别字的文本:去掉直接标识后,情节仍够用。不适合把整段密钥、口令、未发布源码或完整会议录音当「打了星号就能贴」。整段机密应走阅后即焚:明文在本机按 AES-256-GCM 加密,编号走 ?id=,密钥走 #,创建和阅读都打开即用,服务器只暂存密文。密钥为什么不进访问日志,见URL 的 # 片段为什么不会出现在服务器日志里。两条工具不要混成同一种保证。
文件备份是第三条路径。单文件不超过 5 GB 的本地加解密,走文件加密盒,输出 .lock / .enc,文件默认不上传。口令本身强不强,用密码生成器在 6–128 位之间生成,再用密码检测在本机看强度并对照随页面提供的公开泄露弱口令名单。检测不是全网撞库,待测口令不会上传。这些页面和本篇一样打开即用,顶栏右侧只有语言切换。
贴进 AI 之前,先看规则盖住的是六类字段,还是你以为的「整个人」。能分清格式命中和情节对回,才不会把一篇脱敏原理文读成「洗过就能交给任意模型」的担保。
贴进 AI 之前 常被问到的
下面四条只回答本篇的边界,不重复清洗页上的按钮说明。
读完去 核对照掩码结果
文章回答「格式脱敏为什么仍可能对回同一个客户」。要当场对照已掩码的类型和留下的情节,打开敏感脱敏即可,不必先注册。