把工單原文貼進對話式 AI 之前,格式脫敏為什麼仍可能對回同一個客戶
客服把一封客訴原樣丟進對話式 AI,請它起草回覆。手機號打了星號,並不表示這段文字已經無法指向同一個人。格式脫敏按電話、證件字號、信箱這類可核對的樣式蓋住欄位;姓名、地址、訂單編號和「昨天下午四點那通電話」仍留在上下文裡。下面把「蓋得住 / 蓋不住」拆開,並寫出當場能對照的步驟。不是隱私清理頁的操作說明書。
先分清 蓋住的是哪一層
本篇只回答「工單貼進 AI 之前,格式脫敏為什麼仍可能對回同一個客戶」。不是隱私清理的表單說明,也不是某家模型廠商的完整隱私權政策。
貼進去發生了 哪一層轉移
這不是「問了一句怎麼回覆」。整段工單變成另一家處理者的輸入,副本不再只存在於你的工單系統。
客服、營運和一線開發把對話式 AI 當成起草工具,已經是日常動作:貼客訴、貼日誌、貼會議紀錄,等一段更順的回覆。麻煩在於,貼上框看起來還在你的瀏覽器裡,送出之後文字已經離開目前分頁。模型廠商依自己的條款決定是否用於訓練、是否寫入歷史、是否為安全審查再留一份。你在本機打的星號,只有在送出之前打上,才對那一次請求有效。
2023 年 4 月,三星半導體事業的工程師在大約二十天內三次把不該出門的材料貼進 ChatGPT:半導體資料庫原始碼、設備缺陷檢測程式,以及內部會議紀錄。PCMag 轉述《經濟學人》韓文報導寫過這三起;隨後 Bloomberg 在 2023 年 5 月報導,公司在設備上禁止生成式 AI。這三起裡,沒有一起是「忘了幫手機號打星號」。出門的是原始碼、演算法和會議內容。
同一年,Cyberhaven 統計了使用其產品的約 160 萬名員工的職場行為。2023 年 6 月左右的更新寫明:自 ChatGPT 公開以來,約 4.7% 的員工至少把一份機密材料貼進去過;員工貼進 ChatGPT 的內容裡,約 11% 被標成機密。原始說明在 Cyberhaven 自己的部落格。這是一家資安廠商的遙測,不是全產業普查,數字也不能外推到 2026 年的每一個客服座席。它能核對的只有一件事:把工作原文貼進消費級對話框,在 2023 年就已經夠常見,值得單獨拆開「貼之前蓋住了什麼」。
台灣公務體系把這條線寫得更直白。行政院在 2023 年 10 月 3 日函頒《行政院及所屬機關(構)使用生成式 AI 參考指引》,第 4 點寫:業務承辦人不得向生成式 AI 提供涉及公務應保密、個人及未經機關同意公開的資訊。這份指引管的是行政院所屬機關,不是民間客服的合規證書;它能對照的是同一層判斷:星號變多,並不自動等於「這段已經可以交給任意模型」。民間座席若仍要用消費級對話框改語氣,至少先分清格式命中和情節對回,而不是把「打過星號」讀成准許證。
這和「新金鑰為什麼不該再發到聊天視窗」不是同一層。那篇寫的是輪替之後,API Key 又被貼進可搜尋的頻道;見雲端平台環境變數被拖走之後,新金鑰為什麼不該再發到聊天視窗。本篇要補的是另一條日常通道:工單、郵件和日誌在進 AI 之前,格式脫敏到底改變了哪一層身分,哪一層原樣還在。
貼進 AI 要問的不是「模型會不會把這段話大聲讀給下一個使用者聽」,而是「這一次請求的正文裡,還剩哪些能對回同一個客戶的欄位和情節」。星號只覆蓋被規則命中的那一段。
格式脫敏 蓋得住哪六類
它認的是樣式,不是「這段像不像個人資料」。六類都能當場用示例對上;超出這六類,不要指望它自動動手。
這裡說的格式脫敏,就是按可核對樣式做遮罩。UsePwd 的個資遮罩在目前分頁完成,開啟即用,不必註冊。識別類型固定為六種:電話、證件字號、銀行卡、信箱、API Key、IP。原文不作為 HTTP 請求發出,也不寫入 analytics。單次文字不超過 512 KB,超過就拆開再處理。它不是自然語言理解,不會幫「林佳穎」打分,也不會判斷「示例路 12 號」是不是住址。
電話按中國大陸手機號、國際 + 開頭數字,以及常見北美書寫來抓。證件字號裡,18 位居民身分證會先算校驗位再決定是否下手,避免把一串訂單數字誤判成證件;另外還認 15 位舊號、美國社會安全號碼的 123-45-6789 形態,以及一部分護照式字母加數字。銀行卡要求 13 到 19 位數字,並走 Luhn 校驗;15 位和 18 位整段會跳過,以免和證件字號搶同一串。信箱按本地部分 @ 網域抓。金鑰認一批公開前綴,例如 sk-、sk_live_、sk_test_、AKIA、ghp_、github_pat_、xoxb-、Bearer 。IP 認 IPv4 和一部分 IPv6 寫法。
對台灣座席特別要先對上兩條缺口。國民身分證統一編號是「英文字母加九位數字」,不在上述證件規則裡;規則認的護照式寫法是一到兩個大寫字母加七到八位數字,九位數字那一格對不上。市話與手機常見的 0912-345-678(四位、三位、三位)也不等於大陸 11 碼或北美三位加四位。要讓電話穩定被抓到,示例裡用 +886912345678 這種國際碼連寫比較準。這不是介面故障,而是「認樣式、不認中華電信編號計畫」。
預設是智慧遮罩:電話、證件、卡號留下末四碼,信箱留下本地部分第一個字元和完整網域,金鑰留下前綴和末四碼,IPv4 留下前兩段。完全遮罩則把命中段改成同樣長度的星號;信箱變成 ***@***,金鑰仍保留可辨認的前綴再加 ***。兩種模式都只改命中段。右側會列出本次識別到的類型和筆數,用來對照,而不是口頭保證「已經匿名」。
+886912345678 會變成一串星號加 5678。末四碼仍是對回線索。
jiaying@example.com 變成 j***@example.com。公司信箱的網域往往比本地部分更有指向性。
sk_test_ 還在,IPv4 前兩段還在。能判斷「這是哪一類東西」,不能當整段秘密已經消失。
頁面上的識別開關可以關掉某一類。關掉電話後,手機號會原樣留下。這是給你對照用的,不是「關得越少越安全」。外發進 AI 之前,該開的六類都開,再用下一節判斷剩下的文字夠不夠對回客戶。
留下後四碼 為什麼仍能對回
法律條文把「認不出是誰」和「拿掉直接識別」分成兩件事。工單正文通常只做到後一件,而且還只做到一半。
《個人資料保護法》第 2 條第 1 款寫的是:個人資料指自然人的姓名、出生年月日、國民身分證統一編號、護照號碼、聯絡方式,以及其他得以直接或間接方式識別該個人之資料
。全國法規資料庫公布的全文用的是「直接或間接識別」,不是「欄位名稱必須長得像身分證」。工單上把手機號改成 *******5678,只是拿掉一部分直接識別符。誰手裡還有完整工單、通話錄音或訂單庫,就能把末四碼、信箱網域和客訴情節拼回去。
實務上常把這層叫做假名化:拿掉或替換直接識別,但仍能靠額外資訊還原。匿名化才是無法識別且不能復原。台灣個資法本文沒有把「匿名化 / 假名化」兩個詞寫進定義款,學說和實務卻用這組對照來讀第 2 條的反面:資料必須到達「無從直接或間接識別」的程度,才離開個資的範圍。智慧遮罩故意留下末四碼和網域,是為了讓座席自己還能核對「改的是不是剛才那一條」,不是為了讓這段文字可以安全地交給任意第三方。完全遮罩去掉末四碼之後,對回難度會上升,但姓名、地址、單號和情節一句都不會因此消失。把「星號變多了」讀成「已經不能識別」,是把假名化誤當成匿名化。
信箱網域常常比本地部分更危險。個人信箱的 @example.com 指向性弱;@一家只有二十人的公司網域 加上「昨天下午四點要求退款」,在該公司內部幾乎就是點名。IPv4 留下 203.0.*.* 時,對公眾網路使用者意義有限,對只在一個辦公網段裡排障的人,網段本身就是線索。金鑰留下 sk_test_ 或 ghp_,等於告訴下游「這裡曾經出現過哪一類憑證」。前綴不是密碼,卻是分類標籤。
本文引用《個人資料保護法》只為對照「可識別 / 假名化 / 匿名化」這三層。UsePwd 不聲稱符合該法、GDPR 或任何認證,也不提供合規稽核。個資遮罩是本機輔助,重要外發仍要人看一眼。
姓名、地址、單號 蓋不住
規則不讀中文姓名,也不理解「貨到門口外箱破損」。這些欄位往往比手機號更好用。
中文姓名兩個或三個漢字,沒有任何通用校驗位。地址是路名、巷弄和門牌的組合,不是固定位數。訂單編號、工單號、宅配單號各家自己編,今天是 WO-20260903-8842,明天是另一套前綴。對話式 AI 要起草回覆,恰恰最需要這些情節:什麼時候打過電話、貨到了哪裡、承諾過什麼。格式引擎如果把它們全蓋掉,草稿會變得沒辦法用;如果不蓋,身分層就還在。
台灣身分證字號正好落在這條縫裡。它是法定直接識別符,卻不是這套六類規則會下手的樣式。座席若只看「證件字號那一欄有沒有打星號」,會漏掉最不該漏的那一串。所以真正要人工刪的,經常不是手機號。手機號最容易被規則碰到。更值得看的是:聯絡人怎麼稱呼、有沒有完整地址、有沒有可檢索的單號、有沒有足以鎖定一次通話的時間與內容,以及身分證、健保卡號這類本地證件有沒有原樣留下。把這些留在提交給模型的正文裡,再宣稱「已經脫敏」,只說明電話那一行變短了。
若你的目標只是讓模型改語氣、列回覆要點,先把稱呼改成「客戶」,地址改成「配送地址」,單號改成「訂單 A」,時間改成「上次通話」。規則打星號解決不了這一層。若你的目標是讓模型根據真實單號去查系統,那已經超出「脫敏後外發」:模型側會重新看到識別,本機遮罩沒有意義。
當場怎麼 核對遮罩
目標不是證明「模型看不見任何人」,而是證明:六類欄位按規則變了,姓名和情節還在,並且這次輸入沒有進 UsePwd 的請求主體。
-
01
準備一段不真實的示例工單
不要用正式環境工單。例如:單號
WO-20260903-8842,聯絡人林佳穎,手機+886912345678,信箱jiaying@example.com,卡號4111111111111111(公開測試號),收貨臺北市信義區示例路 12 號。身分證寫A123456789(示例,非真實字號)。訴求寫昨天下午四點錄音裡說好的退款未入帳,訂單編號EX20260903001。除錯備註寫回呼曾用sk_test_ExampleNotARealKey01,來源站203.0.113.10。若要看到「證件字號」統計被點亮,另外加一筆公開測試形態123-45-6789;只有台灣身分證時,這一類不該出現。 -
02
開啟個資遮罩並清空輸入
進入隱私清理的個資遮罩。頁面開啟即可用。需要時先清空輸入框,避免和上次貼上混在一起。六類識別保持勾選,先用預設的智慧遮罩。
-
03
對照命中統計和留下的字
結果統計裡應出現電話、信箱、銀行卡、API Key、IP。手機號應留下
5678,信箱應類似j***@example.com,金鑰應留下sk_test_和末四碼,IPv4 應類似203.0.*.*。林佳穎、示例路 12 號、A123456789、WO-20260903-8842、EX20260903001和「昨天下午四點」應原樣還在。這些還在,就說明還不能把這段當「已無法對回」的文字交給 AI。 -
04
再跑一次完全遮罩對照差集
切到完全遮罩。末四碼和信箱網域應不再可讀。姓名、地址、台灣身分證字號、單號和情節仍在。用這個差集判斷:你要交給模型的,到底是「改語氣」,還是「按真實單號繼續查」。
-
05
開啟網路面板看有沒有原文
按 F12 切到網路。遮罩過程中,不應出現把整段工單當作請求正文發出的介面。正式環境可能有發往
/tj/的造訪分析,載荷是頁面與按鈕名,例如遮罩次數,不是你貼上的原文。本機預覽不傳送分析。
這組步驟和安全說明是互補的:安全說明回答明文會不會離開瀏覽器,本文只回答「離開之前,星號蓋住了哪一層」。兩頁都不代替清理頁上的表單。工單裡若還帶著活動連結,同一頁的乾淨網址可先去掉 utm_* 和 click ID;那是另一層,見二次轉發活動連結時,UTM 和 click_id 會把什麼身分一起帶出門。
脫敏 擋不住 的幾件事
把「打了星號」讀成「貼進 AI 一定匿名」,會漏掉幾條同樣能核對的邊界。
OpenAI 的 Temporary Chat 說明把「不出現在歷史、不用於訓練」和「為安全目的最多保留 30 天」寫在同一頁。「如何用你的資料改進模型」則寫明:個人服務上的內容可能用於訓練,除非退出。其他廠商條款不同,不要把一家的按鈕理解成所有對話框的同一保證。共同的、能當場看見的事實只有:送出之後,正文已經不在你這台電腦的唯一控制下。
適合先遮罩再交給模型的,是你只需要改語氣、列要點、檢查錯字的文字:去掉直接識別後,情節仍夠用。不適合把整段金鑰、口令、未發布原始碼或完整會議錄音當「打了星號就能貼」。整段機密應走閱後即焚:明文在本機按 AES-256-GCM 加密,編號走 ?id=,金鑰走 #,建立和閱讀都開啟即用,伺服器只暫存密文。金鑰為什麼不進存取日誌,見URL 的 # 片段為什麼不會出現在伺服器日誌裡。兩條工具不要混成同一種保證。
檔案備份是第三條路徑。單檔不超過 5 GB 的本機加解密,走檔案加密盒,輸出 .lock / .enc,檔案預設不上傳。口令本身強不強,用密碼產生器在 6–128 字元之間產生,再用密碼檢測在本機看強度並對照隨頁面提供的公開洩露弱口令名單。檢測不是全網撞庫,待測口令不會上傳。這些頁面和本篇一樣開啟即用,頂欄右側只有語言切換。
貼進 AI 之前,先看規則蓋住的是六類欄位,還是你以為的「整個人」。能分清格式命中和情節對回,才不會把一篇脫敏原理文讀成「洗過就能交給任意模型」的擔保。
貼進 AI 之前 常被問到的
下面四條只回答本篇的邊界,不重複清理頁上的按鈕說明。
讀完去 核對遮罩結果
文章回答「格式脫敏為什麼仍可能對回同一個客戶」。要當場對照已遮罩的類型和留下的情節,開啟個資遮罩即可,不必先註冊。