本頁說明 Sensitive Data Protection 如何建立儲存在 Cloud Storage 中的去識別化資料副本。本文也會列出這項作業的限制,以及開始作業前應考量的重點。
如要瞭解如何使用 Sensitive Data Protection 建立去識別化的 Cloud Storage 資料副本,請參閱下列文章:
關於去識別化
去識別化是從資料中移除個人識別資訊的程序。目標是讓您在符合隱私權規定的前提下,使用及分享健康、財務或人口統計等個人資訊。如要進一步瞭解去識別化,請參閱「將機密資料去識別化」。
如要進一步瞭解 Sensitive Data Protection 中的去識別化轉換,請參閱轉換參考資料。如要進一步瞭解 Sensitive Data Protection 如何遮蓋圖片中的機密資料,請參閱「圖片檢查和遮蓋」。
使用儲存空間去識別化的時機
以下是一些常見用途:
- 為非正式環境產生匿名資料集:在將資料暫存到開發、測試或訓練環境之前,請先建立儲存在 Cloud Storage 中的正式環境檔案去識別化副本。
- 與第三方共用經過清理的檔案存放區:為外部業務合作夥伴或稽核人員提供大量文件和非結構化檔案,並保留原始資料夾階層,同時模糊處理敏感欄位。
- 自動化處理已擷取文件的隱私權管道:將新上傳檔案中的敏感資料轉換至指定輸出 bucket,不會變更來源檔案或中斷上游管道。
- 強制執行資料落地和區隔:將機密資產的去識別化鏡像副本儲存在不同的 Cloud Storage 值區,並設定不同的 Identity and Access Management 存取控管機制。
去識別化程序
本節說明如何使用 Sensitive Data Protection,將 Cloud Storage 中的內容去識別化。
如要使用這項功能,請建立檢查工作 (DlpJob),並將其設為建立 Cloud Storage 檔案的去識別化副本。Sensitive Data Protection 會掃描指定位置的檔案,並根據您的設定檢查檔案。檢查每個檔案時,Sensitive Data Protection 會去識別化符合機密資料條件的資料,然後將內容寫入新檔案。新檔案的名稱一律與原始檔案相同。
並將新檔案儲存在您指定的輸出目錄中。如果檔案包含在掃描範圍內,但沒有任何資料符合去識別化條件,且處理過程中沒有發生錯誤,系統就會將檔案複製到輸出目錄,且不會進行任何變更。
您設定的輸出目錄必須位於 Cloud Storage bucket 中,且該 bucket 與包含輸入檔案的 bucket 不同。在輸出目錄中,Sensitive Data Protection 會建立與輸入目錄檔案結構相同的檔案結構。
舉例來說,假設您設定下列輸入和輸出目錄:
- 輸入目錄:
gs://input-bucket/folder1/folder1a - 輸出目錄:
gs://output-bucket/output-directory
去識別化期間,Sensitive Data Protection 會將去識別化檔案儲存在 gs://output-bucket/output-directory/folder1/folder1a 中。
如果輸出目錄中有名稱與去識別化檔案相同的檔案,系統會覆寫該檔案。如不想覆寫現有檔案,請先變更輸出目錄,再執行這項作業。或者,您也可以考慮在輸出值區中啟用物件版本管理。
原始檔案的檔案層級存取控制清單 (ACL) 會複製到新檔案,無論是否找到並去識別化機密資料,皆是如此。不過,如果輸出 bucket 僅設定統一 bucket 層級權限,而非細部 (物件層級) 權限,ACL 就不會複製到去識別化檔案。
下圖顯示儲存在 Cloud Storage 值區中的四個檔案去識別化程序。無論 Sensitive Data Protection 是否偵測到任何私密/機密資料,系統都會複製每個檔案。每個複製的檔案都會採用原始檔案的名稱。
定價
如需價格資訊,請參閱「檢查及轉換儲存空間中的資料」。
支援的檔案類型
Sensitive Data Protection 可以將下列檔案類型群組去識別化:
- CSV
- 圖片
- 文字
- TSV
預設去識別化行為
如要定義 Sensitive Data Protection 轉換結果的方式,可以為下列類型的檔案提供去識別範本:
- 非結構化檔案,例如含有任意形式文字的文字檔
- 結構化檔案,例如 CSV 檔案
- 圖片
如未提供任何去識別化範本,Sensitive Data Protection 會依下列方式轉換發現項目:
- 在非結構化和結構化檔案中,Sensitive Data Protection 會將所有發現項目替換為對應的 infoType,如「InfoType 替換」一文所述。
- 在圖片中,Sensitive Data Protection 會以黑框遮蓋所有發現項目。
限制和注意事項
建立去識別化的 Cloud Storage 資料副本前,請先考量下列事項。
磁碟空間
這項作業僅支援儲存在 Cloud Storage 中的內容。
這項作業會複製每個檔案,供 Sensitive Data Protection 檢查。不會修改或移除原始內容。複製的資料會佔用與原始資料大致相同的額外磁碟空間。
儲存空間的寫入權限
由於 Sensitive Data Protection 會建立原始檔案的副本,因此專案的服務代理必須具備 Cloud Storage 輸出 bucket 的寫入權限。
取樣和設定發現限制
這項作業不支援取樣。具體來說,您無法限制 Sensitive Data Protection 掃描及去識別化每個檔案的範圍。也就是說,如果您使用 Cloud Data Loss Prevention API,就無法在 DlpJob 的 CloudStorageOptions 物件中使用 bytesLimitPerFile 和 bytesLimitPerFilePercent。
此外,您無法控管要傳回的調查結果數量上限。
如果您使用 DLP API,就無法在 DlpJob 中設定 FindingLimits 物件。
檢查資料的規定
執行檢查工作時,Sensitive Data Protection 會先根據檢查設定檢查資料,再執行去識別化作業。無法略過檢查程序。
使用檔案擴充功能的規定
Sensitive Data Protection 會根據副檔名,判斷輸入目錄中檔案的類型。如果檔案沒有副檔名,即使檔案類型受支援,系統可能也不會去識別化。
略過的檔案
對儲存空間中的檔案去識別化時,Sensitive Data Protection 會略過下列檔案:
- 超過 60,000 KB 的檔案。如果檔案超過這個大小上限,建議您將檔案分割成較小的區塊。
- 本頁「支援的附件檔案類型」一節未列出的檔案類型。
- 您刻意從去識別化設定中排除的檔案類型。如果您使用 DLP API,系統會略過您從
DlpJob的Deidentify動作的file_types_to_transform欄位排除的檔案類型。 - 發生轉換錯誤的檔案。
去識別化表格中的輸出資料列順序
我們無法保證去識別化資料表中的資料列順序與原始資料表中的資料列順序一致。如要比較原始資料表和去識別化資料表,您無法依賴列號來找出對應的資料列。如要比較資料表中的資料列,請務必使用專屬 ID 識別每筆記錄。
暫時性金鑰
如果選擇加密編譯方法做為轉換方法,您必須先使用 Cloud Key Management Service 建立包裝金鑰。然後在去識別化範本中提供該金鑰。不支援暫時性 (原始) 金鑰。