한 줄 정의
URL은 웹에서 페이지나 파일이 어디 있는지 알려주는 주소야. 브라우저 주소창에 뜨는 그 문자열이고, 쉽게 말하면 인터넷 세상의 집 주소거든. 그런데 AI에 텍스트를 넘기는 상황에서는 이 주소가 개인정보 목록에도 올라가. OpenAI가 공개한 개인정보 가림 모델 Privacy Filter는 개인 URL을 이름, 이메일, 전화번호와 같은 목록에 넣어 가릴 대상으로 다루거든.
어떻게 작동하나
URL 자체는 단순해. 주소를 적으면 그 위치로 찾아가는 약속이야. 여기서 다룰 건 URL이 이메일이나 메모 같은 글 안에 섞여 있을 때 어떻게 걸러내느냐야.
Hugging Face 모델 카드를 보면 Privacy Filter가 찾는 개인정보 범주는 8개야. 계좌번호, 주소, 이메일, 사람 이름, 전화번호, URL, 날짜, 비밀값(비밀번호나 API 키 같은 것)이고, URL 범주의 라벨 이름은 private_url이야. 라벨 이름에 private가 붙어 있으니, 글에 나온 주소를 전부 가린다고 단정하긴 어려워. Decrypt 기사도 같은 8개 범주로 정리했어.
처리 방식은 모델 카드 설명대로 보면 이래. 문장을 한 단어씩 새로 쓰는 게 아니라, 들어온 텍스트를 한 번에 훑으면서 글자 조각(토큰)마다 “여긴 URL”, “여긴 이메일” 같은 라벨을 달아. 라벨 붙은 구간을 [PRIVATE_EMAIL] 같은 자리표시로 바꾸면 마스킹 끝.
크기는 모델 카드 기준 전체 15억 개(1.5B) 파라미터고, 라이선스는 Apache 2.0이야. 카드에 상업적 배포에도 맞는 라이선스라고 적혀 있어서 사내 업무 흐름에 넣어 시험해 보기도 어렵지 않아. 파일은 Hugging Face의 openai/privacy-filter에서 받을 수 있어.
왜 중요한가
AI에 넘길 텍스트를 정리할 때 지울 목록을 이름, 이메일, 전화번호로만 잡았다면, 모델 카드 기준으로는 범주 하나(private_url)를 빠뜨린 셈이야. URL을 개인정보 목록에 넣을지 판단할 때 기준 하나가 생기는 거지.
실제로 써볼 만한 경우는 두 가지 정도야.
- 고객 이메일 묶음을 ChatGPT에 요약시키기 전에, 이름이랑 이메일뿐 아니라 개인 URL까지 먼저 가려서 보낼 때.
- 문의 내역이나 업무 로그를 AI 분석용으로 정리할 때. Decrypt는 “세 자리-대시-세 자리” 같은 패턴으로 찾는 방식은 문맥을 구분 못 하고, Privacy Filter는 주변 문장을 읽어서 구분한다고 설명했어.
성능은 OpenAI가 직접 밝힌 숫자가 있어. Decrypt 보도에 따르면 OpenAI는 PII-Masking-300k 벤치마크에서 F1 96%를 냈고, 수정된 버전에서는 97.43%였다고 보고했어. OpenAI가 스스로 측정한 결과고, 다른 기관이 다시 측정한 결과는 이번 근거 자료에 없어. 범주별 점수도 근거 자료에 나와 있지 않아서, URL만 따로 얼마나 잘 잡는지는 이 숫자로는 알 수 없어.
주의해서 볼 점
한계는 OpenAI가 먼저 밝혔어. Decrypt 기사에 실린 OpenAI 경고를 보면, Privacy Filter는 익명화 도구도 아니고 규정 준수 인증도 아니고 정책 검토를 대신하지도 않아. 모델 카드에도 가림 처리와 데이터 줄이기를 돕는 도구일 뿐 익명화를 보장하지는 않는다고 적혀 있어.
그러니까 URL 몇 개 가렸다고 문서가 익명화되는 건 아니야. 96%가 100%는 아니니까 결과는 사람이 한 번 더 봐야 하고, 모델 카드도 민감한 업무에서는 사람 검토 단계를 두라고 권해. 언어는 주로 영어라고 돼 있으니 한국어 문서라면 먼저 몇 건 돌려보고 판단해 봐. 급할 건 없어. 검사 단계를 하나 더 둔다고 생각하고 써보면 돼.