[런치리포트]비식별조치, 빅데이터 시대 방아쇠

[런치리포트]비식별조치, 빅데이터 시대 방아쇠

김성휘 배소진 정영일 , 그래픽=이승현 디자이너 기자
2016.11.03 08:52
구글 선호 매체 등록 구글에서 머니투데이 추가하기

[the300]종합

빅데이터 법개정 기다리는 기업들..비식별 조치 논쟁 재점화

임종룡 금융위원장이 지난1월 5일 오후 서울 중구 명동 은행회관 뱅커스클럽에서 열린 한국신용정보원 창립기념식에서 축사를 하고 있다/사진=뉴스1
임종룡 금융위원장이 지난1월 5일 오후 서울 중구 명동 은행회관 뱅커스클럽에서 열린 한국신용정보원 창립기념식에서 축사를 하고 있다/사진=뉴스1

2006년 미국 넷플릭스는 영화 추천 알고리즘의 정확성을 높이기 위해 경연대회를 열고 50만명 이용자의 6년 동안 영화 평가 1억 건을 공개했다. 이름 등 개인을 식별할 요소는 지웠지만 평가 점수, 평가 일시는 공개했다. 그런데 텍사스 대학 연구팀이 온라인 영화전문사이트에 공개된 영화평가와 넷플릭스의 데이터를 결합, 개인을 재식별해냈다. 비식별 조치가 금세 뚫릴 수 있다는 것이어서 미국 FTC(연방거래위원회)가 지적했고, 2차 경연대회는 취소됐다.

한편 국내에선 지난해 약학정보원의 진료정보 43억건이 유출됐고 2014년초엔 최악의 카드정보 유출사태로 KB국민카드 5300만건, 롯데카드 2600만건 등이 새어나왔다.

빅데이터가 경제에 활력을 주고 새 일자리를 창출할 21세기의 '원유'로까지 기대를 모으지만 산업화까지 갈 길이 멀다. 개인정보 유출 피해는 막으면서, 부가가치를 창출할 수준의 정보량을 담는 두 가지 과제를 넘어야 한다. 그러자면 개인정보의 이름표 즉 개인 식별사항을 제거하는 비식별 조치가 핵심이다. 20대 국회가 관련법안 심사를 본격화한다.

◇이름 지우면 나인줄 모를까? "비식별 정보는 허용하자"

국회 미래창조과학방송통신위원회는 오는 15일 배덕광 새누리당 의원의 '빅데이터의 이용 및 산업진흥 등에 관한 법률안'에 대해 공청회를 연다. 비식별 처리된 정보를 활용하게 하자며 19대 국회에도 적잖은 법안이 제출됐지만 논란 끝에 일부 통과에 그쳤다.

배 의원 법안은 비식별화 개인정보는 공공기관과 민간기업이 자유롭게 활용, 조합해 새로운 정보를 만들 수 있게 했다. 당사자가 누구인지 알 수 없게 처리하되 정보의 역조합 즉 재식별을 시도하거나 실제 성공했을 경우 5년 이상의 징역 또는 5000만원 이하 벌금에 처하도록 했다.

같은 당 이은권 의원의 정보통신망 이용촉진 및 정보보호 등에 관한 법률 개정안은 재식별 개인정보를 파기하거나 추가 조치를 하지 않으면 3000만원 이하 과태료를 물게 했다.

추경호 의원은 비식별 정보는 개인정보에서 제외, 핀테크 등 금융업에 이용할 수 있게 한 신용정보의 이용 및 보호에 관한 법률 개정안을 냈다. 추 의원은 핀테크 활성화를 위해 크라우드 펀딩 온라인 광고 규제를 완화하는 자본시장법과 동반 제출했다.

빅데이터를 이용한 신규 비즈니스나 맞춤상품은 금융분야에선 핀테크, 그밖에 IT와 이동통신, 렌터카, 호텔 및 여행 숙박 서비스, 헬스케어, 항공 등 거의 무한대로 활용범위가 넓다. 그런데 현행 신용정보법은 개인을 식별할 수 있는 정보 외에 대출 등 거래내용을 판단할 수 있는 정보 등을 모두 개인신용정보로 본다. 비식별 정보는 개인정보일수도, 아닐수도 있는 상황이다. 정부 가이드라인도 비식별 정보를 개인정보가 아닌 것으로 '추정'할 뿐이다. 빅데이터 가공 기술을 가진 벤처기업도, 이를 이용해 비즈니스에 활용하려는 대기업도 법 정비가 시급하다고 본다.

◇"4차 산업 기반 마련"-"재식별되면 어쩌려고"

이 같은 빅데이터 법개정에는 새누리당이 적극적이다. 비식별 조치를 하면 안전하게 개인정보를 빅데이터로 가공할 수 있다고 본다. 미래부, 금융위 등 주무 부처들도 같은 입장이다. 핀테크, 빅데이터 창조경제 등은 박근혜정부의 중점 육성산업이다.

그러나 아무리 익명화를 시켜도 개인 SNS 등의 여러 정보를 교차활용하다보면 개인이 특정될 가능성은 있다. 넷플릭스 사례가 그렇다. 시민단체와 소비자 단체 등에서는 '소비자 보호'를 주장하며 정부의 가이드라인 및 개정안에 반대하고 있다. 업계는 업계대로 재식별이 불가능한 정보는 빅데이터로서의 상품가치가 크지 않다고 보는 불만도 있다.

15일 공청회에서 이 같은 양론이 충돌할 전망이다. 배덕광 새누리당 의원은 2일 머니투데이 더300(the300)과 통화에서 "지난 19대 국회에서는 민생법안이 아니라는 이유로 빅데이터법이 논의도 안 되고 자동 폐기됐다"며 "그동안 개인정보 비식별화 등 현안 중심으로 업계와 학계 등에서 논의가 이뤄진만큼 이번에 조속히 심의해서 4차산업 혁명의 기반을 마련해야 할 것"이라고 말했다.

유의동 새누리당 의원도 "핀테크 시대가 도래함에 따라 빅테이터 활용은 거스를 수 없는 대세"라고 말했다. 단 "여전히 재식별화에 대한 우려가 남아있어 비식별정보의 유통현황을 조사하고 관리, 감독할 수 있는 체계를 마련하는 등 개인정보 보호를 위한 노력이 필요하다"고 말했다. 유 의원은 정무위 국감에서도 이 점을 지적했다.

이재정 더불어민주당 의원(안전행정위)는 국감에서 "데이터 활용으로 인한 개인의 프라이버시 침해, 독점강화와 공정경쟁 저해에 대한 우려는 희석된 채 마케팅 활용에만 관심 갖는 가이드라인을 국민은 신뢰할 수 없다"며 "법률개정이 필요한 것을 가이드라인으로 합법적인 것처럼 해석하는 것은 국회 입법권을 무시하는 월권"이라고 비판했다.

사생활 지키는 비식별조치, 안전성 vs. 활용성 해답은…

빅데이터(Big Data)는 흔히 '21세기의 원유'로 불린다. 20세기의 원유가 그랬던 것처럼 방대하고 다양한 규모의 데이터가 미래산업의 경쟁력을 좌우하는 중요한 자원이 될 것이라는 점에서다. 정치 경제 사회 문화 과학기술 등 거의 모든 영역에서 인류에게 가치있는 정보를 제공해줄 것이라는 기대도 받고 있다.

빅데이터가 풀고 가야할 가장 큰 문제는 사생활 침해 논란이다. 개인정보를 이용해 빅데이터를 만드는 과정에서 특정 개인의 내밀한 정보가 공개될 수 있다는 것이다. 이 때문에 특정 개인을 알아볼 수 없도록 이름을 지우거나 다른 변수로 대체하는 이른바 '비식별화 조치'를 통해 가공하는 과정을 거치게 된다.

정부가 지난 6월 내놓은 개인정보 비식별 조치 가이드라인에 따르면 비식별화 기술은 크게 △가명처리 △총계처리 △데이터삭제 △데이터범주화 △데이터 마스킹 등의 범주로 나눠진다. 이름이나 주민번호, 나이, 주소, 우편번호, 소속, 휴대전화 번호 등이 주요 비식별조치의 대상이 된다.

가명처리는 개인을 알아볼 수 있는 정보(식별자)를 다른 정보로 채워넣는 것을 말한다. 총계처리는 데이터의 총합이나 평균 등으로 개인의 실제정보를 숨기는 기술이다. 데이터삭제와 범주화, 마스킹은 정보 소유자가 누구인지 특정이 되지 않도록 주요 정보를 삭제, 대체하는 방법이다.(시각물 참조)

문제는 개인 정보를 어느 정도까지 비식별화 조치를 하느냐다. 완벽하게 개인과 연결되지 않은 데이터는 사생활 보호에는 유용하지만 산업적 가치가 떨어지는 단점이 있다. 빅데이터 정보를 만들거나 활용하는 업체들은 끊임없이 정보의 안전성과 활용성 사이에서 고민할 수 밖에 없는 상황이다.

비식별화 조치를 마친 데이터라고 해도 다른 자료와 결합해 재식별화될 가능성도 존재한다. 현행 개인정보보호법상에는 다른 정보와 쉽게 결합해 식별이 가능하게 될 경우도 개인정보로 인정한다. 비식별화기술의 적용 만으로 개인정보보호법 위반이 아니라고 단정할 수 없는 이유다.

재식별화가 실제 발생한 1997년 미국 매사추세츠 주 사례가 대표적이다. 매사추세츠주는 연구 목적으로 비식별화된 공무원 병원 진료기록을 공개했다. 하지만 케임브리지시 선거인명부와 비교 분석을 통해 주지사 등의 개인정보가 재식별화되는 사고가 발생한 바 있다.

기술별로 보면 가명처리 기술의 경우 다른 정보와의 결합을 통해 재식별화될 가능성이 비교적 높은 반면 총계처리나 데이터 삭제와 범주화, 마스킹 기술은 상대적으로 위험이 낮은 것으로 알려졌다. 이에 따라 비식별화시 한 기술만 이용할 경우 재식별화 위험이 있는만큼 여러 비식별화 기술을 조합해 사용할 것을 전문가들은 권고하고 있다.

'비식별정보' 통합관리 신용정보원, 빅브라더 혹은 빈껍데기

국민들의 개인정보를 들여다 볼 수 있는 '빅브라더'가 될까. 혹은 당초 취지와 달리 정보를 쌓아두기만 하는 반쪽짜리 기관이 될까. 금융업권별 모든 고객의 신용정보를 통합관리한다는 취지로 설립된 한국신용정보원은 빅데이터 활성화에 대한 기대감과 국민 신용정보 침해 논란 우려를 동시에 안고 올해 1월 첫 발을 뗐다.

◇비식별조치한 개인정보, 개인정보 아니다?

신용정보원은 신용정보의 이용 및 보호에 관한 법(신용정보법)에 의한 종합신용정보집중기관으로서, 신용정보의 집중관리를 통한 신용정보 및 신용정보 주체 보호를 첫 번째 목적으로 한다. 2014년 터진 개인정보유출사고로 인해 여기저기 흩어져 있는 신용정보를 한 곳으로 모아 안전하게 관리해야 할 필요성이 생겼기 때문이다.

하지만 업계는 통합관리의 '부산물'로써 신용정보원에 집중되는 '통합 신용정보'의 활용에 군침을 흘린다. 신용정보원에는 은행연합회·여신금융협회·생명보험협회·손해보험협회·금융투자협회·보험개발원 등 6개 기관이 참여한다. 금융업계의 숙원인 빅데이터 활용에 가장 큰 '이해관계'가 있는 이익단체들이 모인 셈이다. 신용정보원 내 정보분석부에서는 금융권과 비금융권의 빅데이터 활용을 위한 빅데이터 정보를 제공기로 했다. 핀테크산업 활성화를 '신성장동력'으로 꼽는 정부와 기업의 이해관계가 맞물렸다.

신용정보원에서는 서로 다른 금융업권의 이용자 정보를 연계분석, 빅데이터로 제공할 수 있다. 예를 들면 보험가입자의 은행대출 성향을 분석할 수 있다. 대출과 보험의 상관관계를 분석해 대출 이자율을 결정할 수 있게 되는 식이다.

우리나라는 개인정보보호법·정보통신망법 등을 통해 개인정보를 성명, 주민등록번호 등 특정 개인을 알아볼 수 있는 정보로 규정하고 있다. 따라서 이같은 정보를 업계에서 활용하도록 하기 위해서는 '비식별조치'가 수반돼야 한다. '홍길동(35세)'를 '홍00(30대)'로 바꾸는 등 개인정보 일부를 가리거나 바꿔 개인을 특정하지 못하게 하는 기법이다.

정부는 개인정보 비식별화를 통해 빅데이터를 활용할 수 있도록 지난 6월 행정자치부와 방송통신위원회, 금융위원회 등 정보보호와 관련된 부처를 중심으로 '비식별정보 가이드라인'을 내놨다. 비식별화한 정보는 개인정보가 아닌 것으로 추정하고 빅데이터 분석 등 상업적으로 활용할 수 있도록 한다는 것이다. 이 과정에서 기업들은 고객의 추가동의 없이 시장조사나 신상품 개발, 마케팅 활용 등에 이용할 수 있고, 유상으로 제3자에게 제공도 가능하다. 이같은 빅데이터를 제공하는 신용정보원이 '국민 개인정보'의 판매창구가 되는 게 아니냐는 지적이 제기되는 이유다.

◇'재식별화' 우회추진 논란…법 개정 지지부진

문제는 신용정보법에서는 여전히 비식별정보를 개인신용정보로 볼 지에 대해 명확하게 정의하지 않고 있다는 점이다. 정부가 내놓은 가이드라인은 '유권해석'에 가까울 뿐 법적 근거는 되지 못한다.

때문에 정부여당은 신용정보법 개정안 마련에 애를 태우고 있다. 법 개정이 수반되지 않을 경우 신용정보원 역시 정보를 차곡차곡 모으는 '창고'의 역할밖에 하지 못하게 되기 때문이다. 실제로도 신용정보원은 '개인정보 비식별 전문기관'으로 지정돼 융합정보 서비스를 제공할 수 있지만 현재까지 실적은 전무하다시피 한 실정이다.

금융위원회는 지난 4월 어떤 사람의 것인지 구분하지 못하도록 비식별화된 개인신용정보는 금융회사 등에서 활용할 수 있도록 하는 신용정보법 개정안을 입법예고했다. 개인이 특정되지 않으면 법에 저촉되지 않고 얼마든지 정보를 활용할 수 있는 것이다. 이같은 법안은 새누리당 소속 추경호·배덕광 의원 등의 이름으로도 발의된 상태다.

지난 7월에는 '비식별정보'를 개인정보에서 제외하도록 하는 신용정보법 시행령 개정안을 입법예고했지만 개인정보보호법 등 상위법 개정 없는 '우회추진'이란 논란에 부딪혔다. 현재까지 마련된 건 금융위 내부 의결을 통해서도 가능한 신용정보업 감독규정안이다. 신용정보원이 비식별정보를 활용해 업무를 수행할 수 있도록 근거를 마련해준 조치다. 비식별정보의 법적 정의가 마련되지 않은 상태에서는 사실상 '유명무실'하다.

신용정보원이 넘어야 할 또 하나의 산은 '재식별 가능성'이다. 아무리 익명화를 시켜도 개인 SNS 등의 여러 정보를 교차활용하다보면 개인이 특정될 위험성이 항상 존재한다. 시민단체와 소비자 단체 등에서도 '소비자 보호'를 주장하며 정부의 가이드라인 및 개정안에 반대하고 있다. 반대로 업계에서는 재식별이 되지 않는 정보는 빅데이터로서의 상품가치가 크지 않다고 보는 불만도 있다.

비식별·익명정보 활용은 세계 추세…日, 민감한 정보는 제한

구글의 독감 트렌드(Flu trend) 분석은 빅데이터 활용의 대표적 사례로 꼽힌다. 시간·지역별 검색어를 바탕으로 독감 검색패턴을 분석, 독감 발생지역을 실시간으로 보여주고 예측도 했다. 이 데이터를 의료기관과 연결하면 최적의 예산으로 복지를 향상시킬 수 있다. 미국 이동통신회사 T-모바일은 다른 통신사로 옮기는 고객이 보이는 패턴을 분석, 고객이탈을 실시간 감지하는 시스템을 만들었다. 이를 통해 이탈 고객수를 줄였다.

이처럼 빅데이터 활용은 세계적 흐름이다. 미국이 앞서가는 가운데 유럽, 일본 등 선진국도 관련 법제 정비에 나섰다. 덜 민감한 정보는 널리 활용할 수 있게 하되, 민감 정보이거나 식별 가능성이 높으면 활용을 제한하는 식으로 정보활용과 보호 두 가지를 조화시키려는 노력이 보인다.

2일 정부와 정치권에 따르면 미국은 개인정보 보호에 관한 일반법이 없는 대신 의료, 교육 등 분야별로 개인정보 보호에 관한 개별 법령이 있다. 이들 개별 법령에서 제한하지 않는 한 자유로운 데이터의 이용이 보장된다. 이름, 주소, 생일, 전화번호, 이메일주소 등 18가지 주요 식별자를 제거하는 세이프 하버 방식으로 비식별 조치를 한다. 개인을 구별할 수 있는 데이터는 어지간하면 지워서 피해를 예방하는 것이다. 이밖에 전문가가 비식별 조치 범위를 결정할 수도 있다.

이를 통해 비식별 조치된 건강정보는 프라이버시 관련 규제를 적용하지 않는다. 비식별 조치된 학생기록은 별도동의 없이 배포할 수 있다. 이때 데이터 제공자와 받는자가 제공목적 등을 명시한 계약을 체결해야 진행할 수 있다.

일본은 지난해 9월 개인정보보호법을 개정했다. 개인정보와 개인 식별자가 무엇인지 새로 정의했고 익명가공정보(비식별정보) 관리체계도 세웠다. 병력 등 민감한 개인정보는 별도로 분류해 정보취득을 까다롭게 한 반면 민감정보가 아닌 개인정보는 당사자 통보 등 일정 요건을 갖추면 사전동의 없이도 제3자에게 제공할 수 있게 이원화했다. 개인정보를 취급하는 사업자에게 재식별 금지 의무도 부과했다.

EU는 개인정보보호지침상 익명화(가명 처리) 정보를 이 지침 규제대상이 아니라고 본다. 지난 4월 통과된 단일 개인정보 보호법(GDPR)은 이 지침 내용을 구속력 있는 법에 담고 동의 없이 가명 정보를 처리할 수 있는 경우를 공익, 과학연구, 통계 목적 등으로 정비했다. 이 법은 2018년 시행된다.

영국은 2012년 마련한 규약에서 충분한 익명화란 식별 위험성이 매우 낮은 정도라야 한다고 정했다. 합리적으로 식별 위험이 있다면 규제대상인 개인정보에 해당한다는 것이다.

<저작권자 © ‘돈이 보이는 리얼타임 뉴스’ 머니투데이. 무단전재 및 재배포, AI학습 이용 금지>

공유