미성년 성폭력 묘사에 조언까지…스캐터랩AI '제타', 안전장치 뚫렸다

이정현 기자
2026.10.11 15:01

AI(인공지능) 챗봇 '제타'가 성인인증을 거치지 않은 상태에서 미성년자로 설정된 캐릭터를 대상으로 성폭력 등을 묘사하는 대화를 생성하고 차단 장치를 피할 수 있는 표현 방식까지 제시한 것으로 확인됐다. 운영사인 스캐터랩은 "유해 대화 탐지 기준 강화 등 즉각 조치에 나섰다"고 밝혔다.

11일 황정아 더불어민주당 의원이 스캐터랩으로부터 받은 자료에 따르면 지난 9월 말 기준 제타의 월간 활성 이용자 수는 148만명이다. 이 중에서 19세 이하 이용자 수는 38만명에 달했다.

황 의원실이 청소년 이용자와 동일한 안전 기준이 적용되는 '세이프 모드' 에서 제타를 점검한 결과 미성년 캐릭터가 등장하는 대화 시나리오에서 성폭력과 성 착취, 이를 빌미로 한 협박이 이어지는 대화가 생성됐다.

제타의 유해 대화 탐지 모델은 황 의원실의 점검 과정에서 문제 발화 200여건을 차단했다. 그러나 우회 방안을 반복적으로 시도하는 과정에서 일부 안전장치가 무력화되면서 차단됐어야 할 발화가 일부 생성·노출됐다.

특히 대화가 차단되자 AI 가 필터를 피할 수 있는 표현 방식을 제시하고 유해한 전개를 이어가기도 했다.

문제를 인지한 스캐터랩은 긴급 대책 마련에 나섰다. 스캐터랩에 따르면 긴급 조치는 세이프 모드 이용자 전체를 대상으로 순차 적용 중이며 이달 18일까지 완료할 계획이다. 같은 대화 시나리오에서 차단이 반복되면 '경고 → 대화 정지 → 대화 초기화' 순으로 제재하는 단계별 제재도 도입한다.

4분기 중에는 △AI 가 생성 단계부터 연령에 맞게 전개·묘사를 조절하고 우회 요청에 응하지 않도록 개선 △대화 맥락을 반영하는 신규 탐지 모델 배포 △매월 정기 레드팀 점검 △청소년 이용 시간(하루 3시간)·결제 한도 (월 10만원) 설정 △ 콘텐츠 연령 등급 도입 등을 추진한다.

스캐터랩 관계자는 " 성인인증 없이 이용할 수 있는 환경에서 유해한 대화가 생성된 문제를 무겁게 받아들인다" 며 "문제 확인 후 즉시 유해 대화 탐지 및 차단 기능을 강화하고 반복적인 유해 대화 시도에 대한 단계별 이용 제한 조치를 도입했다"고 말했다.

<저작권자 © ‘돈이 보이는 리얼타임 뉴스’ 머니투데이. 무단전재 및 재배포, AI학습 이용 금지>