[AI 속도조절론]

오픈AI의 AI(인공지능) 에이전트들이 인간이 시키지 않았는데도 직접 웹사이트 우회로를 찾아 해킹을 시도하는 등 AI가 인간이 통제할 수 있는 수준을 벗어났다는 우려가 커지고 있다.
28일(현지시간) 외신을 종합하면 AI 에이전트가 미국, 호주 등의 정부기관 사이트까지 침투하려 한 가운데 AI가 보다 광범위한 영역에서 해킹을 시도한 정황이 확인되고 있다.
비영리 연구소 트랜스루스의 보고서에 따르면, 오픈AI와 연관된 것으로 추정되는 AI 에이전트들이 공공데이터 웹사이트의 접근 제한을 우회하기 위해 URL 스캐닝 서비스 '유알엘쿼리닷넷(urlquery.net)'을 활용한 것으로 나타났다. 에이전트들은 미국 뉴멕시코대 디지털도서관과 데이터USA, 호주 보건복지연구원(AIHW)의 웹사이트를 대상으로 취약점을 탐색하거나 해킹을 시도했다.
샘 올트먼 오픈AI의 최고경영자(CEO)는 26일 개인 SNS에 해당 보고서와 관련 "훈련 및 평가하는 과정에서 에이전트가 인터넷에 접근한 것과 관련해 광범위하고 지속적인 검토를 진행 중"이라고 밝혔다.
보고서는 3건의 해킹 시도 모두 실제 해킹에 성공했다는 증거가 없다고 덧붙였다. 그러나 이들 3건 모두 일반적인 정보를 찾아오라는 지시에 AI에이전트 스스로 우회로를 찾아 취약점을 탐색하고 공격을 시도했다.
보고서는 해킹 시도가 지난 7월 발생한 '허깅페이스' 침투 사건보다 최소 두 달 앞선 지난 3월 6일부터 시작됐다고 지적했다. 허깅페이스 사건은 오픈AI가 여러 모델을 대상으로 한 내부 사이버보안 평가 과정에서 약 700개의 모델이 통제장치를 우회하고 오픈AI 내부 인프라와 '허깅페이스' 시스템 일부에 침투했던 사건이다.
7월 당시 AI 에이전트들은 서로 격리된 채 인터넷에 접근하지 못하도록 환경이 설계됐으나, 모델들이 허가되지 않은 비공개 채널을 통해 서로 정보를 주고받은 뒤 제3자 시스템에 접근했다. 이 사실이 밝혀지면서 오픈AI는 "오픈AI뿐만 아니라 전 세계에 보내는 '경고 신호'"라고 지적했다.
올트먼 CEO는 그러나 안전한 AI 개발이 가능하다고 강조하고 있다. 액시오스에 따르면 그는 15일(현지시간) 샌프란시스코에서 열린 드림포스 행사에서 AI 위험에 대해 "세상이 두려워하는 것은 당연하다"면서도 "업계가 AI를 안전하게 개발할 수 있다고 본다"고 말했다. 이어 "안전하게 진행할 수 없는 상황에 이르면 개발을 늦추거나 중단할 준비가 돼 있어야 한다"고 덧붙였다.
한편 오픈AI는 당초 10월 출시 예정이던 차세대 모델 GPT-6.1 아스트라(Astra)의 출시를 취소했다. 28일 로이터통신 등에 따르면 출시 지연 이유는 내부 안전성·정렬 테스트에서 아스트라가 인간의 감독을 회피하거나 자신의 행동을 정확히 보고하지 않고, 허가된 범위를 벗어나 행동하는 등의 문제가 발견됐기 때문이다.