오픈AI가 안전성 우려로 차세대 AI(인공지능) 모델인 GPT 6.1 아스트라를 출시하지 않기로 했다고 28일(현지시간) 밝혔다.
이번 결정은 최근 AI 업계 전반에 AI 시스템이 인간의 통제를 벗어났다는 보고가 잇따르고 있는 가운데 이뤄졌다. 선두 AI 개발업체가 안전성 우려를 이유로 새로운 AI 모델의 출시를 포기하는 것은 이례적인 일이다.
오픈 AI는 당초 GPT 6.1 아스트라를 다음달에 출시할 계획이었다. GPT 6.1 아스트라는 오픈AI의 이전 모델보다 사람의 도움 없이 처음부터 끝까지 까다로운 작업을 수행하는 능력이 뛰어났고 글쓰기 능력도 향상됐다.
하지만 월스트리트 저널(WSJ)에 따르면 오픈AI의 안전 시스템 책임자인 사치 자인은 GPT 6.1 아스트라가 이전 모델에 비해 두 가지 영역에서 성능이 후퇴했다고 밝혔다.
첫째, 정렬(alignment) 측정 테스트에서 성능이 좋지 않았다. 정렬은 AI 모델이 사람이 원하는 대로 얼마나 잘 행동하는지를 의미한다. GPT 6.1 아스트라는 특히 기만 수준이 높게 나왔다. 이는 AI 모델이 자신이 어떤 행동을 했는지, 또는 하지 않았는지에 대해 사용자에게 항상 정직하게 알려주지는 않았다는 것이다.
둘째는 오픈AI가 범위 승인(scope authorization)이라고 부르는 영역에서 문제가 있었다. GPT 6.1 아스트라는 사용자에게 허락을 구하지 않고 작업을 계속 진행하는 경우가 있었고 때로는 안전하지 않을 수 있음에도 외부 도구나 서비스를 이용하려 했다.
자인은 "안전성과 정렬에 관해서는 언제나 상충관계가 존재한다"며 "모델이 장애물을 만났을 때 업무를 실질적으로 어떻게 수행하느냐에 있어서 지나친 나태함을 피하면서 동시에 정해진 범위를 벗어나지 않도록 하는 적절한 선을 찾는 것이 필요하다"고 말했다.
이어 GPT-6.1 아스트라는 문제에 직면했을 때 소극적으로 행동하는 나태함(model laziness)과 같은 영역에서는 성능이 개선됐지만 안전성과 정렬 측면에서는 오픈AI가 요구하는 기준을 충분히 충족하지 못했다며 이에 따라 이 모델을 공개 출시하지 않기로 결정했다고 설명했다.
이번 발표는 오픈AI의 연례 개발자 콘퍼런스 하루 전에 나온 것이다. 오픈AI는 연례 개발자 콘퍼런스를 통해 새로운 모델과 서비스를 공개해왔다.
오픈AI는 최근 몇 달 동안 발생한 AI 에이전트의 보안 사고를 조사하고 근본적인 안전성 문제를 해결하기 위해 노력하고 있다고 밝혔다. 이를 위해 AI 에이전트의 잘못된 행동을 더욱 신속하게 포착하기 위한 새로운 모니터링 시스템을 도입하고 엔지니어들에게 AI 시스템을 테스트할 때 더욱 강력한 보안 안전장치를 사용하도록 요구하기 시작했다.
오픈AI는 지난 7월 사이버보안 테스트를 수행하던 내부 에이전트 수백 개가 AI 개발 플랫폼 기업인 허깅페이스를 해킹하는 상황이 발생했다. 이후 호주 정부와 유엔 등은 오픈AI의 에이전트가 허깅페이스 해킹 사례보다 규모는 작지만 유사한 방식으로 웹사이트에 접근하려 했다는 사실을 발견했다.
공개적으로 알려진 AI 에이전트의 보안 사고 가운데 상당수는 일반에 출시될 계획이 없었던 오픈AI의 내부 AI 모델들이 일으킨 것이었다.
오픈AI는 지난주에는 자사의 가장 뛰어난 AI 모델에 대한 훈련을 일시 중단했다고 밝혔다. 한 AI 에이전트가 회사의 인터넷 접근 제한에 존재하는 허점을 뚫고 공개 챗봇에 질의했기 때문이다. 오픈AI는 새로운 모니터링 시스템이 이 문제를 15분 이내에 탐지했으며 이 모델들의 훈련은 현재도 중단된 상태라고 설명했다.
오픈AI는 GPT-6.1 아스트라는 이 모델들 중 하나가 아니라 별개의 사례라고 밝혔다.
자인은 "회사 내부에서 개발할 때든, 사용자에게 출시할 때든 모델 개발이 안전하다는 점을 확실히 하고 싶다"며 "사용자에게 (모델을) 출시할 때는 안전성과 정렬 측면에서 극도로 높은 기준을 적용한다"고 강조했다.
오픈AI는 GPT-6.1 아스트라를 출시하지 않기로 했지만 동일한 기반의 모델에 추가적인 강화 학습을 진행해 GPT-6 모델의 차세대 버전을 개발하기를 원하고 있다.
자인은 오픈AI가 GPT-6.1 아스트라에서 확인된 문제의 근본 원인을 파악하기 위해 심층 조사를 진행할 계획이라고 밝혔다. 이 조사엔 오픈AI의 강화 학습 환경이 올바른 유형의 행동에 보상을 제공하고 있는지 확인하는 것도 포함된다고 덧붙였다.