오픈AI의 인공지능(AI) 모델이 통제를 벗어나 행동하기 수개월 전 내외부 인사들이 경영진에 경고를 보냈으나 묵살된 것이라는 보도가 나왔다. AI 모델의 안전성을 점검하고 사내 인프라 보안을 강화해야 한다는 경고를 오픈AI 경영진들이 귀담아듣지 않았단 것이다.
뉴욕타임스(NYT)는 오픈AI 사내 이메일을 입수했다며 29일(현지시간) 이같이 보도했다.
이메일에 따르면 직원들은 오픈AI 최신 모델의 성능을 측정하고 안전을 확보하는 테스트 과정에서 적절한 모니터링이 이뤄지지 않고 있다고 우려했다. 이에 대해 경영진은 모델을 제때 출시하려면 테스트를 최대한 빨리 진행해야 한다고 답했고, 추가 보안 프로토콜은 도입되지 않았다. 이후 오픈AI 모델들은 테스트 환경을 벗어나 AI 스타트업 허깅페이스 등을 공격하며 AI 안전성 논쟁을 촉발했다.
조슈아 색스 AI보안업체 어번던트 시큐리티 최고기술책임자(CIO)는 "오픈AI의 보안 수준은 인프라 방어보다 경쟁사를 앞서는 것에만 몰두하며 4년간 과속으로 규모를 키운 연구소의 전형적인 모습"이라고 지적했다.
외부 연구원들도 비슷한 경험을 전했다. 지난 7월 보안업체 핵트론 연구원들은 경쟁사 앤트로픽의 AI 모델 도움을 받아 오픈AI 시스템에 침투하는 방법을 찾아내 알렸으나, 오픈AI는 처음에 이런 접근 방식에 불만을 표했다. 지난 9월에는 비영리단체 오브젝티브시파운데이션 연구원들이 챗GPT 사용자의 개인 대화 기록에 접근하고 브라우저 세션과 몰래 상호작용할 수 있는 버그를 제보했다. 이 단체의 패트릭 워들 소프트웨어 분석가는 제보가 한동안 방치되다가 데인 스터키 최고정보보안책임자(CISO) 에게 직접 연락한 뒤에야 처리됐다고 말했다.
오픈AI 직원들은 이런 문제 제기가 앞으로 더 나올 것으로 보고 있다. 앞서 엔지니어·연구원 그룹이 발표한 독립 보고서에는 오픈AI의 에이전트가 앤트로픽의 챗봇 클로드에 메시지를 보내려 시도한 정황이 추가로 담겼다. 오픈AI도 지난주 자사 최신 모델이 새로운 안전장치를 무력화하고 인터넷에 접근하는 것을 막지 못했다고 인정하며, 가장 고도화된 모델들의 학습을 일시 중단하고 전면 검토에 착수했다고 밝혔다. 이어 연구원들이 제기한 보안 우려로 최신 모델 'GPT-6.1 아스트라'의 출시를 취소한다고 발표했다.
드루 푸사테리 오픈AI 대변인은 "안전 유지를 위해 최선을 다하고 있으며 연구원들의 제보나 우려를 엄중히 받아들이고 있다"며 "첨단 모델이 나오면서 보안 요소들을 진화시키고 있고 일부 AI 개발 속도를 늦추고 연구와 테스트 과정에서의 보안을 강화하고 있다"고 답했다.