오픈AI가 첨단 AI 모델 개발에 속도조절을 걸었다. 더 강력한 모델이 사이버 공격에 활용될 수 있는 수준에 가까워졌다는 판단에 따라, 일부 최전선 모델 훈련을 멈추고 안전장치 보강에 들어갔다. 다만 AI 모델 개발을 전면 중단한 것은 아니다. 오픈AI는 이달 GPT-6 Astra(아스트라)를 공개하고, GPT-6 Sol·Luna(솔·루나)까지 제품군을 확장했다. 성능 경쟁은 이어가되, 고위험 능력을 갖춘 모델의 훈련과 배포는 더 엄격하게 관리하겠다는 의미다.
오픈AI는 최근 공식 홈페이지에서 "모델의 능력이 커질수록 내부 개발과 시험 과정의 위험도 커진다"며 "감시, 정렬, 보안 기준이 이런 위험보다 앞서 있어야 한다"고 밝혔다. 이에 따라 최신 배포 예정 모델의 강화학습(RL) 훈련을 2주간 중단했고, 가장 큰 규모로 계획했던 프런티어 RL 훈련은 여전히 보류 중이라고 설명했다.
계기는 두 가지다. 하나는 오픈AI와 허깅페이스 관련 보안 사고다. 다른 하나는 오픈AI의 차기 모델 중 하나인 Astra가 자체 준비 프레임워크상 '중대한 사이버 보안 능력' 기준에 도달할 수 있다는 예비 신호다. 오픈AI는 이 두 사건이 맞물리면서 훈련 전 과정에서 감시, 정렬, 격리 장치를 강화할 필요가 커졌다고 밝혔다.
오픈AI가 멈춘 것은 위험도가 큰 훈련이다. 대형 RL 훈련을 보류하는 대신, 소규모 훈련과 평가를 계속 진행하고 있다. 모델 행동을 평가하고, 안전장치가 제대로 작동하는지 검증하고, 정렬 증거를 더 확보한 뒤 대형 훈련을 재개하겠다는 방식이다.
연구 환경 보안도 강화했다. 오픈AI는 모델이 생성한 코드나 신뢰하기 어려운 코드를 실행하는 작업에 대해 더 강한 샌드박스 격리를 요구하고, 고위험 작업이 인터넷이나 내부망에 무단 접근하지 못하도록 네트워크 격리 조치를 확대했다. Astra 또는 사이버 관련 모델 작업에는 가장 엄격한 보안 기준을 적용하고 있다고 밝혔다. 일부 Astra 훈련과 평가는 이 기준을 충족했지만, 상당수 작업은 새 기준에 맞게 이전·개선될 때까지 보류 중이다.
모니터링도 촘촘해졌다. 오픈AI는 고성능 모델의 강화학습과 도구 사용 평가 과정에서 비정상 행위, 무단 접근, 데이터 탈취, 보안 우회 시도를 감지하는 시스템을 확대했다. 중대한 보안 경계 위반 가능성이 감지되면 안전·보안·연구팀에 최고 우선순위 경보가 전달되고, 30분 안에 오탐으로 확인되지 않으면 해당 활동을 중단하도록 했다.
다만 이번 조치를 "오픈AI가 첨단 AI 개발을 중단했다"고 보기는 어렵다. 오픈AI는 9월 GPT-6 Astra를 공개하며 이를 자사 모델 중 가장 지능적이고 정렬 수준이 높은 모델이라고 소개했다. Astra는 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 사이버 보안, 과학, 전문 업무에서 최첨단 성능을 낸다고 밝혔다.