카카오, AI 모델 '덜 쓰고 더 잘 학습'…COLM 2026서 효율화 기술 공개

김평화 기자
2026.10.08 09:10

MoE 최적 학습률 예측해 비용 절감…모델 크기 최대 40.4% 줄이고 성능 개선

카카오가 대규모 AI 모델의 학습 비용을 줄이고 모델 크기를 낮추면서도 성능을 높이는 연구 성과를 공개했다.

카카오는 언어모델링 국제학회 'COLM 2026'에서 대규모 전문가 혼합 모델(MoE)의 학습 효율을 높이는 기술과 모델 경량화 기술을 발표했다고 8일 밝혔다.

COLM은 대규모 언어모델과 언어모델링 연구를 전문적으로 다루는 국제 학회로 2024년 신설됐다. 카카오는 이번 학회의 메인 컨퍼런스와 토크나이제이션 워크숍 'TokShop'에서 각각 연구 성과를 소개했다.

메인 컨퍼런스에서는 대규모 MoE 모델의 사전학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 발표했다.

학습률은 AI 모델이 학습 과정에서 매개변수를 얼마나 크게 조정할지를 결정하는 값이다. 값이 너무 크면 학습이 불안정해지고, 너무 작으면 학습 속도가 느려질 수 있어 대규모 모델 학습에서 중요한 설정값으로 꼽힌다.

카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화' 기법을 MoE 구조에 맞게 적용했다. 모델 크기와 학습 토큰량을 단계적으로 키우면서 최적 학습률을 탐색하고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효한지 검증했다.

이 방법론은 카카오의 'Kanana-2.6-155b-a17b' 모델 사전학습에 실제 적용됐다. 카카오는 이를 통해 10조 토큰까지 안정적으로 학습했다고 설명했다.

모델 크기를 줄이는 경량화 연구도 공개했다. 카카오는 TokShop에서 'BBT: BPE-Guided Byte Transformer'를 발표했다. 기존 BPE 방식은 단어나 단어 조각 정보를 저장해 문장을 처리하지만, BBT는 더 작은 단위인 바이트를 활용하면서 기존 압축 방식의 장점도 유지하도록 설계됐다.

비교 실험에서는 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 높였다. 오탈자나 문자 교란에 대한 대응력과 학습하지 않은 언어로의 전이 성능도 개선됐다.

카카오는 BBT가 온디바이스 환경에서 AI 모델의 메모리 부담을 줄이고, 다국어 입력이나 오탈자가 잦은 대화 환경에서도 안정적인 성능을 구현하는 데 활용될 수 있을 것으로 보고 있다.

카카오는 향후 다양한 모델 구조로 연구 적용 범위를 넓히고, 대규모 LLM의 학습 비용을 더욱 줄일 계획이다.

카카오 관계자는 "이번 연구들은 AI 모델의 성능을 유지하거나 향상시키면서도 학습 및 운영 비용을 낮출 수 있는 실용적인 해법을 제시했다는 데 의의가 있다"며 "다양한 모델 구조와 멀티모달·다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이고 글로벌 경쟁력을 강화하겠다"고 말했다.

<저작권자 © ‘돈이 보이는 리얼타임 뉴스’ 머니투데이. 무단전재 및 재배포, AI학습 이용 금지>