[이 기사에 나온 스타트업에 대한 보다 다양한 기업정보는 유니콘팩토리 빅데이터 플랫폼 '데이터랩'에서 볼 수 있습니다.]
멀티모달 영상 이해 AI 기업 트웰브랩스가 1인칭 영상을 로봇 학습용 데이터로 빠르게 전환할 수 있는 비전언어모델(VLM) '페가수스 1.6'을 출시했다고 7일 밝혔다.
페가수스 1.6은 '에고센트릭(egocentric) 데이터' 이해 능력을 강화한 게 특징이다. 에고센트릭 데이터는 작업자가 액션캠이나 스마트글래스를 착용하고 특정 동작을 수행하며 촬영한 1인칭 영상으로, 로봇 학습 데이터로 주목받고 있다.
다만, 영상을 확보하는 것만으론 학습 데이터가 완성되지 않는다. 학습에 맞는 장면을 고르고 행동을 구간별로 나눈 뒤, 손이 어떤 물체와 어떻게 상호작용했는지 일일이 표시해야 한다. 이 과정은 대부분 수작업에 의존한다. 공개 데이터셋 'Ego-Exo4D'의 경우 1286시간 분량 영상의 라벨링에 20만 시간 이상이 투입됐다. 영상 1시간당 155시간꼴이다.
페가수스 1.6은 영상 속 사람의 행동과 사물, 전후 맥락을 함께 이해해 작업을 구간별로 나누고 설명한다. 행동 분할·라벨링, 상세 캡션, 품질 평가, 검색·큐레이션, 개인정보·컴플라이언스 탐지 등 5가지 핵심 기능을 지원한다.
특히 사용자가 정의한 항목에 맞춰 영상 내용을 시간 정보와 함께 구조화하는 '시간 기반 메타데이터(TBM)' 기능은 어떤 행동이 언제 일어났는지가 중요한 로봇 학습에 유용하다. 손·물체·도구를 영상 전반에서 일관되게 식별하는 성능과 대규모 영상 처리 속도·비용 효율도 높였다.
실제 미국의 한 로보틱스 학습데이터 기업은 공장 현장 1인칭 영상의 품질을 페가수스로 평가해 불량 데이터를 거르고, 선별된 영상에 상세 캡션을 붙이는 데 활용하고 있다고 회사 측은 설명했다.
이재성 트웰브랩스 CEO는 "물건이 미끄러졌을 때 바로잡는 것처럼 사람이 현실에서 체득한 경험은 대부분 기계가 학습할 수 있는 형태로 기록되지 않았다"며 "페가수스 1.6은 영상을 구조화된 지식으로 바꿔 피지컬 AI·로보틱스 기업이 인간의 경험을 학습에 활용할 수 있게 할 것"이라고 말했다.