310억 파라미터 모델서 전문가 모듈 25% 제거해도 원본 성능 98% 유지
AI 모델 경량화·최적화 기업 노타가 멀티모달 AI 모델의 성능을 거의 그대로 유지하면서 GPU 메모리 사용량을 절반 가까이 줄이는 기술을 개발했다. 추가 학습 없이 압축이 가능해 기업 AI 인프라 운영 효율을 높일 수 있다고 회사 측은 밝혔다.
노타는 멀티모달 AI 모델의 전문가 혼합(MoE·Mixture of Experts) 구조에 특화한 경량화 기법을 담은 논문이 세계적인 AI 학술대회 ‘NeurIPS 2026’ 메인트랙에 채택됐다고 1일 밝혔다.
채택 논문명은 ‘Modality-Aware Expert Pruning for MoE-Based Multimodal Large Language Models’다.
기존 언어모델용 전문가 프루닝 방식을 멀티모달 모델에 그대로 적용하면 이미지 이해에 필요한 전문가 모듈까지 제거돼 차트 분석 등 시각 과제에서 성능이 크게 저하되는 문제가 있었다.
노타는 텍스트와 이미지 각각에 대한 전문가 중요도를 별도로 평가해, 텍스트 기준 중요도는 유지할 전문가 선정에, 이미지 기준 중요도는 제거 대상 선정에 활용했다.
또 각 층에서 동일한 수의 전문가를 제거하는 대신, 모델 전체를 비교해 중요한 층의 전문가를 우선 보존하는 방식을 적용했다.
성능 평가 결과, 약 310억 파라미터 규모의 멀티모달 모델에서 전문가 모듈을 25% 제거했을 때 원본 성능의 98%를, 50% 제거 시에는 91%를 각각 유지했다.
GPU 메모리 사용량은 58GB에서 31GB로 약 47% 감소해, 40GB 메모리의 GPU 한 장으로 구동 가능한 수준이 됐다.
사용자가 제거 비율만 설정하면 추가 학습 없이 한 차례의 압축으로 경량화를 완료할 수 있다고 회사 측은 설명했다.
노타는 이번 기술을 자사 AI 최적화 플랫폼 ‘넷츠프레소’에 반영해 멀티모달·MoE 모델 지원 범위를 확대할 계획이다.
앞서 ‘키미 K3’, ‘솔라 오픈 2’ 등 초거대 모델에 전문가 프루닝을 적용한 바 있으며, 올해 ICLR·EMNLP·ICML에 이어 NeurIPS까지 주요 AI 학회에서 연구 성과를 인정받았다.
채명수 노타 대표는 “멀티모달 AI로의 전환이 빨라지면서 GPU 메모리 부담도 빠르게 커지고 있다”며 “이번 연구는 모델 성능을 유지하면서 컴퓨팅 자원을 크게 줄일 수 있어 실제 AI 인프라 운영 효율을 높이는 데 의미가 크다”고 말했다.
본 기사에 대한 정정·반론·추후보도 청구는 보도 청구 안내를, 그간 게재된 보도문은 정정·반론보도 모아보기를 참고해 주세요.













