단일 A10G GPU 환경서 추론 속도 6.978배 향상
이번 대회는 ICML 2026 AdaptFM(Resource-Adaptive Foundation Model Inference) 워크샵 소속 챌린지로, 아마존·메타 등 글로벌 기업 연구자들이 조직위원으로 참여했다.
참가 팀들은 단일 엔비디아 A10G GPU 환경에서 오픈소스 LLM인 Qwen3.5-4B의 답변 품질을 유지하면서 추론 속도를 최대화하는 과제를 수행했다.
노타는 양자화로 모델의 메모리 사용량과 연산량을 줄인 뒤, 후속 학습을 통해 정확도 저하를 최소화했다.
여기에 초안 모델(Draft Model)이 답변 후보를 빠르게 생성하고 본 모델이 이를 검증하는 추측적 디코딩을 결합했으며, 슬라이딩 윈도우 어텐션(Sliding-window Attention) 기법을 추가 적용해 불필요한 연산을 줄였다고 밝혔다.
대회 상위권 팀 다수가 유사한 전략을 택한 것으로 전해진다.
김태호 노타 CTO 겸 공동창업자는 “글로벌 AI 생태계에서 활용되는 대표적인 오픈소스 모델인 큐웬(Qwen)을 대상으로 추론 최적화 기술력을 검증받은 사례”라며 “온디바이스·엣지 AI 환경에도 최적화 기술 적용을 확대해 나갈 것”이라고 말했다.
AdaptFM 워크샵에 채택된 논문 2편은 MoE(Mixture of Experts) 구조 LLM 양자화를 다루고 있다.
MoE 구조 특성을 활용해 적은 메모리와 연산 자원으로 성능 저하를 줄이는 최적화 방법론을 제안한 내용이다.
노타는 앞서 엔비디아 네모트론(Nemotron) 해커톤에서도 MoE 양자화 기술로 트랙 우승과 종합우승을 기록한 바 있다.
ICML 2026 기간 중 노타는 서울 삼성동 코엑스 인근에서 ‘Nota AI - Korea Efficient Days’를 개최했다.
행사에는 오픈AI·구글·퀄컴 등 글로벌 기업 관계자와 연구자, 엔지니어들이 참석해 Efficient AI 연구 동향과 산업 적용 가능성에 대한 논의가 이뤄졌다.
본 기사에 대한 정정·반론·추후보도 청구는 보도 청구 안내를, 그간 게재된 보도문은 정정·반론보도 모아보기를 참고해 주세요.














