
‘고양이 몸에 코끼리 피부’ 평가 방식 한계 밝혀
국내 연구진이 인공지능(AI)의 시각 인식 능력을 평가하는 데 널리 활용돼 온 대표 벤치마크의 한계를 규명하고 새로운 평가 기준을 제시했다.
UNIST 인공지능대학원 유재준 교수 연구팀은 기존 AI 시각 인식 평가 방식인 ‘큐 컨플릭트(Cue-conflict)’의 구조적 문제를 분석하고 이를 개선한 새 벤치마크 ‘리파인드 바이어스(REFINED-BIAS)’를 개발했다고 1일 밝혔다.
연구 결과는 유럽 컴퓨터 비전 학회(ECCV 2026)에서 전체 제출 논문 1만473편 가운데 약 1.3%만 선정되는 스포트라이트 논문으로 채택됐다.
큐 컨플릭트는 2019년 제안된 AI 평가 방식으로, 고양이 형상에 코끼리 피부 질감을 입힌 이미지처럼 형상과 질감을 의도적으로 충돌시킨 데이터를 활용한다. AI가 고양이라고 답하면 형상에, 코끼리라고 답하면 질감에 의존한 것으로 평가한다.
당시 연구에서는 AI가 사람과 달리 형상보다 질감에 더 의존하는 것으로 나타나며 AI 모델의 학습 방향에 적지 않은 영향을 미쳤다.
기존 평가 방식의 구조적 문제 지적
연구팀은 큐 컨플릭트가 실제 AI의 인식 특성을 왜곡할 수 있는 구조적 한계를 갖고 있다고 분석했다.
대표적으로 기존 방식은 형상과 질감 정답의 상대적 비율만 평가해 AI가 두 정보를 얼마나 실제로 활용했는지 구분하지 못했다. 또한 일부 합성 이미지에서는 형상과 질감 정보가 명확히 분리되지 않거나 특정 정보가 더 쉽게 인식되는 편향도 존재했다.
채점 방식도 제한적이었다. AI가 실제로 가장 높게 예측한 결과가 평가 대상에서 제외될 경우 다음 순위의 결과가 정답처럼 처리되는 문제가 있었다.
형상·질감 활용 정도까지 측정
연구진이 제안한 REFINED-BIAS는 기존 선호도 개념 대신 형상과 질감 활용 정도를 각각 점수화하는 방식을 적용했다.
이를 위해 형상이 뚜렷한 사물 10종과 질감이 뚜렷한 사물 10종을 선정해 총 6000장의 평가용 이미지를 구축했다. 형상 이미지는 질감을 제거하고 윤곽만 남겼으며, 질감 이미지는 전체 형상이 드러나지 않도록 가공했다.
실험 결과 성능이 우수한 최신 AI 모델일수록 형상과 질감을 모두 적극적으로 활용하는 것으로 나타났다. 또한 최신 트랜스포머 기반 모델과 이미지·텍스트를 함께 학습한 모델이 형상 정보를 더 효과적으로 인식한다는 점도 확인됐다.
유재준 교수는 “벤치마크는 AI 성능 평가뿐 아니라 개발 방향에도 영향을 미치는 만큼 신뢰성 있는 평가 기준이 중요하다”며 “이번 연구가 AI의 시각 인식 능력을 보다 정확하게 분석하는 데 도움이 될 것”이라고 밝혔다.
이번 연구 결과는 「On the Reliability of Cue Conflict and Beyond」라는 제목으로 발표됐다.













