회사소개
사업실적
연혁
인사이트
문의하기

Tel. 055-372-2035
niccol21@insightinfo.kr
경남 양산시 동면 금오로 242, 305호

Insights · Column

벤치마크 데이터셋이란?

LLM의 성능을 공정하게 비교하는 "표준 무대". 왜 중요한지, 어떻게 만드는지, 어디에 쓰이는지 정리했습니다.

LLM 평가벤치마크데이터셋 구축
01 · Definition

평가 지표(Task)는 계속 진화합니다

기존의 LLM 성능평가 벤치마크 데이터셋이 근본적인 언어능력 평가에 초점을 맞췄다면, LLM의 성능이 고도화되고 다양한 영역에서 그 성능을 발휘하면서 고도화한 지능과 문제해결 능력 등 실용적인 부분에 집중할 수 있는 TASK로 벤치마크 데이터셋도 진화하고 있습니다.

이를 위해 벤치마크 데이터셋의 지표(TASK)를 촘촘하게 구성해 고성능 모델의 옥석을 가려내는 것이 중요합니다. LLM 기술이 빠르게 발전함에 따라 1년 전에 만들어진 리더보드 벤치마크(평가지표)의 개선 필요성이 대두되었고, 글로벌 'Open LLM 리더보드'를 운영 중인 허깅페이스 또한 2024년 6월 벤치마크를 새롭게 개편한 리더보드 시즌2를 오픈했습니다. 우리나라 역시 2024년 8월 Open Ko-LLM 리더보드가 추론능력 지표, 감성 지표, 무해성 지표 등으로 구성된 9개의 새로운 벤치마크 데이터셋으로 LLM 성능을 평가하고 있습니다.

인사이트정보도 다양한 벤치마크 데이터셋의 지표(TASK)를 촘촘하게 구성하고, 효율적이고 체계적으로 LLM의 성능을 평가하기 위해 지속적으로 다양한 지표를 개발하고 있으며, NIA(한국지능정보사회진흥원)의 벤치마크 데이터셋 구축 과제에 꾸준히 참여하여 AI 산업 발전에 동참하고 있습니다.

02 · Why it matters

벤치마크 데이터셋의 중요성

벤치마크 데이터셋은 AI 모델 성능을 공정하게 비교할 수 있는 표준 무대를 제공합니다. 동일한 데이터와 평가 기준을 사용함으로써, 다양한 모델의 강점과 약점을 동일 조건에서 객관적으로 비교할 수 있습니다.

연구의 재현성 확보

누구나 결과를 검증하고 기존 연구를 기반으로 확장 가능

모델 개선 방향 제시

AI가 잘하는 영역과 취약한 부분을 명확히 파악

기술 발전의 이정표

시간 흐름에 따른 커뮤니티 전반의 진보 추적 가능

03 · How to build

벤치마크 데이터셋을 만드는 방법

LLM 벤치마크 데이터셋을 만드는 방법에는 여러 가지가 있습니다. 기본적인 단계는 다음과 같습니다.

목표 정의

무엇을 벤치마크하고자 하는지 명확히 정의합니다. 특정 작업의 성능 비교인지, 모델의 일반적 특성 평가인지를 고려합니다.

데이터 수집

벤치마크에 사용할 데이터를 수집합니다. 일반적으로 특정 작업(분류·번역·요약 등)에 관련된 텍스트 데이터입니다.

데이터 전처리

텍스트 정규화, 불용어 제거, 토큰화 등의 전처리 작업을 수행합니다.

훈련·테스트 분리

훈련 데이터는 모델 학습에, 테스트 데이터는 성능 평가에 사용합니다.

벤치마크 평가

모델을 테스트 데이터에 적용해 성능을 측정하고 다른 모델과 비교합니다.

결과 분석 및 보고

모델 성능, 비교 결과, 추가 의견을 포함한 보고서를 작성합니다.

04 · Applications

벤치마크 데이터셋의 주요 활용 분야

딥러닝 기반 컴퓨터 비전(CV), 자연어처리(NLP), 음성 인식(Speech), 자율주행 등 여러 분야에서 작업 유형별로 특화된 데이터셋이 존재하며, 연구 및 산업 발전에 크게 기여하고 있습니다.

01 · Object Detection

객체 감지

이미지 내 여러 객체의 위치(Bounding Box)와 클래스를 예측. 주요 벤치마크: COCO(80개 클래스), PASCAL VOC(20개 클래스), Open Images V7(900만 장+). 활용: CCTV 영상 분석, 자율주행 객체 인식, 상품 검출

02 · Image Classification

이미지 분류

이미지를 하나의 카테고리로 분류하는 가장 기초적인 비전 태스크. 주요 벤치마크: ImageNet(1,000 클래스·1,400만 장), CIFAR-10/100, MNIST. 활용: 품목 분류, 얼굴 인식, 의료 영상 진단

03 · Instance Segmentation

인스턴스 세분화

객체의 픽셀 단위 윤곽선을 인식해 객체별 분할 수행. 주요 벤치마크: COCO Segmentation, LVIS. 활용: 자율주행 실시간 객체 식별, 의료 영상 종양 경계 탐지

04 · Pose Estimation

포즈 추정

사람·물체의 관절/키포인트 위치를 예측해 자세를 구조적으로 인식. 주요 벤치마크: COCO-Keypoints(17개 관절), MPII Human Pose. 활용: 스포츠 분석, 피트니스 모션 추적, AR/VR, 재활 치료

05 · Domain-specific

도메인 특화 AI 작업

의료(BraTS 뇌종양 MRI, CheXpert 흉부 X-ray), 자율주행(nuScenes, Argoverse), 항공/드론(VisDrone). 활용: AI 보조 진단, 스마트시티 교통 감시, 드론 실시간 탐색

06 · General-purpose

멀티태스크 · 범용 평가

다양한 작업과 도메인을 포괄하는 통합 벤치마크. Roboflow 100(100개 미션 멀티태스크), HELM(문서 요약·추론·법률 응답 등 NLP 전반 시나리오 기반 평가)

05 · Our work

인사이트정보가 구축한 벤치마크

2024 · NIA · 주관

글로벌 규범·문화 평가 데이터

다문화 평가 10개 Task, 3개 언어(베트남어·한국어·영어) 25,000건+. 다양한 상용 LLM 대상 평가.