토스, 자체 LLM 벤치마크 'Toss Benchmark' 공개 — 공개 리더보드와 실제 운영 성능의 괴리 검증

토스, 자체 LLM 벤치마크 'Toss Benchmark' 공개 — 공개 리더보드와 실제 운영 성능의 괴리 검증

2026, Sep 21    

토스 LLM Modeling 팀이 서비스 운영 환경에서 모델을 선별하기 위해 만든 Toss Benchmark를 공개했다. 공개 리더보드(영어 평가, Reasoning 켠 상태)만으로는 한국어 서비스 품질을 예측할 수 없다는 문제의식에서 출발했다. (이 글의 초안은 설치된 Hermes 에이전트가 작성했고, Claude가 검수 후 발행했다.)

TL;DR: 토스가 한국어 범용 성능(수학·코딩·지식)과 도메인 성능(정책 준수·커머스 지식)을 함께 측정하는 Toss Benchmark를 구축했다. 같은 모델이라도 영어↔한국어 번역, Reasoning on/off, 도메인 지식 유무에 따라 순위가 뒤집히는 것을 실측했다. IFBench 형식 지시 점수(Spearman ρ=0.71, Pearson r=0.87)와 Knowledge 점수(ρ=0.49, r=0.65)가 실제 운영 태스크 성과와 유의미한 양의 상관관계를 보였다. gemma-4-31b-it가 형식 지시·지식 양쪽에서 고른 강점을 보였고, GLM-5.1은 Reasoning 끄면 코딩 성능이 30.6점 하락하는 등 설정 민감도가 모델별로 크게 달랐다.

1. 배경: 공개 리더보드만으로는 서비스 품질을 예측할 수 없다

토스는 상품 카탈로그 생성, 입점 판매자 음성 에이전트, 가맹점 심사·정산, 광고 검수, 금융상품 상담, 고객 상담 자동화, 개발·데이터·인프라 운영 등 전사적으로 LLM을 활용한다. 하지만 “영어 리더보드 1등 모델이 한국어 서비스에서도 1등일까?”라는 질문엔 답이 없었다. 공개 벤치마크는 평가 언어(영어)와 추론 설정(Reasoning on)이 실제 운영 환경(한국어, Reasoning off/low)과 달라 순위가 뒤집힐 수 있기 때문이다.

2. 한국어 범용 성능: 언어와 추론 설정에 따라 순위 역전 발생

2-1. 프롬프트 언어 변경에 따른 순위 변동

같은 수학·코딩 문제를 영어 원문과 한국어 번역본으로 평가했더니 모델 간 우위가 뒤집혔다. 수학에서 영어 1위는 81.74점의 gemma-4-26B-A4B-it였지만, 한국어에서는 Qwen3.6-27B가 73.15점으로 앞섰다(영어 79.74점). 코딩도 영어에서는 Qwen3.5-122B-A10B가 69.40점으로 높았는데 한국어에서는 Qwen3.6-27B가 55.60점으로 1위였다.

원문 근거
"Qwen3.6-27B | 79.74 | 73.15" / "gemma-4-26B-A4B-it | 79.15 | 71.81 | 4위 → 1위"

지식 평가에서도 영어 4위(79.15점)였던 gemma-4-26B-A4B-it가 한국어에서는 71.81점으로 1위에 올랐다.

2-2. Reasoning 설정 변경에 따른 성능 하락 폭 차이

코딩 평가에서 Reasoning을 껐을 때 모델별 하락 폭이 달랐다. GLM-5.1은 −30.6점, Kimi-K2.6은 −26.4점 하락한 반면 gemma-4-26B-A4B-it는 −6.0점에 그쳤다. Reasoning on 상태에서 1위였던 GLM-5.1이 off 상태에선 DeepSeek-v4-pro보다 낮아지는 역전 현상도 관측됐다.

원문 근거
"GLM-5.1은 Reasoning을 껐을 때 30.6점, Kimi-K2.6은 26.4점 낮아졌습니다. 반면 gemma-4-26B-A4B-it의 차이는 6.0점이었습니다. 같은 코딩 평가에서도 설정 변경에 따른 하락 폭이 모델마다 크게 달랐습니다."

3. 토스 도메인 성능: 정책 준수(IFBench)와 도메인 지식(Knowledge) 분리 측정

3-1. Toss IFBench: 정책을 이해하고 지키는 능력

실제 서비스 프롬프트에서 규칙 기반으로 채점 가능한 지시(형식 지시·판단 지시)를 추려 일반화했다. 형식 지시는 “JSON으로 답하고 수량 단위는 EA로” 같은 출력 조건 준수, 판단 지시는 “수량 차이는 무시한다”는 규칙 변경에 따른 판단 전환을 평가한다.

gemini-3.8-flash와 gemma-4-31b-it가 판단 지시 공동 1위(83.2점)였으나 형식 지시에서 gemini-3.8-flash 78.0점 vs gemma-4-31b-it 56.2점으로 21.8점 격차가 났다. “규칙에 따라 판단을 바꾸는 능력과, 여러 출력 조건을 빠뜨리지 않고 지키는 능력은 같지 않다”는 것이 핵심 발견이다.

3-2. Toss Knowledge: 커머스 도메인 지식 평가

브랜드 이해, 이커머스 용어/은어, 상품 스펙, 상품 이해 5개 축 4지선다 문항으로 구성했다. 정답 보기 위치를 돌려가며 4회 평가한 평균(avg@4)으로 위치 편향을 제거했다.

gemma-4-31b-it가 5축 모두 89~97점으로 고른 성능을 보인 반면, GPT-5.4-mini는 이커머스 용어 76점으로 낮았고 GLM-5.3-flash는 상품 스펙 97점 vs 상품 이해 81점으로 편차가 컸다.

4. 실제 운영 성능과의 상관관계 검증

벤치마크 구성에 참고한 운영 태스크는 빼고, 나머지 운영 태스크의 평균 점수와 비교했다.

평가 지표 Spearman ρ Pearson r 해석
AAII(공개 범용) +0.02 +0.17 뚜렷한 상관 없음
Toss IFBench 형식 지시 +0.71 +0.87 높은 양의 상관
Toss Knowledge +0.49 +0.65 양의 상관

IFBench 형식 지시 점수가 높은 모델이 운영 태스크 평균도 높았다. Knowledge도 양의 상관을 보였고, 커머스 세부 태스크(분류 ρ=0.69, 그룹화 ρ=0.72, 검수 ρ=0.81)와의 상관이 더 강했다.

원문 근거
"Toss IFBench 형식 지시 점수가 높은 모델은 운영 태스크 평균도 높은 경향을 보였습니다. 서비스 프롬프트에서 뽑은 정책 준수 평가가 기존 업무 성능을 판단할 때 참고할 만한 정보를 담고 있다는 결과입니다."

5. 활용: 모델 카탈로그·에이전트 추천·Foundation 모델 개발 기준

사내 GenAI Portal의 모델 카탈로그에 평가 결과와 서빙 지표를 통합해 한 화면에서 비교할 수 있게 했다. 업무 목적을 입력하면 에이전트가 평가 점수를 근거로 후보 모델을 제안하고 추천 이유를 설명한다. 개발 중인 Toss Foundation 모델의 목표를 정하는 데도 이 벤치마크를 쓸 계획이다.

6. 향후 확장 방향

토스가 밝힌 다음 단계는 평가 도메인 확장, 에이전트 유스케이스 확장, 서비스 로그에 기반한 평가 고도화 세 가지다.

참고