① BigCodeBench · 코드 생성
n = 87 · Pass@1MIX1이 KO보다 평균 +1.1%p였지만, 95% bootstrap 구간은 −1.9~+4.2%p입니다. MIX3는 가장 낮았습니다.
같은 문제에 옷만 다르게 입혀 Gemini 3.7 Flash에게 세 번씩 물었습니다. 결과는 간단합니다. 영어가 늘 1등도 아니었고, MIX1의 이점도 task마다 달랐습니다.
전처리는 266개 sample에서 freeze했습니다. 같은 1,330개 요청을 독립 Batch로 두 번 더 실행해, 기존 run과 합쳐 총 3회를 비교했습니다. 세 run의 request hash는 모두 같았습니다.
평균 점수만 보면 시험이 추상적으로 느껴집니다. 아래 세 페이지에는 실제 원문, KO·MIX1·2·3, Gemini의 실제 출력, 세 번의 통과·실패 기록을 넣었습니다.
설명서를 읽고 Python 함수를 만든 뒤 unit test로 채점합니다.
자연어 질문을 SQLite SQL로 바꾸고 실행 결과가 맞는지 봅니다.
금융 상황을 읽고 Python 계산 프로그램을 실행해 숫자를 맞힙니다.
아래는 세 run의 평균입니다. benchmark ambiguity와 timeout artifact를 미리 정한 규칙으로 제외한 strict-primary 결과입니다.
MIX1이 KO보다 평균 +1.1%p였지만, 95% bootstrap 구간은 −1.9~+4.2%p입니다. MIX3는 가장 낮았습니다.
KO와 MIX1은 평균이 같았습니다. EN·KO의 순서는 run마다 뒤집혔고, MIX2에서 작게 내려갔습니다.
거의 모두 비슷합니다. 이미 점수가 높아 천장 효과가 크고, 말투 차이를 보기 어려운 task였습니다.
“EN이 가장 높다” → 세 task 모두 3회 평균에서는 아니었습니다.
“MIX1이 KO보다 높다” → 코드 생성에서 +1.1%p, BIRD에서 0.0%p, 금융에서 −0.3%p였습니다. 지금은 하나의 공통 효과라고 부를 수 없습니다.
주요 condition 간 평균 차이는 대체로 이 정도였습니다.
BigCodeBench에서는 같은 condition도 run이 바뀌면 sample 점수가 이 정도까지 뒤집혔습니다.