Experiment map · 2026.08.30 전처리·EDA 완료 / 성능 실험 전

한 문장으로 먼저

같은 문제에영어 양만조금씩.

문제의 뜻과 정답은 그대로 두고, 한국어 문장 속 영어 표현만 단계별로 늘렸을 때 LLM 성능이 달라지는지 보는 실험입니다.

EN

원래 영어 문제ENGLISH 100%

KO

기준이 되는 한국어 번역ENGLISH MINIMUM

MIX1

KO + 외래어형 표현만 영어+ C1

MIX2

MIX1 + 전문 개념어도 영어+ C2

MIX3

MIX2 + 동작·연산도 영어+ C3

한 샘플 = 다섯 쌍둥이 문제 · 달라지는 것은 자연어 속 영어 비율뿐 아래로 내려가면 전체 공정이 이어집니다 ↓
THE RULE

바꿔도 되는 것과
건드리면 안 되는 것

공정 전체를 지배하는 규칙입니다. 영어 비율 외에 다른 것이 달라지면, 무엇 때문에 성능이 바뀌었는지 알 수 없습니다.

바꾸는 곳

사람이 읽는 질문·지시문만 번역하고 영어 표현으로 치환합니다.

그대로 잠그는 곳

문제의 입력과 정답을 결정하는 기술적 재료는 원문 그대로 둡니다.

함수 signatureidentifierDB schematable·column명SQL·code token문서·표숫자·단위
THE FACTORY

원문이 실험 데이터가
되는 여섯 단계

번역 모델이 MIX 문장을 통째로 다시 쓰는 방식이 아닙니다. 먼저 좋은 한국어 기준문을 만들고, 검증된 위치만 코드가 바꿉니다.

벤치마크 후보를 고릅니다

자연어 질문이 따로 있고, 정답을 자동 채점할 수 있으며, C1·C2·C3가 충분히 나올 만한 데이터인지 살펴봅니다. 최신성만 보고 고르지는 않습니다.

AUDIT DONE

EN을 Canonical KO로 번역합니다

Canonical KO는 모든 MIX의 기준이 되는 한국어 문장입니다. 고유명·schema·code 같은 보호 대상은 가린 뒤 GPT-5.6 Terra가 번역하고, 다시 원래 위치에 복원합니다.

EN: Download data.tar.gz from the URL.
MASK: Download [[[PROTECTED_0001]]] from the URL.
KO: URL에서 data.tar.gz 파일을 다운로드하세요.
BATCH DONE

한 번에 C1·C2·C3를 찾습니다

Terra가 Canonical KO 안에서 바꿀 정확한 글자 구간(exact span)과 영어 replacement를 구조화된 결과로 냅니다. 세 범주가 겹치지 않도록 C1을 먼저 판정합니다.

BATCH DONE

기계 검사와 심사를 통과시킵니다

validator는 span이 실제 문장에 있는지, 서로 겹치지 않는지, 보호 대상을 건드리지 않았는지 확인합니다. Gemini 3.7 Flash는 최종 MIX가 의미와 문법을 유지하는지 심사합니다. Gemini가 탈락시킨 중요한 사례는 직접 다시 봐 false negative를 복구했습니다.

SCREENING DONE

코드가 MIX1·2·3을 만듭니다

모델이 문장을 새로 쓰지 않습니다. MIX1은 C1, MIX2는 C1+C2, MIX3는 C1+C2+C3의 검증된 span만 누적 치환합니다. 그래서 나머지 문장은 모두 같습니다.

GENERATOR READY

같은 설정으로 모델을 시험합니다

한 태스크 안에서는 EN·KO·MIX1·MIX2·MIX3에 똑같은 inference 설정을 적용하고, 공식 evaluator로 점수를 비교합니다. 이 단계는 아직 시작하지 않았습니다.

NEXT · NOT RUN YET
THE 3 LABELS

C1·C2·C3는
영어 농도 조절 손잡이

C1, C2, C3가 MIX1, MIX2, MIX3 자체를 뜻하는 것은 아닙니다. C는 바꿀 표현의 종류이고, MIX는 그 종류를 누적 적용한 완성 문장입니다.

C1

이미 영어에서 온 말

한국어에서 음차·외래어 형태로 쓰이는 표현입니다.

서킷 → circuit
C2

분야의 전문 개념

그 태스크를 이해하는 데 필요한 기술·금융·DB 개념입니다.

랩 기록 → lap record
C3

해야 할 동작

계산, 정렬, 출력처럼 답을 만들기 위해 수행하는 행위입니다.

나열해 주세요 → list해 주세요

실제 BIRD 예시 · 버튼을 눌러 비교

Italy의 서킷 랩 기록을 나열해 주세요.

Italy는 원래 값이므로 보호됩니다. 색이 들어간 표현만 앞 단계에 더해져 바뀝니다.

WHO DOES WHAT

모델 세 역할을
섞어 생각하지 않기

데이터를 만드는 모델, 검사하는 모델, 나중에 시험을 보는 모델은 역할이 다릅니다.

GPT-5.6 Terra

제작자. Canonical KO를 만들고 C1·C2·C3 span을 추출했습니다. translation v2.5.3, extraction v2.9.1을 사용했습니다.

Gemini 3.7 Flash

검사자. Batch로 extraction과 MIX 결과가 그대로 쓸 만한지 심사했습니다. 탈락 사례 중 중요한 것은 사람이 다시 확인했습니다.

Downstream model

시험 대상. 다섯 조건을 풀고 점수를 받는 모델입니다. 아직 이 inference는 실행하지 않았습니다.

WHERE WE ARE

1,531개 처리는 끝났고,
후보 418개도 더 검사했습니다

처음 계획에 적힌 “번역 Batch 진행 중”은 예전 상태입니다. 기존 1,531개의 번역·추출·자동 screening이 끝났고, 새 후보 418개도 같은 방식으로 전체 검사했습니다.

태스크벤치마크전체C1·C2·C3 usable비율
코드BigCodeBench-Instruct Hard14811779.1%
Text-to-SQLBIRD Mini-Dev5007314.6%
금융 추론FinQA validation883101.1%
Text-to-SQL 후보LiveSQLBench Query18012670.0%
금융 추론 후보FinanceReasoning Hard23815966.8%
현재 코드 주 후보새로 전체 검사한 강한 후보

이 숫자는 모델 성능 점수가 아닙니다. 다섯 조건을 공정하게 만들 수 있는 샘플 수입니다. 또한 후보 벤치마크를 모두 합쳐 한 실험에 쓰는 것도 아닙니다. 태스크별로 최종 선택한 풀에서 고정 seed로 약 30개를 뽑게 됩니다.

WHY SO CAREFUL?

우리가 실제로 막은
대표적인 사고

영어 때문에 문법이 깨지는 경우

draw습니다, ratio가었습니까, show 주세요처럼 어색해지면 MIX3만 불리해집니다. 영어 혼용 효과와 비문 효과가 섞이므로 morphology 규칙과 심사로 제외하거나 고쳤습니다.

일반 단어를 전문 개념으로 잘못 잡는 경우

차이, 기간, 총액 같은 일반 표현을 무조건 C2로 만들면 영어 전문용어의 효과를 보는 조건이 흐려집니다. nominal C2 gate와 직접 검수로 과추출을 걸렀습니다.

모델 심사가 너무 엄격해 쓸 수 있는 문장을 버리는 경우

Gemini가 탈락시킨 FinanceReasoning·LiveSQLBench all-three 24개를 전부 다시 봤습니다. 그중 14개는 false negative로 복구했고, 실제 문제가 있는 10개만 제외했습니다.

번역이 숫자·schema·code를 바꾸는 경우

보호 placeholder 복원, 날짜·단위·괄호, exact occurrence를 validator가 검사합니다. 반복해서 보호 대상을 복원하지 못한 후보 3개는 전체 분모에는 남기되 unusable로 처리했습니다.

NEXT

이제 남은 일은
시험지를 확정하고 채점하는 것

01

벤치마크 확정

코드는 BigCodeBench를 유지합니다. LiveSQLBench는 방금 요청한 gold SQL/test cases가 도착하면 공식 실행 평가 가능 여부를 확인합니다.

02

약 30개 고정

전처리 규칙을 더 바꾸지 않고, 태스크별 usable 풀에서 fixed seed held-out subset을 뽑습니다.

03

다섯 조건 실행

EN·KO·MIX1·MIX2·MIX3에 같은 모델 설정을 적용합니다. 조건마다 다른 도움을 주지 않습니다.

04

공식 채점

코드는 Pass@1, SQL과 금융은 가능한 공식 execution 평가를 사용하고 실패 사례·비용·시간도 함께 기록합니다.

지금까지 만든 것은 공정한 시험지 제작 공정입니다. 아직 시험 결과도, 통계적 결론도 나오지 않았습니다.