바꾸는 곳
사람이 읽는 질문·지시문만 번역하고 영어 표현으로 치환합니다.
한 문장으로 먼저
문제의 뜻과 정답은 그대로 두고, 한국어 문장 속 영어 표현만 단계별로 늘렸을 때 LLM 성능이 달라지는지 보는 실험입니다.
원래 영어 문제ENGLISH 100%
기준이 되는 한국어 번역ENGLISH MINIMUM
KO + 외래어형 표현만 영어+ C1
MIX1 + 전문 개념어도 영어+ C2
MIX2 + 동작·연산도 영어+ C3
공정 전체를 지배하는 규칙입니다. 영어 비율 외에 다른 것이 달라지면, 무엇 때문에 성능이 바뀌었는지 알 수 없습니다.
사람이 읽는 질문·지시문만 번역하고 영어 표현으로 치환합니다.
문제의 입력과 정답을 결정하는 기술적 재료는 원문 그대로 둡니다.
번역 모델이 MIX 문장을 통째로 다시 쓰는 방식이 아닙니다. 먼저 좋은 한국어 기준문을 만들고, 검증된 위치만 코드가 바꿉니다.
자연어 질문이 따로 있고, 정답을 자동 채점할 수 있으며, C1·C2·C3가 충분히 나올 만한 데이터인지 살펴봅니다. 최신성만 보고 고르지는 않습니다.
AUDIT DONECanonical KO는 모든 MIX의 기준이 되는 한국어 문장입니다. 고유명·schema·code 같은 보호 대상은 가린 뒤 GPT-5.6 Terra가 번역하고, 다시 원래 위치에 복원합니다.
Terra가 Canonical KO 안에서 바꿀 정확한 글자 구간(exact span)과 영어 replacement를 구조화된 결과로 냅니다. 세 범주가 겹치지 않도록 C1을 먼저 판정합니다.
BATCH DONEvalidator는 span이 실제 문장에 있는지, 서로 겹치지 않는지, 보호 대상을 건드리지 않았는지 확인합니다. Gemini 3.7 Flash는 최종 MIX가 의미와 문법을 유지하는지 심사합니다. Gemini가 탈락시킨 중요한 사례는 직접 다시 봐 false negative를 복구했습니다.
SCREENING DONE모델이 문장을 새로 쓰지 않습니다. MIX1은 C1, MIX2는 C1+C2, MIX3는 C1+C2+C3의 검증된 span만 누적 치환합니다. 그래서 나머지 문장은 모두 같습니다.
GENERATOR READY한 태스크 안에서는 EN·KO·MIX1·MIX2·MIX3에 똑같은 inference 설정을 적용하고, 공식 evaluator로 점수를 비교합니다. 이 단계는 아직 시작하지 않았습니다.
NEXT · NOT RUN YETC1, C2, C3가 MIX1, MIX2, MIX3 자체를 뜻하는 것은 아닙니다. C는 바꿀 표현의 종류이고, MIX는 그 종류를 누적 적용한 완성 문장입니다.
한국어에서 음차·외래어 형태로 쓰이는 표현입니다.
서킷 → circuit그 태스크를 이해하는 데 필요한 기술·금융·DB 개념입니다.
랩 기록 → lap record계산, 정렬, 출력처럼 답을 만들기 위해 수행하는 행위입니다.
나열해 주세요 → list해 주세요Italy의 서킷 랩 기록을 나열해 주세요.
Italy는 원래 값이므로 보호됩니다. 색이 들어간 표현만 앞 단계에 더해져 바뀝니다.
데이터를 만드는 모델, 검사하는 모델, 나중에 시험을 보는 모델은 역할이 다릅니다.
제작자. Canonical KO를 만들고 C1·C2·C3 span을 추출했습니다. translation v2.5.3, extraction v2.9.1을 사용했습니다.
검사자. Batch로 extraction과 MIX 결과가 그대로 쓸 만한지 심사했습니다. 탈락 사례 중 중요한 것은 사람이 다시 확인했습니다.
시험 대상. 다섯 조건을 풀고 점수를 받는 모델입니다. 아직 이 inference는 실행하지 않았습니다.
처음 계획에 적힌 “번역 Batch 진행 중”은 예전 상태입니다. 기존 1,531개의 번역·추출·자동 screening이 끝났고, 새 후보 418개도 같은 방식으로 전체 검사했습니다.
| 태스크 | 벤치마크 | 전체 | C1·C2·C3 usable | 비율 |
|---|---|---|---|---|
| 코드 | BigCodeBench-Instruct Hard | 148 | 117 | 79.1% |
| Text-to-SQL | BIRD Mini-Dev | 500 | 73 | 14.6% |
| 금융 추론 | FinQA validation | 883 | 10 | 1.1% |
| Text-to-SQL 후보 | LiveSQLBench Query | 180 | 126 | 70.0% |
| 금융 추론 후보 | FinanceReasoning Hard | 238 | 159 | 66.8% |
이 숫자는 모델 성능 점수가 아닙니다. 다섯 조건을 공정하게 만들 수 있는 샘플 수입니다. 또한 후보 벤치마크를 모두 합쳐 한 실험에 쓰는 것도 아닙니다. 태스크별로 최종 선택한 풀에서 고정 seed로 약 30개를 뽑게 됩니다.
draw습니다, ratio가었습니까, show 주세요처럼 어색해지면 MIX3만 불리해집니다. 영어 혼용 효과와 비문 효과가 섞이므로 morphology 규칙과 심사로 제외하거나 고쳤습니다.
차이, 기간, 총액 같은 일반 표현을 무조건 C2로 만들면 영어 전문용어의 효과를 보는 조건이 흐려집니다. nominal C2 gate와 직접 검수로 과추출을 걸렀습니다.
Gemini가 탈락시킨 FinanceReasoning·LiveSQLBench all-three 24개를 전부 다시 봤습니다. 그중 14개는 false negative로 복구했고, 실제 문제가 있는 10개만 제외했습니다.
보호 placeholder 복원, 날짜·단위·괄호, exact occurrence를 validator가 검사합니다. 반복해서 보호 대상을 복원하지 못한 후보 3개는 전체 분모에는 남기되 unusable로 처리했습니다.
지금까지 만든 것은 공정한 시험지 제작 공정입니다. 아직 시험 결과도, 통계적 결론도 나오지 않았습니다.