Current experiment, explained simply

같은 문제를 다섯 말투로.

문제의 뜻과 정답은 그대로 둡니다. 바꾸는 건 질문 속 한국어·영어 표현의 비율뿐입니다. 그러고 나서 LLM(문제를 푸는 언어 모델)이 어느 말투에서 더 잘 푸는지 비교합니다.

아직 본 실험 전 · 설계 검토 중

KO · 한국어 질문

로그를 날짜별로 정렬하고 최신 경로를 반환하세요.

버튼을 눌러 보세요. 노랑=C1, 파랑=C2, 주황=C3. MIX3의 영어 동사와 한국어 어미를 붙이는 법은 아직 확정하지 않았습니다.

Five conditions

영어를 한 겹씩 더합니다.

KO를 기준으로 C1, C2, C3 표현을 순서대로 영어로 바꿉니다. 문장 전체를 새로 쓰지 않고, 미리 찾은 위치만 같은 규칙으로 교체합니다.

C1

이미 익숙한 영어계 표현

외래어·음역 표현을 영어 표기로 바꿉니다. 예: 로그 → log.

C2

기술 개념

분야의 핵심 개념을 영어로 바꿉니다. 예: 경로 → path.

C3

해야 할 동작

지시·연산 표현도 영어로 바꿉니다. 예: 반환하세요 → return. 한국어 어미 처리법은 검토 중입니다.

Three jobs

말투만 바꾸고, 채점기는 그대로 둡니다.

서로 다른 능력을 보는 세 과제를 고릅니다. 답이 맞았는지는 사람이 느낌으로 정하지 않고, 가능한 한 공식 실행 채점기로 확인합니다.

{ }

Code generation

설명을 읽고 실행 가능한 Python 함수를 만듭니다.

후보: BigCodeBench Hard · Pass@1
SQL

Text-to-SQL

질문을 읽고 데이터베이스에서 실행되는 SQL을 만듭니다.

후보: BIRD / Arcwise · execution accuracy
ƒ(x)

Financial reasoning

재무 표와 문서를 읽고 계산 프로그램과 답을 만듭니다.

후보: FinQA · execution + program accuracy

End-to-end flow

전체 실험은 이렇게 흘러갑니다.

inspected

1. 쓸 benchmark(공개 문제집) 후보를 비교한다

최신성보다 질문을 안전하게 바꿀 수 있는지, 실행 채점이 가능한지, 결함과 오염 위험이 어떤지를 먼저 봅니다.

reviewed

2. 영어 질문을 기준 한국어로 번역한다

코드·스키마·숫자는 placeholder(임시 보호표)로 잠근 뒤 자연어만 번역합니다. 번역 지시문의 선행연구 근거는 확인했습니다.

paused here

3. C1·C2·C3 위치를 정확히 표시한다

현재 extraction(표현 추출) 규칙과 자동 검사기(validator)가 아직 맞물리지 않습니다. 그래서 더 많은 데이터를 만들기 전에 멈췄습니다.

after approval

4. 표시된 위치만 바꿔 MIX1·2·3을 만든다

LLM이 문장 전체를 다시 쓰지 않습니다. 승인된 표현과 문자 위치(offset)만 사용해 똑같은 규칙으로 교체합니다.

pilot only

5. task마다 약 30문제를 다섯 조건으로 푼다

같은 모델과 같은 inference(모델 실행) 설정을 유지하고, 같은 문제의 EN·KO·MIX 점수를 짝지어 비교합니다.

The small pilot

승인 뒤에도, 먼저 작게 확인합니다.

≈30usable samples per task

  • 고정 추출규칙을 먼저 얼린 뒤 fixed seed로 held-out sample(규칙을 만들 때 보지 않은 표본)을 고릅니다.
  • 다섯 조건EN·KO·MIX1·MIX2·MIX3을 모두 같은 설정으로 실행합니다.
  • 주 모델API가 준비되어 있다면 Gemini 3.7 Flash를 사용합니다.
  • 작은 smoke testGPU가 충분할 때만 EXAONE 3.5 7.8B가 실행되는지 최소 범위로 확인합니다.
  • 결과물점수·차이·실패 사례·비용·시간·막힌 지점을 함께 기록합니다.

중요: 약 30개짜리 pilot은 파이프라인이 끝까지 도는지 보는 시험입니다. “영어 혼용이 성능을 높인다” 같은 통계적 결론은 여기서 내리지 않습니다. 세 모델 전체 실험도 아직 하지 않습니다.