KO · 한국어 질문
로그를 날짜별로 정렬하고 최신 경로를 반환하세요.
문제의 뜻과 정답은 그대로 둡니다. 바꾸는 건 질문 속 한국어·영어 표현의 비율뿐입니다. 그러고 나서 LLM(문제를 푸는 언어 모델)이 어느 말투에서 더 잘 푸는지 비교합니다.
아직 본 실험 전 · 설계 검토 중KO · 한국어 질문
로그를 날짜별로 정렬하고 최신 경로를 반환하세요.
버튼을 눌러 보세요. 노랑=C1, 파랑=C2, 주황=C3. MIX3의 영어 동사와 한국어 어미를 붙이는 법은 아직 확정하지 않았습니다.
Five conditions
KO를 기준으로 C1, C2, C3 표현을 순서대로 영어로 바꿉니다. 문장 전체를 새로 쓰지 않고, 미리 찾은 위치만 같은 규칙으로 교체합니다.
외래어·음역 표현을 영어 표기로 바꿉니다. 예: 로그 → log.
분야의 핵심 개념을 영어로 바꿉니다. 예: 경로 → path.
지시·연산 표현도 영어로 바꿉니다. 예: 반환하세요 → return. 한국어 어미 처리법은 검토 중입니다.
Three jobs
서로 다른 능력을 보는 세 과제를 고릅니다. 답이 맞았는지는 사람이 느낌으로 정하지 않고, 가능한 한 공식 실행 채점기로 확인합니다.
설명을 읽고 실행 가능한 Python 함수를 만듭니다.
후보: BigCodeBench Hard · Pass@1질문을 읽고 데이터베이스에서 실행되는 SQL을 만듭니다.
후보: BIRD / Arcwise · execution accuracy재무 표와 문서를 읽고 계산 프로그램과 답을 만듭니다.
후보: FinQA · execution + program accuracyEnd-to-end flow
최신성보다 질문을 안전하게 바꿀 수 있는지, 실행 채점이 가능한지, 결함과 오염 위험이 어떤지를 먼저 봅니다.
코드·스키마·숫자는 placeholder(임시 보호표)로 잠근 뒤 자연어만 번역합니다. 번역 지시문의 선행연구 근거는 확인했습니다.
현재 extraction(표현 추출) 규칙과 자동 검사기(validator)가 아직 맞물리지 않습니다. 그래서 더 많은 데이터를 만들기 전에 멈췄습니다.
LLM이 문장 전체를 다시 쓰지 않습니다. 승인된 표현과 문자 위치(offset)만 사용해 똑같은 규칙으로 교체합니다.
같은 모델과 같은 inference(모델 실행) 설정을 유지하고, 같은 문제의 EN·KO·MIX 점수를 짝지어 비교합니다.
The small pilot
≈30usable samples per task
중요: 약 30개짜리 pilot은 파이프라인이 끝까지 도는지 보는 시험입니다. “영어 혼용이 성능을 높인다” 같은 통계적 결론은 여기서 내리지 않습니다. 세 모델 전체 실험도 아직 하지 않습니다.