PILOT DATA CONTROL ROOM계획 단계 · inference 전

지금 데이터는 안전하지만, 아직 한 상자에 있지 않습니다

Usable을Pilot로보내는 길.

지금은 extraction, judge, review 증거가 파일별로 있습니다. 다음에는 이 셋을 한 행짜리 최종 여권으로 묶고, prompt 개발이나 직접 검수에서 보지 않은 샘플 30개만 뽑아 다섯 조건으로 시험합니다.

EXTRACTEN·KO·C1/C2/C3·MIXcandidate_id + record_id
JUDGEGemini usable 판정candidate_id + record_id
REVIEW직접 복구·최종 탈락candidate_id + record_id
FROZEN ROW원문부터 최종 판정까지 한 행에 고정
현재: evidence와 집계는 존재다음: immutable usable manifest를 생성
01 · TWO POOLS

“쓸 수 있다”와
“파일럿에 넣는다”는 다릅니다

corpus를 보존하는 기준과 공정한 실험 표본을 뽑는 기준을 나눕니다.

BROAD VIEW

Usable pool

현재 문장과 MIX를 그대로 쓸 수 있다고 판정된 전체 모음입니다.

  • Gemini 자동 통과
  • 직접 확인해 복구한 false negative도 포함
  • EDA와 오류 분석에 사용
FILTER
EXPERIMENT VIEW

Pilot-eligible

실제 시험에 넣어도 선택 편향이 적은 더 엄격한 모음입니다.

  • C1·C2·C3 모두 존재
  • 수리 없이 Gemini 자동 통과
  • prompt 개발·직접 검수에서 보지 않은 행
중요: 지금 보고한 117·73·10·159·126은 broad usable 수입니다. prior-use exclusion ledger를 적용한 뒤의 정확한 pilot-eligible 수는 아직 파일로 고정하지 않았습니다. 파일럿 전에 이 수를 먼저 확정합니다.
02 · INVENTORY

현재 창고에 있는
usable 표본

태스크벤치마크Broad usable현재 판단
코드BigCodeBench Hard117 / 148주 후보
SQLBIRD Mini-Dev73 / 500실행 가능한 fallback
금융FinQA validation10 / 88330개 파일럿에는 부족
SQL 후보LiveSQLBench Query126 / 180GT/test cases 대기
금융 후보FinanceReasoning Hard159 / 238license·평가 protocol gate

후보 벤치마크를 한 태스크에 합쳐 쓰지 않습니다. 태스크마다 하나를 승인한 뒤 그 풀 안에서 30개를 뽑습니다.

03 · ROUTE

앞으로 실제로
진행되는 순서

앞 단계가 고정되지 않으면 다음 단계가 실행되지 않도록 fail-closed로 만듭니다.

증거 파일을 한 행으로 합칩니다

extraction, Gemini 판정, 직접 검수 결과를 candidate_id + record_id로 연결합니다. 중복이나 누락이 하나라도 있으면 멈춥니다.

NEXT

이전에 본 샘플을 표시합니다

prompt 개발, 번역·extraction 검수, 10개 probe, 50개 screening, 직접 검수에 쓰인 ID를 exclusion ledger에 모읍니다.

NEXT

Pilot-eligible 수를 다시 셉니다

자동 통과했고 수리하지 않았으며 이전 검수에서 보지 않은 all-three 행만 남깁니다. 30개 미만이면 몰래 기준을 낮추지 않습니다.

NEXT

벤치마크와 seed를 승인합니다

코드는 BigCodeBench. SQL과 금융은 아래 gate를 통과한 후보 하나씩을 선택합니다. 기존 프로젝트 seed 20260828도 명시적으로 기록합니다.

HUMAN GATE

태스크별 30개 ID를 고정합니다

ID를 정렬한 뒤 fixed seed로 한 번만 추첨합니다. 선택 목록과 입력 풀의 SHA-256을 저장하고, 이후 덮어쓰지 않습니다.

AFTER GATE

30개를 다섯 조건으로 펼칩니다

한 ID에서 EN·KO·MIX1·MIX2·MIX3 다섯 행을 만듭니다. source document, schema, table, code, 숫자는 다섯 행에서 같은 hash여야 합니다.

DETERMINISTIC

태스크별 Batch로 시험을 봅니다

한 태스크 안에서는 다섯 조건의 model 설정을 완전히 같게 둡니다. 3태스크 × 30샘플 × 5조건이면 한 모델에 450개 요청입니다.

TARGET CALL GATE

공식 evaluator로 채점합니다

코드는 Pass@1, SQL은 execution accuracy, 금융은 승인된 하나의 실행 기반 metric을 사용합니다. sample ID로 다섯 결과를 다시 묶습니다.

LAST
04 · SCALE

30개를 뽑으면
왜 150번 시험할까요?

30같은 underlying sample
×
5언어 조건
=
150한 태스크의 요청

세 태스크를 한 모델로 돌리면 450개입니다. 같은 ID끼리 비교하므로 문제 난이도 차이가 아니라 언어 조건 차이에 더 집중할 수 있습니다.

EN원문 영어
KO기준 한국어
MIX1KO + C1
MIX2MIX1 + C2
MIX3MIX2 + C3
05 · GATES

지금 바로 못 누르는
세 개의 버튼

탭을 눌러 태스크별로 무엇이 준비됐고 무엇이 필요한지 확인할 수 있습니다.

BigCodeBench Hard

117개 broad usable이 있고 공식 실행 harness와 Pass@1이 준비돼 있습니다. prior-use exclusion 후에도 30개가 남는지만 확인하면 됩니다.

가장 준비됨
06 · SCORE

결과는 같은 ID끼리
옆으로 놓고 봅니다

한 번의 pass/fail이 다섯 칸으로

예를 들어 같은 코드 문제 ID가 EN에서는 통과하고 KO에서는 실패했지만 MIX2에서 다시 통과할 수 있습니다. 이런 전환을 모든 ID에서 모아 조건 점수와 delta를 계산합니다.

EN공식 score
KOscore + EN 대비 delta
MIX1score + KO 대비 delta
MIX2score + KO 대비 delta
MIX3score + KO 대비 delta
07 · QUICK ANSWERS

헷갈리기 쉬운 부분

직접 복구한 14개는 버리나요?

버리지 않습니다. broad usable corpus와 오류 분석에는 남깁니다. 다만 사람이 본 결과를 파일럿 추첨함에 다시 넣으면 선택 편향이 생길 수 있으므로 clean pilot에서는 제외하는 것이 안전합니다.

현재 usable 파일을 바로 랜덤 30개 뽑으면 안 되나요?

지금은 extraction, judge, review가 별도 파일이라 판정 적용 순서가 달라질 위험이 있습니다. 먼저 한 행으로 합치고 hash를 고정해야 같은 연구를 다시 실행했을 때 같은 30개가 나옵니다.

FinQA 10개를 그냥 쓰면 안 되나요?

작은 별도 관찰은 가능하지만, 태스크별 약 30개라는 현재 파일럿 설계와 맞지 않습니다. FinanceReasoning을 승인하거나, FinQA만 10개로 축소했다는 설계 변경을 명시해야 합니다.

450개를 돌리면 통계 결론을 낼 수 있나요?

450은 서로 독립적인 문제 450개가 아니라 90개 underlying sample의 다섯 조건입니다. 이번 단계는 pipeline과 효과 방향을 확인하는 pilot이므로 통계적 일반화를 주장하지 않습니다.

THE POINT

먼저 깨끗한 추첨함을 만들고,
그다음 같은 문제를 다섯 번 시험합니다.

전처리 결과는 원문·모델 응답·판정·hash와 함께 보존돼 있습니다. 이제 이 증거를 하나의 frozen manifest로 묶으면 파일럿을 시작할 준비가 됩니다.