Usable pool
현재 문장과 MIX를 그대로 쓸 수 있다고 판정된 전체 모음입니다.
- Gemini 자동 통과
- 직접 확인해 복구한 false negative도 포함
- EDA와 오류 분석에 사용
지금 데이터는 안전하지만, 아직 한 상자에 있지 않습니다
지금은 extraction, judge, review 증거가 파일별로 있습니다. 다음에는 이 셋을 한 행짜리 최종 여권으로 묶고, prompt 개발이나 직접 검수에서 보지 않은 샘플 30개만 뽑아 다섯 조건으로 시험합니다.
corpus를 보존하는 기준과 공정한 실험 표본을 뽑는 기준을 나눕니다.
현재 문장과 MIX를 그대로 쓸 수 있다고 판정된 전체 모음입니다.
실제 시험에 넣어도 선택 편향이 적은 더 엄격한 모음입니다.
| 태스크 | 벤치마크 | Broad usable | 현재 판단 |
|---|---|---|---|
| 코드 | BigCodeBench Hard | 117 / 148 | 주 후보 |
| SQL | BIRD Mini-Dev | 73 / 500 | 실행 가능한 fallback |
| 금융 | FinQA validation | 10 / 883 | 30개 파일럿에는 부족 |
| SQL 후보 | LiveSQLBench Query | 126 / 180 | GT/test cases 대기 |
| 금융 후보 | FinanceReasoning Hard | 159 / 238 | license·평가 protocol gate |
후보 벤치마크를 한 태스크에 합쳐 쓰지 않습니다. 태스크마다 하나를 승인한 뒤 그 풀 안에서 30개를 뽑습니다.
앞 단계가 고정되지 않으면 다음 단계가 실행되지 않도록 fail-closed로 만듭니다.
extraction, Gemini 판정, 직접 검수 결과를 candidate_id + record_id로 연결합니다. 중복이나 누락이 하나라도 있으면 멈춥니다.
prompt 개발, 번역·extraction 검수, 10개 probe, 50개 screening, 직접 검수에 쓰인 ID를 exclusion ledger에 모읍니다.
NEXT자동 통과했고 수리하지 않았으며 이전 검수에서 보지 않은 all-three 행만 남깁니다. 30개 미만이면 몰래 기준을 낮추지 않습니다.
NEXT코드는 BigCodeBench. SQL과 금융은 아래 gate를 통과한 후보 하나씩을 선택합니다. 기존 프로젝트 seed 20260828도 명시적으로 기록합니다.
ID를 정렬한 뒤 fixed seed로 한 번만 추첨합니다. 선택 목록과 입력 풀의 SHA-256을 저장하고, 이후 덮어쓰지 않습니다.
AFTER GATE한 ID에서 EN·KO·MIX1·MIX2·MIX3 다섯 행을 만듭니다. source document, schema, table, code, 숫자는 다섯 행에서 같은 hash여야 합니다.
DETERMINISTIC한 태스크 안에서는 다섯 조건의 model 설정을 완전히 같게 둡니다. 3태스크 × 30샘플 × 5조건이면 한 모델에 450개 요청입니다.
TARGET CALL GATE코드는 Pass@1, SQL은 execution accuracy, 금융은 승인된 하나의 실행 기반 metric을 사용합니다. sample ID로 다섯 결과를 다시 묶습니다.
LAST세 태스크를 한 모델로 돌리면 450개입니다. 같은 ID끼리 비교하므로 문제 난이도 차이가 아니라 언어 조건 차이에 더 집중할 수 있습니다.
탭을 눌러 태스크별로 무엇이 준비됐고 무엇이 필요한지 확인할 수 있습니다.
117개 broad usable이 있고 공식 실행 harness와 Pass@1이 준비돼 있습니다. prior-use exclusion 후에도 30개가 남는지만 확인하면 됩니다.
가장 준비됨예를 들어 같은 코드 문제 ID가 EN에서는 통과하고 KO에서는 실패했지만 MIX2에서 다시 통과할 수 있습니다. 이런 전환을 모든 ID에서 모아 조건 점수와 delta를 계산합니다.
버리지 않습니다. broad usable corpus와 오류 분석에는 남깁니다. 다만 사람이 본 결과를 파일럿 추첨함에 다시 넣으면 선택 편향이 생길 수 있으므로 clean pilot에서는 제외하는 것이 안전합니다.
지금은 extraction, judge, review가 별도 파일이라 판정 적용 순서가 달라질 위험이 있습니다. 먼저 한 행으로 합치고 hash를 고정해야 같은 연구를 다시 실행했을 때 같은 30개가 나옵니다.
작은 별도 관찰은 가능하지만, 태스크별 약 30개라는 현재 파일럿 설계와 맞지 않습니다. FinanceReasoning을 승인하거나, FinQA만 10개로 축소했다는 설계 변경을 명시해야 합니다.
450은 서로 독립적인 문제 450개가 아니라 90개 underlying sample의 다섯 조건입니다. 이번 단계는 pipeline과 효과 방향을 확인하는 pilot이므로 통계적 일반화를 주장하지 않습니다.
전처리 결과는 원문·모델 응답·판정·hash와 함께 보존돼 있습니다. 이제 이 증거를 하나의 frozen manifest로 묶으면 파일럿을 시작할 준비가 됩니다.