PUBLIC RESEARCH READER · 2026.09.19점수가 이상할 때,
점수가 이상할 때,
모델보다 먼저 환경을 본다.
Defect Lab은 벤치마크 결함 제보와 로컬 재구성 실험을 한곳에서 읽되, 서로 다른 근거를 섞지 않는 공개 자료집입니다.
핵심 결론
공개 장부의 수정 보고와 우리가 직접 재구성한 결과는 다릅니다. 작은 반복 실험에서 예시 제공은 평균 성능을 개선하지 않았습니다.
600외부 출처 제보
16로컬 재구성 사례
20모델 호출 응답 수
7블로그 읽기 안내
EVIDENCE LANES
세 가지 근거를 따로 읽습니다
01 · EXTERNAL
외부 출처 보고
Open Defects가 정리한 600건입니다. upstream의 수정 상태를 전달하며, Environment Foundry가 600건을 모두 재현했다는 뜻은 아닙니다.
02 · LOCAL
로컬 재구성
공개 사례에서 메커니즘을 추출해 독립 작성한 16개 microcase입니다. 상류 벤치마크 전체의 재현과는 범위가 다릅니다.
03 · CLAIM
논문·사이트 주장
논문 보고, 서비스 설명, 공개 코드에서 직접 관찰한 사실을 라벨로 나누고 독립 검증 여부를 함께 적습니다.
START HERE
읽기 순서
01 · 6 MIN
벤치마크가 틀렸다면, 모델 점수는 무엇을 측정할까
문제의식, 공개 자료, 다섯 쌍 실험과 구현까지 한 편으로 읽습니다.
요약 글 읽기 →02 · METHOD제보가 결함 장부가 되기까지
수집, 정규화, 감사, 반영, 공개 집계의 경계와 사람이 판단할 지점을 봅니다.
방법론 읽기 →03 · EXPERIMENT16개 재구성 · 5쌍 반복
Baseline F1 0.987, Few-shot F1 0.987. 평균 차이가 없었던 작은 실험의 범위를 확인합니다.
실험 읽기 →04 · LEDGER600건을 직접 검색하기
benchmark, 제목, 요약, L2/L3 표기를 검색합니다. 모든 카드는 외부 출처 보고로 표시됩니다.
장부 열기 →이 공개판은 읽기 전용입니다.
전체 연구 워크플로는 로컬 제품의 products/defect-lab/README.md에서 실행합니다. 공개판에는 쓰기 API, 검토 실행, 모델 endpoint, 로컬 DB 연결이 없습니다.