Series: AI 검증이 놓치는 것들
AI가 만든 결과물을 다시 검증하는 장치 자체를, 그 장치가 실제로 뭘 놓치는지 실측으로 들여다본 기록. 상위개념과 하위유형을 동일 대상으로 오판한 병합 감사 장치, 리스트 밀도가 높은 파일에서 항목별 대조 없이 훑어보기만 한 서브에이전트 전수 감사, 다른 사례로만 재검증하느라 원래 오탐 사례는 다시 안 본 것, ingest 단계에서 형제 노트끼리 문단을 그대로 베끼는 걸 처음엔 아무 장치도 못 잡았던 것, 그리고 그 중복을 잡으려 새로 만든 임베딩 필터조차 모델 등급(small/large)에 따라 판정이 뒤집히는 것까지.
-
몇 주 뒤, 그 감사 장치가 못 보는 경우를 찾았다
예전에 32번 중 32번을 다 맞혔던 병합 감사 장치가, 실전에서 상위 개념 노트와 그 하위 유형 노트를 동일 대상으로 오판했다. 원인은 판단력이 아니라 설계 자체 — 그 감사는 처음부터 이 종류의 오판을 잡도록 만들어진 게 아니었다.