본문 바로가기

성급한판정

EP.28 등급별 결과가 정말 나아졌는지 확인하는 방법: 착시를 거르는 3가지 기준 이 글에서 답하는 질문어떤 것을 좋은 것과 나쁜 것으로 나눠 놓았을 때, 좋은 쪽이 정말 더 나은 결과를 냈는지 어떻게 확인할까요? 결론부터 말하면, 두 결과의 차이가 충분히 크고, 확인한 개수가 충분히 많고, 버린 쪽이 오히려 더 낫지는 않은지 세 가지를 함께 봐야 합니다. 앞의 두 가지는 '진짜 차이가 있는지'를 판정하는 조건이고, 세 번째는 그와 별개로 항상 확인하는 경고 신호입니다.이 글은 저희가 만든 종목 선별 도구에서 실제로 겪은 실수를 바탕으로 합니다. 좋은 등급(A)과 낮은 등급(C)의 결과 차이가 아주 미미했는데도 프로그램이 "차이가 있다"고 표시하던 문제를 고친 기록입니다. 숫자를 잘 모르는 분도 따라 할 수 있게 풀어 썼습니다.무엇이 문제였나: 0.03%p 차이를 '성공'이라 부른 것.. 더보기
AI가 만든 '성공' 판정, 부호만 맞으면 통과시키는 함정 — 최소격차·표본 가드로 막는 법 문제 제기: '방향이 맞았다'와 '차이가 있다'는 다르다데이터로 두 그룹을 비교할 때 가장 흔히 저지르는 실수가 있습니다. A의 평균이 B의 평균보다 크기만 하면 "A가 더 낫다"고 결론 내리는 것입니다. 방향(부호)만 보고 판정하는 이 방식은 언뜻 합리적으로 보이지만, 차이의 크기와 표본 수를 무시하기 때문에 노이즈를 실력으로 착각하게 만듭니다.실제로 제가 만든 종목 등급 스크리너의 포워드 평가 함수(run_value_forward_eval)에서 이 문제가 터졌습니다. 판정 조건이 사실상 다음 한 줄이었습니다.if A.avg > C.avg: judgment = "✅ A>C 변별력 있음"이 코드는 A 등급 평균이 C 등급 평균보다 크기만 하면 무조건 성공을 표시합니다. 문제가 드러난 사례는 이랬습니.. 더보기

반응형