📐 용어 설명 — recall · MRR · 질문 유형 4가지
지표
| recall@3 | 정답 근거를 몇 % 찾았나. 근거 3개 중 1개면 0.33 |
| MRR | 정답이 몇 등인가. 1등=1.0, 2등=0.5, 4등=0.25 |
| hit@3 | 하나라도 있으면 만점 — 실패를 숨겨서 안 씁니다 |
질문 유형 (12문항의 설계)
| 사실 | 답이 한 문장에 그대로 있음 |
| 애매 | 구어체·지시어 — "그 조사 언제로 밀렸지?" |
| 다중연결 | 여러 문서를 이어야 답이 나옴 |
| 전체조망 | 어느 한 문서에도 답이 없음 |
💡 지표 하나만 보면 안 됩니다. recall이 높아도 MRR이 낮으면 "찾긴 했는데 뒤에 있다"는 뜻이고,
둘 다 높아도 답변이 틀릴 수 있습니다. 자세한 설명은
용어 사전에 있습니다.
불러오는 중…
전체 기법 성능 비교
골든 질문 12개를 모든 기법에 똑같이 돌린 결과입니다.
열 제목을 누르면 정렬됩니다. 행을 누르면 위쪽 기법 A가 그 기법으로 바뀝니다.
이 표를 그대로 믿으면 안 됩니다
골든 질문 12개 중 9개가 단순 사실 질문입니다. 그래서
GraphRAG Local은 평균 recall이 꼴찌인데도,
이 랩에서 유일하게 근본 원인 문서(doc_11)에 도달한 기법입니다.
평균 지표는 "평균적으로 무난한가"를 잽니다. "가장 어려운 문제를 푸는가"는 재지 않습니다 — 실무에서 RAG를 도입하는 이유가 대개 후자인데도요.
확인하려면 위에서 질문을 "2025년 예산이 삭감된 근본 원인은?" 으로 바꾸고 20 과 20+ 를 나란히 비교해보세요.
평균 지표는 "평균적으로 무난한가"를 잽니다. "가장 어려운 문제를 푸는가"는 재지 않습니다 — 실무에서 RAG를 도입하는 이유가 대개 후자인데도요.
확인하려면 위에서 질문을 "2025년 예산이 삭감된 근본 원인은?" 으로 바꾸고 20 과 20+ 를 나란히 비교해보세요.
실습에 쓰인 문서 24개
전부 가상 자료입니다 (한강수계 생태복원 사업단).
각 문서에는 특정 기법이 필요해지도록 함정을 심어두었습니다 —
이걸 알아야 결과가 왜 그렇게 나오는지 이해됩니다. 클릭하면 원문이 열립니다.
이 랩을 관통하는 인과 사슬
doc_11 장비 납품 지연 ──▶ doc_14 조사 3개월 연기 ──▶ doc_18 예산 12% 삭감
세 문서는 서로를 문서번호로 참조하지 않고, 공통 고유명사도 공유하지 않습니다.
그래서 "2025년 예산이 삭감된 근본 원인은?"
이라는 질문에 벡터·BM25·하이브리드·연쇄검색이 모두 실패하고,
GraphRAG Local(20+)만 doc_11에 도달합니다.
파라미터 직접 밀어보기
청크 크기와 오버랩을 바꾸면 지표가 어떻게 움직이는지 — 모든 조합을 미리 계산해뒀습니다.