LLM은 정말 "모르는" 걸까 — 400만 응답이 보여준 인코딩 포화와 리콜 병목
핵심 발견: 프론티어 모델은 벤치마크 사실의 95–98%를 이미 파라미터에 인코딩해 두고 있었다. 남는 오류의 상당수는 "지식 부재"가 아니라 "지식 접근 실패"였다.
1. 개요
| 항목 | 내용 |
|---|---|
| 주제 | LLM 사실성(Factuality) 오류의 원인을 인코딩(저장) 과 리콜(회상) 으로 분리한 행동 기반 프레임워크와 벤치마크 WikiProfile |
| 핵심 관점 | 분석 단위를 "질문"에서 "사실(fact)"로 옮기면, 같은 오답도 원인과 해결책이 완전히 달라진다 |
| 핵심 키워드 | Empty Shelves(빈 선반) · Lost Keys(잃어버린 열쇠) · 지식 프로파일링 · 리콜 병목 · 역전 저주(reversal curse) · Thinking(추론 시간 계산) |
| 출처 | Nitay Calderon 외 5인, Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality, Google Research · Technion, ICML 2026 Proceedings (arXiv 2602.14080v2) |
2. 핵심 메시지 3가지
① 정확도 점수는 "왜 틀렸는지"를 말해주지 않는다
기존 사실성 평가는 응답을 단순히 맞다/틀리다로만 취급합니다. 논문은 이 지점을 이렇게 짚습니다.
"Encoding and recall failures are indistinguishable under accuracy metrics, yet they imply different limitations and solutions."
인코딩 실패(빈 선반) 는 사전 학습 개입 — 모델 규모나 데이터 커버리지 확장 — 으로 풀립니다. 반면 회상 실패(잃어버린 열쇠) 는 이미 저장된 지식을 꺼내 쓰는 문제이므로 사후 학습·추론 단계 개입이 답입니다. 원인을 섞어 버리면 개선 방향도 섞입니다.
② 프론티어 모델의 선반은 거의 다 채워져 있다
13개 LLM 에서 수집한 400만 건 이상의 채점된 응답을 분석한 결과, Gemini-3-Pro와 GPT-5를 포함한 프론티어 모델의 인코딩률은 95–98% 로 사실상 포화 상태였습니다. 확장이 줄이는 것은 인코딩 실패뿐입니다.
③ Thinking은 "새 지식 생성"이 아니라 "회상 촉진"이다
Thinking(추론 시간 계산)은 인코딩되었으나 직접 회상되지 않는 사실의 40–65% 를 복구합니다. 반면 인코딩되지 않은 사실은 5–15% 만 회복됩니다. 이 비대칭이 Thinking의 실체를 규정합니다.
3. 조사 방법 — WikiProfile은 어떻게 만들어졌나

WikiProfile은 2,150개 사실 × 사실당 10개 질문 구조이며, 합성 트리플이 아니라 실제 위키백과 문서에서 추출한 자연 문장 기반입니다. 자동 파이프라인의 필터링 여정은 다음과 같습니다.
| 단계 | 처리 내용 | 통과 결과 |
|---|---|---|
| ① 모수집 | 위키백과 페이지 요약문(최소 50단어 이상) | 10,000개 문서 |
| ② NER | LLM이 문서당 최대 8개 엔티티 식별, 19가지 사전 정의 유형으로 분류 | — |
| ③ 객체 선별 | 완성 과제에 적합한 최대 3개 객체 엔티티 선정 (비자명·비추측·좌측문맥 단일정답 제약) | 12,031개(35.6%) 확보 |
| ④ 균형화 | 팩트 카테고리·엔티티 유형 균형 다운샘플링 | 5,000개 |
| ⑤ Direct 정제 | 특이성·최소성 프롬프트 적용 | 45개 기각 → 4,955개 |
| ⑥ Direct 필터링 | Google Search 기반 Gemini-2.5-Pro로 모호·다중정답 제거 | 10.6% 제거 |
| ⑦ Reverse 검증 | 역방향 질문 모호성 제거 | 5.5% 제외 → 2,357개 |
| ⑧ 길이 필터 | 질문 40단어 이상 / 문맥 30단어 미만 제거 | 2,200개 |
| ⑨ 수동 품질 | 4개 프론티어 LLM(Gemini-3-Pro/Flash, GPT-5, GPT-4.1) 전원 실패 사례 우선 검토 | 237개(10.7%) 식별 → 43개(<2%) 제거 → 최종 2,150개 |
5가지 지식 프로파일 (Figure 1 상단):
| 프로파일 | 의미 |
|---|---|
| Encoding Failure | 미인코딩 — 저장도 접근도 불가 (빈 선반) |
| Recall Failure | 인코딩됨, 접근 불가 (잃어버린 열쇠) |
| Inference w/o Encoding | 미인코딩이나 Thinking으로 추론 가능 |
| Direct Recall | 인코딩 + Thinking 없이 즉시 회상 |
| Recall with Thinking | 인코딩 + Thinking으로 회상 |
측정 논리는 인코딩 = 존재 양화(∃), 지식 = 전칭 양화(∀) 로 분리됩니다. 즉 인코딩은 "어떤 형태로든 재현 가능한가", 지식은 "표면 표현·관계 방향이 바뀌어도 일관되게 맞는가"를 봅니다. 과제 형식은 10가지(Proposition Completion, Contextual Question, Direct/Direct Natural/Reverse/Reverse Natural 폐쇄형 및 각각의 Multiple-choice 변형, 선택지 4개)입니다.
4. 발견 ① — 스케일링은 선반만 채운다
Gemma3 패밀리의 1B → 27B 확장에서 인코딩 실패는 85%에서 23% 로 급감했습니다. 반면 리콜 실패는 규모가 커져도 사라지지 않습니다.
| 모델 | Knows(지식 보유율) |
|---|---|
| Gemini-3-Pro | 87.5 |
| GPT-5 | 83.8 |
| GPT-5-mini | 67.0 |
| Gemma3-27b | 45.3 |
Figure 1 하단의 이 수치가 말하는 바는 명확합니다. 인코딩은 95–98% 대인데 Knows는 87.5 에 그친다면, 그 격차 전량이 리콜 손실입니다.
"Scaling primarily improves encoding, while recall remains a major bottleneck."
강건성 확인: 임계값 τ를 0.99 라는 보수적 기준으로 올려도 프론티어 모델의 인코딩은 거의 포화 상태이며, 리콜 실패가 오류의 상당 부분을 차지하고, Thinking이 회복 메커니즘으로 작용한다는 결론은 변하지 않았습니다.
5. 발견 ② — 롱테일과 역전 저주는 '기억 문제'가 아니었다
인기도 격차
Wikipedia 페이지 방문 수 기준으로 사실을 상위 20% / 하위 20%로 나눈 결과:
| 격차 유형 | 크기 |
|---|---|
| 인코딩 격차 (인기 vs 롱테일) | 수 %p (a few percentage points) |
| 리콜 격차 (인기 vs 롱테일) | 대개 25% 초과 |
Gemini-3-Pro 기준 희귀 사실의 인코딩 성공률은 99.5% vs 94.5% 로 오히려 높은 편이지만, 리콜 성공률 격차는 Δ=21.3 까지 벌어집니다. 13개 중 Gemma3 12b/4b/1b를 제외한 10개 모델에서 리콜 격차가 인코딩 격차를 현저히 초과했습니다.
역전 저주(Reversal Curse)
"A가 B에서 첫 공연을 했다"는 답하면서 "B에서 첫 공연을 한 팀은?"은 틀리는 현상. WikiProfile의 분해 결과는 이렇습니다.
- 폐쇄형 생성(CBQA): 역방향 질문에서 일관되게 더 많은 오류 — 모든 모델에서 역방향 오류가 직접 질문보다 많음
- 다중 선택 검증(MCQA): 역방향에서도 정답을 인지함 — 13개 중 9개 모델에서 역방향 검증이 오히려 더 쉬움
즉 양방향 연결이 학습되지 않은 것이 아니라, 회상의 비대칭성입니다. 두 현상 모두 "누락된 지식"이 아니라 "접근 조건이 맞지 않는 인코딩된 지식" 으로 재해석됩니다.
6. 발견 ③ — Thinking의 3가지 가설과 판정
Thinking이 사실성을 높이는 메커니즘으로 다음 세 가설이 검토되었습니다.
| 가설 | 작동 방식 | 예측 |
|---|---|---|
| ① 응답 다양성 | 출력 분산 증가로 정답 확률 상승 | 가용성↑ / 일관성 = |
| ② 추론 | 다른 인코딩 사실들을 연결해 답 도출 | 인코딩 여부와 무관하게 작동 |
| ③ 회상 촉진 | 인코딩됐으나 직접 생성으로 접근 불가한 사실 활성화 | 가용성↑ / 일관성↑ |
판정 근거 — 'correct≥k' 지표: 낮은 k는 가용성(최소 1회 정답), 높은 k는 일관성(전체 정답)을 측정합니다.
- Thinking 최적화 모델(Gemini-3, GPT-5 등): 낮은 임계값과 높은 임계값 모두에서 향상 → 가설 ① 기각, 가설 ③ 지지
- CoT 프롬프팅만 사용한 모델(Gemma3, GPT-4.1): 가용성은 개선되나 일관성은 저하되거나 미미 → 가설 ① 효과가 주류
- 결정적 비대칭: Thinking 최적화 모델은 인코딩된 사실의 40–65% 를 회상 촉진으로 복구, 비인코딩 사실은 20% 미만 복구
효과가 가장 큰 지점: 직접 리콜이 약한 영역 — 롱테일 사실과 역방향 질문. Thinking은 13개 중 8개 모델에서 인기도 격차를, 9개 모델에서 방향성 격차를 완화했으며, 강력한 프론티어 모델일수록 효과가 두드러졌습니다.
인간 인지와의 유사성: 저자들은 이를 인간 기억의 tip-of-the-tongue(말끝에 걸림) 현상에 비유합니다. 정보는 존재하나 즉각 산출되지 않고, 관련 개념을 떠올리거나 맥락을 재구성하는 추가 노력으로 회상되는 상태 — Thinking이 바로 그 "추가 계산"에 해당합니다.
7. 측정 신뢰도를 지탱한 장치들
| 항목 | 내용 |
|---|---|
| 채점 | Gemini-2.5-Pro 기반 LLM 그레이더, 라벨 CORRECT / INCORRECT / PARTIALLY / OTHER 4단계 |
| 지표 예외 처리 | PARTIALLY·OTHER는 주관적 가중치 회피를 위해 제외 — 전체 응답의 5% 미만 |
| 채점자 일치율 | Gemini-2.5-Pro vs GPT-5 채점자, 4,160개 응답 중 98.2% 일치 |
| 다중 응답 표본 수 | 부트스트랩 분석 결과 n=8 에서 90% 신뢰구간 폭이 1% 미만 으로 수렴 (±0.5% 이내 안정성) → n=8 채택 |
| 문구 효과 통제 | 프롬프트 문구 변경에 대한 104건 가설 검정, Benjamini-Yekutieli 절차 적용 → 모든 검정에서 유의미한 차이 없음 |
| PARTIALLY/OTHER 처리 전략 | 태스크 쌍 전체가 채점 불가능할 때만 사실을 제외하는 전략 채택 → 제외 비율 1–4% 로 프로파일 분포 유지 |
8. 관점 포인트
- "모른다"와 "꺼내지 못했다"를 분리하라. 같은 오답률 10%라도 인코딩 실패 10%와 리콜 실패 10%는 전혀 다른 투자 방향을 요구합니다.
- 스케일링의 한계 지점. 프론티어 모델에서 인코딩은 이미 95–98% — 여기서 더 큰 모델을 돌려도 얻을 수 있는 인코딩 이득은 2–5%p 에 불과합니다.
- RAG 시대에도 파라메트릭 지식은 대체재가 아니다. 유창성·속도·통합을 위해 매개변수 지식이 필수적이며, 문제는 저장량이 아니라 접근성입니다.
- MCQA 점수는 리콜을 과대평가한다. 선택지 검증은 회상 실패를 가립니다. 역전 저주를 "미학습"으로 진단하기 전에 생성/검증을 분리해 보세요.
- Thinking은 무료가 아니다. 프론티어 모델 전체 프로파일링 비용이 약 500달러 수준 — 평가 설계 시 예산 변수로 고려해야 합니다.
- 해결 레이어는 세 갈래. 사전 학습 데이터 증강 / 사후 학습 정렬 / 추론 시 Thinking 활용 — 논문은 세 번째가 이미 검증된 회복 장치라고 보고합니다.
9. 최종 핵심 정리
확인해야 할 핵심 질문
- 우리 모델의 오류는 빈 선반인가, 잃어버린 열쇠인가?
- 롱테일 사실에서 인코딩률과 리콜률의 격차(Δ) 는 얼마인가?
- 역방향 질문을 생성으로 묻는가, 검증으로 묻는가?
- Thinking을 켰을 때 인코딩된 사실의 복구율은 40–65% 대에 도달하는가, 아니면 비인코딩 사실처럼 20% 미만에 머무는가?
- 평가 표본 수는 n=8 이상인가? 단일 응답으로 "안다/모른다"를 판정하고 있지는 않은가?
연구 한계 (원문 명시)
- WikiProfile은 위키백과라는 백과사전적 도메인(비교적 저명한 사실)에 한정 — 타 코퍼스 일반화 보장 불가
- 지식 정의가 방향성·문구 두 축의 단일 홉(single-hop) 사실에 국한
- 프론티어 모델 전체 프로파일링 비용 약 500달러
한 줄 요약: 프론티어 LLM의 사실성 병목은 지식을 담는 그릇(인코딩)이 아니라, 이미 담긴 지식을 꺼내는 손(리콜)이며 — Thinking은 그릇을 새로 만드는 대신 잃어버린 열쇠를 찾아주는 메커니즘이다.
댓글 0
아직 댓글이 없습니다 — 첫 댓글을 남겨보세요.