핵심 요약
- LLM이 말하는 "90% 확신한다"는 신뢰도는 실제 계산된 확률이 아니라 그럴듯한 단어를 이어 붙인 것에 불과합니다.
- RLCD 방식은 모델에게 결과 구간별 확률 분포를 제시하게 하고 실제 결과와 비교 채점하여 과신이나 회피를 방지합니다.
- 이를 통해 모델이 틀릴 가능성을 정직하게 반영하도록 유도해 실제 수학적 의사결정에 쓸 수 있는 신뢰도를 얻을 수 있습니다.
요약 LLM에게 "자신감이 몇 %냐"고 물으면 보통 "약 90% 확신한다" 같은 답변을 내놓지만, 이는 실제 계산된 수치가 아니라 그저 다음 토큰을 그럴싸하게 예측한 '단어 선택'에 불과합니다. 지어낸 헛소리를 할 때도 똑같이 당당하게 90%라고 말할 수 있는 이유입니다.
이러한 환각과 과신 문제를 해결하기 위해 제시된 방식이 RLCD(강화학습 기반 보정)입니다. 모델에게 단일 답변과 신뢰도를 요구하는 대신 가능한 결과값 범위를 여러 구간(버킷)으로 나누고 각각에 확률을 할당하도록 확률 분포를 예측하게 만듭니다.
이후 모델이 예측한 확률 분포를 실제 발생한 실제 결과와 비교해 평가합니다. 항상 과도하게 확신하는 모델은 틀렸을 때 큰 감점을 받고, 반대로 늘 애매하게 회피하는 모델도 좋은 점수를 얻지 못하게 설계되어 있습니다. 오직 60% 확률로 발생하는 사건에는 60%라고 솔직하게 예측해야만 최고 점수를 받도록 보상 시스템을 설계하여 모델이 '정답 맞히기'뿐만 아니라 '자신의 불확실성을 정직하게 인정하는 법'을 배우게 합니다. 이렇게 보정된 신뢰도 수치는 단순한 느낌이 아니라 주식 예측이나 기대값 계산 같은 실제 의사결정 수식에 바로 적용할 수 있는 의미 있는 데이터가 됩니다.
Sponsored · 광고