가치와 탐색 품질: MuZero라는 실전 사례
MuZero(암묵적 월드모델)
MuZero는 픽셀을 재구성하지 않습니다. 월드모델 전체가 표현 함수, 동역학 함수, 예측 함수라는 세 신경망 안에 완전히 숨겨져 있습니다. 이를 평가하려면 탐색 품질과 표현 안정성이라는 두 각도에서 접근해야 합니다.
가치 정확도(Value Accuracy)
MCTS 탐색 전, 신경망은 루트 노드에서 초기 가치 추정값 V₀를 내놓습니다. 탐색이 끝나면 방문 횟수로 Q값을 가중 평균해 정제된 추정값 V*를 얻습니다. 이 둘 사이의 평균제곱오차가 "탐색 없이도 얼마나 정확하게 판단할 수 있는가"를 나타냅니다.
값이 1에 가까울수록 좋습니다. 충분히 학습된 MuZero에서는 V₀가 V*에 근접해야 하며, 탐색의 역할이 "교정"이 아니라 "검증"에 가까워야 합니다.
진단 규칙: 가치 정확도가 오랫동안 0.6 아래에 머문다면, 보상 모델(동역학 함수가 출력하는 r̂)을 다시 학습시켜야 하거나, 리플레이 버퍼에 낡은 정책이 만들어낸 분포 밖 샘플이 너무 많이 섞여 있다는 뜻입니다. 우선순위 리플레이(priority replay, 각 전이의 TD 오차 크기에 따라 샘플링 확률을 배분하는 방법으로, 오차가 클수록 모델이 그 샘플을 잘 예측하지 못한다는 뜻이라 학습에 더 자주 샘플링됩니다)의 가중치를 늘려 최근 데이터가 더 자주 샘플링되도록 하는 것이 좋습니다.
MCTS 방문 엔트로피(Visit Entropy)
탐색 트리에서 각 자식 노드의 방문 횟수 n_i는 하나의 분포를 이룹니다. 엔트로피는 다음과 같이 정의됩니다.
엔트로피가 높다는 것은 모델이 여러 동작에 대해 확신이 없어 탐색의 폭이 넓다는 뜻이고, 엔트로피가 낮다는 것은 특정 동작에 대한 확신이 강하다는 뜻입니다.
맥락에 따라 다르게 봐야 합니다. 엔트로피가 높다고 반드시 나쁜 건 아닙니다. 확률성이 강한 게임(예: 바둑의 초반 포석)에서는 객관적으로 가치가 비슷한 수가 여러 개 있을 수 있고, 높은 엔트로피는 "여러 동작이 다 가치 있다"는 현실을 정확히 반영한 것입니다. 낮은 엔트로피는 승패가 명확해진 게임 후반부에서만 모델이 정당하게 확신으로 수렴했다는 좋은 신호입니다. 학습 초반이나 확률성이 강한 국면에서 엔트로피가 비정상적으로 낮다면, 오히려 모델이 특정 동작으로 너무 일찍 치우쳤다는 뜻이며 이는 수렴이 아니라 탐색 커버리지 부족의 신호입니다.
진단 규칙: 엔트로피가 계속 매우 낮은데 가치 정확도까지 낮다면, 모델이 진짜 근거 없이 판단하는 "가짜 확신(pseudo-confidence)" 상태에 빠져 있는 것입니다. 이럴 땐 보통 탐색 노이즈를 추가해야 합니다. 디리클레 노이즈(Dirichlet noise, 디리클레 분포에서 샘플링한 무작위 노이즈를 루트 노드의 사전 정책 분포에 더하는 방법으로, MCTS가 탐색 초기에 강제로 다양한 동작을 시도하게 만들어 정책 네트워크가 최적이라고 여기는 몇몇 분기만 반복해서 탐색하는 것을 막습니다)를 추가하거나, 리플레이 버퍼의 다양성을 늘리는 것이 좋습니다.
표현 안정성(Representation Stability)
이는 MuZero 고유의 진단 지표로, 표현 함수(representation network)의 강건성을 확인하는 데 씁니다.
📖 코사인 유사도(cosine similarity): 벡터의 크기와 무관하게 두 벡터의 방향이 얼마나 비슷한지를 측정합니다.
이며, 값의 범위는 입니다. 1은 방향이 완전히 같음을, 0은 직교(무관함)를, -1은 방향이 정반대임을 뜻합니다. 여기서 유클리드 거리 대신 이걸 쓰는 이유는 표현 벡터의 절대적인 크기는 중요하지 않기 때문입니다. 중요한 건 고차원 공간에서 두 벡터가 "같은 방향을 가리키는가"이며, 방향이 같다는 것은 모델이 비슷한 두 입력에 비슷한 의미를 부여했다는 뜻입니다.
국면 o에 약한 무작위 섭동 ε을 더했을 때(예: 픽셀값 범위의 약 1%에 해당하는 표준편차를 가진 가우시안 노이즈를 이미지 관측에 추가), 표현 함수가 출력하는 잠재 상태는 섭동을 가하지 않았을 때의 출력과 매우 가까워야 하며, 목표 코사인 유사도는 > 0.95입니다.
왜 중요한가: 표현이 불안정하면 물리적으로 거의 동일한 인접 국면에 대해 MCTS가 완전히 다른 탐색 결정을 내리게 되어, 정책이 아주 작은 섭동에도 크게 요동칩니다. 실제 로봇이나 게임 AI라면, 이는 정책이 센서 노이즈에 극도로 민감해 신뢰할 수 없다는 뜻입니다.
진단 규칙: 안정성이 0.9 아래로 떨어진다면, 표현 함수의 학습 데이터에 비슷한 국면들의 다양성이 부족하거나, 네트워크 용량이 너무 작아 비슷한 입력 사이에서도 특징이 비선형적으로 튀는 것입니다. 네트워크 폭을 늘리거나 대조 학습 손실(예: SimCLR 스타일의 양성 쌍(positive pair). SimCLR은 자기지도 대조 학습 프레임워크로, 같은 이미지에 서로 다른 두 가지 무작위 증강을 적용해 "양성 쌍"을 만든 뒤, 양성 쌍의 표현은 서로 가까워지고 음성 샘플과는 멀어지도록 인코더를 학습시켜 강건한 시각적 표현을 익히게 합니다)을 쓰면 효과적으로 개선할 수 있습니다.
