Skip to content

관측, 상태, 믿음 상태

탁자 중앙에 공이 놓인 사진 한 장을 보더라도 공이 다음 순간 왼쪽으로 갈지 오른쪽으로 갈지는 알 수 없습니다. 서로 전혀 다른 두 궤적이 같은 사진을 만들 수 있기 때문입니다. 한 프레임은 공의 위치를 보여주지만 속도, 직전에 충돌했는지, 화면 밖에서 누군가 밀고 있는지는 알려주지 않습니다.

이 예시는 월드모델의 첫 번째 모델링 문제를 드러냅니다. 모델이 받는 것은 관측이지만, 미래를 예측하려면 충분한 상태를 추론해야 합니다.

이 페이지를 읽고 나면 관측, 환경 상태, 믿음 상태를 구분하고, 기억이 왜 상태 추정의 일부인지 설명하며, 고전적인 예측-보정 순환을 RSSM의 사전 분포와 사후 분포에 대응시킬 수 있어야 합니다.

같은 관측이 서로 다른 미래로 이어질 수 있다

시각 t의 완전한 환경 상태를 st라고 하겠습니다. 여기에는 물체의 위치, 속도, 질량, 접촉 관계와 에이전트가 직접 볼 수 없는 변수들이 포함될 수 있습니다. 에이전트가 실제로 받는 것은 이미지나 센서 측정값과 같은 관측 ot입니다. 행동 at가 환경 상태를 바꾸고, 바뀐 상태가 다음 관측을 만듭니다.

st+1penv(st+1st,at),otpobs(otst)

두 분포는 각각 세계가 어떻게 변하는지, 세계가 어떻게 보이는지를 나타냅니다. 이미지는 수천 개 픽셀을 가지므로 상태보다 수치 차원이 더 높을 수 있지만, 예측에 필요한 변수를 여전히 빠뜨릴 수 있습니다. 차원이 높다고 해서 완전한 것은 아닙니다.

변수의미픽셀 제어 과제의 예
st숨은 환경 상태위치, 속도, 접촉 상태
ot센서가 제공하는 관측RGB 프레임 한 장
at에이전트가 가하는 행동왼쪽 또는 오른쪽으로 밀기
ht이력을 압축한 기억최근 운동 추세와 충돌 단서

stat가 주어진 뒤 더 오래된 이력이 st+1 예측을 개선하지 않는다면 st는 마르코프 성질을 만족합니다. 원시 관측은 대개 그렇지 않습니다. 한 장의 이미지만 보면 속도는 알 수 없습니다.

믿음 상태는 숨은 세계에 대한 추정이다

부분 관측 환경에서 에이전트는 st에 직접 접근할 수 없습니다. 대신 관측과 행동 이력을 바탕으로 믿음 상태를 유지합니다.

bt(s)=p(st=so1:t,a1:t1)

bt는 하나의 확정된 답이 아니라 현재 가능한 상태들에 대한 모델의 확률 판단입니다. 같은 정지 화면이 왼쪽으로 움직이는 공에서 나왔을 수도 있고 오른쪽으로 움직이는 공에서 나왔을 수도 있습니다. 이력이 충분해질수록 이 분포는 대체로 좁아집니다. 센서에 잡음이 있거나 물체가 가려졌을 때는 하나의 점 추정치보다 분포를 보존하는 편이 더 정직합니다.

믿음 상태는 세 가지 직접적인 이점을 줍니다.

  1. 숨은 변수 복원: 연속된 관측에서 속도, 방향, 접촉을 추정합니다.
  2. 불확실성 보존: "위치를 안다"와 "두 위치가 모두 가능하다"를 구분합니다.
  3. 의사결정 지원: 불확실성이 높고 비용이 큰 행동을 피하거나 정보를 얻기 위한 행동을 선택합니다.

예측과 보정

상태 추정은 두 단계를 반복합니다. 먼저 모델은 이전 믿음 상태와 행동으로 현재 상태를 예측합니다.

bt(st)=p(stst1,at1)bt1(st1)dst1

새 관측이 도착하면 모델은 그 증거로 예측을 보정합니다.

bt(st)p(otst)bt(st)

예측 단계는 기존 동역학에 따르면 시스템이 지금 어디에 있어야 하는지를 묻습니다. 보정 단계는 새 증거를 본 뒤 어떤 가능성이 더 믿을 만한지를 묻습니다. 칼만 필터, 입자 필터, 현대적인 순환 상태 공간 모델은 구현은 다르지만 모두 이 공통 문제를 다룹니다.

믿음 상태에서 RSSM으로

RSSM은 실제 환경 상태를 저장하거나 위의 베이즈 적분을 정확히 계산하지 않습니다. 대신 신경망으로 근사합니다.

  • 결정론적 은닉 상태 ht는 과거 상태, 행동, 관측 정보를 요약합니다.
  • 사전 분포 p(ztht)는 현재 관측을 보지 않고 잠재 상태를 예측합니다.
  • 사후 분포 q(ztht,ot)는 현재 관측으로 그 예측을 보정합니다.

따라서 뒤에서 "사전 분포는 상상에, 사후 분포는 학습에 쓰인다"는 설명을 볼 때 이를 고립된 신경망 기법으로 이해해서는 안 됩니다. 이는 예측-보정 순환을 심층 월드모델 안에 구현한 것입니다.

최근 K개 프레임을 이어 붙이면 증거는 늘어나지만 마르코프 상태가 자동으로 만들어지지는 않습니다. 표현과 행동이 주어졌을 때 더 오래된 이력이 미래 예측을 유의미하게 개선하는지 직접 검사해야 합니다.

P01과 P02에 미치는 영향

P01의 VAE는 잠재 변수가 현재 관측을 재구성하는 데 유용하다는 것만 보장합니다. 잠재 변수가 속도를 담거나 예측에 알맞은 상태가 된다는 보장은 없습니다. P01을 점검할 때 재구성 이미지만 보지 말고 위치, 운동 방향, 과제 관련 변수를 잠재 표현에서 안정적으로 읽어낼 수 있는지 물어야 합니다.

P02의 RSSM은 시간 차원을 맡습니다. 기억으로 단일 프레임에서 빠진 정보를 보충하고, 새 관측이 없어도 계속 예측하는 법을 배워야 합니다. P01이 이 프레임을 어떻게 인코딩할지 답한다면, P02는 숨은 세계가 지금 어떤 상태이며 다음에 무엇이 일어날지를 답하기 시작합니다.

사진으로 돌아가 순환을 닫기

여기서 다룬 모든 장치, 믿음 분포, 예측-보정 순환, RSSM의 사전 확률과 사후 확률은 모두 이 페이지의 첫머리에서 던진 질문에 대한 답입니다. 공의 정지 사진 한 장만 보고 있을 때 무엇이 빠져 있으며, 모델은 그것을 어떻게 복원하는가. 다음 두 페이지는 같은 사진으로 돌아가, 이 빠진 정보가 인코딩 과정에서 어디서 사라질 수 있는지, 그리고 이력만으로 동역학 모델이 그것을 어떻게 다시 복원해야 하는지를 보여줍니다.

이해 점검

  1. 픽셀이 완전히 같은 두 관측이 왜 서로 다른 환경 상태에 대응할 수 있습니까? 숨은 변수 하나를 들어보세요.
  2. RSSM의 ht, 사전 분포, 사후 분포는 상태 추정 순환에서 각각 어떤 역할을 합니까?
  3. P01의 잠재 표현이 위치뿐 아니라 물체 속도도 보존하는지 검사할 작은 실험을 설계해보세요.