[๋ ผ๋ฌธ๋ฆฌ๋ทฐ] FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction
๐ 2026
๐ก ํด๋น ํฌ์คํฐ์ ์ ๋ฆฌํ ๋ด์ฉ์ ์ ๊ฐ ๋ ผ๋ฌธ์ ์ฝ๊ณ ์ดํดํ ํ๋ฆ๋๋ก ๋ด์ฉ์ ์ฌ๊ตฌ์ฑํ์ฌ ์์ฑํ์ต๋๋ค. ๋ฐ๋ผ์ ๊ธ์ ์์ ๋ชฉ ๋ฐ ์์ ๋ฒํธ๋ ์ค์ ๋ ผ๋ฌธ์ ๊ตฌ์ฑ๊ณผ ๋ค๋ฅผ ์ ์์ต๋๋ค!
1. Introduction
1-1. Motivation
์คํธ๋ฆฌ๋ฐ 3D ์ฌ๊ตฌ์ฑ (Streaming 3D reconstruction)์ ๋์์์ด ๋ค์ด์ค๋ ์ด๋ฏธ์ง ํ๋ ์์ผ๋ก๋ถํฐ 3D ๊ณต๊ฐ์ ์ค์๊ฐ์ผ๋ก ๋ณต์ํ๋ ๊ธฐ์ ๋ก, ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋๊ณผ latency๋ฅผ ๋ฎ๊ฒ ์ ์งํ๋ ๊ฒ์ด ํ์์ ์ด๋ค.
์๋ฅผ ๋ค์ด, ์นด๋ฉ๋ผ๊ฐ ๋ฐฉ ๋ด๋ถ๋ฅผ ์ด๋ํ๋ฉฐ ์ดฌ์ํ ๋ ์ฐ์์ ์ผ๋ก ๋ค์ด์ค๋ ํ๋ ์๋ค์ ์ฒ๋ฆฌํ์ฌ ๋ฐฉ์ ๊ณต๊ฐ ๊ตฌ์กฐ๋ฅผ ๋ณต์ํ๋ ์ํฉ์ ๋ ์ฌ๋ ค ๋ณผ ์ ์๋ค.
๊ทธ ์ค, ์ํํ ์คํธ๋ฆฌ๋ฐ ๋ชจ๋ธ (Recurrent streaming model)๋ค์ ๊ณผ๊ฑฐ์ 3D ๊ณต๊ฐ์ ์ ๋ณด (persistent latent token)๋ฅผ ์ ์งํ๋ฉฐ, ํ๋ ์์ด ๋ค์ด์ฌ ๋๋ง๋ค ์ด๋ฅผ ์ ๋ฐ์ดํธํ๋ ๋ฐฉ์์ ์ฌ์ฉํ๋ค.
ํ์ง๋ง ์ด๋ฌํ ๋ฐฉ์์ ๋ชจ๋ธ์ด ํ์ตํ๋ ์ํ์ค ๊ธธ์ด๋ฅผ ์ด๊ณผํ๋ ๊ธด ์์์ด ๋ค์ด์ฌ ๋ ์ฑ๋ฅ์ด ๊ธ๊ฒฉํ ์ ํ๋๊ณ , ์ต๊ทผ ํ๋ ์์์ ๋ณด์ด์ง ์๋ ๊ณผ๊ฑฐ์ ์ ์ฉํ 3D ์ ๋ณด๋ค์ ์ ์ฐจ ์์ด๋ฒ๋ฆฌ๊ฒ ๋๋ ๋ฌธ์ ๊ฐ ์กด์ฌํ๋ค.
๊ฒฐ๊ตญ ์ํํ ์คํธ๋ฆฌ๋ฐ 3D ์ฌ๊ตฌ์ฑ ๋ชจ๋ธ์ ๋ค์์ ๋๋ ๋ง๋ฅผ ํด๊ฒฐํด์ผ ํ๋ค.
- ๋น ๋ฅธ ์ ์ (Fast adaptation): ๋ฐฉ๊ธ ๋ค์ด์จ ์๋ก์ด ๊ด์ธก์น๋ฅผ ์ผ๋ง๋ ๋ฏฟ์ ๊ฒ์ธ๊ฐ?
- ์ฅ๊ธฐ์ ์ผ๊ด์ฑ (Long-term consistency): ๊ณผ๊ฑฐ๋ถํฐ ๋์ ํด ์จ ๊ธฐ์กด 3D ์ ๋ณด๋ฅผ ์ผ๋ง๋ ๋ฏฟ๊ณ ์ ์งํ ๊ฒ์ธ๊ฐ?
1-2. Limitations of Existing Methods
๊ธฐ์กด ๋ชจ๋ธ๋ค์ ์ด ๋๋ ๋ง๋ฅผ ํด๊ฒฐํ๊ธฐ ์ํ ์ ๋ฐ์ดํธ ๊ท์น $\mathbf{s}_t = (1 - \beta_t) \odot \mathbf{s}_{t-1} + \beta_t \odot \tilde{\mathbf{s}}_t$ ์์ ์ ๋ฐ์ดํธ ๋น์จ $\beta_t$๋ฅผ ๊ฒฐ์ ํ ๋ ํ๊ณ๋ฅผ ๋ณด์๋ค.
- CUT3R: $\beta_t=1$๋ก ์ค์ ํ์ฌ, ํญ์ ์๋ก์ด ๊ด์ธก์น๋ง 100% ์ ๋ขฐํ๋ค. ํ์ง๋ง ์ด๋ฌํ ๋ฐฉ์์ ๊ณผ๊ฑฐ์ ์ ๋ณด๋ฅผ ๋จ 1ํ๋ ์ ๋ง์ ์ง์๋ฒ๋ฆฌ๋ catastrophic forgetting์ ์ด๋ํ๋ค.
- TTT3R: ์ดํ ์ ํต๊ณ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก $\beta_t$๋ฅผ ์กฐ์ ํ์ฌ ์์ ์ฑ์ ๋์์ง๋ง, ์ฌ์ ํ heuristic์ธ ๋ฐฉ์์ ๋ถ๊ณผํ๋ค.
1-3. Contributions
- ์คํธ๋ฆฌ๋ฐ 3D ์ฌ๊ตฌ์ฑ ๋ฌธ์ ๋ฅผ latent token ๊ณต๊ฐ์์์ ํ๋ฅ ์ ์ํ ์ถ์ ๋ฌธ์ ๋ก ์ฌ์ ์ํ์๋ค.
๊ณ ์ ์ ์ธ Adapative Kalman Filter (AKF) ํจ๋ฌ๋ค์์ ๋ฐ๋ผ, ์ธก์ ๋ ธ์ด์ฆ๋ ๊ณ ์ ํ๊ณ ํ๋ก์ธ์ค ๋ ธ์ด์ฆ๋ง ์ํฉ์ ๋ฐ๋ผ ์ ์์ ์ผ๋ก ๋ณํํ๋๋ก ์ค๊ณํ๋ค.
์ด๋ฅผ ํตํด ์ ์ ์ธ ์ฅ๋ฉด์์๋ ๊ธฐ์กด์ latent token์ ํ์ ์ด ๊ฐํด์ ธ kalman gain์ด ๊ฐ์ํ๊ณ ์ ํจ ๊ธฐ์ต ์๊ฐ์ด ์ฐ์ฅ๋๋ฉฐ, ์ฅ๋ฉด์ด ๊ธ๋ณํ ๋๋ ํ๋ก์ธ์ค ๋ ธ์ด์ฆ๊ฐ ์ปค์ง๋ฉฐ ์๋ก์ด ๊ด์ธก์น์ ๋น ๋ฅด๊ฒ ์ ์ํ๊ฒ ๋์๋ค.
- ์ ์ํ๋ ๊ธฐ๋ฒ์ Training-free, Plug-and-play์ด๋ค.
- ์งง๊ณ ๊ธด ๋ค์ํ ์คํธ๋ฆฌ๋ฐ ํ๊ฒฝ์์ ํ๊ฐํ ๊ฒฐ๊ณผ, ๋ถํ์ค์ฑ์ ์ธ์งํ๋ FILT3R์ gain ์กฐ์ ๋ฐฉ์์ด ๊ธฐ์กด ๋ฒ ์ด์ค๋ผ์ธ๋ค์ ์ผ๊ด๋๊ฒ ๋ฐ์ด๋์ผ๋ฉฐ ๊ธธ์ด ์ผ๋ฐํ (Length generalization)์ ์ฅ๊ธฐ ์์ ์ฑ์ ํ๊ธฐ์ ์ผ๋ก ๊ฐ์ ํจ์ ์ ์ฆํ๋ค.
2. Methods
2-1. Problem formulation
๋จผ์ ๋ ผ๋ฌธ์์ ์ฌ์ฉํ๋ ๊ธฐํธ๋ค์ ๊ธฐ์กด ์นผ๋ง ํํฐ์์์ ๊ธฐํธ๋ค๊ณผ ๋น๊ตํ์ฌ ์ ๋ฆฌํ์๋ค.
| ๋ ผ๋ฌธ์์์ ๊ธฐํธ | ์นผ๋ง ํํฐ์์์ ๊ธฐํธ | ์ค๋ช |
|---|---|---|
| $\mathbf{s}_t$ | $\hat{\mathbf{x}}_k$ | ์ต์ข
์ํ ์ถ์ ๊ฐ (Posterior estimate) ๋ฉ๋ชจ๋ฆฌ์ ์ ์ฅ๋์ด ๋ค์ ์คํ ์ผ๋ก ์ ๋ฌ๋๋ state |
| $\mathbf{s}_{t-1}$ | $\hat{\mathbf{x}}_k^-$ | ๋ชจ๋ธ์ ์ฌ์ ์ํ ์ถ์ ๊ฐ (Prior estimate) ์ด์ ์์ ์ ์ํ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก, ๋ชจ๋ธ์ด ์์ธกํ ํ์ฌ์ state |
| $\tilde{\mathbf{s}}_t$ | $\mathbf{z}_k$ | ์ผ์์ ์ธก์ ๊ฐ (Measurement) ๋์ฝ๋ (์ผ์)๊ฐ ํ์ฌ ํ๋ ์ (์ ๋ ฅ)์ ํตํด ์ถ์ถํ candidate state |
๋ ผ๋ฌธ์์๋ $\mathbf{s}_t$๋ Belief (์์คํ ์ด ์ถ์ ํ์ฌ ๋์ ํด ์จ ์ต์ ์ ์ํ ์ถ์ ๊ฐ), $\tilde{\mathbf{s}}_t$๋ฅผ Noisy measurement (๋ ธ์ด์ฆ๊ฐ ์์ธ ๋ถ์์ ํ ์ธก์ ๊ฐ)๋ผ๊ณ ํํํ๋ค.
์์ผ๋ก ๋์ฌ latent state์ state token์ด๋ผ๋ ์ฉ์ด๋ ์ฌ์ค์ ๊ฐ์ ๋์์ ๊ฐ๋ฆฌํค๋ ๋ง์ด์ง๋ง, ๋์์ค๊ฐ ์ด์ง ๋ค๋ฅด๋ค.
- Latent state: 3D ๊ณต๊ฐ์ ๊ธฐํํ์ ์ ๋ณด๋ ๋งฅ๋ฝ์ ๋ด๊ณ ์๋ ์ ๋ณด
- State token: ์ด๋ฌํ latent state๋ฅผ ๋ฅ๋ฌ๋ ๋ชจ๋ธ์ด ์ฒ๋ฆฌํ ์ ์๋๋ก ๋ง๋ค์ด ๋์ ๋ฒกํฐ
์์คํ
์ ํ๋์ ํ๋ ์์ด ์
๋ ฅ๋๋ฉด, ๊ฐ๊ฐ $D$ ์ฐจ์์ ๊ฐ์ง๋ $N$๊ฐ์ ํ ํฐ์ผ๋ก ๋ถํ ๋๋ค.
์์คํ
์ ๊ธฐ๋ณธ์ ์ผ๋ก ๋งค ์คํ
๋ง๋ค 3D ๊ณต๊ฐ์ ์ ๋ณด๋ฅผ ๋ด๊ณ ์๋ state token $\mathbf{s}_t\in\mathbb{R}^{N\times D}$๋ฅผ ์ง์์ ์ผ๋ก ์ ์งํ๋ค.
ํ๋ฅ ์ ์ํ ๊ณต๊ฐ ๋ชจ๋ธ (Stochastic State-Space Model)
๋
ผ๋ฌธ์์๋ 3D ์ฌ๊ตฌ์ฑ ๊ณผ์ ์ ํ๋ฅ ์ ์ํ ๊ณต๊ฐ ๋ชจ๋ธ๋ก ํด์ํ์๋ค.
์ฆ, ์ฐ๋ฆฌ๊ฐ ์๊ณ ์ถ์ true state๋ ์จ๊ฒจ์ ธ ์๊ณ , ์ฐ๋ฆฌ๊ฐ ๋ณผ ์ ์๋ ๊ฑด ์ค์ฐจ๊ฐ ์์ธ ๊ด์ธก๊ฐ๋ฟ์ด๋ค๋ ๊ฒ์ด๋ค.
ํ ํฐ ๊ณต๊ฐ์์์ ๋ณํ๋ฅผ ๋ค์๊ณผ ๊ฐ์ ์์์ผ๋ก ์ ์ํ์๋ค.
\[\mathbf{s}_t=\mathbf{s}_{t-1}+\mathbf{w}_t~~,~~\mathbf{w}_t\sim\mathcal{N}(\mathbf{0},\mathbf{Q}_t) \tag{1}\] \[\tilde{\mathbf{s}}_t=\mathbf{s}_t+\mathbf{v}_t~~,~~\mathbf{v}_t\sim\mathcal{N}(\mathbf{0},\mathbf{R}) \tag{2}\]์ (1)์ ์ํ ๋ฐฉ์ ์ (State Equation)์ด๋ค.
ํ์ฌ 3D ๊ณต๊ฐ์ true latent state $\mathbf{s}_t$๋ ๊ธฐ๋ณธ์ ์ผ๋ก ์ง์ ์์ ์ ์ํ $\mathbf{s}_{t-1}$์ ๋์ผํ๋, 1ํ๋ ์ ๋์ ๋ฐ์ํ ๋ฌผ๋ฆฌ์ ์ธ ๋ณํ $\mathbf{w}_t$๋งํผ ๋ํด์ ธ ๋ณํ๋ค๋ ์๋ฏธ์ด๋ค.
์๋ฅผ ๋ค์ด, ์นด๋ฉ๋ผ๊ฐ ์ด๋ํ๋ฉด ์ด์ ์ด๋ฏธ์ง ํ๋ ์์์๋ ๋ณด์ด์ง ์๋ ๋ฌผ์ฒด๊ฐ ์๋กญ๊ฒ ์์ผ์ ๋ํ๋๋ฉด์ latent state๊ฐ ๋ณํ ์ ์๋ค. ์ด๋ ๊ฒ ์ฐ์๋ ์ด๋ฏธ์ง ํ๋ ์ ์ฌ์ด์์ latent state๊ฐ ์ผ๋ง๋ ์ญ๋์ ์ผ๋ก ๋ณํ ๊ฒ์ธ์ง๋ฅผ ๋ํ๋ด๋ ๋ถํ์ค์ฑ์ ํฌ๊ธฐ๋ฅผ $\mathbf{Q}_t$๋ก ํ๊ธฐํ์๊ณ , ์ด๋ ์นผ๋ง ํํฐ์์ ํ๋ก์ธ์ค ๋ ธ์ด์ฆ (process noise) ๊ณต๋ถ์ฐ์ ํด๋นํ๋ค.
์ (2)๋ ๊ด์ธก ๋ฐฉ์ ์ (Observe Equation)์ด๋ค.
๋์ฝ๋๊ฐ ํ์ฌ์ ์ด๋ฏธ์ง ํ๋ ์๋ง์ ๋ณด๊ณ ์ถ๋ก ํด ๋ธ ํ๋ณด state token $\tilde{\mathbf{s}}_t$๋ true latent state $\mathbf{s}_t$์ ๋์ฝ๋ ์์ฒด์ ์ค์ฐจ $\mathbf{v}_t$ (์ผ์ข ์ ๋ถ์์ ํ ์ผ์ ๋ ธ์ด์ฆ)๊ฐ ์์ฌ ์๋ ๊ด์ธก์น๋ผ๋ ์๋ฏธ์ด๋ค.
๋์ฝ๋ ๋ชจ๋ธ์ ์์ธก ๊ฒฐ๊ณผ๋ฅผ ์ผ๋ง๋ ์ ๋ขฐํ ์ ์๋์ง, ์ฆ ์ด ์ผ์ ๋ ธ์ด์ฆ๊ฐ ๊ฐ์ง๋ ๋ถํ์ค์ฑ์ ํฌ๊ธฐ๋ฅผ $\mathbf{R}$๋ก ํ๊ธฐํ์๊ณ , ์ด๋ ์นผ๋ง ํํฐ์์ ์ธก์ ๋ ธ์ด์ฆ (measurement noise) ๊ณต๋ถ์ฐ์ ํด๋นํ๋ค.
FILT3R์์ ๊ฐ์ฅ ์ค์ํ ์ค๊ณ ์ค ํ๋๋ ์ธก์ ๋ ธ์ด์ฆ ๊ณต๋ถ์ฐ $\mathbf{R}$์ ์๊ฐ์ ๋ฐ๋ผ ๋ณํ์ง ์๋ ์์ ๋๊ฐ ํ๋ ฌ $\mathbf{R} = r\mathbf{I}$๋ก ์ค์ ํ๋ค๋ ๊ฒ์ด๋ค.
์ ์๊ฐ ๋งํ๊ธธ ๋ ๊ฐ์ง ์ด์ ๊ฐ ์๋ค๊ณ ํ๋ค.
๋์ฝ๋๋ ์ฌ์ ์ ํ์ต์ด ์๋ฃ๋์ด ๊ฐ์ค์น๊ฐ ๊ณ ์ ๋ ๋คํธ์ํฌ๋ค. ๋ฐ๋ผ์ ๋์ฝ๋์ ์์ธก ํ๋ฆฌํฐ๋ ํ์ฌ 3D ๊ณต๊ฐ์ด ์ผ๋ง๋ ์ญ๋์ ์ธ์ง (Scene dynamics)์๋ ๋ฌด๊ดํ๋ฉฐ, ์ค์ง ๋์ฝ๋ ์์ฒด์ ์ํคํ ์ฒ์ ํ์ต๋ ๋ฐ์ดํฐ์ ์ํด์๋ง ๊ฒฐ์ ๋๋ค.
์ด๋ ์ ์ด ๊ณตํ์์ ์ฐ๋ฆฌ๊ฐ ์ฌ์ฉ ์ค์ธ ํ๋์จ์ด ์ผ์์ ์์ฒด์ ์ธ ์ค์ฐจ ์คํ์ ์ด๋ฏธ ์๊ณ ์๋ค๊ณ ๊ฐ์ ํ๋ ํ์ค์ ์ธ ์ ๊ทผ๋ฒ๊ณผ ๋์ผํ ๋งฅ๋ฝ์ด๋ผ๊ณ ํ๋ค.
๋ง์ฝ ์ํฉ์ ๋ฐ๋ผ $\mathbf{Q}_t$์ $\mathbf{R}_t$๊ฐ ๋ชจ๋ ๋ณํ๋๋ก ํ์ฉํ๋ค๋ฉด, ์ฅ๋ฉด์ด ๊ฐ์์ค๋ฝ๊ฒ ์ ํ๋์ด ๊ด์ธก ์ค์ฐจ๊ฐ ํฌ๊ฒ ๋ฐ์ํ์ ๋, ๋ชจ๋ธ์ ์ด๊ฒ์ด ์ค์ 3D ๊ณต๊ฐ์ด ๊ธ๋ณํ ๊ฒ์ธ์ง, ์๋๋ฉด ๋จ์ํ ์ด๋ฒ ์ด๋ฏธ์ง ํ๋ ์์์ ๋์ฝ๋๊ฐ ์ค์๋ํ ๊ฒ์ธ์ง ์ํ์ ์ผ๋ก ๊ตฌ๋ถํ๊ธฐ ๋งค์ฐ ์ด๋ ต๋ค.
๋ ๋ถํ์ค์ฑ ๋ณ์๊ฐ ๋์์ ์๋์น๊ฒ ๋๋ฉด kalman gain $\mathbf{k}_t$๊ฐ ๊ณผ๋ํ๊ฒ ์ค๋ฒ์ํ ๋ ์ ์๋ค๊ณ ํ๋ค.
2-2. Update rule
FILT3R์ state๋ฅผ ์ ๋ฐ์ดํธํ๋ ๋ฐฉ์์ ๊ธฐ๋ณธ์ ์ผ๋ก ์นผ๋ง ํํฐ๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ํ๊ธฐ ๋๋ฌธ์, ํฌ๊ฒ ์์ธก (prediction) ๋จ๊ณ์ ๋ณด์ (update) ๋จ๊ณ๋ก ์ด๋ฃจ์ด์ ธ ์๋ค.
์ด๋ฅผ ๋ธ๋ก๋๋ก ํํํ๋ฉด ์๋์ ๊ฐ์๋ฐ, โ์นผ๋ง ํํฐ 2 - ์๊ณ ๋ฆฌ์ฆโ ํฌ์คํฐ์ ๋ธ๋ก๋์ ๋น๊ตํด๋ณด๊ธธ ๋ฐ๋๋ค.
์ (1)์ ๋ณด๋ฉด ๋ชจ๋ธ์ ๋ฌผ๋ฆฌ ๋ฒ์น์ ์ ํ์ง ์์๊ธฐ ๋๋ฌธ์,
ํ๋ก์ธ์ค ๋ ธ์ด์ฆ ๊ฐ์
๋ ผ๋ฌธ์์๋ ์นผ๋ง ํํฐ์์ ์ญํ๋ ฌ ๊ณ์ฐ๊ณผ ๊ฐ์ ๋ฌด๊ฑฐ์ด ํ๋ ฌ ์ฐ์ฐ์ ๊ฐ๋ณ๊ฒ ๋ง๋ค๊ธฐ ์ํด, ๋ถํ์ค์ฑ์ ์ ์ํ ๋ ๋ ๊ฐ์ง ์ค์ํ ์ํ์ ๊ฐ์ ์ ๋์ ํ์๋ค.
๋ฑ๋ฐฉ์ฑ (Isotropic) ๊ฐ์
ํ๋์ ํ ํฐ์ $D$์ฐจ์์ ๋ฒกํฐ๋ก ์ด๋ฃจ์ด์ ธ ์์ผ๋ฏ๋ก ๋ฐฉํฅ์ ๋ฐ๋ผ ๋ถํ์ค์ฑ์ด ๋ค๋ฅผ ์ ์์ง๋ง, ๋ ผ๋ฌธ์์๋ ๊ฐ ํ ํฐ ๋ด์ ๋ชจ๋ ์ฐจ์ ๋ฐฉํฅ์ผ๋ก ๋ถํ์ค์ฑ์ด ๋์ผํ๋ค๊ณ ๊ฐ์ ํ๋ค.
์ฆ, ํ ํฐ๋น ๋จ ํ๋์ ์ค์นผ๋ผ ๋ถ์ฐ ๊ฐ๋ง์ ํ ๋นํ์๊ณ , $N$๊ฐ์ ํ ํฐ์ ๋ํ ์ฌํ ๋ถ์ฐ์ $\mathbf{p}_t \in \mathbb{R}^N$์ด๋ผ๋ 1์ฐจ์ ๋ฒกํฐ๋ก ์์ถํ๋ค.
๋๊ฐ ํ๋ ฌ (Diagonal) ๊ฐ์
์๋ก ๋ค๋ฅธ ํ ํฐ๋ค ์ฌ์ด์๋ ์ด๋ ํ ์๊ด๊ด๊ณ๋ ์๋ค๊ณ ๊ฐ์ ํ๋ค.
์ฆ, ๊ณต๋ถ์ฐ ํ๋ ฌ $\mathbf{Q}_t$์ $\mathbf{P}_t$๊ฐ ๋น๋๊ฐ ์์๋ค์ด ๋ชจ๋ 0์ด๊ณ ๋๊ฐ์ฑ๋ถ์๋ง ๊ฐ ํ ํฐ์ ๊ณ ์ ํ ๋ถ์ฐ๊ฐ๋ง์ ๊ฐ์ง๋ ๋๊ฐ ํ๋ ฌ๋ก ์ ์๋๋ค.
์ด๋ฌํ ๊ฐ์ ์ ํ์ง ์์๋ค๋ฉด, ๊ณต๋ถ์ฐ ํ๋ ฌ์ ๋ชจ๋ ์์์ ๊ฐ์ด ์กด์ฌํ๋ ๊ฑฐ๋ํ ์ ๋ฐฉ ํ๋ ฌ์ด ๋์์ ๊ฒ์ด๋ค.
\[\mathbf{P} = \mathbb{E}[(\mathbf{s}_{flat} - \bar{\mathbf{s}}_{flat})(\mathbf{s}_{flat} - \bar{\mathbf{s}}_{flat})^\top]\in\mathbb{R}^{(ND) \times (ND)}~~,~~\mathbf{s}_{flat}\in\mathbb{R}^{ND\times 1}\]์์ธก (Prediction) ๋จ๊ณ
์์ธก ๋จ๊ณ์์๋ ์๋ก์ด ์ด๋ฏธ์ง ํ๋ ์์ ๊ด์ธกํ๊ธฐ ์ , ์๊ฐ์ด ํ๋ฆ์ ๋ฐ๋ผ ์ํ ์ถ์ ์น์ ๋ถํ์ค์ฑ์ด ์ด๋ป๊ฒ ๋ณํ๋์ง ์์ธกํ๋ค.
\[\mathbf{p}_t^-=\mathbf{p}_{t-1}+\mathbf{q}_t \tag{3}\]์ ์์ ๊ตฌ์ฑํ๋ ๊ฐ ๋ณ์์ ์๋ฏธ๋ ๋ค์๊ณผ ๊ฐ๋ค.
- $\mathbf{p}_{t-1}$ (Variance): ์ง์ ์ด๋ฏธ์ง ํ๋ ์๊น์ง ๋์ ๋์ด ์ํ ์ถ์ ์น์ ๋ํ ๋ถํ์ค์ฑ์ด๋ค.
- $\mathbf{q}_t$ (Process noise): 1ํ๋ ์ ๋์ 3D latent state๊ฐ ์ผ๋ง๋ ์ญ๋์ ์ผ๋ก ๋ณํ๋์ง๋ฅผ ๋ํ๋ด๋ ๋ถํ์ค์ฑ์ผ๋ก, ๋งค ์ด๋ฏธ์ง ํ๋ ์๋ง๋ค ์๋กญ๊ฒ ๊ณ์ฐ๋๋ค.
- $\mathbf{p}_t^-$ (Prior variance): ๊ณผ๊ฑฐ์ ๋ถํ์ค์ฑ์ ํ์ฌ์ ๋ณํ๋์ ๋ํด ๊ตฌํ, ์๋ก์ด ์ด๋ฏธ์ง ํ๋ ์์ ๊ด์ธกํ๊ธฐ ์ ์ ์ด ๋ถํ์ค์ฑ์ด๋ค. ํ์ฌ latent state๊ฐ ๋ณํ ๋งํผ ๊ธฐ์กด ์ํ ์ถ์ ์น์ ๋ํ ํ์ ๋ ๋จ์ด์ง๊ฒ ๋๋ค.
์ (3)์ ๊ณ ์ ์ ์นผ๋ง ํํฐ์ ๋ถ์ฐ ์์ธก ๊ณต์์ธ $P_t^-=AP_{t-1}A^\top+Q$์์, $A=I$๋ก ๋๊ณ ๊ณ์ฐ์ ๋จ์ํํ ํํ์ด๋ค.
$A=I$๋ก ๊ฐ์ ํ๋ค๋ ๊ฒ์ ์์คํ ๋ด๋ถ์ ๋ณต์กํ ๋ฌผ๋ฆฌ์ ๋ฒ์น์ ์ ์ํ์ง ์๊ณ , ์ธ๋ถ์์ ๋ ธ์ด์ฆ๊ฐ ๊ฐํด์ง์ง ์๋ ํ, 3D latent state๋ ๊ธฐ์กด์ ์ํ๋ฅผ ๊ทธ๋๋ก ์ ์งํ๋ ค๋ ์ฑ์ง์ด ์๋ค๋ ์ ์ ์ ๊ฐ๋ค.
๋ณด์ (Update) ๋จ๊ณ
๋ณด์ ๋จ๊ณ๋ ๋์ฝ๋๋ก๋ถํฐ ์๋ก์ด ์ด๋ฏธ์ง ํ๋ ์์ ๋ํ ๊ด์ธก์น $\tilde{\mathbf{s}}_t$๋ฅผ ๋ฐ์, ์ค์ ์ํ ์ถ์ ์น $\mathbf{s}_t$์ ๋ถํ์ค์ฑ $\mathbf{p}_t$๋ฅผ ์ต์ข ์ ์ผ๋ก ์ ๋ฐ์ดํธํ๋ ๋จ๊ณ์ด๋ค.
์๋ก์ด ๊ด์ธก์น๋ฅผ ์ผ๋ง๋ ์ ๋ขฐํ์ฌ ๊ธฐ์กด ์ํ์ ๋ฐ์ํ ์ง๋ฅผ ๊ฒฐ์ ํ๋ ๊ฐ์ค์น์ธ kalman gain์ ๊ณ์ฐํ๋ ๊ณผ์ ์ ๋ค์๊ณผ ๊ฐ๋ค.
\[\mathbf{k}_t=\frac{\mathbf{p}_t^-}{\mathbf{p}_t^-+r} \tag{4}\]์ (4)๋ ๊ณ ์ ์ ์นผ๋ง ํํฐ์ kalman gain ๊ณ์ฐ ๊ณต์์ธ $K_t=\frac{P_t^-H^\top}{HP_k^-H^\top+R}$์์, $H=I$๋ก ๋๊ณ ๊ณ์ฐ์ ๋จ์ํํ ํํ์ด๋ค.
$H=I$๋ก ๊ฐ์ ํ๋ค๋ ๊ฒ์ ์์คํ ์ด ์ถ์ ํ๋ ค๋ 3D latent state์ ๋์ฝ๋์ ๊ด์ธก์น์ ์ํ์ ์ฐจ์๊ณผ ๋จ์๊ฐ ์๋ฒฝํ๊ฒ ๋์ผํ๋ค๋ ๊ฒ์ ์๋ฏธํ๋ค.
์ต์ข ์ ์ผ๋ก latent state๋ฅผ ์ ๋ฐ์ดํธํ๋ ๊ณผ์ ์ ๋ค์๊ณผ ๊ฐ๋ค.
\[\mathbf{s}_t=\mathbf{s}_{t-1}+\mathbf{k}_t\odot(\tilde{\mathbf{s}}_t-\mathbf{s}_{t-1}) \tag{5}\]์ฌ๊ธฐ์ $(\tilde{\mathbf{s}}_t-\mathbf{s}_{t-1})$์ ๊ธฐ์กด ์์ธก๊ณผ ์๋ก์ด ๊ด์ธก์น ์ฌ์ด์ ์ค์ฐจ๋ฅผ ๋ํ๋ธ๋ค. ์ฆ, ์ด์ ์ ์ํ์ ์ด ์ค์ฐจ๋ฅผ kalman gain์ ๋น์จ๋งํผ๋ง ๋ฐ์ํ์ฌ ๋ํ๋ ํํ์ด๋ค.
์ (5)๋ฅผ ์ ๊ฐํ๋ฉด ์๋์ ๊ฐ์๋ฐ, ์ด๋ $\mathbf{s}_{t-1}$์ $\tilde{\mathbf{s}}_t$์ ์ฌ์ด๋ฅผ $\mathbf{k}_t$๋ผ๋ ๋น์จ๋ก ๋ด๋ถํ๋ ๊ฒ๊ณผ ๋์ผํ๋ค.
\[\mathbf{s}_t=(1-\mathbf{k}_t)\odot\mathbf{s}_{t-1}+\mathbf{k}_t\odot\tilde{\mathbf{s}}_t\]- $\mathbf{k}_t\approx1$์ธ ๊ฒฝ์ฐ: ์์ธก ๋ถํ์ค์ฑ์ด ๋๋ฌด ์ปค์, ๊ณผ๊ฑฐ์ ์ ๋ณด๋ฅผ ๋ฌด์ํ๊ณ ์๋ก์ด ๊ด์ธก์น๋ฅผ ์ ์ ์ผ๋ก ์ ๋ขฐํ๊ฒ ๋๋ค.
- $\mathbf{k}_t\approx0$์ธ ๊ฒฝ์ฐ: ์๋ก์ด ๊ด์ธก์น๋ฅผ ๋ฌด์ํ๊ณ ๊ธฐ์กด์ ์ํ๋ฅผ ์ ์งํ๊ฒ ๋๋ค.
๋ง์ง๋ง์ผ๋ก, latent state๋ฅผ ์ ๋ฐ์ดํธํ ํ ์์คํ ์ด ๊ฐ์ง๋ ์ต์ข ์ ์ธ ๋ถ์ฐ์ ์ ๋ฐ์ดํธํ๋ ๊ณผ์ ์ ์๋์ ๊ฐ์ผ๋ฉฐ, ์ค์นผ๋ผ ํํ์ Joseph form์ ์ฌ์ฉํ๋ค.
\[\mathbf{p}_t=(1-\mathbf{k}_t)^2\odot\mathbf{p}_t^-+r\mathbf{k}_t^2~~,~~\mathbf{k}_t^2=\mathbf{k}_t\odot\mathbf{k}_t \tag{6}\]๋จ์ํ $\mathbf{p}_t=(1-\mathbf{k}_t)\mathbf{p}_t^-$ ํํ๋ฅผ ์ฌ์ฉํ์ง ์์ ์ด์ ๋, ์ฐ์ฐ ๊ณผ์ ์์ ๋ถ๋ ์์์ ์ค์ฐจ๊ฐ ๋์ ๋ ๊ฒฝ์ฐ ๋ถ์ฐ ๊ฐ์ด ์์๊ฐ ๋ ์๋ ์๊ธฐ ๋๋ฌธ์ด๋ค.
๋ฐ๋ผ์ Joseph form์ ์ฌ์ฉํด ์์ ๋ด์ ๋ชจ๋ ํญ์ด ์ ๊ณฑ ํํ๋ก ๊ตฌ์ฑ๋๊ฒ ํ์ฌ, ๋ถ์ฐ์ด ํญ์ ์์๋ฅผ ์ ์งํ๋๋ก ๋ณด์ฅํ๋ค.
Uncertainty modeling of latent evolution
ํ๋ก์ธ์ค ๋ ธ์ด์ฆ $\mathbf{q}_t$๋ ์ฐ์๋ ์ด๋ฏธ์ง ํ๋ ์ ์ฌ์ด์์ 3D latent state๊ฐ ์ผ๋ง๋ ๋ณํ ๊ฒ์ผ๋ก ์์๋๋์ง ๊ทธ ๋ถํ์ค์ฑ์ ๋ํ๋ธ๋ค. ๋ฐ๋ผ์ ์ ์ ์ธ ์ฅ๋ฉด์์๋ ์๊ฒ, ๊ธ๊ฒฉํ ํ๋ฉด ์ ํ์ด ์๋ ๋์ ์ธ ์ฅ๋ฉด์์๋ ํฌ๊ฒ ํ ๋น๋์ด์ผ ํ๋ค.
๋ ผ๋ฌธ์์๋ $i$๋ฒ์งธ์ state token์ด ๊ฒช๋ temporal drift $\Delta_{t,i}$๋ฅผ ์ธก์ ํ๊ณ , ์๊ทธ๋ชจ์ด๋ ํจ์๋ฅผ ํต๊ณผ์์ผ ๋์ ์ผ๋ก ํ๋ก์ธ์ค ๋ ธ์ด์ฆ $q_{t,i}$๋ฅผ ๊ฒฐ์ ํ์๋ค.
\[q_{t,i}=q_{\min}+(q_{\max}-q_{\min})\cdot\sigma\left(\alpha_q(g_{t,i}-\tau_q)\right) \tag{7}\]์ ์์์ $q_{\max}$์ $q_{\min}$์ ๋ ธ์ด์ฆ๊ฐ ๊ฐ์ง ์ ์๋ ์ต์๊ฐ๊ณผ ์ต๋๊ฐ์ด๊ณ , $\alpha_q$๋ ์๊ทธ๋ชจ์ด๋ ํจ์์ ๊ณก์ ๊ฒฝ์ฌ๋ฅผ ๊ฒฐ์ ํ๋ค.
- ์ฅ๋ฉด์ด ๊ธ๋ณํ๋ ๊ฒฝ์ฐ ($g_{t,i}\gg\tau_q$): ์๊ทธ๋ชจ์ด๋ ๊ฒฐ๊ณผ๊ฐ์ด $\sigma\approx1$์ด ๋์ด $q_{t,i} \approx q_{\max}$๊ฐ ๋๋ค.
- ์ฅ๋ฉด์ด ์ ์ ์ธ ๊ฒฝ์ฐ ($g_{t,i}\ll\tau_q$): ์๊ทธ๋ชจ์ด๋ ๊ฒฐ๊ณผ๊ฐ์ด $\sigma\approx0$์ด ๋์ด $q_{t,i} \approx q_{\min}$์ด ๋๋ค.
$g_{t,i}$๋ normalized drift score๋ก, ํ์ฌ ๋ฐ์ํ ๋ณํ๊ฐ ํ์ ์์ค์ ๋นํด ์ผ๋ง๋ ํฐ์ง๋ฅผ ์๋์ ์ผ๋ก ํ๊ฐํ๋ ๊ฐ์ผ๋ก ์ ์๋๋ค.
\[g_{t,i}=\frac{\Delta_{t,i}}{\hat{\Delta}_t} \tag{8}\]์์์ ๋ฑ์ฅํ๋ 3๊ฐ์ง temporal drift $\Delta t$๋ ๋ค์๊ณผ ๊ฐ์ด ์ ์๋๋ค.
\[\Delta_{t,i}=\lVert\tilde{\mathbf{s}}_{t,i}-\tilde{\mathbf{s}}_{t-1,i}\rVert_2\]$\Delta_{t,i}$๋ ๊ฐ๋ณ ํ ํฐ์ ์ ๋์ ๋ณํ๋์ผ๋ก, ํ์ฌ ์ด๋ฏธ์ง ํ๋ ์์์ ๋์ฝ๋๊ฐ ์์ธกํ $i$๋ฒ์งธ ๊ด์ธก์น $\tilde{\mathbf{s}}_{t,i}$๊ฐ ์ง์ ํ๋ ์ ๊ด์ธก์น $\tilde{\mathbf{s}}_{t-1,i}$ ๋๋น ์ ํด๋ฆฌ๋์ ๊ณต๊ฐ์์ ์ผ๋ง๋ ํฌ๊ฒ ์ด๋ํ๋์ง๋ฅผ ๋ํ๋ด๋ ๊ฑฐ๋ฆฌ์ด๋ค.
\[\bar{\Delta}_t=\sum_i\frac{\Delta_{t,i}}{N}\]$\bar{\Delta}_t$๋ ํ์ฌ ์ด๋ฏธ์ง ํ๋ ์์์์ ํ๊ท ๋ณํ๋ (Frame-level mean drift)์ผ๋ก, ํ์ฌ ์ด๋ฏธ์ง ํ๋ ์์ ์กด์ฌํ๋ ๋ชจ๋ $N$๊ฐ ํ ํฐ๋ค์ ๋ณํ๋์ ํ๊ท ๋ธ ๊ฐ์ด๋ค. ์ฆ, ์ด๋ฒ ์ด๋ฏธ์ง ํ๋ ์์์ 3D ๊ณต๊ฐ ์ ์ฒด๊ฐ ์ ๋ฐ์ ์ผ๋ก ์ผ๋ง๋ ์์ง์๋๊ฐ๋ฅผ ๋ํ๋ธ๋ค.
\[\hat{\Delta}_t=(1-\lambda_\Delta)\hat{\Delta}_{t-1}+\lambda_\Delta\bar{\Delta}_t\]$\hat{\Delta}_t$๋ ์ ์ฒด ์คํธ๋ฆผ์์์ ํ๊ท ๋ณํ๋ (Stream-level mean drift)์ผ๋ก, $\bar{\Delta}_t$๋ฅผ EMA ๋ฐฉ์์ผ๋ก ๋์ ํ์ฌ ๋ถ๋๋ฝ๊ฒ ๋ง๋ ์ ์ด๋ค. ์ฆ, ๋น๋์ค ์คํธ๋ฆผ์ ํ์์ ํ๋ค๋ฆผ ์์ค์ ๋ํ๋ด๋ ๊ธฐ์ค์ ์ด ๋๋ค. ๋ ผ๋ฌธ์์๋ EMA baseline์ด๋ผ๊ณ ๋ถ๋ฅธ๋ค.
Implementation issue
์์ ๊ณต์๋ค์ ์ค์ ์ฝ๋๋ก ๊ตฌํํ ๋, ์์น์ ์์ ์ฑ๊ณผ ์ค์๋์ ๋ฐฉ์งํ๊ธฐ ์ํด ๋ช ๊ฐ์ง ์์ ์ฅ์น๊ฐ ํ์ํ๋ค.
Avoid the division by a zero value
์ (4)์ (8)์์ ๋ถ๋ชจ๊ฐ 0์ด ๋๋ ๊ฒ์ ๋ฐฉ์งํ๊ธฐ ์ํด ๋ถ๋ชจ์ ์์ฃผ ์์ ๊ฐ $\epsilon$์ ๋ํ๋ค.
\[\mathbf{k}_t=\frac{\mathbf{p}_t^-}{\mathbf{p}_t^-+r+\epsilon}~~,~~ g_{t,i}=\frac{\Delta_{t,i}}{\hat{\Delta}_t+\epsilon}\]Clamp the Kalman Gain
๋ง์ฝ kalman gain์ด 0์ด ๋๋ค๋ฉด, ๊ธฐ์กด์ 3D latent state๋ฅผ ๋ค ์ง์๋ฒ๋ฆฌ๋ full overwrite ํ์์ด ๋ฐ์ํ๋ค.
๋ฐ๋ผ์ ์ ์ ํ ์์ค์ ์ ์ฐ์ฑ์ ์ ์งํ๋๋ก $[k_{\min}, k_{\max}]$ ์ฌ์ด์์ ๊ฐ์ ์ ์งํ๋๋ก ํ๋ค.
Clamp the EMA Baseline
์นด๋ฉ๋ผ๊ฐ ์์ง์ด์ง ์๊ณ ๋น๋์ค ์คํธ๋ฆผ์ ์ด๋ฏธ์ง ํ๋ ์์ด ์ค๋ซ๋์ ์ ์งํด ์์ผ๋ฉด, $\hat{\Delta}_t\approx0$์ด ๋๋๋ฐ, ์ด๋ ์์ ๋ณํ๊ฐ ์๋ ์ด๋ฏธ์ง ํ๋ ์์ด ๋ค์ด์ค๋ฉด, $g_{t,i}$๊ฐ ํญ๋ฐํ๊ฒ ๋๋ค.
์ด๋ฌํ ํ์์ ๋ฐฉ์งํ๊ธฐ ์ํด, $\hat{\Delta}_t$๊ฐ ํน์ ๊ฐ ์๋๋ก ๋ด๋ ค๊ฐ์ง ์๋๋ก ์ต์๊ฐ $\Delta_{\text{floor}}$๋ฅผ ์ค์ ํ๋ค.
2-3. Filtering as adaptive token retention
์์ ๊ตฌํ kalman gain $\mathbf{k}_t$๋ ๊ฐ state token์ ์ผ๋ง๋ ์ ๋ฐ์ดํธํ ์ง ๊ฒฐ์ ํ๋ ์ผ์ข ์ ์ ๋ฐ์ดํธ ๊ณ์ $\boldsymbol{\beta}_t:=\mathbf{k}_t\in[0,1]^N$์ฒ๋ผ ๋์ํ๋ค.
์ (5)๋ฅผ ๋ค์ ์์ฑํด๋ณด๋ฉด, ์ ๋ฐ์ดํธ ๊ณต์์ Exponential Smoothing๊ณผ ๋์ผํ ํํ๊ฐ ๋๋ค. (EMA์ ์๋ฆฌ๋ ๋์ผํ์ง๋ง EMA๋ ํ๊ท ์ ์ธ ํ๋ฆ์ ์ถ์ ํ๋ ๊ฒ์, Exponential Smoothing์ ๊ฐ๋ค์ ์๋ ๊ฒ์ ์ด์ ์ ๋ง์ถ ์ฉ์ด์)
\[\mathbf{s}_t=(1-\boldsymbol{\beta}_t)\odot\mathbf{s}_{t-1}+\boldsymbol{\beta}_t\odot\tilde{\mathbf{s}}_t\]๋ํ ๋ถํ์ค์ฑ์ ์ง์์ ์ผ๋ก ์ ํํ๋ ์นผ๋ง ํํฐ์ ํน์ฑ ๋๋ถ์, ์ํฉ์ ๋ฐ๋ผ ์ด $\beta_t$ ๊ฐ์ ์ ์ ํ๊ฒ ์กฐ์ ํด ๋ธ๋ค.
์นด๋ฉ๋ผ๊ฐ ์ ์งํด ์๊ฑฐ๋ ํ๋ฉด ๋ณํ๊ฐ ์๋ ์์ ์ ์ธ ๊ตฌ๊ฐ์์๋ ํ๋ก์ธ์ค ๋ ธ์ด์ฆ $\mathbf{q}_t$๊ฐ ๋งค์ฐ ์๊ฒ ์ ์ง๋๋ค. ๋ถ์ฐ ์ถ์ ์น $\mathbf{q}_t$๊ฐ ์์ผ๋ฏ๋ก $\mathbf{p}_t^-$๋ ์ ์ ๊ฐ์ํ๊ณ , ๊ฒฐ๊ณผ์ ์ผ๋ก kalman gain $\mathbf{k}_t$๋ ์ง์์ ์ผ๋ก ๊ฐ์ํ๋ค. ์ํ์ ์ผ๋ก $\mathbf{k}_t\approx0$์ด๋ผ๋ ๋ป์ ๊ธฐ์กด์ ์ํ ์ถ์ ์น๋ฅผ ๊ฐ๋ ฅํ๊ฒ ๋ณด์กดํ๋ค๋ ๋ป์ด๋ฏ๋ก, ๋ชจ๋ธ์ ์ ํจ ๊ธฐ์ต ์๊ฐ (Effective memory horizon)์ด ๋์์ด ํ์ฅ๋๋ ํจ๊ณผ๋ฅผ ๋ณ๋๋ค.
์ฆ, ๋น๋์ค๊ฐ ์ ์ ์ธ ์ํฉ์์๋ ๊ณผ๊ฑฐ์ ์ ๋ณด๋ฅผ ์ค๋ซ๋์ ์ ์งํ ์ ์๋ค๋ ์๋ฏธ์ด๋ค.
In stable regimes, $\mathbf{q}_t$ stays near qmin, so $\mathbf{p}_t^-$ gradually decreases as the Joseph update (Eq. (6)) shrinks the variance, causing $\mathbf{k}_t$ to decay and the effective memory horizon to grow.
๋ฐ๋ฉด ์นด๋ฉ๋ผ๊ฐ ๊ธ๊ฒฉํ ์์ง์ฌ ์์ผ๊ฐ ๋ฐ๋๋ฉด, $\mathbf{q}_t$๊ฐ ํฌ๊ฒ ์น์๋๋ค. ์ด๋ก ์ธํด $\mathbf{p}_t^-$๊ฐ ์ฆ๊ฐํ๊ณ $\mathbf{k}_t$ ์ญ์ ๊ธ๊ฒฉํ ์์นํ๋ค. ๊ทธ ๊ฒฐ๊ณผ ๋ชจ๋ธ์ ๊ณผ๊ฑฐ์ ์ํ๋ฅผ ๊ณ ์งํ์ง ์๊ณ , ์๋กญ๊ฒ ๋ค์ด์จ ๊ด์ธก์น๋ฅผ ๋น ๋ฅด๊ฒ ์ตํฉํ์ฌ ์๋ก์ด 3D latent state์ ์ฆ๊ฐ์ ์ผ๋ก ์ ์ํ๋ค.
During scene transitions, $\mathbf{q}_t$ spikes, $\mathbf{p}_t^-$ increases, and $\mathbf{k}_t$ rises, allowing the filter to rapidly integrate new evidence.
3. Experiments
- Inference setting
- Datasets
- TUM-RGBD (for Camera Pose Estimation)
- Sintel, Bonn, KITTI (for Depth Estimation)
- 7-Scenes, NRGBD (for 3D Reconstruction)
- Hardware & Efficiency
- ์ฌ์ฉ GPU: a single NVIDIA RTX 5090 (32GB VRAM)
- ์ถ๋ก ์๋: 25.14 FPS
- Datasets
3-1. Long-horizon Estimation
์๋์ ํ ์ด๋ธ์ ์ํ์ค๊ฐ ๊ธด ๋น๋์ค์์ 3D Reconstruction (Table 1), Camera Pose Estimation (Table 2), Depth Estimation (Table 3)์ ์ฑ๋ฅ์ ๋น๊ตํ ํ์ด๋ค.
Fig 4๋ Table 2์ Table 3์ ๊ฒฐ๊ณผ๋ฅผ ์๊ฐํํ์ฌ, ๋น๋์ค๊ฐ ๊ธธ์ด์ง์ ๋ฐ๋ผ ์ค์ฐจ๊ฐ ์ด๋ป๊ฒ ๋์ ๋๋๊ฐ๋ฅผ ๋ณด์ฌ์ฃผ๋ ๊ทธ๋ํ์ด๋ค.
CUT3R์ TTT3R์ ์ ์ ์๊ฐ์ด ์ง๋ ์๋ก ์ค์ฐจ๊ฐ ์ฆ๊ฐํ๋ ๋ฐ๋ฉด, FILT3R๋ ์ค์ฐจ ์ฆ๊ฐ์จ์ด ์๋งํ๊ฒ ์ ์ง๋๋ ๊ฒ์ ํ์ธํ ์ ์๋ค.
3-2. Short-horizon Estimation
Table 4๋ ์ํ์ค๊ฐ ์งง์ ๋น๋์ค์์์ Depth Estimation ์ฑ๋ฅ์ ๋น๊ตํ ํ์ด๋ค. (์ฅ๊ธฐ ๊ธฐ์ต๋ ฅ์ ์ป์ ๋์ , ์งง์ ์์์์์ ์ ํ๋๋ฅผ ํฌ์ํ ๊ฒ์ผ์๋ ์๊ธฐ ๋๋ฌธ์)
์งง์ ๋น๋์ค์์๋ ๊ธฐ์กด ๋ชจ๋ธ๊ณผ ๋๋ฑํ๊ฑฐ๋ ๋ ํฅ์๋ ๋จ๊ธฐ ์ฑ๋ฅ์ ๊ธฐ๋กํ ๊ฒ์ ํ์ธํ ์ ์๋ค.
3-3. Runtime & GPU Memory
Table 5๋ 500 ํ๋ ์ ํ๊ฒฝ์์ FPS์ GPU ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ ์ธก์ ํ ํ์ด๋ค.
๊ธฐ์กด TTT3R ๋ชจ๋ธ์ ๊ฒ์ดํธ ์กฐ์ ์ ์ํด ์ดํ ์ ๋งต์ ์บ์ฑํ๋๋ผ ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ด ์ฝ 6.3GB๋ก ๋ ๋ฐฐ ๊ฐ๊น์ด ๋ฐ์์ง๋ง, FILT3R๋ ๋ฌด์กฐ๊ฑด ๋ฎ์ด์ฐ๋ CUT3R์ ์์ ํ ๋์ผํ ์ฝ 3.5GB์ ๊ฐ๋ฒผ์ด ๋ฉ๋ชจ๋ฆฌ๋ง์ ์ฌ์ฉํ๋ฉฐ, FPS ์ ํ๋ ์ ํ ์๋ ๊ฒ์ ํ์ธํ ์ ์๋ค.
Fig 5๋ ์ ๋ ฅ๋๋ ๋น๋์ค์ ์ํ์ค ๊ธธ์ด๊ฐ 100์์ 1000๊น์ง ๋์ด๋ ๋, ๊ฐ ๋ชจ๋ธ์์์ ์ต๋ GPU ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ด ์ด๋ป๊ฒ ๋ณํ๋์ง ๋น๊ตํ ๊ทธ๋ํ์ด๋ค.
VGGT๋ Depth-Anything3์ ๊ฐ์ Full-attention ๋ชจ๋ธ์ ์ํ์ค ๊ธธ์ด๊ฐ ๊ธธ์ด์ง์๋ก ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ด ๊ธ๊ฒฉํ๊ฒ ์ฌ๋ผ๊ฐ๋ค.
๋ฐ๋ฉด, ์ํํ ์คํธ๋ฆฌ๋ฐ ๊ตฌ์กฐ๋ฅผ ์ฑํํ CUT3R, TTT3R, FILT3R๋ ์ํ์ค ๊ธธ์ด๊ฐ ์๋ฌด๋ฆฌ ๊ธธ์ด์ ธ๋ ๋ฉ๋ชจ๋ฆฌ ์ฌ์ฉ๋์ด ๋์ด๋์ง ์๋ ๊ฒ์ ํ์ธํ ์ ์๋ค.
3-4. Ablation Study
Table 6์ FILT3R์ ์ํ์ ์์๋ค์ด ๊ฐ๊ฐ ์ฑ๋ฅ์ ์ด๋ค ์ํฅ์ ๋ฏธ์น๋์ง๋ฅผ ๊ฒ์ฆํ ํ์ด๋ค.
์ธก์ ๋ ธ์ด์ฆ $r$์ ์ ์์ ์ผ๋ก ์กฐ์ ๋๊ฒ ์ค์ ํ๋ฉด ์คํ๋ ค ์ฑ๋ฅ์ด ํ๋ฝํ๋ ๊ฒ์ ํ์ธํ ์ ์๋ค.









