Post

[๋…ผ๋ฌธ๋ฆฌ๋ทฐ] FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction

๐Ÿ“ 2026

[๋…ผ๋ฌธ๋ฆฌ๋ทฐ] FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction

[Paper] [GitHub]

๐Ÿ’ก ํ•ด๋‹น ํฌ์Šคํ„ฐ์— ์ •๋ฆฌํ•œ ๋‚ด์šฉ์€ ์ œ๊ฐ€ ๋…ผ๋ฌธ์„ ์ฝ๊ณ  ์ดํ•ดํ•œ ํ๋ฆ„๋Œ€๋กœ ๋‚ด์šฉ์„ ์žฌ๊ตฌ์„ฑํ•˜์—ฌ ์ž‘์„ฑํ–ˆ์Šต๋‹ˆ๋‹ค. ๋”ฐ๋ผ์„œ ๊ธ€์˜ ์†Œ์ œ๋ชฉ ๋ฐ ์ˆ˜์‹ ๋ฒˆํ˜ธ๋Š” ์‹ค์ œ ๋…ผ๋ฌธ์˜ ๊ตฌ์„ฑ๊ณผ ๋‹ค๋ฅผ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค!

1. Introduction

1-1. Motivation

์ŠคํŠธ๋ฆฌ๋ฐ 3D ์žฌ๊ตฌ์„ฑ (Streaming 3D reconstruction)์€ ๋Š์ž„์—†์ด ๋“ค์–ด์˜ค๋Š” ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์œผ๋กœ๋ถ€ํ„ฐ 3D ๊ณต๊ฐ„์„ ์‹ค์‹œ๊ฐ„์œผ๋กœ ๋ณต์›ํ•˜๋Š” ๊ธฐ์ˆ ๋กœ, ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰๊ณผ latency๋ฅผ ๋‚ฎ๊ฒŒ ์œ ์ง€ํ•˜๋Š” ๊ฒƒ์ด ํ•„์ˆ˜์ ์ด๋‹ค.

์˜ˆ๋ฅผ ๋“ค์–ด, ์นด๋ฉ”๋ผ๊ฐ€ ๋ฐฉ ๋‚ด๋ถ€๋ฅผ ์ด๋™ํ•˜๋ฉฐ ์ดฌ์˜ํ•  ๋•Œ ์—ฐ์†์ ์œผ๋กœ ๋“ค์–ด์˜ค๋Š” ํ”„๋ ˆ์ž„๋“ค์„ ์ฒ˜๋ฆฌํ•˜์—ฌ ๋ฐฉ์˜ ๊ณต๊ฐ„ ๊ตฌ์กฐ๋ฅผ ๋ณต์›ํ•˜๋Š” ์ƒํ™ฉ์„ ๋– ์˜ฌ๋ ค ๋ณผ ์ˆ˜ ์žˆ๋‹ค.

๊ทธ ์ค‘, ์ˆœํ™˜ํ˜• ์ŠคํŠธ๋ฆฌ๋ฐ ๋ชจ๋ธ (Recurrent streaming model)๋“ค์€ ๊ณผ๊ฑฐ์˜ 3D ๊ณต๊ฐ„์˜ ์ •๋ณด (persistent latent token)๋ฅผ ์œ ์ง€ํ•˜๋ฉฐ, ํ”„๋ ˆ์ž„์ด ๋“ค์–ด์˜ฌ ๋•Œ๋งˆ๋‹ค ์ด๋ฅผ ์—…๋ฐ์ดํŠธํ•˜๋Š” ๋ฐฉ์‹์„ ์‚ฌ์šฉํ•œ๋‹ค.

ํ•˜์ง€๋งŒ ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ๋ชจ๋ธ์ด ํ•™์Šตํ–ˆ๋˜ ์‹œํ€€์Šค ๊ธธ์ด๋ฅผ ์ดˆ๊ณผํ•˜๋Š” ๊ธด ์˜์ƒ์ด ๋“ค์–ด์˜ฌ ๋•Œ ์„ฑ๋Šฅ์ด ๊ธ‰๊ฒฉํžˆ ์ €ํ•˜๋˜๊ณ , ์ตœ๊ทผ ํ”„๋ ˆ์ž„์—์„œ ๋ณด์ด์ง€ ์•Š๋Š” ๊ณผ๊ฑฐ์˜ ์œ ์šฉํ•œ 3D ์ •๋ณด๋“ค์„ ์ ์ฐจ ์žŠ์–ด๋ฒ„๋ฆฌ๊ฒŒ ๋˜๋Š” ๋ฌธ์ œ๊ฐ€ ์กด์žฌํ•œ๋‹ค.

๊ฒฐ๊ตญ ์ˆœํ™˜ํ˜• ์ŠคํŠธ๋ฆฌ๋ฐ 3D ์žฌ๊ตฌ์„ฑ ๋ชจ๋ธ์€ ๋‹ค์Œ์˜ ๋”œ๋ ˆ๋งˆ๋ฅผ ํ•ด๊ฒฐํ•ด์•ผ ํ•œ๋‹ค.

  • ๋น ๋ฅธ ์ ์‘ (Fast adaptation): ๋ฐฉ๊ธˆ ๋“ค์–ด์˜จ ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜๋ฅผ ์–ผ๋งˆ๋‚˜ ๋ฏฟ์„ ๊ฒƒ์ธ๊ฐ€?
  • ์žฅ๊ธฐ์  ์ผ๊ด€์„ฑ (Long-term consistency): ๊ณผ๊ฑฐ๋ถ€ํ„ฐ ๋ˆ„์ ํ•ด ์˜จ ๊ธฐ์กด 3D ์ •๋ณด๋ฅผ ์–ผ๋งˆ๋‚˜ ๋ฏฟ๊ณ  ์œ ์ง€ํ•  ๊ฒƒ์ธ๊ฐ€?

1-2. Limitations of Existing Methods

๊ธฐ์กด ๋ชจ๋ธ๋“ค์€ ์ด ๋”œ๋ ˆ๋งˆ๋ฅผ ํ•ด๊ฒฐํ•˜๊ธฐ ์œ„ํ•œ ์—…๋ฐ์ดํŠธ ๊ทœ์น™ $\mathbf{s}_t = (1 - \beta_t) \odot \mathbf{s}_{t-1} + \beta_t \odot \tilde{\mathbf{s}}_t$ ์—์„œ ์—…๋ฐ์ดํŠธ ๋น„์œจ $\beta_t$๋ฅผ ๊ฒฐ์ •ํ•  ๋•Œ ํ•œ๊ณ„๋ฅผ ๋ณด์˜€๋‹ค.

  • CUT3R: $\beta_t=1$๋กœ ์„ค์ •ํ•˜์—ฌ, ํ•ญ์ƒ ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜๋งŒ 100% ์‹ ๋ขฐํ•œ๋‹ค. ํ•˜์ง€๋งŒ ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ๊ณผ๊ฑฐ์˜ ์ •๋ณด๋ฅผ ๋‹จ 1ํ”„๋ ˆ์ž„ ๋งŒ์— ์ง€์›Œ๋ฒ„๋ฆฌ๋Š” catastrophic forgetting์„ ์ดˆ๋ž˜ํ•œ๋‹ค.
  • TTT3R: ์–ดํ…์…˜ ํ†ต๊ณ„๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ $\beta_t$๋ฅผ ์กฐ์ ˆํ•˜์—ฌ ์•ˆ์ •์„ฑ์„ ๋†’์˜€์ง€๋งŒ, ์—ฌ์ „ํžˆ heuristic์ธ ๋ฐฉ์‹์— ๋ถˆ๊ณผํ•˜๋‹ค.

1-3. Contributions

  • ์ŠคํŠธ๋ฆฌ๋ฐ 3D ์žฌ๊ตฌ์„ฑ ๋ฌธ์ œ๋ฅผ latent token ๊ณต๊ฐ„์—์„œ์˜ ํ™•๋ฅ ์  ์ƒํƒœ ์ถ”์ • ๋ฌธ์ œ๋กœ ์žฌ์ •์˜ํ•˜์˜€๋‹ค.
  • ๊ณ ์ „์ ์ธ Adapative Kalman Filter (AKF) ํŒจ๋Ÿฌ๋‹ค์ž„์„ ๋”ฐ๋ผ, ์ธก์ • ๋…ธ์ด์ฆˆ๋Š” ๊ณ ์ •ํ•˜๊ณ  ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ๋งŒ ์ƒํ™ฉ์— ๋”ฐ๋ผ ์ ์‘์ ์œผ๋กœ ๋ณ€ํ™”ํ•˜๋„๋ก ์„ค๊ณ„ํ–ˆ๋‹ค.

    ์ด๋ฅผ ํ†ตํ•ด ์ •์ ์ธ ์žฅ๋ฉด์—์„œ๋Š” ๊ธฐ์กด์˜ latent token์˜ ํ™•์‹ ์ด ๊ฐ•ํ•ด์ ธ kalman gain์ด ๊ฐ์†Œํ•˜๊ณ  ์œ ํšจ ๊ธฐ์–ต ์‹œ๊ฐ„์ด ์—ฐ์žฅ๋˜๋ฉฐ, ์žฅ๋ฉด์ด ๊ธ‰๋ณ€ํ•  ๋•Œ๋Š” ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ๊ฐ€ ์ปค์ง€๋ฉฐ ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜์— ๋น ๋ฅด๊ฒŒ ์ ์‘ํ•˜๊ฒŒ ๋˜์—ˆ๋‹ค.

  • ์ œ์•ˆํ•˜๋Š” ๊ธฐ๋ฒ•์€ Training-free, Plug-and-play์ด๋‹ค.
  • ์งง๊ณ  ๊ธด ๋‹ค์–‘ํ•œ ์ŠคํŠธ๋ฆฌ๋ฐ ํ™˜๊ฒฝ์—์„œ ํ‰๊ฐ€ํ•œ ๊ฒฐ๊ณผ, ๋ถˆํ™•์‹ค์„ฑ์„ ์ธ์ง€ํ•˜๋Š” FILT3R์˜ gain ์กฐ์ ˆ ๋ฐฉ์‹์ด ๊ธฐ์กด ๋ฒ ์ด์Šค๋ผ์ธ๋“ค์„ ์ผ๊ด€๋˜๊ฒŒ ๋›ฐ์–ด๋„˜์œผ๋ฉฐ ๊ธธ์ด ์ผ๋ฐ˜ํ™” (Length generalization)์™€ ์žฅ๊ธฐ ์•ˆ์ •์„ฑ์„ ํš๊ธฐ์ ์œผ๋กœ ๊ฐœ์„ ํ•จ์„ ์ž…์ฆํ–ˆ๋‹ค.

2. Methods

fig1

2-1. Problem formulation

๋จผ์ € ๋…ผ๋ฌธ์—์„œ ์‚ฌ์šฉํ•˜๋Š” ๊ธฐํ˜ธ๋“ค์„ ๊ธฐ์กด ์นผ๋งŒ ํ•„ํ„ฐ์—์„œ์˜ ๊ธฐํ˜ธ๋“ค๊ณผ ๋น„๊ตํ•˜์—ฌ ์ •๋ฆฌํ•˜์˜€๋‹ค.

๋…ผ๋ฌธ์—์„œ์˜ ๊ธฐํ˜ธ์นผ๋งŒ ํ•„ํ„ฐ์—์„œ์˜ ๊ธฐํ˜ธ์„ค๋ช…
$\mathbf{s}_t$$\hat{\mathbf{x}}_k$์ตœ์ข… ์ƒํƒœ ์ถ”์ •๊ฐ’ (Posterior estimate)
๋ฉ”๋ชจ๋ฆฌ์— ์ €์žฅ๋˜์–ด ๋‹ค์Œ ์Šคํ…์œผ๋กœ ์ „๋‹ฌ๋˜๋Š” state
$\mathbf{s}_{t-1}$$\hat{\mathbf{x}}_k^-$๋ชจ๋ธ์˜ ์‚ฌ์ „ ์ƒํƒœ ์ถ”์ •๊ฐ’ (Prior estimate)
์ด์ „ ์‹œ์ ์˜ ์ƒํƒœ๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ, ๋ชจ๋ธ์ด ์˜ˆ์ธกํ•œ ํ˜„์žฌ์˜ state
$\tilde{\mathbf{s}}_t$$\mathbf{z}_k$์„ผ์„œ์˜ ์ธก์ •๊ฐ’ (Measurement)
๋””์ฝ”๋” (์„ผ์„œ)๊ฐ€ ํ˜„์žฌ ํ”„๋ ˆ์ž„ (์ž…๋ ฅ)์„ ํ†ตํ•ด ์ถ”์ถœํ•œ candidate state

๋…ผ๋ฌธ์—์„œ๋Š” $\mathbf{s}_t$๋Š” Belief (์‹œ์Šคํ…œ์ด ์ถ”์ •ํ•˜์—ฌ ๋ˆ„์ ํ•ด ์˜จ ์ตœ์ ์˜ ์ƒํƒœ ์ถ”์ •๊ฐ’), $\tilde{\mathbf{s}}_t$๋ฅผ Noisy measurement (๋…ธ์ด์ฆˆ๊ฐ€ ์„ž์ธ ๋ถˆ์™„์ „ํ•œ ์ธก์ •๊ฐ’)๋ผ๊ณ  ํ‘œํ˜„ํ•œ๋‹ค.

์•ž์œผ๋กœ ๋‚˜์˜ฌ latent state์™€ state token์ด๋ผ๋Š” ์šฉ์–ด๋Š” ์‚ฌ์‹ค์ƒ ๊ฐ™์€ ๋Œ€์ƒ์„ ๊ฐ€๋ฆฌํ‚ค๋Š” ๋ง์ด์ง€๋งŒ, ๋‰˜์•™์Šค๊ฐ€ ์‚ด์ง ๋‹ค๋ฅด๋‹ค.

  • Latent state: 3D ๊ณต๊ฐ„์˜ ๊ธฐํ•˜ํ•™์  ์ •๋ณด๋‚˜ ๋งฅ๋ฝ์„ ๋‹ด๊ณ  ์žˆ๋Š” ์ •๋ณด
  • State token: ์ด๋Ÿฌํ•œ latent state๋ฅผ ๋”ฅ๋Ÿฌ๋‹ ๋ชจ๋ธ์ด ์ฒ˜๋ฆฌํ•  ์ˆ˜ ์žˆ๋„๋ก ๋งŒ๋“ค์–ด ๋†“์€ ๋ฒกํ„ฐ

์‹œ์Šคํ…œ์— ํ•˜๋‚˜์˜ ํ”„๋ ˆ์ž„์ด ์ž…๋ ฅ๋˜๋ฉด, ๊ฐ๊ฐ $D$ ์ฐจ์›์„ ๊ฐ€์ง€๋Š” $N$๊ฐœ์˜ ํ† ํฐ์œผ๋กœ ๋ถ„ํ• ๋œ๋‹ค.
์‹œ์Šคํ…œ์€ ๊ธฐ๋ณธ์ ์œผ๋กœ ๋งค ์Šคํ…๋งˆ๋‹ค 3D ๊ณต๊ฐ„์˜ ์ •๋ณด๋ฅผ ๋‹ด๊ณ  ์žˆ๋Š” state token $\mathbf{s}_t\in\mathbb{R}^{N\times D}$๋ฅผ ์ง€์†์ ์œผ๋กœ ์œ ์ง€ํ•œ๋‹ค.

ํ™•๋ฅ ์  ์ƒํƒœ ๊ณต๊ฐ„ ๋ชจ๋ธ (Stochastic State-Space Model)

๋…ผ๋ฌธ์—์„œ๋Š” 3D ์žฌ๊ตฌ์„ฑ ๊ณผ์ •์„ ํ™•๋ฅ ์  ์ƒํƒœ ๊ณต๊ฐ„ ๋ชจ๋ธ๋กœ ํ•ด์„ํ•˜์˜€๋‹ค.
์ฆ‰, ์šฐ๋ฆฌ๊ฐ€ ์•Œ๊ณ  ์‹ถ์€ true state๋Š” ์ˆจ๊ฒจ์ ธ ์žˆ๊ณ , ์šฐ๋ฆฌ๊ฐ€ ๋ณผ ์ˆ˜ ์žˆ๋Š” ๊ฑด ์˜ค์ฐจ๊ฐ€ ์„ž์ธ ๊ด€์ธก๊ฐ’๋ฟ์ด๋‹ค๋Š” ๊ฒƒ์ด๋‹ค.

ํ† ํฐ ๊ณต๊ฐ„์—์„œ์˜ ๋ณ€ํ™”๋ฅผ ๋‹ค์Œ๊ณผ ๊ฐ™์€ ์ˆ˜์‹์œผ๋กœ ์ •์˜ํ•˜์˜€๋‹ค.

\[\mathbf{s}_t=\mathbf{s}_{t-1}+\mathbf{w}_t~~,~~\mathbf{w}_t\sim\mathcal{N}(\mathbf{0},\mathbf{Q}_t) \tag{1}\] \[\tilde{\mathbf{s}}_t=\mathbf{s}_t+\mathbf{v}_t~~,~~\mathbf{v}_t\sim\mathcal{N}(\mathbf{0},\mathbf{R}) \tag{2}\]
  • ์‹ (1)์€ ์ƒํƒœ ๋ฐฉ์ •์‹ (State Equation)์ด๋‹ค.

    ํ˜„์žฌ 3D ๊ณต๊ฐ„์˜ true latent state $\mathbf{s}_t$๋Š” ๊ธฐ๋ณธ์ ์œผ๋กœ ์ง์ „ ์‹œ์ ์˜ ์ƒํƒœ $\mathbf{s}_{t-1}$์™€ ๋™์ผํ•˜๋˜, 1ํ”„๋ ˆ์ž„ ๋™์•ˆ ๋ฐœ์ƒํ•œ ๋ฌผ๋ฆฌ์ ์ธ ๋ณ€ํ™” $\mathbf{w}_t$๋งŒํผ ๋”ํ•ด์ ธ ๋ณ€ํ•œ๋‹ค๋Š” ์˜๋ฏธ์ด๋‹ค.

    ์˜ˆ๋ฅผ ๋“ค์–ด, ์นด๋ฉ”๋ผ๊ฐ€ ์ด๋™ํ•˜๋ฉด ์ด์ „ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์—์„œ๋Š” ๋ณด์ด์ง€ ์•Š๋˜ ๋ฌผ์ฒด๊ฐ€ ์ƒˆ๋กญ๊ฒŒ ์‹œ์•ผ์— ๋‚˜ํƒ€๋‚˜๋ฉด์„œ latent state๊ฐ€ ๋ณ€ํ•  ์ˆ˜ ์žˆ๋‹ค. ์ด๋ ‡๊ฒŒ ์—ฐ์†๋œ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„ ์‚ฌ์ด์—์„œ latent state๊ฐ€ ์–ผ๋งˆ๋‚˜ ์—ญ๋™์ ์œผ๋กœ ๋ณ€ํ•  ๊ฒƒ์ธ์ง€๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” ๋ถˆํ™•์‹ค์„ฑ์˜ ํฌ๊ธฐ๋ฅผ $\mathbf{Q}_t$๋กœ ํ‘œ๊ธฐํ•˜์˜€๊ณ , ์ด๋Š” ์นผ๋งŒ ํ•„ํ„ฐ์—์„œ ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ (process noise) ๊ณต๋ถ„์‚ฐ์— ํ•ด๋‹นํ•œ๋‹ค.

  • ์‹ (2)๋Š” ๊ด€์ธก ๋ฐฉ์ •์‹ (Observe Equation)์ด๋‹ค.

    ๋””์ฝ”๋”๊ฐ€ ํ˜„์žฌ์˜ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„๋งŒ์„ ๋ณด๊ณ  ์ถ”๋ก ํ•ด ๋‚ธ ํ›„๋ณด state token $\tilde{\mathbf{s}}_t$๋Š” true latent state $\mathbf{s}_t$์— ๋””์ฝ”๋” ์ž์ฒด์˜ ์˜ค์ฐจ $\mathbf{v}_t$ (์ผ์ข…์˜ ๋ถˆ์™„์ „ํ•œ ์„ผ์„œ ๋…ธ์ด์ฆˆ)๊ฐ€ ์„ž์—ฌ ์žˆ๋Š” ๊ด€์ธก์น˜๋ผ๋Š” ์˜๋ฏธ์ด๋‹ค.

    ๋””์ฝ”๋” ๋ชจ๋ธ์˜ ์˜ˆ์ธก ๊ฒฐ๊ณผ๋ฅผ ์–ผ๋งˆ๋‚˜ ์‹ ๋ขฐํ•  ์ˆ˜ ์žˆ๋Š”์ง€, ์ฆ‰ ์ด ์„ผ์„œ ๋…ธ์ด์ฆˆ๊ฐ€ ๊ฐ€์ง€๋Š” ๋ถˆํ™•์‹ค์„ฑ์˜ ํฌ๊ธฐ๋ฅผ $\mathbf{R}$๋กœ ํ‘œ๊ธฐํ•˜์˜€๊ณ , ์ด๋Š” ์นผ๋งŒ ํ•„ํ„ฐ์—์„œ ์ธก์ • ๋…ธ์ด์ฆˆ (measurement noise) ๊ณต๋ถ„์‚ฐ์— ํ•ด๋‹นํ•œ๋‹ค.

FILT3R์—์„œ ๊ฐ€์žฅ ์ค‘์š”ํ•œ ์„ค๊ณ„ ์ค‘ ํ•˜๋‚˜๋Š” ์ธก์ • ๋…ธ์ด์ฆˆ ๊ณต๋ถ„์‚ฐ $\mathbf{R}$์„ ์‹œ๊ฐ„์— ๋”ฐ๋ผ ๋ณ€ํ•˜์ง€ ์•Š๋Š” ์ƒ์ˆ˜ ๋Œ€๊ฐ ํ–‰๋ ฌ $\mathbf{R} = r\mathbf{I}$๋กœ ์„ค์ •ํ–ˆ๋‹ค๋Š” ๊ฒƒ์ด๋‹ค.

์ €์ž๊ฐ€ ๋งํ•˜๊ธธ ๋‘ ๊ฐ€์ง€ ์ด์œ ๊ฐ€ ์žˆ๋‹ค๊ณ  ํ•œ๋‹ค.

  1. ๋””์ฝ”๋”๋Š” ์‚ฌ์ „์— ํ•™์Šต์ด ์™„๋ฃŒ๋˜์–ด ๊ฐ€์ค‘์น˜๊ฐ€ ๊ณ ์ •๋œ ๋„คํŠธ์›Œํฌ๋‹ค. ๋”ฐ๋ผ์„œ ๋””์ฝ”๋”์˜ ์˜ˆ์ธก ํ€„๋ฆฌํ‹ฐ๋Š” ํ˜„์žฌ 3D ๊ณต๊ฐ„์ด ์–ผ๋งˆ๋‚˜ ์—ญ๋™์ ์ธ์ง€ (Scene dynamics)์™€๋Š” ๋ฌด๊ด€ํ•˜๋ฉฐ, ์˜ค์ง ๋””์ฝ”๋” ์ž์ฒด์˜ ์•„ํ‚คํ…์ฒ˜์™€ ํ•™์Šต๋œ ๋ฐ์ดํ„ฐ์— ์˜ํ•ด์„œ๋งŒ ๊ฒฐ์ •๋œ๋‹ค.

    ์ด๋Š” ์ œ์–ด ๊ณตํ•™์—์„œ ์šฐ๋ฆฌ๊ฐ€ ์‚ฌ์šฉ ์ค‘์ธ ํ•˜๋“œ์›จ์–ด ์„ผ์„œ์˜ ์ž์ฒด์ ์ธ ์˜ค์ฐจ ์ŠคํŽ™์€ ์ด๋ฏธ ์•Œ๊ณ  ์žˆ๋‹ค๊ณ  ๊ฐ€์ •ํ•˜๋Š” ํ‘œ์ค€์ ์ธ ์ ‘๊ทผ๋ฒ•๊ณผ ๋™์ผํ•œ ๋งฅ๋ฝ์ด๋ผ๊ณ  ํ•œ๋‹ค.

  2. ๋งŒ์•ฝ ์ƒํ™ฉ์— ๋”ฐ๋ผ $\mathbf{Q}_t$์™€ $\mathbf{R}_t$๊ฐ€ ๋ชจ๋‘ ๋ณ€ํ•˜๋„๋ก ํ—ˆ์šฉํ•œ๋‹ค๋ฉด, ์žฅ๋ฉด์ด ๊ฐ‘์ž‘์Šค๋Ÿฝ๊ฒŒ ์ „ํ™˜๋˜์–ด ๊ด€์ธก ์˜ค์ฐจ๊ฐ€ ํฌ๊ฒŒ ๋ฐœ์ƒํ–ˆ์„ ๋•Œ, ๋ชจ๋ธ์€ ์ด๊ฒƒ์ด ์‹ค์ œ 3D ๊ณต๊ฐ„์ด ๊ธ‰๋ณ€ํ•œ ๊ฒƒ์ธ์ง€, ์•„๋‹ˆ๋ฉด ๋‹จ์ˆœํžˆ ์ด๋ฒˆ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์—์„œ ๋””์ฝ”๋”๊ฐ€ ์˜ค์ž‘๋™ํ•œ ๊ฒƒ์ธ์ง€ ์ˆ˜ํ•™์ ์œผ๋กœ ๊ตฌ๋ถ„ํ•˜๊ธฐ ๋งค์šฐ ์–ด๋ ต๋‹ค.

    ๋‘ ๋ถˆํ™•์‹ค์„ฑ ๋ณ€์ˆ˜๊ฐ€ ๋™์‹œ์— ์š”๋™์น˜๊ฒŒ ๋˜๋ฉด kalman gain $\mathbf{k}_t$๊ฐ€ ๊ณผ๋„ํ•˜๊ฒŒ ์˜ค๋ฒ„์ŠˆํŒ…๋  ์ˆ˜ ์žˆ๋‹ค๊ณ  ํ•œ๋‹ค.

2-2. Update rule

FILT3R์˜ state๋ฅผ ์—…๋ฐ์ดํŠธํ•˜๋Š” ๋ฐฉ์‹์€ ๊ธฐ๋ณธ์ ์œผ๋กœ ์นผ๋งŒ ํ•„ํ„ฐ๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•˜๊ธฐ ๋•Œ๋ฌธ์—, ํฌ๊ฒŒ ์˜ˆ์ธก (prediction) ๋‹จ๊ณ„์™€ ๋ณด์ • (update) ๋‹จ๊ณ„๋กœ ์ด๋ฃจ์–ด์ ธ ์žˆ๋‹ค.

์ด๋ฅผ ๋ธ”๋ก๋„๋กœ ํ‘œํ˜„ํ•˜๋ฉด ์•„๋ž˜์™€ ๊ฐ™์€๋ฐ, โ€˜์นผ๋งŒ ํ•„ํ„ฐ 2 - ์•Œ๊ณ ๋ฆฌ์ฆ˜โ€™ ํฌ์Šคํ„ฐ์˜ ๋ธ”๋ก๋„์™€ ๋น„๊ตํ•ด๋ณด๊ธธ ๋ฐ”๋ž€๋‹ค.

fig2

์‹ (1)์„ ๋ณด๋ฉด ๋ชจ๋ธ์— ๋ฌผ๋ฆฌ ๋ฒ•์น™์„ ์ •ํ•˜์ง€ ์•Š์•˜๊ธฐ ๋•Œ๋ฌธ์—,

ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ ๊ฐ€์ •

๋…ผ๋ฌธ์—์„œ๋Š” ์นผ๋งŒ ํ•„ํ„ฐ์—์„œ ์—ญํ–‰๋ ฌ ๊ณ„์‚ฐ๊ณผ ๊ฐ™์€ ๋ฌด๊ฑฐ์šด ํ–‰๋ ฌ ์—ฐ์‚ฐ์„ ๊ฐ€๋ณ๊ฒŒ ๋งŒ๋“ค๊ธฐ ์œ„ํ•ด, ๋ถˆํ™•์‹ค์„ฑ์„ ์ •์˜ํ•  ๋•Œ ๋‘ ๊ฐ€์ง€ ์ค‘์š”ํ•œ ์ˆ˜ํ•™์  ๊ฐ€์ •์„ ๋„์ž…ํ•˜์˜€๋‹ค.

  1. ๋“ฑ๋ฐฉ์„ฑ (Isotropic) ๊ฐ€์ •

    ํ•˜๋‚˜์˜ ํ† ํฐ์€ $D$์ฐจ์›์˜ ๋ฒกํ„ฐ๋กœ ์ด๋ฃจ์–ด์ ธ ์žˆ์œผ๋ฏ€๋กœ ๋ฐฉํ–ฅ์— ๋”ฐ๋ผ ๋ถˆํ™•์‹ค์„ฑ์ด ๋‹ค๋ฅผ ์ˆ˜ ์žˆ์ง€๋งŒ, ๋…ผ๋ฌธ์—์„œ๋Š” ๊ฐ ํ† ํฐ ๋‚ด์˜ ๋ชจ๋“  ์ฐจ์› ๋ฐฉํ–ฅ์œผ๋กœ ๋ถˆํ™•์‹ค์„ฑ์ด ๋™์ผํ•˜๋‹ค๊ณ  ๊ฐ€์ •ํ–ˆ๋‹ค.

    ์ฆ‰, ํ† ํฐ๋‹น ๋‹จ ํ•˜๋‚˜์˜ ์Šค์นผ๋ผ ๋ถ„์‚ฐ ๊ฐ’๋งŒ์„ ํ• ๋‹นํ•˜์˜€๊ณ , $N$๊ฐœ์˜ ํ† ํฐ์— ๋Œ€ํ•œ ์‚ฌํ›„ ๋ถ„์‚ฐ์„ $\mathbf{p}_t \in \mathbb{R}^N$์ด๋ผ๋Š” 1์ฐจ์› ๋ฒกํ„ฐ๋กœ ์••์ถ•ํ–ˆ๋‹ค.

  2. ๋Œ€๊ฐ ํ–‰๋ ฌ (Diagonal) ๊ฐ€์ •

    ์„œ๋กœ ๋‹ค๋ฅธ ํ† ํฐ๋“ค ์‚ฌ์ด์—๋Š” ์–ด๋– ํ•œ ์ƒ๊ด€๊ด€๊ณ„๋„ ์—†๋‹ค๊ณ  ๊ฐ€์ •ํ–ˆ๋‹ค.

    ์ฆ‰, ๊ณต๋ถ„์‚ฐ ํ–‰๋ ฌ $\mathbf{Q}_t$์™€ $\mathbf{P}_t$๊ฐ€ ๋น„๋Œ€๊ฐ ์›์†Œ๋“ค์ด ๋ชจ๋‘ 0์ด๊ณ  ๋Œ€๊ฐ์„ฑ๋ถ„์—๋งŒ ๊ฐ ํ† ํฐ์˜ ๊ณ ์œ ํ•œ ๋ถ„์‚ฐ๊ฐ’๋งŒ์„ ๊ฐ€์ง€๋Š” ๋Œ€๊ฐ ํ–‰๋ ฌ๋กœ ์ •์˜๋œ๋‹ค.

\[\mathbf{Q}_t=\text{diag}(\mathbf{q}_t)~~,~~\mathbf{P}_t=\text{diag}(\mathbf{p}_t)\]

fig3

์ด๋Ÿฌํ•œ ๊ฐ€์ •์„ ํ•˜์ง€ ์•Š์•˜๋‹ค๋ฉด, ๊ณต๋ถ„์‚ฐ ํ–‰๋ ฌ์€ ๋ชจ๋“  ์š”์†Œ์— ๊ฐ’์ด ์กด์žฌํ•˜๋Š” ๊ฑฐ๋Œ€ํ•œ ์ •๋ฐฉ ํ–‰๋ ฌ์ด ๋˜์—ˆ์„ ๊ฒƒ์ด๋‹ค.

\[\mathbf{P} = \mathbb{E}[(\mathbf{s}_{flat} - \bar{\mathbf{s}}_{flat})(\mathbf{s}_{flat} - \bar{\mathbf{s}}_{flat})^\top]\in\mathbb{R}^{(ND) \times (ND)}~~,~~\mathbf{s}_{flat}\in\mathbb{R}^{ND\times 1}\]

์˜ˆ์ธก (Prediction) ๋‹จ๊ณ„

์˜ˆ์ธก ๋‹จ๊ณ„์—์„œ๋Š” ์ƒˆ๋กœ์šด ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์„ ๊ด€์ธกํ•˜๊ธฐ ์ „, ์‹œ๊ฐ„์ด ํ๋ฆ„์— ๋”ฐ๋ผ ์ƒํƒœ ์ถ”์ •์น˜์˜ ๋ถˆํ™•์‹ค์„ฑ์ด ์–ด๋–ป๊ฒŒ ๋ณ€ํ–ˆ๋Š”์ง€ ์˜ˆ์ธกํ•œ๋‹ค.

\[\mathbf{p}_t^-=\mathbf{p}_{t-1}+\mathbf{q}_t \tag{3}\]

์œ„ ์‹์„ ๊ตฌ์„ฑํ•˜๋Š” ๊ฐ ๋ณ€์ˆ˜์˜ ์˜๋ฏธ๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

  • $\mathbf{p}_{t-1}$ (Variance): ์ง์ „ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„๊นŒ์ง€ ๋ˆ„์ ๋˜์–ด ์ƒํƒœ ์ถ”์ •์น˜์— ๋Œ€ํ•œ ๋ถˆํ™•์‹ค์„ฑ์ด๋‹ค.
  • $\mathbf{q}_t$ (Process noise): 1ํ”„๋ ˆ์ž„ ๋™์•ˆ 3D latent state๊ฐ€ ์–ผ๋งˆ๋‚˜ ์—ญ๋™์ ์œผ๋กœ ๋ณ€ํ–ˆ๋Š”์ง€๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” ๋ถˆํ™•์‹ค์„ฑ์œผ๋กœ, ๋งค ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„๋งˆ๋‹ค ์ƒˆ๋กญ๊ฒŒ ๊ณ„์‚ฐ๋œ๋‹ค.
  • $\mathbf{p}_t^-$ (Prior variance): ๊ณผ๊ฑฐ์˜ ๋ถˆํ™•์‹ค์„ฑ์— ํ˜„์žฌ์˜ ๋ณ€ํ™”๋Ÿ‰์„ ๋”ํ•ด ๊ตฌํ•œ, ์ƒˆ๋กœ์šด ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์„ ๊ด€์ธกํ•˜๊ธฐ ์ „์˜ ์ด ๋ถˆํ™•์‹ค์„ฑ์ด๋‹ค. ํ˜„์žฌ latent state๊ฐ€ ๋ณ€ํ•œ ๋งŒํผ ๊ธฐ์กด ์ƒํƒœ ์ถ”์ •์น˜์— ๋Œ€ํ•œ ํ™•์‹ ๋„ ๋–จ์–ด์ง€๊ฒŒ ๋œ๋‹ค.

์‹ (3)์€ ๊ณ ์ „์  ์นผ๋งŒ ํ•„ํ„ฐ์˜ ๋ถ„์‚ฐ ์˜ˆ์ธก ๊ณต์‹์ธ $P_t^-=AP_{t-1}A^\top+Q$์—์„œ, $A=I$๋กœ ๋‘๊ณ  ๊ณ„์‚ฐ์„ ๋‹จ์ˆœํ™”ํ•œ ํ˜•ํƒœ์ด๋‹ค.

$A=I$๋กœ ๊ฐ€์ •ํ•œ๋‹ค๋Š” ๊ฒƒ์€ ์‹œ์Šคํ…œ ๋‚ด๋ถ€์— ๋ณต์žกํ•œ ๋ฌผ๋ฆฌ์  ๋ฒ•์น™์„ ์ •์˜ํ•˜์ง€ ์•Š๊ณ , ์™ธ๋ถ€์—์„œ ๋…ธ์ด์ฆˆ๊ฐ€ ๊ฐ€ํ•ด์ง€์ง€ ์•Š๋Š” ํ•œ, 3D latent state๋Š” ๊ธฐ์กด์˜ ์ƒํƒœ๋ฅผ ๊ทธ๋Œ€๋กœ ์œ ์ง€ํ•˜๋ ค๋Š” ์„ฑ์งˆ์ด ์žˆ๋‹ค๋Š” ์ „์ œ์™€ ๊ฐ™๋‹ค.

๋ณด์ • (Update) ๋‹จ๊ณ„

๋ณด์ • ๋‹จ๊ณ„๋Š” ๋””์ฝ”๋”๋กœ๋ถ€ํ„ฐ ์ƒˆ๋กœ์šด ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์— ๋Œ€ํ•œ ๊ด€์ธก์น˜ $\tilde{\mathbf{s}}_t$๋ฅผ ๋ฐ›์•„, ์‹ค์ œ ์ƒํƒœ ์ถ”์ •์น˜ $\mathbf{s}_t$์™€ ๋ถˆํ™•์‹ค์„ฑ $\mathbf{p}_t$๋ฅผ ์ตœ์ข…์ ์œผ๋กœ ์—…๋ฐ์ดํŠธํ•˜๋Š” ๋‹จ๊ณ„์ด๋‹ค.

์ƒˆ๋กœ์šด ๊ด€์ธก์น˜๋ฅผ ์–ผ๋งˆ๋‚˜ ์‹ ๋ขฐํ•˜์—ฌ ๊ธฐ์กด ์ƒํƒœ์— ๋ฐ˜์˜ํ• ์ง€๋ฅผ ๊ฒฐ์ •ํ•˜๋Š” ๊ฐ€์ค‘์น˜์ธ kalman gain์„ ๊ณ„์‚ฐํ•˜๋Š” ๊ณผ์ •์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

\[\mathbf{k}_t=\frac{\mathbf{p}_t^-}{\mathbf{p}_t^-+r} \tag{4}\]

์‹ (4)๋Š” ๊ณ ์ „์  ์นผ๋งŒ ํ•„ํ„ฐ์˜ kalman gain ๊ณ„์‚ฐ ๊ณต์‹์ธ $K_t=\frac{P_t^-H^\top}{HP_k^-H^\top+R}$์—์„œ, $H=I$๋กœ ๋‘๊ณ  ๊ณ„์‚ฐ์„ ๋‹จ์ˆœํ™”ํ•œ ํ˜•ํƒœ์ด๋‹ค.

$H=I$๋กœ ๊ฐ€์ •ํ•œ๋‹ค๋Š” ๊ฒƒ์€ ์‹œ์Šคํ…œ์ด ์ถ”์ •ํ•˜๋ ค๋Š” 3D latent state์™€ ๋””์ฝ”๋”์˜ ๊ด€์ธก์น˜์˜ ์ˆ˜ํ•™์  ์ฐจ์›๊ณผ ๋‹จ์œ„๊ฐ€ ์™„๋ฒฝํ•˜๊ฒŒ ๋™์ผํ•˜๋‹ค๋Š” ๊ฒƒ์„ ์˜๋ฏธํ•œ๋‹ค.

์ตœ์ข…์ ์œผ๋กœ latent state๋ฅผ ์—…๋ฐ์ดํŠธํ•˜๋Š” ๊ณผ์ •์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

\[\mathbf{s}_t=\mathbf{s}_{t-1}+\mathbf{k}_t\odot(\tilde{\mathbf{s}}_t-\mathbf{s}_{t-1}) \tag{5}\]

์—ฌ๊ธฐ์„œ $(\tilde{\mathbf{s}}_t-\mathbf{s}_{t-1})$์€ ๊ธฐ์กด ์˜ˆ์ธก๊ณผ ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜ ์‚ฌ์ด์˜ ์˜ค์ฐจ๋ฅผ ๋‚˜ํƒ€๋‚ธ๋‹ค. ์ฆ‰, ์ด์ „์˜ ์ƒํƒœ์— ์ด ์˜ค์ฐจ๋ฅผ kalman gain์˜ ๋น„์œจ๋งŒํผ๋งŒ ๋ฐ˜์˜ํ•˜์—ฌ ๋”ํ•˜๋Š” ํ˜•ํƒœ์ด๋‹ค.

์‹ (5)๋ฅผ ์ „๊ฐœํ•˜๋ฉด ์•„๋ž˜์™€ ๊ฐ™์€๋ฐ, ์ด๋Š” $\mathbf{s}_{t-1}$์™€ $\tilde{\mathbf{s}}_t$์˜ ์‚ฌ์ด๋ฅผ $\mathbf{k}_t$๋ผ๋Š” ๋น„์œจ๋กœ ๋‚ด๋ถ„ํ•˜๋Š” ๊ฒƒ๊ณผ ๋™์ผํ•˜๋‹ค.

\[\mathbf{s}_t=(1-\mathbf{k}_t)\odot\mathbf{s}_{t-1}+\mathbf{k}_t\odot\tilde{\mathbf{s}}_t\]
  • $\mathbf{k}_t\approx1$์ธ ๊ฒฝ์šฐ: ์˜ˆ์ธก ๋ถˆํ™•์‹ค์„ฑ์ด ๋„ˆ๋ฌด ์ปค์„œ, ๊ณผ๊ฑฐ์˜ ์ •๋ณด๋ฅผ ๋ฌด์‹œํ•˜๊ณ  ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜๋ฅผ ์ „์ ์œผ๋กœ ์‹ ๋ขฐํ•˜๊ฒŒ ๋œ๋‹ค.
  • $\mathbf{k}_t\approx0$์ธ ๊ฒฝ์šฐ: ์ƒˆ๋กœ์šด ๊ด€์ธก์น˜๋ฅผ ๋ฌด์‹œํ•˜๊ณ  ๊ธฐ์กด์˜ ์ƒํƒœ๋ฅผ ์œ ์ง€ํ•˜๊ฒŒ ๋œ๋‹ค.

๋งˆ์ง€๋ง‰์œผ๋กœ, latent state๋ฅผ ์—…๋ฐ์ดํŠธํ•œ ํ›„ ์‹œ์Šคํ…œ์ด ๊ฐ€์ง€๋Š” ์ตœ์ข…์ ์ธ ๋ถ„์‚ฐ์„ ์—…๋ฐ์ดํŠธํ•˜๋Š” ๊ณผ์ •์€ ์•„๋ž˜์™€ ๊ฐ™์œผ๋ฉฐ, ์Šค์นผ๋ผ ํ˜•ํƒœ์˜ Joseph form์„ ์‚ฌ์šฉํ•œ๋‹ค.

\[\mathbf{p}_t=(1-\mathbf{k}_t)^2\odot\mathbf{p}_t^-+r\mathbf{k}_t^2~~,~~\mathbf{k}_t^2=\mathbf{k}_t\odot\mathbf{k}_t \tag{6}\]

๋‹จ์ˆœํžˆ $\mathbf{p}_t=(1-\mathbf{k}_t)\mathbf{p}_t^-$ ํ˜•ํƒœ๋ฅผ ์‚ฌ์šฉํ•˜์ง€ ์•Š์€ ์ด์œ ๋Š”, ์—ฐ์‚ฐ ๊ณผ์ •์—์„œ ๋ถ€๋™ ์†Œ์ˆ˜์  ์˜ค์ฐจ๊ฐ€ ๋ˆ„์ ๋  ๊ฒฝ์šฐ ๋ถ„์‚ฐ ๊ฐ’์ด ์Œ์ˆ˜๊ฐ€ ๋  ์ˆ˜๋„ ์žˆ๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค.

๋”ฐ๋ผ์„œ Joseph form์„ ์‚ฌ์šฉํ•ด ์ˆ˜์‹ ๋‚ด์˜ ๋ชจ๋“  ํ•ญ์ด ์ œ๊ณฑ ํ˜•ํƒœ๋กœ ๊ตฌ์„ฑ๋˜๊ฒŒ ํ•˜์—ฌ, ๋ถ„์‚ฐ์ด ํ•ญ์ƒ ์–‘์ˆ˜๋ฅผ ์œ ์ง€ํ•˜๋„๋ก ๋ณด์žฅํ•œ๋‹ค.

Uncertainty modeling of latent evolution

ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ $\mathbf{q}_t$๋Š” ์—ฐ์†๋œ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„ ์‚ฌ์ด์—์„œ 3D latent state๊ฐ€ ์–ผ๋งˆ๋‚˜ ๋ณ€ํ•  ๊ฒƒ์œผ๋กœ ์˜ˆ์ƒ๋˜๋Š”์ง€ ๊ทธ ๋ถˆํ™•์‹ค์„ฑ์„ ๋‚˜ํƒ€๋‚ธ๋‹ค. ๋”ฐ๋ผ์„œ ์ •์ ์ธ ์žฅ๋ฉด์—์„œ๋Š” ์ž‘๊ฒŒ, ๊ธ‰๊ฒฉํ•œ ํ™”๋ฉด ์ „ํ™˜์ด ์žˆ๋Š” ๋™์ ์ธ ์žฅ๋ฉด์—์„œ๋Š” ํฌ๊ฒŒ ํ• ๋‹น๋˜์–ด์•ผ ํ•œ๋‹ค.

๋…ผ๋ฌธ์—์„œ๋Š” $i$๋ฒˆ์งธ์˜ state token์ด ๊ฒช๋Š” temporal drift $\Delta_{t,i}$๋ฅผ ์ธก์ •ํ•˜๊ณ , ์‹œ๊ทธ๋ชจ์ด๋“œ ํ•จ์ˆ˜๋ฅผ ํ†ต๊ณผ์‹œ์ผœ ๋™์ ์œผ๋กœ ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ $q_{t,i}$๋ฅผ ๊ฒฐ์ •ํ•˜์˜€๋‹ค.

\[q_{t,i}=q_{\min}+(q_{\max}-q_{\min})\cdot\sigma\left(\alpha_q(g_{t,i}-\tau_q)\right) \tag{7}\]

์œ„ ์‹์—์„œ $q_{\max}$์™€ $q_{\min}$์€ ๋…ธ์ด์ฆˆ๊ฐ€ ๊ฐ€์งˆ ์ˆ˜ ์žˆ๋Š” ์ตœ์†Ÿ๊ฐ’๊ณผ ์ตœ๋Œ“๊ฐ’์ด๊ณ , $\alpha_q$๋Š” ์‹œ๊ทธ๋ชจ์ด๋“œ ํ•จ์ˆ˜์˜ ๊ณก์„  ๊ฒฝ์‚ฌ๋ฅผ ๊ฒฐ์ •ํ•œ๋‹ค.

fig4

  • ์žฅ๋ฉด์ด ๊ธ‰๋ณ€ํ•˜๋Š” ๊ฒฝ์šฐ ($g_{t,i}\gg\tau_q$): ์‹œ๊ทธ๋ชจ์ด๋“œ ๊ฒฐ๊ณผ๊ฐ’์ด $\sigma\approx1$์ด ๋˜์–ด $q_{t,i} \approx q_{\max}$๊ฐ€ ๋œ๋‹ค.
  • ์žฅ๋ฉด์ด ์ •์ ์ธ ๊ฒฝ์šฐ ($g_{t,i}\ll\tau_q$): ์‹œ๊ทธ๋ชจ์ด๋“œ ๊ฒฐ๊ณผ๊ฐ’์ด $\sigma\approx0$์ด ๋˜์–ด $q_{t,i} \approx q_{\min}$์ด ๋œ๋‹ค.

$g_{t,i}$๋Š” normalized drift score๋กœ, ํ˜„์žฌ ๋ฐœ์ƒํ•œ ๋ณ€ํ™”๊ฐ€ ํ‰์†Œ ์ˆ˜์ค€์— ๋น„ํ•ด ์–ผ๋งˆ๋‚˜ ํฐ์ง€๋ฅผ ์ƒ๋Œ€์ ์œผ๋กœ ํ‰๊ฐ€ํ•˜๋Š” ๊ฐ’์œผ๋กœ ์ •์˜๋œ๋‹ค.

\[g_{t,i}=\frac{\Delta_{t,i}}{\hat{\Delta}_t} \tag{8}\]

์ˆ˜์‹์— ๋“ฑ์žฅํ•˜๋Š” 3๊ฐ€์ง€ temporal drift $\Delta t$๋Š” ๋‹ค์Œ๊ณผ ๊ฐ™์ด ์ •์˜๋œ๋‹ค.

\[\Delta_{t,i}=\lVert\tilde{\mathbf{s}}_{t,i}-\tilde{\mathbf{s}}_{t-1,i}\rVert_2\]

$\Delta_{t,i}$๋Š” ๊ฐœ๋ณ„ ํ† ํฐ์˜ ์ ˆ๋Œ€์  ๋ณ€ํ™”๋Ÿ‰์œผ๋กœ, ํ˜„์žฌ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์—์„œ ๋””์ฝ”๋”๊ฐ€ ์˜ˆ์ธกํ•œ $i$๋ฒˆ์งธ ๊ด€์ธก์น˜ $\tilde{\mathbf{s}}_{t,i}$๊ฐ€ ์ง์ „ ํ”„๋ ˆ์ž„ ๊ด€์ธก์น˜ $\tilde{\mathbf{s}}_{t-1,i}$ ๋Œ€๋น„ ์œ ํด๋ฆฌ๋””์•ˆ ๊ณต๊ฐ„์—์„œ ์–ผ๋งˆ๋‚˜ ํฌ๊ฒŒ ์ด๋™ํ–ˆ๋Š”์ง€๋ฅผ ๋‚˜ํƒ€๋‚ด๋Š” ๊ฑฐ๋ฆฌ์ด๋‹ค.

\[\bar{\Delta}_t=\sum_i\frac{\Delta_{t,i}}{N}\]

$\bar{\Delta}_t$๋Š” ํ˜„์žฌ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์—์„œ์˜ ํ‰๊ท  ๋ณ€ํ™”๋Ÿ‰ (Frame-level mean drift)์œผ๋กœ, ํ˜„์žฌ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์— ์กด์žฌํ•˜๋Š” ๋ชจ๋“  $N$๊ฐœ ํ† ํฐ๋“ค์˜ ๋ณ€ํ™”๋Ÿ‰์„ ํ‰๊ท  ๋‚ธ ๊ฐ’์ด๋‹ค. ์ฆ‰, ์ด๋ฒˆ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์—์„œ 3D ๊ณต๊ฐ„ ์ „์ฒด๊ฐ€ ์ „๋ฐ˜์ ์œผ๋กœ ์–ผ๋งˆ๋‚˜ ์›€์ง์˜€๋Š”๊ฐ€๋ฅผ ๋‚˜ํƒ€๋‚ธ๋‹ค.

\[\hat{\Delta}_t=(1-\lambda_\Delta)\hat{\Delta}_{t-1}+\lambda_\Delta\bar{\Delta}_t\]

$\hat{\Delta}_t$๋Š” ์ „์ฒด ์ŠคํŠธ๋ฆผ์—์„œ์˜ ํ‰๊ท  ๋ณ€ํ™”๋Ÿ‰ (Stream-level mean drift)์œผ๋กœ, $\bar{\Delta}_t$๋ฅผ EMA ๋ฐฉ์‹์œผ๋กœ ๋ˆ„์ ํ•˜์—ฌ ๋ถ€๋“œ๋Ÿฝ๊ฒŒ ๋งŒ๋“  ์„ ์ด๋‹ค. ์ฆ‰, ๋น„๋””์˜ค ์ŠคํŠธ๋ฆผ์˜ ํ‰์ƒ์‹œ ํ”๋“ค๋ฆผ ์ˆ˜์ค€์„ ๋‚˜ํƒ€๋‚ด๋Š” ๊ธฐ์ค€์„ ์ด ๋œ๋‹ค. ๋…ผ๋ฌธ์—์„œ๋Š” EMA baseline์ด๋ผ๊ณ  ๋ถ€๋ฅธ๋‹ค.

Implementation issue

์œ„์˜ ๊ณต์‹๋“ค์„ ์‹ค์ œ ์ฝ”๋“œ๋กœ ๊ตฌํ˜„ํ•  ๋•Œ, ์ˆ˜์น˜์  ์•ˆ์ •์„ฑ๊ณผ ์˜ค์ž‘๋™์„ ๋ฐฉ์ง€ํ•˜๊ธฐ ์œ„ํ•ด ๋ช‡ ๊ฐ€์ง€ ์•ˆ์ „ ์žฅ์น˜๊ฐ€ ํ•„์š”ํ•˜๋‹ค.

  1. Avoid the division by a zero value

    ์‹ (4)์™€ (8)์—์„œ ๋ถ„๋ชจ๊ฐ€ 0์ด ๋˜๋Š” ๊ฒƒ์„ ๋ฐฉ์ง€ํ•˜๊ธฐ ์œ„ํ•ด ๋ถ„๋ชจ์— ์•„์ฃผ ์ž‘์€ ๊ฐ’ $\epsilon$์„ ๋”ํ•œ๋‹ค.

    \[\mathbf{k}_t=\frac{\mathbf{p}_t^-}{\mathbf{p}_t^-+r+\epsilon}~~,~~ g_{t,i}=\frac{\Delta_{t,i}}{\hat{\Delta}_t+\epsilon}\]
  2. Clamp the Kalman Gain

    ๋งŒ์•ฝ kalman gain์ด 0์ด ๋œ๋‹ค๋ฉด, ๊ธฐ์กด์˜ 3D latent state๋ฅผ ๋‹ค ์ง€์›Œ๋ฒ„๋ฆฌ๋Š” full overwrite ํ˜„์ƒ์ด ๋ฐœ์ƒํ•œ๋‹ค.

    ๋”ฐ๋ผ์„œ ์ ์ ˆํ•œ ์ˆ˜์ค€์˜ ์œ ์—ฐ์„ฑ์„ ์œ ์ง€ํ•˜๋„๋ก $[k_{\min}, k_{\max}]$ ์‚ฌ์ด์—์„œ ๊ฐ’์„ ์œ ์ง€ํ•˜๋„๋ก ํ•œ๋‹ค.

  3. Clamp the EMA Baseline

    ์นด๋ฉ”๋ผ๊ฐ€ ์›€์ง์ด์ง€ ์•Š๊ณ  ๋น„๋””์˜ค ์ŠคํŠธ๋ฆผ์˜ ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์ด ์˜ค๋žซ๋™์•ˆ ์ •์ง€ํ•ด ์žˆ์œผ๋ฉด, $\hat{\Delta}_t\approx0$์ด ๋˜๋Š”๋ฐ, ์ด๋•Œ ์ž‘์€ ๋ณ€ํ™”๊ฐ€ ์žˆ๋Š” ์ด๋ฏธ์ง€ ํ”„๋ ˆ์ž„์ด ๋“ค์–ด์˜ค๋ฉด, $g_{t,i}$๊ฐ€ ํญ๋ฐœํ•˜๊ฒŒ ๋œ๋‹ค.

    ์ด๋Ÿฌํ•œ ํ˜„์ƒ์„ ๋ฐฉ์ง€ํ•˜๊ธฐ ์œ„ํ•ด, $\hat{\Delta}_t$๊ฐ€ ํŠน์ • ๊ฐ’ ์•„๋ž˜๋กœ ๋‚ด๋ ค๊ฐ€์ง€ ์•Š๋„๋ก ์ตœ์†Œ๊ฐ’ $\Delta_{\text{floor}}$๋ฅผ ์„ค์ •ํ•œ๋‹ค.

2-3. Filtering as adaptive token retention

์•ž์„œ ๊ตฌํ•œ kalman gain $\mathbf{k}_t$๋Š” ๊ฐ state token์„ ์–ผ๋งˆ๋‚˜ ์—…๋ฐ์ดํŠธํ• ์ง€ ๊ฒฐ์ •ํ•˜๋Š” ์ผ์ข…์˜ ์—…๋ฐ์ดํŠธ ๊ณ„์ˆ˜ $\boldsymbol{\beta}_t:=\mathbf{k}_t\in[0,1]^N$์ฒ˜๋Ÿผ ๋™์ž‘ํ•œ๋‹ค.

์‹ (5)๋ฅผ ๋‹ค์‹œ ์ž‘์„ฑํ•ด๋ณด๋ฉด, ์—…๋ฐ์ดํŠธ ๊ณต์‹์€ Exponential Smoothing๊ณผ ๋™์ผํ•œ ํ˜•ํƒœ๊ฐ€ ๋œ๋‹ค. (EMA์™€ ์›๋ฆฌ๋Š” ๋™์ผํ•˜์ง€๋งŒ EMA๋Š” ํ‰๊ท ์ ์ธ ํ๋ฆ„์„ ์ถ”์ ํ•˜๋Š” ๊ฒƒ์—, Exponential Smoothing์€ ๊ฐ’๋“ค์„ ์„ž๋Š” ๊ฒƒ์— ์ดˆ์ ์„ ๋งž์ถ˜ ์šฉ์–ด์ž„)

\[\mathbf{s}_t=(1-\boldsymbol{\beta}_t)\odot\mathbf{s}_{t-1}+\boldsymbol{\beta}_t\odot\tilde{\mathbf{s}}_t\]

๋˜ํ•œ ๋ถˆํ™•์‹ค์„ฑ์„ ์ง€์†์ ์œผ๋กœ ์ „ํŒŒํ•˜๋Š” ์นผ๋งŒ ํ•„ํ„ฐ์˜ ํŠน์„ฑ ๋•๋ถ„์—, ์ƒํ™ฉ์— ๋”ฐ๋ผ ์ด $\beta_t$ ๊ฐ’์„ ์ ์ ˆํ•˜๊ฒŒ ์กฐ์ ˆํ•ด ๋‚ธ๋‹ค.

์นด๋ฉ”๋ผ๊ฐ€ ์ •์ง€ํ•ด ์žˆ๊ฑฐ๋‚˜ ํ™”๋ฉด ๋ณ€ํ™”๊ฐ€ ์—†๋Š” ์•ˆ์ •์ ์ธ ๊ตฌ๊ฐ„์—์„œ๋Š” ํ”„๋กœ์„ธ์Šค ๋…ธ์ด์ฆˆ $\mathbf{q}_t$๊ฐ€ ๋งค์šฐ ์ž‘๊ฒŒ ์œ ์ง€๋œ๋‹ค. ๋ถ„์‚ฐ ์ถ”์ •์น˜ $\mathbf{q}_t$๊ฐ€ ์ž‘์œผ๋ฏ€๋กœ $\mathbf{p}_t^-$๋„ ์ ์  ๊ฐ์†Œํ•˜๊ณ , ๊ฒฐ๊ณผ์ ์œผ๋กœ kalman gain $\mathbf{k}_t$๋„ ์ง€์†์ ์œผ๋กœ ๊ฐ์†Œํ•œ๋‹ค. ์ˆ˜ํ•™์ ์œผ๋กœ $\mathbf{k}_t\approx0$์ด๋ผ๋Š” ๋œป์€ ๊ธฐ์กด์˜ ์ƒํƒœ ์ถ”์ •์น˜๋ฅผ ๊ฐ•๋ ฅํ•˜๊ฒŒ ๋ณด์กดํ•œ๋‹ค๋Š” ๋œป์ด๋ฏ€๋กœ, ๋ชจ๋ธ์˜ ์œ ํšจ ๊ธฐ์–ต ์‹œ๊ฐ„ (Effective memory horizon)์ด ๋์—†์ด ํ™•์žฅ๋˜๋Š” ํšจ๊ณผ๋ฅผ ๋‚ณ๋Š”๋‹ค.

์ฆ‰, ๋น„๋””์˜ค๊ฐ€ ์ •์ ์ธ ์ƒํ™ฉ์—์„œ๋Š” ๊ณผ๊ฑฐ์˜ ์ •๋ณด๋ฅผ ์˜ค๋žซ๋™์•ˆ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ๋‹ค๋Š” ์˜๋ฏธ์ด๋‹ค.

In stable regimes, $\mathbf{q}_t$ stays near qmin, so $\mathbf{p}_t^-$ gradually decreases as the Joseph update (Eq. (6)) shrinks the variance, causing $\mathbf{k}_t$ to decay and the effective memory horizon to grow.

๋ฐ˜๋ฉด ์นด๋ฉ”๋ผ๊ฐ€ ๊ธ‰๊ฒฉํžˆ ์›€์ง์—ฌ ์‹œ์•ผ๊ฐ€ ๋ฐ”๋€Œ๋ฉด, $\mathbf{q}_t$๊ฐ€ ํฌ๊ฒŒ ์น˜์†Ÿ๋Š”๋‹ค. ์ด๋กœ ์ธํ•ด $\mathbf{p}_t^-$๊ฐ€ ์ฆ๊ฐ€ํ•˜๊ณ  $\mathbf{k}_t$ ์—ญ์‹œ ๊ธ‰๊ฒฉํžˆ ์ƒ์Šนํ•œ๋‹ค. ๊ทธ ๊ฒฐ๊ณผ ๋ชจ๋ธ์€ ๊ณผ๊ฑฐ์˜ ์ƒํƒœ๋ฅผ ๊ณ ์ง‘ํ•˜์ง€ ์•Š๊ณ , ์ƒˆ๋กญ๊ฒŒ ๋“ค์–ด์˜จ ๊ด€์ธก์น˜๋ฅผ ๋น ๋ฅด๊ฒŒ ์œตํ•ฉํ•˜์—ฌ ์ƒˆ๋กœ์šด 3D latent state์— ์ฆ‰๊ฐ์ ์œผ๋กœ ์ ์‘ํ•œ๋‹ค.

During scene transitions, $\mathbf{q}_t$ spikes, $\mathbf{p}_t^-$ increases, and $\mathbf{k}_t$ rises, allowing the filter to rapidly integrate new evidence.

3. Experiments

  • Inference setting
    • Datasets
      • TUM-RGBD (for Camera Pose Estimation)
      • Sintel, Bonn, KITTI (for Depth Estimation)
      • 7-Scenes, NRGBD (for 3D Reconstruction)
    • Hardware & Efficiency
      • ์‚ฌ์šฉ GPU: a single NVIDIA RTX 5090 (32GB VRAM)
      • ์ถ”๋ก  ์†๋„: 25.14 FPS

3-1. Long-horizon Estimation

์•„๋ž˜์˜ ํ…Œ์ด๋ธ”์€ ์‹œํ€€์Šค๊ฐ€ ๊ธด ๋น„๋””์˜ค์—์„œ 3D Reconstruction (Table 1), Camera Pose Estimation (Table 2), Depth Estimation (Table 3)์˜ ์„ฑ๋Šฅ์„ ๋น„๊ตํ•œ ํ‘œ์ด๋‹ค.

fig5

Fig 4๋Š” Table 2์™€ Table 3์˜ ๊ฒฐ๊ณผ๋ฅผ ์‹œ๊ฐํ™”ํ•˜์—ฌ, ๋น„๋””์˜ค๊ฐ€ ๊ธธ์–ด์ง์— ๋”ฐ๋ผ ์˜ค์ฐจ๊ฐ€ ์–ด๋–ป๊ฒŒ ๋ˆ„์ ๋˜๋Š”๊ฐ€๋ฅผ ๋ณด์—ฌ์ฃผ๋Š” ๊ทธ๋ž˜ํ”„์ด๋‹ค.

fig6

CUT3R์™€ TTT3R์˜ ์„ ์€ ์‹œ๊ฐ„์ด ์ง€๋‚ ์ˆ˜๋ก ์˜ค์ฐจ๊ฐ€ ์ฆ๊ฐ€ํ•˜๋Š” ๋ฐ˜๋ฉด, FILT3R๋Š” ์˜ค์ฐจ ์ฆ๊ฐ€์œจ์ด ์™„๋งŒํ•˜๊ฒŒ ์œ ์ง€๋˜๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

3-2. Short-horizon Estimation

Table 4๋Š” ์‹œํ€€์Šค๊ฐ€ ์งง์€ ๋น„๋””์˜ค์—์„œ์˜ Depth Estimation ์„ฑ๋Šฅ์„ ๋น„๊ตํ•œ ํ‘œ์ด๋‹ค. (์žฅ๊ธฐ ๊ธฐ์–ต๋ ฅ์„ ์–ป์€ ๋Œ€์‹ , ์งง์€ ์˜์ƒ์—์„œ์˜ ์ •ํ™•๋„๋ฅผ ํฌ์ƒํ•œ ๊ฒƒ์ผ์ˆ˜๋„ ์žˆ๊ธฐ ๋•Œ๋ฌธ์ž„)

fig7

์งง์€ ๋น„๋””์˜ค์—์„œ๋„ ๊ธฐ์กด ๋ชจ๋ธ๊ณผ ๋™๋“ฑํ•˜๊ฑฐ๋‚˜ ๋” ํ–ฅ์ƒ๋œ ๋‹จ๊ธฐ ์„ฑ๋Šฅ์„ ๊ธฐ๋กํ•œ ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

3-3. Runtime & GPU Memory

Table 5๋Š” 500 ํ”„๋ ˆ์ž„ ํ™˜๊ฒฝ์—์„œ FPS์™€ GPU ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์„ ์ธก์ •ํ•œ ํ‘œ์ด๋‹ค.

fig8

๊ธฐ์กด TTT3R ๋ชจ๋ธ์€ ๊ฒŒ์ดํŠธ ์กฐ์ ˆ์„ ์œ„ํ•ด ์–ดํ…์…˜ ๋งต์„ ์บ์‹ฑํ•˜๋А๋ผ ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์ด ์•ฝ 6.3GB๋กœ ๋‘ ๋ฐฐ ๊ฐ€๊นŒ์ด ๋›ฐ์—ˆ์ง€๋งŒ, FILT3R๋Š” ๋ฌด์กฐ๊ฑด ๋ฎ์–ด์“ฐ๋Š” CUT3R์™€ ์™„์ „ํžˆ ๋™์ผํ•œ ์•ฝ 3.5GB์˜ ๊ฐ€๋ฒผ์šด ๋ฉ”๋ชจ๋ฆฌ๋งŒ์„ ์‚ฌ์šฉํ•˜๋ฉฐ, FPS ์ €ํ•˜๋„ ์ „ํ˜€ ์—†๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

Fig 5๋Š” ์ž…๋ ฅ๋˜๋Š” ๋น„๋””์˜ค์˜ ์‹œํ€€์Šค ๊ธธ์ด๊ฐ€ 100์—์„œ 1000๊นŒ์ง€ ๋Š˜์–ด๋‚  ๋•Œ, ๊ฐ ๋ชจ๋ธ์—์„œ์˜ ์ตœ๋Œ€ GPU ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์ด ์–ด๋–ป๊ฒŒ ๋ณ€ํ•˜๋Š”์ง€ ๋น„๊ตํ•œ ๊ทธ๋ž˜ํ”„์ด๋‹ค.

fig9

VGGT๋‚˜ Depth-Anything3์™€ ๊ฐ™์€ Full-attention ๋ชจ๋ธ์€ ์‹œํ€€์Šค ๊ธธ์ด๊ฐ€ ๊ธธ์–ด์งˆ์ˆ˜๋ก ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์ด ๊ธ‰๊ฒฉํ•˜๊ฒŒ ์˜ฌ๋ผ๊ฐ„๋‹ค.

๋ฐ˜๋ฉด, ์ˆœํ™˜ํ˜• ์ŠคํŠธ๋ฆฌ๋ฐ ๊ตฌ์กฐ๋ฅผ ์ฑ„ํƒํ•œ CUT3R, TTT3R, FILT3R๋Š” ์‹œํ€€์Šค ๊ธธ์ด๊ฐ€ ์•„๋ฌด๋ฆฌ ๊ธธ์–ด์ ธ๋„ ๋ฉ”๋ชจ๋ฆฌ ์‚ฌ์šฉ๋Ÿ‰์ด ๋Š˜์–ด๋‚˜์ง€ ์•Š๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

3-4. Ablation Study

Table 6์€ FILT3R์˜ ์ˆ˜ํ•™์  ์ˆ˜์‹๋“ค์ด ๊ฐ๊ฐ ์„ฑ๋Šฅ์— ์–ด๋–ค ์˜ํ–ฅ์„ ๋ฏธ์น˜๋Š”์ง€๋ฅผ ๊ฒ€์ฆํ•œ ํ‘œ์ด๋‹ค.

fig10

์ธก์ • ๋…ธ์ด์ฆˆ $r$์„ ์ ์‘์ ์œผ๋กœ ์กฐ์ ˆ๋˜๊ฒŒ ์„ค์ •ํ•˜๋ฉด ์˜คํžˆ๋ ค ์„ฑ๋Šฅ์ด ํ•˜๋ฝํ•˜๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

This post is licensed under CC BY 4.0 by the author.