[๋ ผ๋ฌธ๋ฆฌ๋ทฐ] An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion
๐ ICLR 2023
๐ Summary
์ฌ์ ํ์ต๋ ์์ฑ ๋ชจ๋ธ๊ณผ ํ
์คํธ ์ธ์ฝ๋๋ฅผ ๊ฑด๋๋ฆฌ์ง ์๊ณ , ํด๋น ๋ชจ๋ธ์ ํ
์คํธ ์๋ฒ ๋ฉ ๊ณต๊ฐ ๋ด์์ ์๋ก์ด ๊ฐ๋
์ ์ฐพ๋ ๊ฒ์ด ๋ชฉํ์ด๋ค.
- ํํํ๊ธธ ์ํ๋ ๋จ์ด๋ฅผ pseudo-word $S_*$๋ก ํ๊ธฐํ ํ ํ ์คํธ ์ธ์ฝ๋์ ์ ๋ ฅ
- ํด๋น ๋จ์ด์ ๋์๋๋ ์๋ฒ ๋ฉ ๋ฒกํฐ $v_*$์ ๋ํด์๋ง ์ต์ ํ
Introduction
๊ธฐ์กด ์ฐ๊ตฌ๋ค์ ํ๊ณ์
- T2I ๋ชจ๋ธ์ ์ฌ์ฉ์๊ฐ ์ํ๋ ๋์์ ํ ์คํธ๋ก ์ผ๋ง๋ ์ ์ค๋ช ํ๋๋์ ์ํด ๊ทธ ํ์ฉ์ด ์ ํ๋๋ค.
- ๋๊ท๋ชจ ๋ชจ๋ธ์ ์๋ก์ด ๊ฐ๋
์ ๋์
ํ๋ ์ผ์ ์ด๋ ต๋ค.
- ๋งค๋ฒ ์๋ก์ด ๊ฐ๋ ๋ง๋ค ๋ชจ๋ธ์ ๋ค์ ํ์ต์ํค๋ ๊ฒ์ ๋น์ฉ์ด ๋ง์ด ๋ ๋ค.
- ์์์ ์์๋ก ํ์ธํ๋์ ํ๋ฉด ๊ธฐ์กด ์ง์์ ๋ง๊ฐํ๋ catastrophic forgetting ๋ฌธ์ ๊ฐ ๋ฐ์ํ๋ค.
์ ์ํ๋ ๋ฐฉ๋ฒ
- ์ฌ์ฉ์๊ฐ ์ ๊ณตํ ๊ฐ๋ ์ ํตํด ์๋ก์ด ์ด๋ฏธ์ง๋ฅผ ๋ง๋๋ personalized text-to-image generation์ด๋ผ๋ ์๋ก์ด task๋ฅผ ์ ์ํ๋ค.
- ์ฌ์ ํ์ต๋ T2I ๋ชจ๋ธ์ ํ ์คํธ ์๋ฒ ๋ฉ ๊ณต๊ฐ ์์์ ์๋ก์ด ๋จ์ด(pseudo-word)๋ฅผ ์ฐพ๋ ๋ฐฉ๋ฒ์ ์ ์ํ๋ค. ์ฆ, ์๋ก์ด ๊ฐ๋ ์ ๋ํ๋ผ ์ ์๋ ์๋ก์ด ์๋ฒ ๋ฉ ๋ฒกํฐ๋ฅผ ์ฐพ๋ ๊ฒ์ด ๋ชฉํ์ด๋ค.
- ์์ฑ ๋ชจ๋ธ ์์ฒด๋ ๊ฑด๋๋ฆฌ์ง ์๊ธฐ ๋๋ฌธ์ ๊ธฐ์กด ๋ชจ๋ธ์ ํ ์คํธ ์ดํด๋ ฅ๊ณผ ์ผ๋ฐํ ๋ฅ๋ ฅ์ ๋ณด์กดํ ์ ์๋ค.
Methods
1. Latent Diffusion Models
๋ณธ ์ฐ๊ตฌ์์๋ LDM์ ์ฌ์ฉํ์๋ค.
\[L_{LDM} := \mathbb{E}_{z \sim \mathcal{E}(x),\, y,\, \epsilon \sim \mathcal{N}(0,1),\, t} \left[ \left\| \epsilon - \epsilon_\theta(z_t, t, c_\theta(y)) \right\|_2^2 \right]\]ํ ์คํธ ์ธ์ฝ๋ $c_\theta$๋ก๋ BERT๋ฅผ ์ฌ์ฉํ์๊ณ , $y$๋ ํ ์คํธ ์๋ฒ ๋ฉ์ ์๋ฏธํ๋ค.
ํ์ต ์ค์ $c_\theta$์ $\epsilon_\theta$๋ ํจ๊ป ์ต์ ํ๋๋ค.
2. Text Embeddings
์ ๋ ฅ ๋ฌธ์์ด์ ๊ฐ ๋จ์ด๋ sub-word(๋จ์ด์ ์ผ๋ถ)๋ ํ ํฐ์ผ๋ก ๋ณํ๋๋ฉฐ, ์ด ํ ํฐ๋ค์ ๋ฏธ๋ฆฌ ์ ์๋ dictionary ๋ด์ ์ธ๋ฑ์ค์ด๋ค.
๊ฐ ํ ํฐ์ ๊ณ ์ ํ ์๋ฒ ๋ฉ ๋ฒกํฐ์ ์ฐ๊ฒฐ๋์ด ์์ผ๋ฉฐ, ์ด ๋ฒกํฐ๋ ์ธ๋ฑ์ค๋ฅผ ๊ธฐ๋ฐ์ผ๋ก ์กฐํํ์ฌ ๊ฐ์ ธ์ฌ ์ ์๋ค.
ํ์ตํ๊ณ ์ ํ๋ ์๋ก์ด ๊ฐ๋ ์ ๋ํ๋ด๊ธฐ ์ํด ๋์ฒด ๋ฌธ์์ด(placeholder string) $S_$๋ฅผ ์ง์ ํ๊ณ , ์ด์ ๋์๋๋ ์๋ฒ ๋ฉ ๋ฒกํฐ $v_$๋ฅผ ์ถ๋ ฅํ๋๋ก ํ์ฌ ๊ฐ๋ ์ ์ดํ์ ์ฃผ์ ํ๋ค.
3. Textual Inversion
์๋ก์ด ์๋ฒ ๋ฉ $v_*$๋ฅผ ์ฐพ๊ธฐ ์ํด 3~5์ฅ์ ์๋์ ์ด๋ฏธ์ง๋ฅผ ์ฌ์ฉํ๋ค.
\[v_* =\underset{v}{ \arg\min}~\mathbb{E}_{z \sim \mathcal{E}(x),\, y,\, \epsilon \sim \mathcal{N}(0,1),\, t} \left[ \left\| \epsilon - \epsilon_\theta(z_t, t, c_\theta(y)) \right\|_2^2 \right]\]์์ฑ ๋ชจ๋ธ๊ณผ ํ ์คํธ ์ธ์ฝ๋์ ๊ฐ์ค์น๋ ๊ณ ์ ํ๊ณ , ์์ LDM loss๋ฅผ ์ต์ํํ๋๋ก $v_*$๋ง ์ต์ ํํ๋ค.
์ฆ, ์ฃผ์ด์ง ์ ๋ ฅ ์ด๋ฏธ์ง๋ฅผ ์ฌ๊ตฌ์ฑํ๋๋ก $S_$์ ๋์๋๋ ์ต์ ์ ํ ์คํธ ์๋ฒ ๋ฉ $v_$๋ฅผ ์ฐพ๋ ๊ฒ์ด ๋ชฉํ์ด๋ค.
์ผ๋ฐ์ ์ธ T2I ๋ชจ๋ธ์ ํ ์คํธ๋ฅผ ์ ๋ ฅ์ผ๋ก ์ฃผ๋ฉด ๊ทธ์ ๋์๋๋ ์ด๋ฏธ์ง๋ฅผ ๋ง๋ค์ง๋ง, textual inversion์์๋ ์ด๋ฏธ์ง๋ฅผ ์ฃผ๊ณ , ๊ทธ ์ด๋ฏธ์ง๋ฅผ ๊ฐ์ฅ ์ ์ค๋ช ํ ์ ์๋ ํ ์คํธ ์๋ฒ ๋ฉ์ ์ญ์ผ๋ก ์ฐพ์๋ด๊ธฐ ๋๋ฌธ์ inversion์ด๋ผ๊ณ ๋ถ๋ฅธ๋ค.
Experiments
Qualitative Comparisons and Applications
Image variations
์ ์ํ ๋ฐฉ๋ฒ์ 2๊ฐ์ baseline๊ณผ ๋น๊ตํ์๋ค.
- LDM: ์ฌ๋์ด ์์ฑํ ์งง์ caption๊ณผ ๊ธด caption์ ์กฐ๊ฑด์ผ๋ก ์ ๋ ฅ
- DALLE-2: ์ด๋ฏธ์ง์ ์ฌ๋์ด ์์ฑํ ๊ธด caption์ ์กฐ๊ฑด์ผ๋ก ์ ๋ ฅ
Style transfer
Textual-embedding space๋ ์คํ์ผ๊ณผ ๊ฐ์ ์ถ์์ ์ธ ๊ฐ๋
๋ ํํํ ์ ์๋ค.
์ด๋, ์คํ์ผ์ด ๊ณต์ ๋ ๋ช ์ฅ์ ์ด๋ฏธ์ง์ โA painting in the style of $S_*$โ ํ์์ ํ๋กฌํํธ๋ฅผ ํตํด ํ์ต์ ์งํํ๋ค.
Quantitative Analysis
์ผ์ชฝ์ CLIP-based ํ๊ฐ, ์ค๋ฅธ์ชฝ์ user study์ด๋ค.




