[๋ ผ๋ฌธ๋ฆฌ๋ทฐ] CLIP: Learning Transferable Visual Models From Natural Language Supervision
๐ ICML 2021
Introduction
NLP์์์ ๋ณํ
๊ณผ๊ฑฐ์๋ ๊ธฐ๊ณ๊ฐ ์ธ์ด๋ฅผ ๋ฐฐ์ฐ๊ธฐ ์ํด ๋ฒ์ญ, ์ง๋ฌธ-๋ต๋ณ ๋ฑ task๋ง๋ค ๋ณ๋์ ๋ผ๋ฒจ๋ง๋ ๋ฐ์ด์ ์ ๋ง๋ค์ด์ผ ํ๋ค.
๊ทธ๋ฐ๋ฐ ์ต๊ทผ์๋ ์น์ ์กด์ฌํ๋ ์์ ํ ์คํธ (raw text)๋ง์ผ๋ก๋ ํ์ตํ ์ ์๋ ๋ฐฉ๋ฒ์ด ๋ฐ์ ํ๋ค. ์ด ๋ฐฉ์์์๋ ๋์ด์ ๋ณ๋์ ๋ผ๋ฒจ๋ง์ด ํ์ํ์ง ์๋ค.
์ฌ๊ธฐ์ โ์ ๋ ฅ๋ ํ ์คํธ, ์ถ๋ ฅ๋ ํ ์คํธ (text-to-text)โ๋ผ๋ ๊ท์น์ ์ ์ฉํ๋ฉด์, ๋ชจ๋ task๋ฅผ ์๋์ ๊ฐ์ด ๋จ์ํ ํ ์คํธ ๋ณํ ๋ฌธ์ ๋ก ํต์ผํ ์ ์๊ฒ ๋์๋ค.
- ์์ด ๋ฌธ์ฅ์ ๋ฃ์ผ๋ฉด ๋ฒ์ญ๋ ํ๊ตญ์ด๋ ํ ์คํธ
- ์ง๋ฌธ์ ๋ฃ์ผ๋ฉด ๋ต๋ณ๋ ํ ์คํธ
์ด๋ฌํ ์์ด๋์ด๋ฅผ ๊ทน๋จ์ ์ผ๋ก ํ์ฅํ ๋ชจ๋ธ์ด GPT-3์ด๋ค. GPT-3๋ ๋ฒ์ญ์ ์ํ ๋ณ๋์ ๋ฐ์ดํฐ๋ก ํ์ตํ์ง ์๊ณ , ๋จ์ง ์๋ง์ ์น ํ ์คํธ๋ง ํ์ตํ์ ๋ฟ์ธ๋ฐ ์์ฒญ๋ง ํ๋ฉด ๋ค์ํ ์์ ์ ์ํํ ์ ์์๋ค.
์ฆ, ์ถ๊ฐ ํ์ต ์์ด ์๋ก์ด task๋ฅผ ์ํํ ์ ์๋ zero-shot transfer ๋ฅ๋ ฅ์ด ์๊ธด ๊ฒ์ด๋ค.
Computer Vision์์์ ์ ์ฉ
์ปดํจํฐ ๋น์ ๋ถ์ผ์์๋ ๋๋ถ๋ถ์ ๋ชจ๋ธ์ด ImageNet๊ณผ ๊ฐ์ด ์ฌ์ ์ ์ ํด์ง ๋ผ๋ฒจ์ด ๋ถ์ ๋ฐ์ดํฐ์ ์ผ๋ก pre-training๋๋ ๊ฒ์ด ์ผ๋ฐ์ ์ด์๋ค.
์ด๋ฌํ ๋ฐฉ์์ ์๋ก์ด ๊ฐ๋ ์ด๋ task๋ฅผ ๋ค๋ฃจ๊ธฐ ์ํด, ์ถ๊ฐ ๋ผ๋ฒจ๋ง ๋ฐ์ดํฐ๋ฅผ ๋ชจ์ ์ถ๊ฐ์ ์ธ ํ์ต์ด ํ์ํ๋ค๋ ํ๊ณ๊ฐ ์์๋ค.
์ด๋ ์์ฐ์ด๋ฅผ supervision์ผ๋ก ์ฌ์ฉํ๋ฉด ์ปดํจํฐ ๋น์ ์์๋ ๋ํ๊ตฌ๋ฅผ ๋ง๋ค ์ ์์ง ์์๊น ํ๋ ์๋ฌธ์ด ์ ๊ธฐ๋์๋ค.
์ฌ์ค ๊ณผ๊ฑฐ์๋ image-text ํ์ต์ ๋ํ ์๋๊ฐ ์กด์ฌํ์์ง๋ง, ๋๋ถ๋ถ ์ฑ๋ฅ์ด ๋ฎ๊ณ softmax classifier ๊ธฐ๋ฐ์ ๊ตฌ์กฐ๋ฅผ ์ฌ์ฉํด ๊ณ ์ ๋ ํด๋์ค ์งํฉ ๋ด์์๋ง ์์ธก์ด ๊ฐ๋ฅํ์๋ค.
Natural language supervision์ ๋น์ ์ ์ ์ฉํ๊ธฐ ์ํด ์ธํฐ๋ท์์ ์์งํ 4์ต ์์ image-text ๋ฐ์ดํฐ์ ์ ๊ตฌ์ถํ๊ณ , contrastive learning objective๋ฅผ ํตํด ์ด๋ฏธ์ง์ ํ ์คํธ์ ์ฌ๋ฐ๋ฅธ ์ง์ ๋ง์ถ๋ ๋ฐฉ์์ผ๋ก ๋ชจ๋ธ์ ํ์ต์์ผฐ๋ค.
์ด๋ฅผ ํตํด CLIP์ ๋ณ๋์ fine-tuning ์์ด๋ ๋ค์ํ ์ปดํจํฐ ๋น์ task์์ zero-shot transfer๊ฐ ๊ฐ๋ฅํ๋ค๋ ๊ฒ์ ๋ณด์ฌ์ฃผ์๋ค.
Methods
Contrastive pre-training
$N$๊ฐ์ ์ด๋ฏธ์ง์ ํ ์คํธ ์์ ๊ฐ๊ฐ ์ธ์ฝ๋์ ํต๊ณผ์์ผ image representation $I_n$์ text representation $T_n$๋ฅผ ์ป๋๋ค. $n$์ ์ธ๋ฑ์ค ๋ฒํธ๋ฅผ ์๋ฏธํ๋ค.
ํ์ต ๊ณผ์ ์์๋ $N\times N$๊ฐ์ pair ์ค์์ $N$๊ฐ์ positive pair์ ๋ํด์๋ cosine similarity๊ฐ ๋์์ง๋๋ก, ๋๋จธ์ง $N^2-N$๊ฐ์ negative pair์ ๋ํด์๋ cosine similarity๊ฐ ๋ฎ์์ง๋๋ก ํ์ต์ ์ํจ๋ค.
์ด๋ ๊ฒ ๊ณ์ฐ๋ similarity score๋ฅผ ๊ธฐ๋ฐ์ผ๋ก cross entropy loss๋ฅผ ์ฌ์ฉํด ์ด๋ฏธ์ง ์ธ์ฝ๋์ ํ ์คํธ ์ธ์ฝ๋๋ฅผ ๋์์ ํ์ต์ํจ๋ค.
๋ณธ ์ฐ๊ตฌ์์๋ ์ด๋ฏธ์ง ์ธ์ฝ๋๋ก ResNet-50, Vision Transformer๋ฅผ, ํ ์คํธ ์ธ์ฝ๋๋ก Transformer๋ฅผ ์ด์ฉํ๋ค๊ณ ํ๋ค.
์๋๋ pseudo code์ด๋ค.
์์์ I_f์ T_f๋ ์ธ์ฝ๋๋ฅผ ๊ฑฐ์ณ ์ป์ feature representation์ด๋ฉฐ, I_e์ T_e๋ ์ถ๊ฐ์ ์ธ linear projection์ ๊ฑฐ์ณ ์ป์ multimodal embedding์ ์๋ฏธํ๋ค.
- Feature representation: ์ธ์ฝ๋๊ฐ ์ถ์ถํ ๊ฐ๊ฐ ๋ชจ๋ฌ๋ฆฌํฐ์ feature ํํ
- Multimodal embedding: ๋ ๋ชจ๋ฌ๋ฆฌํฐ๊ฐ projection์ ๊ฑฐ์น ๋ค ๊ณตํต๋ ๊ณต๊ฐ์ ๋์ธ ๋ฒกํฐ (์ด๋ฏธ์ง์ ํ ์คํธ๊ฐ ๊ฐ์ ๊ณต๊ฐ์ ๋์ฌ์ง)
loss_i๋ ์ด๋ฏธ์ง๋ฅผ ๊ธฐ์ค์ผ๋ก ํ์ ๋ ์ ๋ต ํ
์คํธ๋ฅผ ๋ง์ถ๋ loss, loss_t๋ ํ
์คํธ๋ฅผ ๊ธฐ์ค์ผ๋ก ํ์ ๋ ์ ๋ต ์ด๋ฏธ์ง๋ฅผ ๋ง์ถ๋ loss๋ฅผ ์๋ฏธํ๋ค.
Zero-shot prediction
ํ์ต๋ CLIP ๋ชจ๋ธ์ ๋ค์ํ downstream task์ ์ ์ฉ๋ ์ ์๋ค.
์๋ฅผ ๋ค์ด, ์ด๋ฏธ์ง ๋ถ๋ฅ task์์๋ ๋จผ์ ์ด๋ฏธ์ง ์ธ์ฝ๋๋ฅผ ํตํด ์
๋ ฅ ์ด๋ฏธ์ง์ representation์ ์ถ์ถํ๋ค. ์ด์ด์ ํ
์คํธ ์ธ์ฝ๋๋ฅผ ์ฌ์ฉํด A photo of a {label}๊ณผ ๊ฐ์ ํ๋กฌํํธ๋ฅผ ๊ฐ ํด๋์ค ๋ผ๋ฒจ์ ๋ํด ๋ณํํ์ฌ ํ
์คํธ representation์ ์ป๋๋ค.
์ดํ ์ด๋ฏธ์ง representation๊ณผ ๊ฐ ํ ์คํธ representation ๊ฐ์ cosine similarity๋ฅผ ๊ณ์ฐํ๊ณ , ๊ฐ์ฅ ์ ์ฌ๋๊ฐ ๋์ ๋ผ๋ฒจ์ ์ต์ข ์์ธก๊ฐ์ผ๋ก ์ ํํ๋ค. ์๋ฅผ ๋ค์ด, similarity๊ฐ โdogโ ๋ผ๋ฒจ ๋ฌธ์ฅ๊ณผ ๊ฐ์ฅ ๋๋ค๋ฉด, ํด๋น ์ด๋ฏธ์ง๋ dog๋ก ๋ถ๋ฅ๋๋ค.
๋ชจ๋ธ์ด โdogโ, โcatโ, โplaneโ๊ณผ ๊ฐ์ ํด๋์ค์ ๋ํด fine-tuning์ ํ์ง ์๊ณ , ํ ์คํธ ์ค๋ช ๋ง์ผ๋ก ์๋ก์ด ๋ผ๋ฒจ์ ์ ์ํ๊ณ ์์ธกํ ์ ์๊ธฐ ๋๋ฌธ์ zero-shot prediction์ด๋ผ๊ณ ํ๋ค.
Prompt engineering
CLIP์์๋ ๋จ์ํ cat์ด๋ผ๋ ๋จ์ด๋ฅผ ๋ฐ๋ก ํ
์คํธ ์ธ์ฝ๋์ ๋ฃ์ง ์๊ณ , A photo of cat๊ณผ ๊ฐ์ ๋ฌธ์ฅ ํํ์ ํ๋กฌํํธ๋ก ๋ณํํด ํ
์คํธ ์ธ์ฝ๋์ ์
๋ ฅํ๋ค.
์ด๋ ๊ฒ ํ๋ ์ด์ ๋ ๋ค์์ฑ์ด ์๋ ๋จ์ด๊ฐ ์๊ณ , ์ค์ ์ธํฐ๋ท์๋ ๋จ์ด๋ณด๋ค ๋ฌธ์ฅ ํํ๊ฐ ๋ ๋ง์ด ๋ฑ์ฅํ๊ธฐ ๋๋ฌธ์ด๋ค.
๋ํ ํ๋กฌํํธ ๋ฌธ์ฅ์ ์ปค์คํฐ๋ง์ด์งํ ์ ์๋ค. ์๋ฅผ ๋ค์ด, pet ๋ฐ์ดํฐ์
์ ๋ง์ถ์ด A photo of a cat, a type of pet๊ณผ ๊ฐ์ด ๋ฌธ์ฅ์ ํ์ฅํ๋ฉด ์ ํ๋๊ฐ ํฅ์๋๋ ๊ฒฐ๊ณผ๋ฅผ ์ป์ ์ ์๋ค.


