Post

[๋…ผ๋ฌธ๋ฆฌ๋ทฐ] CLIP: Learning Transferable Visual Models From Natural Language Supervision

๐Ÿ“ ICML 2021

[๋…ผ๋ฌธ๋ฆฌ๋ทฐ] CLIP: Learning Transferable Visual Models From Natural Language Supervision

[Paper]

Introduction

NLP์—์„œ์˜ ๋ณ€ํ™”

๊ณผ๊ฑฐ์—๋Š” ๊ธฐ๊ณ„๊ฐ€ ์–ธ์–ด๋ฅผ ๋ฐฐ์šฐ๊ธฐ ์œ„ํ•ด ๋ฒˆ์—ญ, ์งˆ๋ฌธ-๋‹ต๋ณ€ ๋“ฑ task๋งˆ๋‹ค ๋ณ„๋„์˜ ๋ผ๋ฒจ๋ง๋œ ๋ฐ์ด์…‹์„ ๋งŒ๋“ค์–ด์•ผ ํ–ˆ๋‹ค.

๊ทธ๋Ÿฐ๋ฐ ์ตœ๊ทผ์—๋Š” ์›น์— ์กด์žฌํ•˜๋Š” ์›์‹œ ํ…์ŠคํŠธ (raw text)๋งŒ์œผ๋กœ๋„ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋Š” ๋ฐฉ๋ฒ•์ด ๋ฐœ์ „ํ–ˆ๋‹ค. ์ด ๋ฐฉ์‹์—์„œ๋Š” ๋”์ด์ƒ ๋ณ„๋„์˜ ๋ผ๋ฒจ๋ง์ด ํ•„์š”ํ•˜์ง€ ์•Š๋‹ค.

์—ฌ๊ธฐ์— โ€˜์ž…๋ ฅ๋„ ํ…์ŠคํŠธ, ์ถœ๋ ฅ๋„ ํ…์ŠคํŠธ (text-to-text)โ€™๋ผ๋Š” ๊ทœ์น™์„ ์ ์šฉํ•˜๋ฉด์„œ, ๋ชจ๋“  task๋ฅผ ์•„๋ž˜์™€ ๊ฐ™์ด ๋‹จ์ˆœํ•œ ํ…์ŠคํŠธ ๋ณ€ํ™˜ ๋ฌธ์ œ๋กœ ํ†ต์ผํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋˜์—ˆ๋‹ค.

  • ์˜์–ด ๋ฌธ์žฅ์„ ๋„ฃ์œผ๋ฉด ๋ฒˆ์—ญ๋œ ํ•œ๊ตญ์–ด๋„ ํ…์ŠคํŠธ
  • ์งˆ๋ฌธ์„ ๋„ฃ์œผ๋ฉด ๋‹ต๋ณ€๋„ ํ…์ŠคํŠธ

์ด๋Ÿฌํ•œ ์•„์ด๋””์–ด๋ฅผ ๊ทน๋‹จ์ ์œผ๋กœ ํ™•์žฅํ•œ ๋ชจ๋ธ์ด GPT-3์ด๋‹ค. GPT-3๋Š” ๋ฒˆ์—ญ์„ ์œ„ํ•œ ๋ณ„๋„์˜ ๋ฐ์ดํ„ฐ๋กœ ํ•™์Šตํ•˜์ง€ ์•Š๊ณ , ๋‹จ์ง€ ์ˆ˜๋งŽ์€ ์›น ํ…์ŠคํŠธ๋งŒ ํ•™์Šตํ–ˆ์„ ๋ฟ์ธ๋ฐ ์š”์ฒญ๋งŒ ํ•˜๋ฉด ๋‹ค์–‘ํ•œ ์ž‘์—…์„ ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ์—ˆ๋‹ค.

์ฆ‰, ์ถ”๊ฐ€ ํ•™์Šต ์—†์ด ์ƒˆ๋กœ์šด task๋ฅผ ์ˆ˜ํ–‰ํ•  ์ˆ˜ ์žˆ๋Š” zero-shot transfer ๋Šฅ๋ ฅ์ด ์ƒ๊ธด ๊ฒƒ์ด๋‹ค.

Computer Vision์—์„œ์˜ ์ ์šฉ

์ปดํ“จํ„ฐ ๋น„์ „ ๋ถ„์•ผ์—์„œ๋Š” ๋Œ€๋ถ€๋ถ„์˜ ๋ชจ๋ธ์ด ImageNet๊ณผ ๊ฐ™์ด ์‚ฌ์ „์— ์ •ํ•ด์ง„ ๋ผ๋ฒจ์ด ๋ถ™์€ ๋ฐ์ดํ„ฐ์…‹์œผ๋กœ pre-training๋˜๋Š” ๊ฒƒ์ด ์ผ๋ฐ˜์ ์ด์—ˆ๋‹ค.

์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ์ƒˆ๋กœ์šด ๊ฐœ๋…์ด๋‚˜ task๋ฅผ ๋‹ค๋ฃจ๊ธฐ ์œ„ํ•ด, ์ถ”๊ฐ€ ๋ผ๋ฒจ๋ง ๋ฐ์ดํ„ฐ๋ฅผ ๋ชจ์•„ ์ถ”๊ฐ€์ ์ธ ํ•™์Šต์ด ํ•„์š”ํ•˜๋‹ค๋Š” ํ•œ๊ณ„๊ฐ€ ์žˆ์—ˆ๋‹ค.

์ด๋•Œ ์ž์—ฐ์–ด๋ฅผ supervision์œผ๋กœ ์‚ฌ์šฉํ•˜๋ฉด ์ปดํ“จํ„ฐ ๋น„์ „์—์„œ๋„ ๋ŒํŒŒ๊ตฌ๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ์ง€ ์•Š์„๊นŒ ํ•˜๋Š” ์˜๋ฌธ์ด ์ œ๊ธฐ๋˜์—ˆ๋‹ค.

์‚ฌ์‹ค ๊ณผ๊ฑฐ์—๋„ image-text ํ•™์Šต์— ๋Œ€ํ•œ ์‹œ๋„๊ฐ€ ์กด์žฌํ–ˆ์—ˆ์ง€๋งŒ, ๋Œ€๋ถ€๋ถ„ ์„ฑ๋Šฅ์ด ๋‚ฎ๊ณ  softmax classifier ๊ธฐ๋ฐ˜์˜ ๊ตฌ์กฐ๋ฅผ ์‚ฌ์šฉํ•ด ๊ณ ์ •๋œ ํด๋ž˜์Šค ์ง‘ํ•ฉ ๋‚ด์—์„œ๋งŒ ์˜ˆ์ธก์ด ๊ฐ€๋Šฅํ•˜์˜€๋‹ค.

Natural language supervision์„ ๋น„์ „์— ์ ์šฉํ•˜๊ธฐ ์œ„ํ•ด ์ธํ„ฐ๋„ท์—์„œ ์ˆ˜์ง‘ํ•œ 4์–ต ์Œ์˜ image-text ๋ฐ์ดํ„ฐ์…‹์„ ๊ตฌ์ถ•ํ–ˆ๊ณ , contrastive learning objective๋ฅผ ํ†ตํ•ด ์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ์˜ ์˜ฌ๋ฐ”๋ฅธ ์ง์„ ๋งž์ถ”๋Š” ๋ฐฉ์‹์œผ๋กœ ๋ชจ๋ธ์„ ํ•™์Šต์‹œ์ผฐ๋‹ค.

์ด๋ฅผ ํ†ตํ•ด CLIP์€ ๋ณ„๋„์˜ fine-tuning ์—†์ด๋„ ๋‹ค์–‘ํ•œ ์ปดํ“จํ„ฐ ๋น„์ „ task์—์„œ zero-shot transfer๊ฐ€ ๊ฐ€๋Šฅํ•˜๋‹ค๋Š” ๊ฒƒ์„ ๋ณด์—ฌ์ฃผ์—ˆ๋‹ค.

Methods

Contrastive pre-training

fig1

$N$๊ฐœ์˜ ์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ ์Œ์„ ๊ฐ๊ฐ ์ธ์ฝ”๋”์— ํ†ต๊ณผ์‹œ์ผœ image representation $I_n$์™€ text representation $T_n$๋ฅผ ์–ป๋Š”๋‹ค. $n$์€ ์ธ๋ฑ์Šค ๋ฒˆํ˜ธ๋ฅผ ์˜๋ฏธํ•œ๋‹ค.

ํ•™์Šต ๊ณผ์ •์—์„œ๋Š” $N\times N$๊ฐœ์˜ pair ์ค‘์—์„œ $N$๊ฐœ์˜ positive pair์— ๋Œ€ํ•ด์„œ๋Š” cosine similarity๊ฐ€ ๋†’์•„์ง€๋„๋ก, ๋‚˜๋จธ์ง€ $N^2-N$๊ฐœ์˜ negative pair์— ๋Œ€ํ•ด์„œ๋Š” cosine similarity๊ฐ€ ๋‚ฎ์•„์ง€๋„๋ก ํ•™์Šต์„ ์‹œํ‚จ๋‹ค.

์ด๋ ‡๊ฒŒ ๊ณ„์‚ฐ๋œ similarity score๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ cross entropy loss๋ฅผ ์‚ฌ์šฉํ•ด ์ด๋ฏธ์ง€ ์ธ์ฝ”๋”์™€ ํ…์ŠคํŠธ ์ธ์ฝ”๋”๋ฅผ ๋™์‹œ์— ํ•™์Šต์‹œํ‚จ๋‹ค.

๋ณธ ์—ฐ๊ตฌ์—์„œ๋Š” ์ด๋ฏธ์ง€ ์ธ์ฝ”๋”๋กœ ResNet-50, Vision Transformer๋ฅผ, ํ…์ŠคํŠธ ์ธ์ฝ”๋”๋กœ Transformer๋ฅผ ์ด์šฉํ–ˆ๋‹ค๊ณ  ํ•œ๋‹ค.

์•„๋ž˜๋Š” pseudo code์ด๋‹ค.

fig2

์œ„์—์„œ I_f์™€ T_f๋Š” ์ธ์ฝ”๋”๋ฅผ ๊ฑฐ์ณ ์–ป์€ feature representation์ด๋ฉฐ, I_e์™€ T_e๋Š” ์ถ”๊ฐ€์ ์ธ linear projection์„ ๊ฑฐ์ณ ์–ป์€ multimodal embedding์„ ์˜๋ฏธํ•œ๋‹ค.

  • Feature representation: ์ธ์ฝ”๋”๊ฐ€ ์ถ”์ถœํ•œ ๊ฐ๊ฐ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ์˜ feature ํ‘œํ˜„
  • Multimodal embedding: ๋‘ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๊ฐ€ projection์„ ๊ฑฐ์นœ ๋’ค ๊ณตํ†ต๋œ ๊ณต๊ฐ„์— ๋†“์ธ ๋ฒกํ„ฐ (์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ๊ฐ€ ๊ฐ™์€ ๊ณต๊ฐ„์— ๋†“์—ฌ์ง)

loss_i๋Š” ์ด๋ฏธ์ง€๋ฅผ ๊ธฐ์ค€์œผ๋กœ ํ–ˆ์„ ๋•Œ ์ •๋‹ต ํ…์ŠคํŠธ๋ฅผ ๋งž์ถ”๋Š” loss, loss_t๋Š” ํ…์ŠคํŠธ๋ฅผ ๊ธฐ์ค€์œผ๋กœ ํ–ˆ์„ ๋•Œ ์ •๋‹ต ์ด๋ฏธ์ง€๋ฅผ ๋งž์ถ”๋Š” loss๋ฅผ ์˜๋ฏธํ•œ๋‹ค.

Zero-shot prediction

ํ•™์Šต๋œ CLIP ๋ชจ๋ธ์€ ๋‹ค์–‘ํ•œ downstream task์— ์ ์šฉ๋  ์ˆ˜ ์žˆ๋‹ค.

fig3

์˜ˆ๋ฅผ ๋“ค์–ด, ์ด๋ฏธ์ง€ ๋ถ„๋ฅ˜ task์—์„œ๋Š” ๋จผ์ € ์ด๋ฏธ์ง€ ์ธ์ฝ”๋”๋ฅผ ํ†ตํ•ด ์ž…๋ ฅ ์ด๋ฏธ์ง€์˜ representation์„ ์ถ”์ถœํ•œ๋‹ค. ์ด์–ด์„œ ํ…์ŠคํŠธ ์ธ์ฝ”๋”๋ฅผ ์‚ฌ์šฉํ•ด A photo of a {label}๊ณผ ๊ฐ™์€ ํ”„๋กฌํ”„ํŠธ๋ฅผ ๊ฐ ํด๋ž˜์Šค ๋ผ๋ฒจ์— ๋Œ€ํ•ด ๋ณ€ํ™˜ํ•˜์—ฌ ํ…์ŠคํŠธ representation์„ ์–ป๋Š”๋‹ค.

์ดํ›„ ์ด๋ฏธ์ง€ representation๊ณผ ๊ฐ ํ…์ŠคํŠธ representation ๊ฐ„์˜ cosine similarity๋ฅผ ๊ณ„์‚ฐํ•˜๊ณ , ๊ฐ€์žฅ ์œ ์‚ฌ๋„๊ฐ€ ๋†’์€ ๋ผ๋ฒจ์„ ์ตœ์ข… ์˜ˆ์ธก๊ฐ’์œผ๋กœ ์„ ํƒํ•œ๋‹ค. ์˜ˆ๋ฅผ ๋“ค์–ด, similarity๊ฐ€ โ€˜dogโ€™ ๋ผ๋ฒจ ๋ฌธ์žฅ๊ณผ ๊ฐ€์žฅ ๋†’๋‹ค๋ฉด, ํ•ด๋‹น ์ด๋ฏธ์ง€๋Š” dog๋กœ ๋ถ„๋ฅ˜๋œ๋‹ค.

๋ชจ๋ธ์ด โ€˜dogโ€™, โ€˜catโ€™, โ€˜planeโ€™๊ณผ ๊ฐ™์€ ํด๋ž˜์Šค์— ๋Œ€ํ•ด fine-tuning์„ ํ•˜์ง€ ์•Š๊ณ , ํ…์ŠคํŠธ ์„ค๋ช…๋งŒ์œผ๋กœ ์ƒˆ๋กœ์šด ๋ผ๋ฒจ์„ ์ •์˜ํ•˜๊ณ  ์˜ˆ์ธกํ•  ์ˆ˜ ์žˆ๊ธฐ ๋•Œ๋ฌธ์— zero-shot prediction์ด๋ผ๊ณ  ํ•œ๋‹ค.

Prompt engineering

CLIP์—์„œ๋Š” ๋‹จ์ˆœํžˆ cat์ด๋ผ๋Š” ๋‹จ์–ด๋ฅผ ๋ฐ”๋กœ ํ…์ŠคํŠธ ์ธ์ฝ”๋”์— ๋„ฃ์ง€ ์•Š๊ณ , A photo of cat๊ณผ ๊ฐ™์€ ๋ฌธ์žฅ ํ˜•ํƒœ์˜ ํ”„๋กฌํ”„ํŠธ๋กœ ๋ณ€ํ™˜ํ•ด ํ…์ŠคํŠธ ์ธ์ฝ”๋”์— ์ž…๋ ฅํ•œ๋‹ค.

์ด๋ ‡๊ฒŒ ํ•˜๋Š” ์ด์œ ๋Š” ๋‹ค์˜์„ฑ์ด ์žˆ๋Š” ๋‹จ์–ด๊ฐ€ ์žˆ๊ณ , ์‹ค์ œ ์ธํ„ฐ๋„ท์—๋Š” ๋‹จ์–ด๋ณด๋‹ค ๋ฌธ์žฅ ํ˜•ํƒœ๊ฐ€ ๋” ๋งŽ์ด ๋“ฑ์žฅํ•˜๊ธฐ ๋•Œ๋ฌธ์ด๋‹ค.

๋˜ํ•œ ํ”„๋กฌํ”„ํŠธ ๋ฌธ์žฅ์€ ์ปค์Šคํ„ฐ๋งˆ์ด์ง•ํ•  ์ˆ˜ ์žˆ๋‹ค. ์˜ˆ๋ฅผ ๋“ค์–ด, pet ๋ฐ์ดํ„ฐ์…‹์— ๋งž์ถ”์–ด A photo of a cat, a type of pet๊ณผ ๊ฐ™์ด ๋ฌธ์žฅ์„ ํ™•์žฅํ•˜๋ฉด ์ •ํ™•๋„๊ฐ€ ํ–ฅ์ƒ๋˜๋Š” ๊ฒฐ๊ณผ๋ฅผ ์–ป์„ ์ˆ˜ ์žˆ๋‹ค.

This post is licensed under CC BY 4.0 by the author.