[3차원 기하학] 2D ↔ 3D 좌표계 변환
카메라 행렬을 통해 3D 월드 좌표와 2D 이미지 픽셀 좌표 간의 변환이 가능하다. [출처] 각 좌표의 notation은 아래와 같이 표기하겠다. $\mathbf{P}_w=(X_w,Y_w,Z_w)$ : 3D 월드 좌표 $\mathbf{P}_c=(X_c,Y_c,Z_c)$ : 3D 카메라 좌표 $\mathbf{p}_n=(x,y)$ : ...
카메라 행렬을 통해 3D 월드 좌표와 2D 이미지 픽셀 좌표 간의 변환이 가능하다. [출처] 각 좌표의 notation은 아래와 같이 표기하겠다. $\mathbf{P}_w=(X_w,Y_w,Z_w)$ : 3D 월드 좌표 $\mathbf{P}_c=(X_c,Y_c,Z_c)$ : 3D 카메라 좌표 $\mathbf{p}_n=(x,y)$ : ...
핀홀 카메라 모델 핀홀 카메라는 렌즈 없이 아주 작은 구멍 (핀홀)을 통해 빛을 받아들여 이미지를 맺는 가장 단순한 형태의 카메라이다. 이러한 원리 때문에 이미지 센서 (필름)에는 상하좌우가 뒤집힌 상이 맺힌다. [출처] 실제 카메라에서는 렌즈를 통과한 빛이 렌즈 뒤쪽에 있는 이미지 센서에 맺히고, 이 센서의 표면이 물리적인 이미지 평면 역할을...
3D 데이터 표현 방식 (3D Data Representation) 3D 데이터를 표현하는 방식을 분류하는 기준에는 크게 2가지가 있다. 명시적 (Explicit) 표현 vs 암시적 (Implicit) 표현 명시적 표현: 물체의 표면이나 부피를 점, 선, 면 등의 기하학적 요소로 직접적으로 정의한다. 암시적 표현: 물체의 표면을 직접 정...
📄 관련 논문: [ICLR 2021] Score-Based Generative Modeling through Stochastic Differential Equations 초기 디퓨전 모델인 NCSN과 DDPM은 각자의 방식으로 큰 성공을 거두었지만, 두 모델 모두 노이즈를 주입할 때 $t=1,2,\dots, T$ 처럼 이산 시간 (Discrete-t...
PEFT (Parameter-Efficient Fine-Tuning) GPT-3, LLaMA, Stable Diffusion과 같은 수십억 개 이상의 파라미터를 가진 사전 학습 모델을 Full Fine-Tuning하려면, 막대한 GPU 메모리와 긴 학습 시간이 필요하다. 또한, 이미 학습된 모델을 새로운 task에 맞춰 파인튜닝하는 과정에서 이전...
지식 증류 (Knowledge Distillation) 지식 증류는 크고 복잡한 Teacher Model이 정답을 찾아가는 과정과 방법을 작은 Student Model에게 전달하는 기법이다. 여기서 3가지 용어가 나온다. Hard Label: 실제 정답 라벨 ex) $[0,0,1]$ Soft Label: Teacher 모델이 예측한 확률...
Guidance란? 디퓨전 모델은 완전한 노이즈 상태에서 출발하여 점진적으로 노이즈를 제거함으로써, 거친 (coarse) 구조에서 정교한 (fine) 세부 묘사까지 순차적으로 복원해 내는 방식으로 데이터를 생성한다. 가이던스 (Guidance)는 이러한 생성 모델이 텍스트 프롬프트나 이미지와 같은 사용자의 조건을 반영하여 원하는 샘플을 얻어내는 제...
📄 관련 논문: [NeurIPS 2019] Generative Modeling by Estimating Gradients of the Data Distribution 📄 관련 논문: [ICLR 2021] Score-Based Generative Modeling through Stochastic Differential Equations Score F...
📄 관련 논문: [ICLR 2021] Denoising Diffusion Implicit Models 헷갈릴 수 있는 용어와 수식에 대해서 먼저 정리하겠다. 생성 모델 논문에서 $q$로 표기한 분포는 수학적으로 계산한 진짜 확률 분포 (Ground Truth), $p$로 표기한 분포는 신경망이 예측한 확률 분포를 의미한다. Forw...