[머신러닝] Bagging
K-fold Cross Validation 학습 데이터셋을 K개의 부분집합 (fold라고 부름)으로 나눈다. 학습을 K번 반복하면서 매번 1개의 fold는 검증용으로, 나머지 K-1개의 fold는 학습용으로 사용한다. 이후 최종 성능은 K번의 결과를 평균하여 평가한다. [출처] 데이터의 낭비가 없지만, 각 학습 세트가 항상 K-2개의 fold...
K-fold Cross Validation 학습 데이터셋을 K개의 부분집합 (fold라고 부름)으로 나눈다. 학습을 K번 반복하면서 매번 1개의 fold는 검증용으로, 나머지 K-1개의 fold는 학습용으로 사용한다. 이후 최종 성능은 K번의 결과를 평균하여 평가한다. [출처] 데이터의 낭비가 없지만, 각 학습 세트가 항상 K-2개의 fold...
데이터 생성 과정 어떤 $x$를 입력했을 때 완벽하게 $y$를 출력하는 이상적인 시스템 $F^*(x)$가 있다고 가정하더라도, 현실 세계에서 관측되는 $(x,y)$ 쌍에는 사람이 통제할 수 없는 노이즈 $\epsilon$이 포함된다. [y=F^*(x)+\epsilon,\epsilon\sim\mathcal{N}(0,\sigma^2)] $F^*...
Decision Tree 데이터의 각 특징 (feature)은 서로 다른 정보를 담고 있으며, Decision Tree는 이 특징을 기준으로 순차적으로 질문을 던지면서 최종 예측을 수행하는 알고리즘이다. 이는 일종의 스무고개로 볼 수 있다. 예를 들어, 입력 벡터 $\mathbf{x}\in\mathbb{R}^3$이 ‘날씨’, ‘습도’, ‘바람’의...
커널 트릭 (Kernel Trick) SVM은 기본적으로 데이터를 선으로 분류하는 선형 분류기다. 하지만 현실의 대부분의 데이터는 선으로 깔끔하게 나눌 수 없는 경우가 많다. 아래 그림처럼, 저차원 공간에서는 선형 분리가 안되는 데이터일지라도 고차원 공간에서는 선형 분리가 가능할 수도 있다. [출처] 이를 위해 SVM은 입력 데이터를 더 높은...
Support Vector Machine 결정 경계 (Decision Boundary)와 가장 가까운 데이터 샘플을 Support Vector라고 부르고, 각 클래스의 Support Vector 사이의 거리를 마진 (margin)이라고 한다. SVM은 이 마진을 최대화할 수 있는 결정 경계를 찾는 방법이다. [출처] 이전 포스터에서 설명했듯이...
로지스틱 회귀 (Logistic Regression) 로지스틱 회귀는 이름에 회귀가 들어있지만 실제로는 분류 (Classification) 문제를 푸는 모델이다. 즉, 어떤 입력 $\mathbf{x}$가 주어졌을 때, 그 샘플이 특정 클래스에 속할 확률을 예측하는 모델이다. 회귀와 분류의 차이는 아래와 같다. 회귀: 주택 가격, 기온처럼 ...
선형 회귀 (Linear Regression) 선형 회귀는 입력 변수 $x$와 출력 변수 $y$ 사이의 관계를 직선 형태의 수학적 모델로 근사하는 방법이다. 즉, 주어진 데이터에 가장 잘 맞는 직선 또는 초평면 (hyperplane)을 찾는 것이 목표이다. 단순 선형 회귀 (Simple Linear Regression) 입력 변수가 1개인 경우...
데이터 행렬 (Data Matrix) $N$개의 데이터 샘플이 있고, 각 샘플이 $D$차원 벡터라고 하자. 하나의 샘플을 아래와 같이 열벡터로 표현할 수 있다. [\mathbf{x}^{(i)}=\begin{bmatrix}x_1^{(i)}\\vdots\x_D^{(i)}\end{bmatrix}\in\mathbb{R}^D] $N$개의 샘플로 이루어진...
📝 CVPR 2023
📝 CVPR 2023