← notes

라벨이 불균형한 데이터에서 오버샘플링의 효과

2024-11-10 · ai-ml

Is Augmentation Effective in Improving Prediction in Imbalanced Datasets? (2024)

Intro

정리

- $P(Y=1)$ : 원래 데이터셋의 불균형 정도, 즉 $P(Y=1)=0.1$인 경우 전체 데이터 중 1이 10%라는 뜻 - 이 그림을 보면 $P_a$ 에 대해 0.5라는 임계값을 정하는 것은 사실상 원본 데이터를 가지고 학습한 $P$에 대해 $c$를 $P(Y=1)$로 정한 것과 맵핑되므로 괜히 오버샘플링을 해서 리소스를 더 쓸 게 아니라 그냥 애초에 decision threshold를 0.1로 하라는 것

실험

성능

ba(g)=(P(g(X)=1Y=1)+P(g(X)=0Y=0))/2ba(g) = (P(g(X)=1 \vert Y=1) + P(g(X)=0 \vert Y=0))/2 pg=ba(ga)ba(gb)ba(gb)pg = \frac{ba(g_a)-ba(g_b)}{ba(g_b)}

x,y관계를 잘 추정하는지