← notes

Contrastive Learning이 Mean Pooling에 강한 이유

2026-05-09 · contrastive-learning, representation-learning

Why Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings (2026)

Mean pooling은 1차 통계(평균)만 보존하여 2차 통계(공분산)를 버리는 구조적 한계가 있는데, 실제로 contrastive fine-tuned 모델은 이 collapse에 강건하다는 것을 이론/실험으로 입증

  • SOCM(Second-Order Collapse by Mean pooling) 메트릭 제안: 평균 SOCM이 낮을수록 MTEB 성능이 높음 (Spearman ρ = -0.678)
  • Fine-tuning 후 토큰 임베딩이 텍스트 내에서 concentrate되어 2차 통계 차이(dΣ)가 자연스럽게 줄어든다는 메커니즘 규명

![[assets/Contrastive Learning이 Mean Pooling에 강한 이유/overview.png|310]]

Background

Method

SOCM (Second-Order Collapse by Mean pooling) 메트릭

SOCM(dμ,dΣ):=(1dμ)dΣ\text{SOCM}(d_\mu, d_\Sigma) := (1 - d_\mu) d_\Sigma dμ:=μ(X1)μ(X2)22/4d_\mu := \|\mu(X_1) - \mu(X_2)\|_2^2 / 4 dΣ:=tr(Σ(X1)+Σ(X2))2(Σ(X1)1/2Σ(X2)Σ(X1)1/2)1/24d_\Sigma := \frac{\text{tr}(\Sigma(X_1) + \Sigma(X_2)) - 2\left(\Sigma(X_1)^{1/2}\Sigma(X_2)\Sigma(X_1)^{1/2}\right)^{1/2}}{4}

Concentration Theory

Experiments

실험 설정

Fine-tuned 모델의 SOCM 강건성

![[assets/Contrastive Learning이 Mean Pooling에 강한 이유/result.png|299]]

Concentration 메커니즘 검증

SOCM과 Downstream 성능 상관관계