← notes

검색과 추천을 동시에 최적화하는 Semantic ID 전략

2026-01-18 · recsys, generative-recsys

Semantic IDs for Joint Generative Search and Recommendation (2025)

Joint Search&Recommendation 생성 모델에서 어떤 Semantic ID 구성 전략이 두 태스크를 동시에 잘 처리하는지 비교함

  • 기존 task-specific Semantic ID는 단일 태스크에서 최강이지만, 상대 태스크 성능을 최대 60% 이상 하락시킴
  • Multi-task bi-encoder로 생성한 Semantic ID가 두 태스크 모두에서 경쟁력 있는 균형을 달성
  • RQ-KMeans 토크나이저가 학습 기반 RQ-VAE보다 일관되게 우수하여 실용적이고 안정적인 선택지임

Background

Method

실험 세팅

Semantic ID 구성 전략

Task-specific 접근 (베이스라인)

  1. Search-based: all-mpnet-base-v2 기반 bi-encoder를 검색 데이터 DSD_S로 fine-tuning
    • In-batch random negatives, MultipleNegativesRankingLoss
    • 임베딩 차원: 386
  2. Rec-based: ENMF (Efficient Neural Matrix Factorization) 협업 필터링 모델
    • 임베딩 차원: 256

Cross-task 접근

Experiments

주요 결과

![[assets/검색과 추천을 동시에 최적화하는 Semantic ID 전략/result.png|375]]

Tokenization Method Ablation


💭