← notes

Agentic Search with LLM router @Spotify

2026-02-22 · recsys, search

You Say Search, I Say Recs: A Scalable Agentic Approach to Query Understanding and Exploratory Search at Spotify (2025)

LLM을 query understanding에만 집중시키고 personalization을 downstream tool에 넘기는 책임 분리로 scalability를 확보한 Spotify 검색 시스템 - p75 latency ~450ms로 수백만 유저에게 배포됨

  • user features를 LLM에 넣지 않아 caching hit rate 극대화. LLM은 intent 분류와 query 파라미터화에만 집중
  • Post-training(RFT)으로 teacher LLM 대비 latency 60%, cost 99% 감소
  • Pre-fusion route bundle + 선택적 sub-agent 호출로 유연성보다 scalability 우선하는 현실적인 설계

Background


Method

Parallel Fusion Router (PFR)

두 가지 동작 모드

멀티 인텐트 처리

Caching 전략

Query Understanding (LLM의 부산물)

Downstream Tools 구성

Post-training

전통 LLM 프롬프팅 방식은 높은 latency/cost 문제가 있음 → 작은 LLM을 fine-tuning해 효율화

프로세스

  1. Training data: real + synthetic 예시 혼합 (evaluation set과 분리)
  2. Teacher LLM: 강력한 LLM을 프롬프팅해 각 예시의 correct routing 결정 생성
    • high temperature로 샘플링 → 다양한 후보 확보
  3. RFT (Rejection sampling Fine-Tuning):
    • Reward model로 낮은 품질의 샘플 필터링
    • Reward model = LLM-as-a-judge (PASS/NO PASS 평가)
    • PASS 받은 응답만 fine-tuning 데이터로 사용
  4. Fine-tuned 소형 LLM router: 더 큰 teacher LLM의 성능을 smaller 모델로 재현

성능 비교 (Teacher LLM 대비 offline 상대적 개선)


Experiments

평가 방법

Offline: LLM-as-a-judge

Online

결과

💭