Sequential Recommendation에서 SASRec, BERT4Rec 같은 Transformer 계열 모델은 사실상 표준 베이스라인으로 자리 잡았다. 그런데 실무적 관점에서 이 계열을 다루다 보면, 모델 구조만큼이나 자주 부딪히는 문제가 있다. 바로 아이템 카탈로그 규모가 커질수록 학습이 어려워진다는 점이다.아이템이 수십만~수백만 단위로 늘어나면, 학습 시점에 모든 아이템에 대한 점수를 계산하는 full softmax 방식은 메모리와 연산량 때문에 사실상 불가능해진다. 결국 대부분의 모델은 negative sampling에 의존한다. 즉, 정답(positive) 1개에 대해 일부 negative만 뽑아서 학습하는 방식이다.이 논문은 여기서 한 걸음 더 들어간다.negative sampling을..