Source-linked AI summary

Are We Really Making Much Progress? A Worrying Analysis of Recent Neural Recommendation Approaches

Maurizio Ferrari Dacrema, Paolo Cremonesi, Dietmar Jannach

arXiv:1907.06902v3cs.IRcs.LGcs.NE

TL;DR

출판된 비교가 취약한 baseline에 의존하고 재현하기 어려울 수 있어 neural recommendation의 진척을 판단하기 어렵다. 이 논문은 최근 접근법을 체계적으로 평가한 결과, 재현된 방법 대부분이 더 단순한 대안을 일관되게 능가하지 못함을 발견했으며, 더욱 엄격한 평가 관행의 필요성을 제기한다.

  • 문제

    취약하거나 불완전한 baseline과 제한적인 재현성으로 인해 다양한 적용 시나리오에서 어떤 recommendation method가 가장 우수한지 판단하기 어렵다.

  • 방법

    이 연구는 네 개 학회의 2015–2018년 논문을 체계적으로 검토하고, 이용 가능한 결과를 재현하며, 추가적인 nearest-neighbor 및 graph-based baseline으로 실험을 다시 수행한다.

  • 결과

    조사한 7개 deep learning technique 중 6개는 평가된 사례 전반에서 단순하고 fine-tuned된 baseline method를 일관되게 능가하지 못했다.

  • 시사점 및 한계

    이 결과는 neural recommendation에서 algorithmic contribution을 평가할 때 더욱 엄격한 평가와 더 나은 연구 관행이 필요함을 보여준다.

  • 시사점 및 한계

    Recommendation method의 hyper-parameter optimization은 작은 dataset에서도 며칠 또는 몇 주가 걸릴 수 있어 재현성과 확장성을 어렵게 만든다.

Abstract

from arXiv · show

Deep learning techniques have become the method of choice for researchers working on algorithmic aspects of recommender systems. With the strongly increased interest in machine learning in general, it has, as a result, become difficult to keep track of what represents the state-of-the-art at the moment, e.g., for top-n recommendation tasks. At the same time, several recent publications point out problems in today's research practice in applied machine learning, e.g., in terms of the reproducibility of the results or the choice of the baselines when proposing new models. In this work, we report the results of a systematic analysis of algorithmic proposals for top-n recommendation tasks. Specifically, we considered 18 algorithms that were presented at top-level research conferences in the last years. Only 7 of them could be reproduced with reasonable effort. For these methods, it however turned out that 6 of them can often be outperformed with comparably simple heuristic methods, e.g., based on nearest-neighbor or graph-based techniques. The remaining one clearly outperformed the baselines but did not consistently outperform a well-tuned non-neural linear ranking method. Overall, our work sheds light on a number of potential problems in today's machine learning scholarship and calls for improved scientific practices in this area. Source code of our experiments and full results are available at: https://github.com/MaurizioFD/RecSys2019_DeepLearning_Evaluation.

1 서론

이 연구는 최근 딥러닝 추천 연구가 재현 가능하며 단순하고 잘 조정된 baseline보다 top-n 추천 성능을 실제로 향상시키는지 검토한다. 18편의 논문 가운데 합리적인 노력으로 재현할 수 있었던 것은 7편뿐이었고, 그 7편 중 6편은 단순한 휴리스틱 방법을 일관되게 능가하지 못했다.

  • 동기: 서론은 신뢰할 수 있는 비교를 가로막는 요인으로 취약하거나 충분히 조정되지 않은 baseline, 일관되지 않은 평가 관행, 불완전한 code 또는 data 공유를 지적한다.dataset, protocol, metric, preprocessing의 차이와 preprocessing 또는 tuning code의 누락으로 논문 간 결론을 도출하기 어려울 수 있다.
  • 연구 질문: 이 연구는 두 가지 질문을 다룬다. 최근 recommendation 연구는 얼마나 재현 가능한가, 그리고 그 알고리즘은 비교적 단순하면서도 잘 조정된 baseline보다 성능을 향상시키는가.이 질문들은 top-n recommendation task를 위한 deep learning method의 체계적 분석을 뒷받침한다.
  • 비교 평가: 재현 가능한 7개 사례 중 6개에서 제안된 deep learning technique은 단순한 heuristic baseline을 일관되게 능가하지 못했다.추가 baseline에는 user- 및 item-based nearest neighbor와 두 가지 단순한 graph-based variant가 포함되었다.

2 연구 방법

이 연구는 KDD, SIGIR, WWW, RecSys에서 발표된 2015–2018년 deep-learning top-n recommendation 관련 장문 논문을 체계적으로 선별한 뒤, 엄격한 artifact 및 data 기준에 따라 재현을 시도했다. 재현된 방법은 원 논문의 절차와 함께 간단한 baseline을 사용해 평가했다.

  • 코퍼스 선정: 분석 대상은 KDD, SIGIR, WWW, RecSys에서 2015–2018년에 발표되었으며 top-n recommendation을 위한 deep-learning 기법을 제안한 장문 논문이었다.다른 recommendation task를 다룬 연구는 제외했으며, 평가는 Precision, Recall, MAP와 같은 classification 또는 ranking metric을 사용해야 했다.
  • 재현성: 재현은 주로 저자가 제공한 artifact에 의존했으며, 누락된 code나 data는 저자에게 문의하고 응답을 30일간 기다려 보완했다.Skeleton code, 전적으로 비공개인 기업 data, 공유되지 않은 웹 수집 data는 재현 불가능한 것으로 분류했다.
  • 재현 가능성: 분석한 연구 중 약 삼분의 일만 재현 가능했지만, 그 비율은 시간이 지나면서 증가했다. 표본이 너무 작아 학회 간 비교를 신뢰성 있게 수행하기는 어려웠다.재현 가능하다고 보려면 작동하거나 최소한의 수정만으로 사용할 수 있는 코드, 이용 가능한 데이터셋이 하나 이상, 그리고 접근 가능하거나 재구성할 수 있는 train-test split이 필요했다.
  • 측정 방법: 저자들은 원 구현을 refactor하여 training, hyper-parameter optimization, prediction을 baseline에도 적용되는 공통 evaluation procedure와 분리했다.이를 통해 각 논문의 원래 evaluation procedure를 보존하면서 baseline을 일관되게 비교할 수 있었다.
  • Baseline: baseline suite에는 TopPopular, ItemKNN, UserKNN, content-based 및 hybrid ItemKNN 변형, graph-based P3α algorithm 등 개념적으로 단순한 방법이 포함되었다.이 방법들은 popularity, neighborhood similarity, item feature, 결합된 rating과 feature, 또는 세 단계 user-item random walk를 사용한다.

3 베이스라인과의 검증

재현 가능한 추천 방법 전반에서 단순한 personalized, nearest-neighbor, graph-based, linear baseline은 neural 접근법과 자주 비슷한 성능을 보이거나 이를 능가했다. Mult-VAE는 가장 뚜렷한 예외로, 모든 configuration에서 테스트한 baseline을 일관되게 10–20% 능가했다.

  • CMN: CMN은 어떤 dataset에서도 최선의 방법이 아니었으며, personalized baseline이 이를 자주 능가했고, unpersonalized TopPopular는 Epinions에서 큰 차이로 승리했다.제공된 문헌에 따르면 CMN은 TopPopular를 제외하면 Epinions에서 다른 알고리즘보다 훨씬 우수했다.
  • MCRec: 올바르게 configuration한 ItemKNN은 MovieLens100k의 보고된 모든 성능 측정값에서 완전한 MCRec model을 능가했다.평가 절차는 재현했지만, 다른 dataset에서는 meta-path construction code를 사용할 수 없었기 때문에 세부 결과는 MovieLens로 제한되었다.
  • CVAE: CVAE는 길고 비교적 흔하지 않은 recommendation cutoff에서만 baseline보다 우수했으며, 짧은 list length에서는 pure collaborative-filtering method가 자주 승리했다.더 긴 list length에서는 dense CiteULike-a에서 hybrid ItemKNN-CFCBF가 최상의 결과를 보였고, sparse CiteULike-t에서도 유사한 결과가 나타났다.
  • CDL: CDL은 CVAE와 동일한 short-list 패턴을 보였다. 즉, 짧은 list length에서는 pure collaborative-filtering baseline이 hybrid method를 능가했지만, 네 가지 dataset configuration 중 두 가지에서는 100을 넘어서 CDL이 더 높은 Recall을 달성했다.비교는 dense CiteULike-a에서 재현된 실험을 사용해 수행되었다.
  • NeuMF와 SLIM: NeuMF는 Pinterest의 모든 metric에서 두 personalized baseline에 패했지만, MovieLens에서는 단순한 baseline을 명확히 능가했다. SLIM 역시 평가된 dataset에서 NeuMF를 능가했다.이러한 비교는 neural method의 성능이 dataset과 baseline configuration에 크게 의존했음을 보여준다.
  • Mult-VAE: Mult-VAE는 테스트한 모든 configuration에서 단순한 baseline을 일관되게 10%–20% 능가했으며, 복잡한 method가 큰 차이로 승리한 가장 뚜렷한 사례를 제공했다.SLIM 대비 개선 폭은 NDCG에서는 작았지만 Recall에서는 확실했다. 원래의 cutoff 선택이 일관되지 않았기 때문에 추가 cutoff 측정값도 보고되었다.

4 논의

신경망 추천에서의 진전은 여러 신경망 방법이 더 단순한 알고리즘을 능가하지 못하고, 취약한 baseline과 일관되지 않은 연구 관행이 비교를 흐리기 때문에 불분명하다는 결론이다. 실험 코드의 누락과 상당한 계산 요구량 때문에 재현성도 제한적이다.

  • 4 논의: 연구자들이 hyperparameter optimization, evaluation, preprocessing, baseline 구현을 위한 코드를 자주 누락하기 때문에 재현성은 여전히 낮다.핵심 알고리즘 코드는 이전보다 더 자주 공유되지만, 실험을 구성하는 주변 코드가 누락되어 보고된 결과를 검증하기 어렵다.
  • 4 논의: GPU를 사용할 수 있어도 작은 dataset에서 hyperparameter optimization에 며칠 또는 몇 주가 걸릴 수 있어 계산 복잡도 역시 재현성의 또 다른 장벽이 된다.논의에서는 수십만 개의 rating을 포함하는 현재 dataset과 훨씬 더 큰 Netflix Prize dataset을 대조한다.
  • 4 논의: 최근의 여러 신경망 추천 방법은 개념적으로나 계산적으로 더 단순한 알고리즘을 능가하지 못하므로, 이 분야가 이룬 진전은 불분명하다.이 결론은 제안된 방법 다수의 계산 복잡도에도 불구하고 성립한다.
  • 4 논의: 충분히 최적화되지 않았거나 문서화가 부족한 baseline, data-splitting 오류, evaluation protocol 오류는 유령 같은 진전에 대한 주장을 만들어낼 수 있다.논의에서는 복잡한 신경망 모델이 취약한 신경망 baseline과 비교될 수 있음을 지적한다. NCF [14]는 한 dataset에서 단순한 baseline에 의해 능가되며, 다른 dataset에서는 개선 폭이 작고 linear regression에도 능가된다.
  • 4 논의: 연구마다 dataset, evaluation protocol, metric, baseline이 크게 달라지고 20개가 넘는 공개 dataset이 사용되기 때문에 진전을 평가하기 어렵다.많은 dataset은 한두 편의 논문에만 등장하며, metric에는 Precision, Recall, Mean Average Precision, NDCG, MRR이 포함된다.
  • 4 논의: 논의에서는 이러한 문제의 원인을 정확도 중심 연구에서 찾으며, 여기에는 구체적인 가설이 부족한 경우가 많고 MovieLens rating dataset으로 implicit feedback을 평가하는 사례도 포함된다.한계적으로 더 높은 정확도를 추구하는 일이 그러한 향상이 추천 가치를 더한다는 명확한 근거 없이 연구를 지배할 수 있다고 주장한다.

5 요약

분석 결과, 최근 neural top-n recommendation 연구의 재현은 여전히 어렵고, 더 단순한 알고리즘이 일부 데이터셋에서 검토된 방법 대부분보다 자주 더 나은 성능을 보이는 것으로 나타났다. 따라서 더 엄격한 평가 관행이 필요하며, 이 연구는 범위가 제한적이므로 다른 학술 매체, recommendation 문제, 전통적 baseline으로 확장되어야 한다.

  • 5 요약: 출판된 neural recommendation 연구의 재현은 여전히 어렵고, 검토된 방법 대부분은 일부 데이터셋에서 더 단순한 알고리즘보다 낮은 성능을 보일 수 있다.더 단순한 대안은 개념적·계산적 복잡도가 더 낮은 것으로 설명된다.
  • 5 요약: 이 결과는 recommendation에 대한 알고리즘적 기여를 평가할 때 더 높은 엄밀성과 개선된 연구 관행이 필요함을 보여준다.
  • 5 요약: 이 분석은 선정된 학술대회 시리즈로 범위가 제한되며, 향후 다른 학술 매체, recommendation 문제, matrix factorization과 같은 전통적 baseline으로 확장될 예정이다.
Loading 1907.06902v3…