쉽게 이해하기

추천 서비스에서는 단순히 클릭률을 높이는 것보다 사용자의 다양한 취향과 새로운 발견을 유도하는 요소가 중요합니다. 그러나 전통적인 강화학습 방식은 탐색 과정에서 무작위성을 주로 사용하여 실제 사용자의 선호도와 맞지 않는 결과가 나올 수 있습니다. LAAC는 이러한 문제를 해결하기 위해 대규모 언어 모델을 참고 정책으로 삼아, 무작위 탐색 대신 언어 모델이 제안한 새로운 아이템을 기반으로 학습합니다. 적대형 배우-평론가 구조를 통해 아이템의 다양성과 새로움을 극대화하면서도 실제 사용자에게 가치 있는 추천을 전달할 수 있도록 최적화합니다. --- 참고 자료: - [AGILE: A Novel Reinforcement Learning Framework of LLM Agents](https://neurips.cc/virtual/2024/poster/94945) - [Generalizing task models to novel reinforcement-learning tasks through hierarchical inference (EN)](https://www.youtube.com/watch?v=xsSS9-we7eQ) - [Large language model-enhanced reinforcement learning for diverse and novel recommendations - Amazon Science](https://www.amazon.science/publications/large-language-model-enhanced-reinforcement-learning-for-diverse-and-novel-recommendations) - [Reinforcement learning - Wikipedia](https://en.wikipedia.org/wiki/Reinforcement_learning) - [Part 1: Key Concepts in RL — Spinning Up documentation](https://spinningup.openai.com/en/latest/spinningup/rl_intro.html)