Rethinking Large Language Model Architectures for Sequential Recommendations
This paper proposes Lite-LLM4Rec, a hierarchical LLM architecture that eliminates beam search, reducing inference time by 97.28% and boosting performance by 46.8%.
Hanbing Wang, Xiaorui Liu, Wenqi Fan et al.