Netflix 用大模型重构推荐系统逻辑可行吗?
在推荐算法领域,人们早已习惯通过堆砌特征维度来提升点击率。不过,Netflix 最近的一次内部试验却给所有开发者敲响了警钟:reliance 于数千个手工特征工程的时代,可能真的快要结束了。
长期以来,这家流媒体巨头的推荐逻辑本质上是一场极其复杂的数学建模游戏。为了让用户在首页看到想看的内容,工程师需要定义成千上万个维度——比如用户观看的类型标签、单次观看时长、观看的时间点,甚至进度条是否发生跳跃。这些数据被转换为数值特征,喂给深度学习模型。尽管这种逻辑在工业界已证明稳健,但其致命瓶颈在于:模型能捕捉到什么,完全取决于工程师定义了怎样的“好特征”。如果工程师未能意识到“周五晚上连续观看”是一个关键信号,模型就永远学不到这一规律。
GenRec 如何颠覆传统的特征工程链路?
Netflix 推出的 GenRec 方案彻底颠覆了这种“特征-模型”链路。它不再试图将用户行为数值化,而是直接将其“语义化”。
具体操作逻辑是:GenRec 将用户的历史行为轨迹直接翻译成自然语言描述。例如,原本数据库里的一串时间戳和 ID,在 GenRec 看来,它被转化成了类似“该用户在周五晚上连续观看了三集悬疑剧,且在第二集结尾没有退出”这样的纯文本描述。随后,系统将这段文本作为上下文输入给大模型,让模型通过对语义的理解,直接预测用户下一步最可能感兴趣的内容。
从“特征匹配”到“语义理解”的转变,带来了实实在在的效果:GenRec 在实验中击败了那套运行多年的传统推荐引擎。这意味着,当模型能够像人类一样“阅读”用户的行为轨迹时,它能捕捉到比数值特征更细微、更深层次的行为模式。
语义化推荐方案面临哪些工程挑战?
但作为 AI 工程师,我们不能只看结果,还得分析其中的工程挑战。GenRec 这种方案最核心的痛点在于长序列文本的处理成本。一个资深用户的观看历史可能长得惊人,如果将所有行为全部转化为自然语言,Token 消耗将是一个天文数字,且容易触碰 LLM 的上下文窗口上限。
这就带来了一个关键的技术权衡:如何在大规模压缩行为轨迹的同时,不丢失关键的语义信息?如果简单的截断或摘要会导致模型丢失“用户在三年前看过某部冷门剧”这一关键信号,那么 GenRec 的泛化能力就会受限。
推荐系统架构是否将迎来一次潜在重构?
这次实验最值得深思的是,它预示了推荐系统架构的一次潜在重构。目前的推荐系统大多在做高维空间的向量匹配,而 GenRec 实际上是在做行为的文本化重构。如果未来的 LLM 能够高效处理超长行为序列,并将其转化为高质量的 Prompt,那么我们现在苦心经营的特征工程(Feature Engineering)可能会变得冗余。
尽管 Netflix 将此定义为“一个早期且充满希望的步骤”,但这种从“数学建模”向“语义推理”的迁移,极有可能成为下一代推荐系统的标准范式。

全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。

用户历史过万条时,上下文窗口的问题就变得极其严峻,因为如果直接将所有行为轨迹转化为自然语言描述,Token 数量可能瞬间爆炸,直接撑爆模型的处理能力。比如,你可能需要在生成文本描述时,只保留近期高频行为或关键事件,比如“用户在周五晚上连续观看三集悬疑剧”这类核心信号,而非一股脑塞进所有观影记录,这样既能压缩序列长度,又不丢失核心语义。