推荐系统:从协同过滤到深度学习,用户只是想要点新鲜的
我手机上装过一个新闻App用了三个月之后推荐给我的内容就只剩下三样东西俄乌冲突的最新进展、某科技公司又出了什么新车、以及一位钓鱼博主每天钓了几条鲫鱼。最初是我自己选的确实点过几次。但当我看了两个月一模一样的新闻框架之后我终于卸载了它。不是它推荐得不精准是它太精准了精准到把我关进了一个信息茧房连一扇窗户都不给我留。推荐系统这些年卷得不成样子。模型从协同过滤卷到深度学习从双塔卷到Transformer多目标排序、强化学习、图神经网络轮番上阵。学术界刷着MovieLens和Amazon Reviews的榜单工业界的工程师们在A/B测试里为了千分之一的CTR提升熬夜上线。但有一个根本问题很多系统做到最后都忘了用户到底想要什么用户想要的不是精准是惊喜。精准是手段惊喜才是目的。一、协同过滤的落日余晖ItemCF和UserCF这两个算法大概是推荐系统历史上最伟大的发明。简单可解释冷启动也不算太差。你买了这本《深度学习》系统告诉你买这本书的人也买了那本《模式识别》你一看确实需要下单。皆大欢喜。但协同过滤有一个天花板它只能推荐流行的东西。ItemCF的共现矩阵天然偏向热门物品冷门但高质量的内容永远沉在矩阵底部。你用了一个协同过滤主导的推荐系统之后会发现自己越来越被推向大众审美的中心。你看的电影是豆瓣Top250你买的书是当当畅销榜你听的音乐是抖音神曲。你被困在了流行度构成的舒适区里不是因为你不喜欢冷门的好东西是因为算法不知道那些好东西的存在或者即使知道也因为交互数据太少而不敢推荐给你。我做过一个图书推荐的项目一开始全量上ItemCF点击率涨了百分之十五看上去很美。但仔细看数据推荐出去的百分之八十都是各种畅销书和经典名著小众学术书和冷门小说的曝光量反而下降了。长尾图书的销量本来就不高推荐不给流量卖得更差数据更稀疏以后就更不可能被推荐。这是一个死亡螺旋。后来我们强行在排序层加了一个长尾提权因子用逆用户频率对候选集做了重排序把冷门但主题高度相关的书拉到前排。点击率微跌了一点但长尾图书的整体销量涨了百分之三十用户收藏夹的多样性也大幅提升。这个改动在技术上毫无难度难的是说服产品经理接受“短期点击率下降”这件事。二、深度学习进来之后发生了什么深度学习给推荐系统带来的最大改变不是精度是特征交互的自动化。以前做特征工程交叉特征要手动构造用户年龄和商品价格的交叉用户性别和品类的交叉排列组合起来没完没了。DeepFM、DCN、xDeepFM这些模型本质上是把特征交叉这件事交给了神经网络自动完成。但这带来一个新的问题模型变成了一个你越来越看不懂的黑盒。排序分为什么涨了不知道大概是第几个隐层里的哪几个神经元被激活了。为什么这个商品没被推荐更不知道模型的输出就是一个分数没有解释。业务方问你为什么用户A看到了这个推荐你只能耸肩。这对需要强解释的场景是灾难。金融产品的推荐、医疗信息的推荐、教育内容的推荐推荐理由有时候比推荐结果本身还重要。你得告诉用户“因为你之前学习过微积分所以我们推荐线性代数”用户才会信任你。深度学习模型堆得再深也很难优雅地生成这种推荐理由。我的折中方案是把推荐系统拆成召回和排序两个阶段。召回层尽量用多路策略协同过滤一路内容标签一路实时兴趣一路热门和冷启动各一路。每一路召回都有自己的业务逻辑和可解释性。排序层可以上深度学习但它只负责给各路召回的结果排个先后顺序最终的推荐理由从触发的那一路召回逻辑里生成。这样既用上了深度学习的排序能力又保留了可解释性。虽然粗糙但至少当用户问“为什么推这个”的时候你能说出个一二三。三、实时性和“下一刻”的问题推荐系统有一个非常微妙的时效性问题用户的兴趣在下一刻可能就变了。他刚买了一台打印机你紧接着推荐墨盒这叫贴心。他买了打印机三个月之后你还在推荐墨盒这叫烦人。他买了一台手机你推荐手机壳结果他下一秒就退出了App你的推荐在他下次打开App的时候才出现这时候他可能已经在别的平台买完了。真正的实时推荐不是在离线训练一个模型然后每天更新一次而是要在用户行为的下一秒就做出反应。这要求你的特征计算、模型推理、排序下发全链路延迟在毫秒级。技术栈要上Flink做实时特征Redis做特征存储模型要能在线增量更新。工程成本极高不是大厂很难吃得消。但中小公司也有取巧的办法。把“实时性”拆成两个层面短期兴趣的捕捉和长期偏好的建模。长期偏好用离线模型每天更新一次搞定用户的基本盘。短期兴趣用规则引擎用户刚刚搜索了“机械键盘”接下来的三十分钟内不管他刷到什么页面硬塞几个机械键盘的推荐进去。这个规则粗暴但有效成本几乎为零。很多看起来很智能的实时推荐底层就是这么一堆规则的集合加上一点基于会话的协同过滤。创业公司别一上来就想搞工业级实时推荐系统先用规则把用户体验兜住把数据积累起来等体量到了再升级。四、推荐系统的道德困境推荐系统是注意力经济时代最强大的工具之一。你可以用它来提升用户满意度也可以用它来最大化广告收入。这中间的张力每个做推荐的人都要面对。一个视频平台推荐策略是“最大化观看时长”。算法发现争议性越强、情绪越极端的内容观看时长越长。于是推荐系统不断给用户推送能激发愤怒和焦虑的内容。用户确实看更久了但看完之后身心俱疲。平台指标好看用户福祉在受损。这个矛盾不是技术问题但最终是通过技术手段来实现的做推荐的工程师就在这个漩涡的中心。我在做内容推荐的时候内部定过一个不成文的规矩不做纯粹的情绪驱动推荐。如果一个内容被大量用户标注为“引起不适”或者“过度煽情”即使它的点击率高也要在排序时降权。这个规矩不是算法推导出来的是产品和算法团队坐在一起讨论出来的价值观。推荐系统从来不是价值中立的。你设计的每一个目标函数、每一个特征权重、每一条召回策略都在定义平台认为什么是“好的内容”。这个权力太大大到你必须主动意识到它的存在并承担责任。五、用户要的到底是什么回到开头那个被我卸载的新闻App。它的问题不是推荐技术不好是对“用户需求”的理解太狭窄。它把我当成了一个只对三个主题感兴趣的静态实体而忘了我是一个会变化、会厌倦、偶尔想随便看看别的东西的活人。推荐系统里有一个概念叫“探索与利用的平衡”Explore Exploit。利用就是推你确定用户喜欢的东西探索就是推一些可能喜欢但不确定的东西。大多数系统的探索比例都极低因为利用的短期收益太明显了。但长期来看没有探索的系统必然走向信息茧房用户会在某个厌倦的峰值点离开。这个离开通常是沉默的、不可逆的。你看到他卸载的那一天其实他已经忍受了好几个月的单调推荐。我后来自己做推荐策略的时候坚持在排序层留出一个固定的随机探索流量百分之五到百分之十。这批流量不参与任何精准排序纯粹随机从候选池里抽取但要保证内容质量和安全底线。这百分之十的流量长期来看贡献了平台上几乎全部的新兴趣发现。很多用户的第一次跨品类购买第一次进入一个新的话题圈第一关注一个之前从未接触过的创作者都来自这个随机的窗口。百分之十的流量损失换来的是整个生态的新鲜血液。这个账从纯粹的短期CTR上算不过去但从用户生命周期的角度算绝对划算。推荐系统的终极目标不是让用户点那个按钮而是让用户在点完之后觉得嗯这个我没见过但我确实喜欢。你能给用户的最好的推荐是那个他自己都不知道自己会喜欢的东西。这需要算法需要工程但更需要你对“人”本身的理解和敬畏。那些只知道往模型里堆层数的人永远做不出让人眼前一亮的推荐。真正好的推荐系统藏在每一行代码背后的是设计者对用户好奇心和生活多样性的尊重。

相关新闻

想学AI漫剧?看这本书就够!普通人实实在在的副业收入!

想学AI漫剧?看这本书就够!普通人实实在在的副业收入!

想副业赚到钱的朋友们,今天一定要看看漫剧这个赛道。有些人一直在不停换副业,无法长期坚持,核心问题有两个:一个是没利润,大家都在做,高度内卷;二是投入成本高,费时费力,…

2026/7/28 21:43:48 阅读更多 →
异常检测:别老想把离群点干掉,那是情报

异常检测:别老想把离群点干掉,那是情报

刚入行那几年,我对异常点的态度很粗暴:影响模型训练,干掉。箱线图一画,上下须一划拉,须子外面的全删。后来被人问了一句:“你删掉的那些点里,有没有正在偷刷信用卡的骗子?”我突然意…

2026/7/28 21:43:48 阅读更多 →
YOLOv8模型部署全链路优化:从1.2FPS到35FPS的实战指南

YOLOv8模型部署全链路优化:从1.2FPS到35FPS的实战指南

大家好,我是专注于计算机视觉与深度学习部署的开发者。在实际项目中,我们常常遇到这样的困境:一个训练好的 YOLOv8 模型,在推理时帧率(FPS)低得令人沮丧,例如只有 1.2FPS,这完全无法…

2026/7/28 21:42:48 阅读更多 →

最新新闻

基于Java+MySQL+SSM个性化旅游攻略定制系统设计与实现

基于Java+MySQL+SSM个性化旅游攻略定制系统设计与实现

系列文章目录 项目介绍 开发环境 系统实现 论文参考 项目介绍 在如今社会上,关于信息上面的处理,没有任何一个企业或者个人会忽视,如何让信息急速传递,并且归档储存查询,采用之前的纸张记录模式已经不符合当前使用…

2026/7/28 21:52:54 阅读更多 →
[VMM]虚拟内存精粹

[VMM]虚拟内存精粹

虚拟内存精粹 一、导言 虚拟内存是当今计算机系统中最重要的抽象概念之一,它的提出是为了更加有效地管理内存并且降低内存出错的概率。虚拟内存影响着计算机的方方面面,包括硬件设计、文件系统、共享对象和进程/线程调度等等,每一个致力于编写高效且出错概率低的程序的程序…

2026/7/28 21:52:54 阅读更多 →
[VMM]虚拟内存(Virtual Memory)

[VMM]虚拟内存(Virtual Memory)

虚拟内存(Virtual Memory) 尽管基址寄存器(base register)和界限寄存器(limit register)可以用来创建地址空间(address space)的抽象,还存在另一个问题:管理软件的膨胀(bloatware)。 当现代软件对运行内存要求越来越高时,交换技术(swapping)就不是一项有…

2026/7/28 21:52:54 阅读更多 →
免费硬盘健康监测工具:CrystalDiskInfo完整使用指南

免费硬盘健康监测工具:CrystalDiskInfo完整使用指南

免费硬盘健康监测工具:CrystalDiskInfo完整使用指南 【免费下载链接】CrystalDiskInfo CrystalDiskInfo 项目地址: https://gitcode.com/gh_mirrors/cr/CrystalDiskInfo CrystalDiskInfo是一款免费开源的硬盘健康监测工具,能够全面检测PATA、SATA…

2026/7/28 21:52:54 阅读更多 →
使用VHF框架实现一个虚拟HID键盘

使用VHF框架实现一个虚拟HID键盘

使用VHF框架实现一个虚拟HID键盘 什么是VHF框架?为什么需要虚拟HID键盘?大家好,我是你们的老朋友,一个喜欢把复杂技术讲成故事的博主。今天,我们来聊聊一个听起来高大上、但实际很有意思的主题——使用VHF框架实现一个…

2026/7/28 21:52:54 阅读更多 →
Bash脚本进阶技巧与自动化实践指南

Bash脚本进阶技巧与自动化实践指南

1. 为什么你需要掌握Bash脚本进阶技巧在Linux和Unix系统中,Bash脚本就像一把瑞士军刀,能帮你把重复性工作自动化。我见过太多运维工程师每天花几个小时手动执行相同的命令序列,而一个精心编写的脚本可能只需要几秒钟就能完成同样的工作。Bash…

2026/7/28 21:51:54 阅读更多 →

日新闻

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生

告别臃肿!3步让你的暗影精灵笔记本重获新生 【免费下载链接】OmenSuperHub Control Omen laptop performance, fan speeds, and keyboard lighting, and unlock power limits. 项目地址: https://gitcode.com/gh_mirrors/om/OmenSuperHub 你是否也曾为官方Om…

2026/7/28 0:00:43 阅读更多 →
RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

RAG必踩坑!财报法规检索不准?这款开源工具让答案浮出水面,准确率飙升98.7%!

做 RAG 的人应该都踩过这个致命的坑:把几百页的财报、法规、技术手册扔给向量库,问一个具体问题,搜出来的全是沾边但没用的内容 —— 关键信息要么被硬切块拆碎了,要么藏在几十条结果的最下面。语义相似≠真正相关,这个…

2026/7/28 0:00:43 阅读更多 →
抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

抖音视频文案提取工具全指南:免费2026版、手机App、在线工具一网打尽

2026年做短视频运营,从抖音上扒文案早就不是偷偷抄笔记的事了。我刚开始做内容的时候,每天刷半小时抖音,手动把爆款视频的口播敲进备忘录,一条2分钟的视频得花十来分钟,碰到语速快的还要反复回听。后来试了一圈工具&am…

2026/7/28 0:00:43 阅读更多 →

周新闻

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 道路桥梁裂缝检测数据集 道路桥梁病害识别检测数据集

深度学习道路桥梁裂缝检测系统 数据集6000张 完整源码已标注数据集训练好的模型环境配置教程程序运行说明文档,可以直接使用!系统支持图片、视频、摄像头等多种方式检测裂缝,功能强大实用。 1数据集6000张 8各类别

2026/7/28 12:04:22 阅读更多 →
深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

深度学习YOLO模型如何训练 PUBG 绝地求生目标检测数据集

pubg数据集 精选原图1.42万数据 1.49万标签 无任何重复、算法增强或冗余图像! pubg绝地求生目标检测数据集 1分类:e_body,14905个标签,txt格式 共计14244张图,99%为640*640尺寸图像 适合yolo目标检测、AI训练关键词&am…

2026/7/28 8:29:16 阅读更多 →
Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex英雄目标检测数据集 深度学习框架YOLO如何训练APEX数据集

Apex检测数据集数据集详情检测类别: allies enemy tag图片总量:7247张训练集:5139张验证集:1425张测试集:683张标注状态:全部已标注,即拿即用数据格式:支持YOLO格式及其他格式&#…

2026/7/28 5:03:42 阅读更多 →

月新闻