楼主: YangLoveXin
跳转到指定楼层
上一主题 下一主题
收起左侧

推荐系统小项目

   
🔗
 楼主| YangLoveXin 2025-5-2 12:08:29 | 只看该作者
全局:
LittleFishBall 发表于 2025-5-1 09:59
Youtube 上有一个很好的推荐系统相关的 tutorial.
搜 "ai alchemy recommendation system"

感谢分享!回头去参考看看!
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-2 12:08:59 | 只看该作者
全局:

哈哈可以,我回头看看 migrate 到 uv 上面,稍微的 standard 一些
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-2 12:11:38 | 只看该作者
全局:
slightlyOff 发表于 2025-5-1 14:18
lz你好,我目前在找machine learning engineer工作,之前没有相关经验,你觉得跟着你的这个项目做下来,会 ...

我会通过这个项目来介绍一些业界推荐系统的实现方式,希望能帮助大家更好的准备 MLE/ML SD 的面试

评分

参与人数 1大米 +1 收起 理由
slightlyOff + 1 楼主/层主请继续!

查看全部评分

回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-2 12:14:30 | 只看该作者
全局:
tommychang1983 发表于 2025-5-1 02:22
Alibaba的公开数据集也可以试试。实现哪些模型?wide and deep, DIN, deepFM这些我也很感兴趣可以一起研究 ...

嗯嗯,欢迎一起研究!

目前的计划是把一些经典模型先实现了,这个在 README 的 Roadmap 上面有写

现在已经实现了
1. 一个简化版本的 DIN,没有实现文章中新提出的 activation func
2. 双塔模型,这个是用来 export movie embedding
3. 一个非常非常非常简单的 recommendation engine, 之后会慢慢扩展,打算用开源工具来搭建
4. TransAct 模型还在施工中,目前只是实现了 TransAct 和 DCNv2 的 module, 还需要 E2E hook 在一起进行 training
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-2 12:15:37 | 只看该作者
全局:
tommychang1983 发表于 2025-5-1 02:22
Alibaba的公开数据集也可以试试。实现哪些模型?wide and deep, DIN, deepFM这些我也很感兴趣可以一起研究 ...

之后我是打算把我在 Arxiv 上面新看到的论文感觉不错的也加进来

我比较熟悉 PyTorch 所以就打算之弄 PT 了,而且和 LLM 那边的工作 integrate 起来也会相对容易一些
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-13 07:33:04 | 只看该作者
全局:
更新一下最近的 update:
1. 针对 TransAct 有了一个简单版本的实现,这个是推荐系统领域一个很经典的用来做 user sequence modeling 的工作
2. 使用双塔模型来训练 item embedding purely from user collaborative signals, 这个是用来平替 Pinformer 的,TransAct 的一个针对输入的要求
3. 一个简单的 trainer 在 MovieLen small dataset 上实现 E2E 的 training
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-5-22 13:48:02 | 只看该作者
全局:
更新一下最近的进展:
1. TransAct 的 E2E training on MovieLen Full dataset, 目前的 AUCPR 在 cross-user 上的 evaluation 是 0.73 左右,应该还有继续提高的空间,作为之后探索的方向
2. Inference Engine 也支持了 TransAct 模型,针对 inference stack 有一个简单的小 refactor

之后的计划打算先暂停模型方面的开发,转向推荐系统的 retrieval stage 做提高
1. EBR candidate retrieval
2. User/Item content based retrieval (e.g. SWING)
3. DuckDB integration, FAISS integration 等

评分

参与人数 1大米 +1 收起 理由
机灵小不点 + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-6-1 01:12:20 | 只看该作者
全局:
更新一下最近的进展

1. 目前支持了两种 EBR 的方式,一种是直接调用的 FAISS library 来建立 index, 然后 setup 一个简单的 server 来负责搜索;另一种是使用 DuckDB 作为 vector database 来进行搜索
2. FAISS 遇到了一个多线程方面的问题,和 FastAPI 犯冲,所以不得不单独搭建一个 server 来 host
3. DuckDB 的 ANN search 暂时不支持多个 query 同时去跑,可以用多线程来优化,但是暂时还没有实现这部分

下一步打算把其他的 U2U, I2I 的 retrieval channel 也加上,然后开始 explore semantic id 的方向 (最近从 arxiv 上看在 recsys 比较火爆)
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-6-9 11:02:34 | 只看该作者
全局:
更新一下最近的进展,这周主要是在做 semantic id 的准备工作

1. 写了一个简单的 script 来从 TMDB 上面抓取到了 86k 的 movie overview 的文本数据
2. 使用 Qwen3 1.7B 的模型对每一个 movie 生成了 semantic embedding,整个 script 使用的是 MBP M4 Max, 36G 内存,整个大概跑了 4 个小时,受限于技能问题不能很好的并行

接下来会尝试实现 RQ-VAE 然后生成 semantic, 同时尝试在 TransAct 里面使用新的 semantic embedding 来和之前的 collaborative embedding 进行比较
回复

使用道具 举报

🔗
 楼主| YangLoveXin 2025-6-16 13:56:49 | 只看该作者
全局:
更新一下最近的进展

1. RQ-VAE 的代码实现已经完成,但是仍然有比较大的 id collapse 的问题;目前尝试了一些不同的方法来提高效果,之后打算引入 diversity loss 来看能不能让 codebook 的利用率更高

下周打算把 semantic embedding 用在 TransAct 里面进行训练;同时看能不能用 Qwen3 1.7B 的 embedding 模型来生成一套新的 semantic embedding 并比价其效果
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表