查看: 1211| 回复: 2
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 如何利用机器学习抵制垃圾信息(下)

全局:

2022(10-12月)-EE本科+3个月-1年 | 内推|其他地区 分析|数据科学类实习@bytedance

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
如何利用机器学习抵制垃圾信息(下)


(4)聚类
..
我们已经开发了轻量级的聚类模型,用于早期检测可疑的用户和机器人。这项技术也解决了我们分类模型的缺口,除非用新的标记数据重新训练,否则这些模型不知道新出现的模式。我们根据能够成功隔离可疑群体的属性对用户进行聚类,并具有较高的准确性。专家们通过探索可疑用户的行为和他们使用资源创建垃圾内容来识别这些属性。这个模型使用PySpark和SparkSQL实现,每天执行。.


(5)垃圾邮件用户-域模型

用户与域之间的互动被一个各种各样的二方图明确地捕获。我们将用户和域表示为图中的节点,如果用户创建或保存了一个带有该域链接的Pin,则在用户和域之间建立一条边缘。这个图有利于我们通过半监督学习来同时识别垃圾邮件的用户和域名。我们使用一小部分有标签的用户和域来运行一个标签传播算法,并为没有标签的用户和域学习分数。我们在Spark中实现这个迭代算法,并定期运行。


(6)测量方法

我们通过计算带有垃圾邮件链接或由从事垃圾邮件活动的用户创建的Pin数量来衡量Pinterest上的垃圾邮件流行程度。我们定期对印象图钉和用户进行抽样和人工审查。我们通过从印象深刻的头域开始采样和审查,然后在一段时间内将覆盖范围扩大到尾域,从而扩大我们的测量范围。这些样本被用来测量整体垃圾邮件的流行程度,以及训练我们的机器学习模型。.--


总结

Pinterest的使命是为每个人带来灵感,创造他们热爱的生活。我们努力保护我们的Pinners的体验,迅速和适当地对我们一系列最新的机器学习模型所识别的恶意用户和垃圾内容采取行动。我们计划继续投资于发展我们的社区准则和技术,以应对不可避免的新挑战,并为我们数百万有价值的用户带来最佳体验。

上一篇:23ng 延毕?master?工作?
下一篇:浅谈Google的internship和full-time招人流程
全局:
你这个帖子会不会就属于被抵制的那一类?
回复

使用道具 举报

全局:
赤赤菌 发表于 2022-11-27 10:11:09. 1point 3acres
你这个帖子会不会就属于被抵制的那一类?
给点面子兄弟
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表