查看: 1530| 回复: 1
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 如何利用机器学习抵制垃圾信息(上)

全局:

2022(10-12月)-EE本科+3个月-1年 | 内推|其他地区 MachineLearningEng实习@apple
如何利用机器学习抵制垃圾信息(上)
数以亿计的人定期访问Pinterest,在数十亿的Pins中直观地发现鼓舞人心的想法。灵感是一个很高的标准,我们必须保持警惕,确保Pinners不会看到垃圾邮件、有害内容或错误信息。为了执行我们的社区政策并维持一个鼓舞人心的环境,我们使用最新的机器学习技术来建立自动化系统,迅速检测并打击垃圾邮件内容和垃圾邮件发送者。
. .и
我们的反垃圾邮件系统由反应式和主动式两部分组成,以有效对抗对抗性滥用者--那些故意试图规避系统的用户。我们的主动式系统由复杂的机器学习模型组成,而被动式系统包括在实时规则引擎中执行的规则和轻量级机器学习模型。我们不仅使用最新的建模技术,而且还通过添加新的数据和探索新的技术突破,定期迭代这些模型,以便随着时间的推移保持或提高其性能,从而有效解决垃圾邮件。

机器学习模型
.1point3acres
(1)垃圾邮件域模型

我们使用一个深度神经网络分类器主动识别垃圾邮件Pin链接。为了使影响最大化,我们的模型会学习将一个域名分类为垃圾邮件,而不是链接。我们对属于同一领域的链接的所有Pin应用同样的执行。这个模型是在人工标注的域名上交互训练的,以达到更高的召回率和更低的假阳性率。我们使用从链接、网页文本和媒体、用户与域的互动、以及用户行为中创建的特征作为输入。对于每个领域,我们对链接和网页进行取样以创建特征。我们从语义上将链接分割成语义标记,只使用频繁的标记作为特征。我们分析用户行为在一段时间内的外在模式,以创建行为特征。这个模型由PySpark工作使用Tensorflow、Spark SQL和UDF定期进行大规模的批量推断



(2)垃圾邮件用户模型.google  и

识别从事垃圾邮件活动的用户是打击垃圾邮件的最终解决方案,但这是极难实现的。我们利用有监督和无监督的模型来建立一个有效的垃圾邮件用户识别系统。

(3)分类模型

我们的垃圾邮件用户分类模型是一个深度神经网络,是我们主动式系统的一部分。它是使用人工标注的数据进行训练的,并以最少的人工监督来确保质量。我们使用从用户属性和他们过去的行为创建的特征作为输入。我们还使用用户与领域的互动,总结为每个用户的领域分数分布,其中领域分数是从垃圾邮件领域模型中重新使用的,作为输入。这个模型定期进行批量推断,由一个使用Tensorflow、Spark SQL和UDF的PySpark工作对数百万Pinners进行评分。
. .и
补充内容 (2022-11-27 01:20 +8:00):
下来了
https://www.1point3acres.com/bbs/thread-948688-1-1.html

本帖子中包含更多资源

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x

评分

参与人数 4大米 +4 收起 理由
钾肥宝 + 1 很有用的信息!
whoami24 + 1 欢迎分享你知道的情况,会给更多积分奖励!
rrrrrr1019 + 1
Jerry668 + 1 很有用的信息!

查看全部评分


上一篇:狗家 customer engineer, smart analytics team match 求捞
下一篇:怎么在 GitHub 上找到自己喜欢的项目?
🔗
Jerry668 2022-11-26 14:47:32 | 只看该作者
全局:
感谢楼主分享,写的非常好,期待后续(下)篇。

有两个问题请教下:
1. 垃圾邮件的training label如何收集呢?人工标注代价太高,样本量也小。用户举报的coverage也会很小。如何能获取大量且精准的label呢?
2. 如果模型上线后垃圾邮件被拦截,会造成数据特征分布变化,对模型性能会有什么样的影响?该如何解决这个问题呢?

多谢解答!
回复

使用道具 举报

无效楼层,该帖已经被删除
您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表