楼主: donnice
跳转到指定楼层
上一主题 下一主题
收起左侧

有人像我一样喜欢污染谷歌的数据集吗?

   
🔗
sabre80 2022-12-28 11:37:08 | 只看该作者
全局:
浪费你的时间啊
回复

使用道具 举报

🔗
337845818 2022-12-28 11:49:27 | 只看该作者
全局:
笑死以前的recaptcha都是做两次的,第一次随便选根本不算数。

评分

参与人数 1大米 +1 收起 理由
greenforest + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
Edify 2022-12-28 13:12:37 | 只看该作者
全局:
个人并不是……
回复

使用道具 举报

🔗
eludeme 2022-12-28 13:20:40 来自APP | 只看该作者
全局:
youtube广告我也会随机点几个假装感兴趣

评分

参与人数 1大米 +1 收起 理由
lixuexue + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
每天烧20美元 争取搞崩美国经济
回复

使用道具 举报

全局:
好奇怪的思维 captcha后台都是知道答案的 你怎么污染。 你用的谷歌验证 不是第三方验证 根本没法污染
回复

使用道具 举报

🔗
 楼主| donnice 2022-12-28 14:20:44 来自APP | 只看该作者
全局:
微信用户_yfkz8 发表于 2022-12-27 21:54:44
好奇怪的思维 captcha后台都是知道答案的 你怎么污染。 你用的谷歌验证 不是第三方验证 根本没法污染
我的理解,这个答案不是像中学数学一样,一道题有一份固定的参考答案,而是在有一个baseline的基础上,基于大多数人的选择来确定答案。

比如要求在9张有马有河有车的图里选一辆车,如果绝大多数用户都指马为车,那算法就会把马标记成车,然后混入训练集里。
回复

使用道具 举报

🔗
hgon23 2022-12-28 15:07:19 | 只看该作者
全局:
之前那个需要分辨英文字母数字的recaptcha实际是在帮助识别图书,手稿之类的。也算是为图书数字化做了点贡献

https://www.wired.com/2007/05/re ... and-digitize-books/
回复

使用道具 举报

全局:
有这时间给孩子喂喂奶不好吗?
回复

使用道具 举报

🔗
z3t1 2022-12-28 15:33:38 | 只看该作者
全局:
你这样大概只会适得其反,label noise 对 ML model training 往往会有提升作用。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表