查看: 494| 回复: 2
跳转到指定楼层
上一主题 下一主题
收起左侧

[其他] 做llm eval + experimentation 的ds都在做什么

🔗
匿名用户-8T5BZ  前天 10:00 |倒序浏览

2026(7-9月)-DataScience/Analytics硕士+5-10年 | 网上海投| 分析|数据科学类全职@

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
rt, 好奇做llm eval + experimentation 的ds都在做什么
请问现在那些llm eval 的metric都是ds 定的还是mle定的,和传统product ds 做的experimentation 有什么不同,求指点

上一篇:Verkada SWE Intern 求面经
下一篇:【求捞】Google SWE Early Career (L3) HC已过7个月求组Match
全局:
最大的不同是 offline 和 online 经常对不上,offline 涨、线上不涨是常态。你多数时间在造 eval set、调 judge、做人评对齐,A/B 反而只占一小块。传统那套因果推断只能部分用,随机单元和样本量都很尴尬。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-8T5BZ  前天 12:41
现实的梨子 发表于 2026-9-17 19:19
最大的不同是 offline 和 online 经常对不上,offline 涨、线上不涨是常态。你多数时间在造 eval set、调 j ...

感谢大佬,听起来eval set很重要,那这些都是ds 决定用什么样的eval set, cover 哪些topic,哪些level?还是mle, research engineer先定大方向?调judge,需要自己去看eval set对比么?还是只是看high level metrics的变化。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表