查看: 612| 回复: 0
跳转到指定楼层
上一主题 下一主题
收起左侧

Agentic Evaluation 今年的热度很高

全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
我最近在想,它相比过去的 RAG / Search / Recommendation Evaluation,到底本质上增加了什么?
传统搜索和推荐,大多数时候评估的是一个预测(Prediction)
用户搜「东京旅游」,模型有没有返回更相关的结果? 推荐的视频,用户有没有点击?
而 Agent 更像是在完成一个任务(Task)
例如一句简单的需求:
帮我规划一趟东京五日亲子旅行。
Agent 可能需要理解需求、拆解子任务、搜索信息、比较酒店、规划路线、调用多个工具,再根据用户反馈不断调整。不同 Agent,甚至可能走出完全不同的 Reasoning Path,但最终都能完成任务。
这也是为什么 Agentic Evaluation 的重点,不再只是最终答案,而是整个系统:
  • 是否完成目标(Task Success)
  • Planning 和 Reasoning 是否合理
  • Tool Use 是否高效
  • 出错后是否能够 Recovery
  • 多轮交互是否越来越接近用户真正的需求
从商业分析和 Data Science 的角度来看,这也是一个有意思的变化。
过去我们更多评估一个 Prediction System;未来,我们评估的是一个 Decision-making System
评价对象,从一个模型,逐渐变成了一个完整的软件系统。. 1point 3acres
未来几年,Agentic Evaluation 很可能会像 A/B Testing 之于推荐系统一样,逐渐成为 AI 产品的重要基础设施。

🎓 作者个人导师主页: 👉 https://mentorcruise.com/mentor/jaywang/
📘 大模型与推荐系统图书购买链接: 👉 https://www.amazon.com/dp/B0FX7N91FQ/ref=tmm_kin_swatch_0

上一篇:Whatnot Senior DS 面经
下一篇:请教AI coding 面试经验
您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表