这些疑惑都有道理。当一个新鲜事物逐渐发展起来的时候,本来就会存在很多模糊的地方。不同公司在使用一个热门 title 的时候,实际需要的人才也很可能并不一样。
我在大公司和startups都做过NLP方面的ML engineer,现在在一家B轮的startup工作。我最熟悉的是各种垂直领域的应用型初创公司。这些公司往往有大量 AI Engineer 的需求,而且对这个职位的定义相对比较一致。所以我想结合自己的经验,分享一下我对这个新生岗位的理解。
更具体地说,我想回答两个问题:
第一,AI Engineer 到底是做什么的?.google и
以及更重要的,一个好的 AI Engineer,到底为公司创造什么独特的价值?. 1point3acres
AI Engineer 不是什么,又和 MLE 有什么不同?
在讲 AI Engineer 是什么之前,我需要先讲一下它不是什么。
首先,一般业内所说的 AI Engineer 并不训练大语言模型。随着 foundation models 的泛化能力越来越强,同时训练模型的成本也不断攀升,LLM 训练这件事越来越向少数 Model Labs 集中。大部分应用层的 AI startups 不会、或者很少自己训练模型。在 Model Labs 里,负责模型训练的通常是 Research Scientists 和 Research Engineers。
另外,大多数 AI Engineer 的工作也和 inference 其实也搭不上太大关系。有些 infra startups 会需要专门的人来做 model inference,但这一部分工作非常偏 infra,和一般意义上的 AI Engineer 在工作性质和技能要求上都很不一样。
接下来我想花点时间谈谈最容易混淆也最有争议的一个问题:.-- AI Engineer 是不是就是传统 Machine Learning Engineer 的旧瓶装新酒?
直接给出我的看法:不是。. 1point 3 acres
两三年前,这两个职位之间的关系可能还比较模糊,而且很多现在的 AI Engineer 也是从之前的 MLE 逐渐转变过来的。但随着这几年 agentic system 的发展,很多围绕 LLM 设计和构建系统、产品的思路与范式逐渐形成,已经开始沿着和经典 Machine Learning Engineering 不同的方向发展。
.1point3acres
这有点像在一棵进化树上,一个物种逐渐分化成了两个物种。
当然,一些新的 AI startups 在招聘时可能仍然沿用 ML Engineer 的叫法,所以具体工作的性质还是要看公司的实际需求。这里我只是想做一个大致的区分。
传统的 Machine Learning Engineer 至少十多年前就已经存在,往往集中在 NLP、CV、自动驾驶、搜索、广告和推荐系统等领域。主要工作包括收集数据、清洗数据、协调数据标注、训练模型,以及部署模型。在 NLP 和 CV 领域,很多问题都有相对成熟的研究范式,比如 named entity detection、classification、image segmentation 等。
. 1point 3 acres
我在经典 ML 时代和 LLM 时代都做过 AI Assistant 产品,所以我觉得自己的经历还挺适合用来比较 MLE 和 AI Engineer 工作之间的区别。. .и
在 2023 年 LLM 普及以前,已经有不少 startups 和大厂在做类似于今天 AI agents 的产品。只不过那时候还不叫 agents,一般叫 AI assistant。说到这里我突然想到,《乌合之众》的作者勒庞讲过,词语会在人们的脑海中唤起具体的形象和联想。可能是因为一提到 AI assistant,人们就会联想起 Siri 和 Alexa 一类的语音助手。不知道是哪位聪明的营销天才发明了 agentic 这个词,一下子和旧时代的 AI 产品划清了界限。. 1point3acres.com
有点儿跑题了。. 1point 3acres
在前 LLM 时代,如果想做一个能够在网页或者 Slack 上帮人搜索信息、执行任务的 AI chatbot,是个相当浩大的工程,背后涉及一整套复杂的工程系统。
用户问了一个问题以后,系统可能先要判断用户使用的语言(language detection),然后做翻译(translation),抓取其中提到的人名、地名和组织(NER),识别用户意图(intent classification),最后再从可选的行动方案中找出最优解(search and ranking)。如果过程中还需要向用户提 follow-up questions,那通常还需要一个 state machine。其中的每一步,都可能需要一个甚至多个 machine learning models。这些模型往往已经相当成熟,大多是用现有的 BERT、RoBERTa 或类似的 classifier,在自己标注的数据集上重新训练。
.1point3acres一个 ML Engineer 的工作成效,往往就体现在自己负责的模型 performance 上。Evaluation 通常比较直接,因为已经有比较成熟的 metrics。大量时间会花在收集数据、标注数据和清洗数据上。
.google и
而且很多时候,随着 business 的变化,还需要不断重新设计和定义 taxonomy。比如,一个 AI assistant 原本只是为了帮助用户解决 IT 问题,现在公司扩展了新的业务,希望它也能支持 HR 相关的问题。如果你负责 intent classification,就需要在模型的 taxonomy 里加入 HR 相关的用户意图标签。比如原来的model可以分辨申请新软件安装,更换硬件设备,和重设密码这三种意图就够了,现在需要加入请假和报税。这意味着你要收集新数据、标注数据,然后重新训练模型。