中级农民
- 积分
- 102
- 大米
- 颗
- 鳄梨
- 个
- 水井
- 尺
- 蓝莓
- 颗
- 萝卜
- 根
- 小米
- 粒
- 学分
- 个
- 注册时间
- 2020-5-11
- 最后登录
- 1970-1-1
|
同为SRE路过,在tech和非tech公司都做过,入行不久,2年多,说下我的感受:
1. SRE这个title感觉近些年越来越火。. 1point3acres
这个趋势有点像DevOps,可以从Google trend上看出,越来越多公司开始招这个职位。可能只是跟风,或者受到Google这些科技巨头影响。tech之外的很多行业在进行科技转型,什么Cloud, ML 之类的需求旺盛,对运维来说也是水涨船高
SRE这个title的定义不同公司差别巨大。. 1point 3acres
其实说到低真正需要SRE的是基础设施提供商如Google,AWS这类,他们遇到的问题也是真正的at scale的问题,巨量的traffic和servers 如何管理这本身就是一个challenging的事情,这时候automation以及运维的tooling是一条不得不走的道路。.
而一些中小型的公司,如果不自己host大量的infra的话其实是不太需要SRE的,这个时候这个title的定义就会跑偏,有的时候可能就是production support,oncall,debugging 这些dev 不愿意做的活就是SRE。如果公司的infra 在云上的话其实就是在招一个cloud administrator,偶尔有特别需求可能些几个automation。
.
2. 核心竞争力可能是经验/best practice/process. 1point3acres
比如incident management 本身就是一个需要经验的流程,reliability metrics 应该怎么做,dev应该怎么配合,release 怎么做等等。大厂 SRE 的经验在国内这些一线公司应该也是比较受追捧。出去跟人值得称道的东西可能也是我维护的 XXX 服务能经受 XXX tps的流量。-baidu 1point3acres
如果基于这一点的话工作方向可能就是去越大的厂越好。. 1point3acres
. 1point 3acres
3. 书籍基本上就是Google 那两本圣经了,有许多devops的资料书籍也可以看看,很多地方sre 和 devops还是混用的.google и
很多问题对于中小厂来说还不是问题,我的用户还没破百万priority是用户增长,而不是先把infra 做到百万级别 (当然作为sre 我们argue说要提前准备scalability,但事实上business decision上看肯定做用户增长带来收益更多). From 1point 3acres bbs
4. +ML 是最近比较新颖的话题,可能有很大前景. check 1point3acres for more.
这个逻辑是这样的,还是水涨船高,随着ML 的火热也会带动这方面sre/devops 的需求。因为做ML 也需要一个infra去支持,从 数据采集,数据处理,训练,测试,production,监控 一系列的pipeline 和传统软件流程有不同的challenge,所以+ML 也算是一个有一点壁垒的领域,不过也是一个新领域
如果将来AI 暴打人类了,那基本上ML 成了基本需求, 这个方向上也能被带飞吧
和lz一样,我也是对于SRE这个方向比较迷茫。我觉得一个优点是对于整体的把握,要和PM,Dev,Testing 各类team 打交道,也可能是cross frontend and backend,对整体的理解有助于在管理层做platform lead,或者将来创业了在软件这块可以全部拿下,feature delivery 可以交给PM来管,其他的构架infra就可以按着自己的经验理念来铺。而缺点也是,技术没有深耕,很多时候只要大概了解一个service就足够了,做的东西比较广而虚的感觉。
抛砖引玉,希望能听到工作多年的前辈分享一些看法 |
|