📣 Back to School开学季 - VIP通行证5折优惠!蓝莓、Offer多多同步优惠
楼主: WorkoutMonkey
跳转到指定楼层
上一主题 下一主题
收起左侧

[找工就业] 大家对Databricks的前景怎么看?

   
全局:
WorkoutMonkey 发表于 2020-5-3 22:48
感谢长篇回复!

你的顾虑和我的一模一样。
..
关于他们提到的“客户为了避免vendor lockin,所以选择databricks”, 我觉得不是很能站的住脚。要作产品,就不可能避免vendor lockin。况且AWS不会把Spark改的面目全非来让用户使用的。再者,如果从另外一个角度分析,其实AWS给用户跟多的选择,比如在ETL方面,就可以选择Flink,而非Spark。况且,数据pipeline一担放到public cloud上面,就基本上和AWS或是Azure绑死了。
.1point3acres-baidu 1point3acres
至于提到的Databricks的另外两个优势(Spark的创造者,还有更好的用户体验),这个我不好说。比如A用户一天需要上传和处理100TB的数据,B用户则是一天100GB的数据。他们需要使用public cloud来作Data platform和ETL系统。一个是AWS帮你建造,一个是Databricks在AWS或是Azure上建,你觉得哪个技术能力更强?
回复

使用道具 举报

🔗
 楼主| WorkoutMonkey 2020-5-5 06:55:46 | 只看该作者
全局:
mine_that_bird 发表于 2020-5-4 15:01
关于他们提到的“客户为了避免vendor lockin,所以选择databricks”, 我觉得不是很能站的住脚。要作产品 ...

嗯。你说的很有道理。我基本跟你持相同看法。多谢你的分享了!
回复

使用道具 举报

全局:
从使用者的角度说吧,目前我们公司的ML data pipeline是kafka+flink+s3,数据最终以parquet的格式写入s3 sink;下游每个ML业务再从s3用spark去读取parquet做ML模型的训练;这句话非常重要:”每个ML业务再从s3用spark去读取parquet做ML模型的训练”,换句话说spark在我们公司(头部SaaS公司)的使用主要集中于从s3读数据,我们并没有用spark做streaming platform etc;

另外我主要做ML 模型,每天都要用spark,我个人非常不喜欢spark,主要原因是spark基于column的存储和我的需求背道而驰,我需要的是按条件filter row然后读取整行数据(而非只要部分列),spark在这方面速度很慢,如果这是由于数据集体量较大还可以理解(TB level);然而根据实验我们发现spark在读取小数据集(GB level)上的也比较慢;我本人很不理解column based的存储模式,因为随着业务的发展,数据量的增大,Deep learning模型越来越多,而这种data eager的模型很吃数据量,最好的方式就是把尽可能多的特征喂进模型,所以我们往往需要的是整行数据而非部分列数据

评分

参与人数 4大米 +4 收起 理由
kamia + 1 给你点个赞!
vertise827 + 1 谢谢分享!
eval + 1 赞一个
roadtohome + 1 赞一个

查看全部评分

回复

使用道具 举报

全局:
redrummurder 发表于 2020/05/03 18:03:28
看完楼主的pe帖子过来的。. ----

databricks是一个先天非常优秀的创业公司。优秀的工程师很多,又一手控制spark开...
谢谢层主的留言感觉非常有收获。希望也可以加一下好友多多请教。感谢
回复

使用道具 举报

🔗
gcf108 2020-5-25 10:58:27 来自APP | 只看该作者
全局:
kingxueyuf 发表于 2020/05/11 13:15:37
从使用者的角度说吧,目前我们公司的ML data pipeline是kafka+flink+s3,数据最终以parque...
你转一下row Based不就行了
回复

使用道具 举报

🔗
gcf108 2020-5-25 11:00:24 来自APP | 只看该作者
全局:
gravenguan 发表于 2020/05/03 10:08:47
我之前是aws的,我觉得小客户要用spark可以直接用emr,还更灵活一些,databrick相对emr还是偏贵,用ze...
确实如此,用emr notebook或者直接用IDE
回复

使用道具 举报

🔗
gcf108 2020-5-25 11:01:26 来自APP | 只看该作者
全局:
gravenguan 发表于 2020/05/03 10:05:57
databrick不是ds工具或者说主业不是给ds的,主要是给de做大数据etl,这是应用最多的
同意,是做pipeline的
回复

使用道具 举报

🔗
gcf108 2020-5-25 11:09:12 来自APP | 只看该作者
全局:
kingxueyuf 发表于 2020/05/11 13:15:37
从使用者的角度说吧,目前我们公司的ML data pipeline是kafka+flink+s3,数据最终以parque...
既然你是存s3的,用flink的意义在哪里?
回复

使用道具 举报

全局:
kingxueyuf 发表于 2020/05/11 13:15:37
从使用者的角度说吧,目前我们公司的ML data pipeline是kafka+flink+s3,数据最终以parque...
这个我好奇了,Vertica也是column based的,但读取速度快得一AC,按你这么说,一旦到了parquet这种格式column based就不好用,感觉是spark的column based设计跟parquet不compatible?非DE,也许问了dumb question
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表