楼主: zhong950419
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 聊聊大数据的前生今生

   
🔗
 楼主| zhong950419 2022-8-16 00:13:36 来自APP | 只看该作者
全局:
ucfgut 发表于 2022-08-15 08:59:18. check 1point3acres for more.
大佬水平很高。
Mpp 比spark 厉害那么多 为啥databricks 还没死呢
因为贵啊,而且未必厉害多少。个人觉得databricks的完全体就是我说的  一个看起来和MPP很像,但是每个组件都可以自己scale的系统,他们多半会叫什么数据平台,但是根据鸭子辨别法,我觉得就是重新发明了db

具体到系统设计其实两边都有在拿对方的一些东西来用。比如td的atlas号称spark+mr+mpp 啥都有。而且做这些系统的人也是一波人。再加上MPP在各种试图支持semi structure,DB也是很早就有了自己的SQL引擎。本质上他们要解决的问题时是类似的,只是出发点不同
.google  и
具体到实现层面上感觉还是那些老几样 SIMD,code generation,云原生,etc 用的技术都是一样的的,就看谁的算法写得好,或者说储存层对计算层的感知更强呗。



补充内容 (2022-08-16 00:31 +08:00):
突然想到MPPvsDatalake有点类似于买苹果整机vs自己攒电脑。买整机除了贵和硬件选择不自主都是优点,自己攒电脑则是可以根据自己的需要选配硬件,以及更加低廉的成本。

评分

参与人数 2大米 +7 收起 理由
爱丽丝和鲍勃 + 5 谢谢分享!
linglingnvnv + 2 赞一个!

查看全部评分

回复

使用道具 举报

地里匿名用户
🔗
匿名用户-TMWLP  | 添加认证 | 2022-8-16 00:13:48 来自APP
low latency 实时处理,spark有spark streaming啊,把spark和MR归为一类是否不太合适
回复

使用道具 举报

全局:
写得好,虽然不懂技术细节和行业背景,感觉楼主很专业很真诚

评分

参与人数 1大米 +1 收起 理由
zhong950419 + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
hunterx 2022-8-16 00:45:00 | 只看该作者
全局:
实名膜拜楼主。想深化对数据库/数据处理方面的理解,请教楼主平常是怎么学习的,或者有没有书籍/项目的推荐?
回复

使用道具 举报

全局:
匿名用户 发表于 2022-08-15 09:13:48
low latency 实时处理,spark有spark streaming啊,把spark和MR归为一类是否不太合适
lz有说在Google data flow出来后,batch和streaming已经统一了,flink和spark都在做对方的东西,甚至包括现在hudi iceberg deltalake都是同时支持batch/streaming的
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-PSZWB  | 添加认证 | 2022-8-16 00:53:23 来自APP
最后的预测不就是Google Spanner吗
回复

使用道具 举报

🔗
沙场小兵 2022-8-16 01:26:31 | 只看该作者
全局:
看完之后有种“原来如此”的感觉。
上学的时候,只知道Goolge的“三架马车”开启了分布式的时代,但是对出现的历史机遇没有任何了解。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-ZBABR  | 添加认证 | 2022-8-16 01:38:53 来自APP
感谢楼主分享,最近也在接触大数据这一方面,感觉servless sql 就是厂商正在做的一次尝试
回复

使用道具 举报

🔗
daydreamerlee 2022-8-16 01:54:42 | 只看该作者
全局:
本帖最后由 daydreamerlee 于 2022-8-15 10:58 编辑 . 1point 3 acres

感谢大佬的分享!打通了这些名词上关联
可以请楼主在分享一些对下面问题的看法么。
1. Data-lake vs data-warehouse: data-lake 的起源和 context, 应用场景和相关的技术

2. ML 应用场景下的 OLAP 或 HTAP 的一些应用和技术细节 (看到 Databrick 分享了一些 他们的产品 在 aws 或 azure 上 train ML model 的免费电子书) 想了解一下Databrick / snowflake 在 ML training 应用的各自技术和市场地位

3. TiDB Aurora Spanner 这一类新的 OLTP 是楼主说的 MPP 类的产品么。他们算是 HTAP 么。

4. Snowflake vs Databrick vs (Aurora Spanner 这一类分布式关系型数据库)

谢谢!
回复

使用道具 举报

🔗
 楼主| zhong950419 2022-8-16 02:11:17 来自APP | 只看该作者
全局:
daydreamerlee 发表于 2022-08-15 10:54:42
感谢大佬的分享!打通了这些名词上关联
可以请楼主在分享一些对下面问题的看法么。
1. Data-lake vs data-warehouse: data-lake 的起源和 context, 应用
不是大佬,只是个人看法

1. datalake不就是分布式储存引擎+分布式计算引擎+别的吗,我下面说的那种每个组件都可以scale的未来数据库不就是datalake嘛,广义上的data warehouse就是跨产品线的历史数据分析系统,从这个角度来说 datalake可以算是data warehouse的一个实现吧。狭义上来说data warehouse一般是snowflake这种数据库

2. 个人对于non determinisyic的算法不是很感兴趣【被调参各种折磨】,对这些不太懂

3. 我觉得tidb spanner广义上可以算MPP架构 aurora可以说是SMP 但是因为这俩词一般用在OlAP side,所以做OLTP的不会去提。HTAP是指又能做分析 又能做事务。那么 tidb 和f1/spanner应该都算htap

4. 不要把OLTP和OLAP做对比,他们用于不同的场景。没有人用snowflake当application的后端。也没有人用aurora做数据仓库。 snowflake和db上面已经说了。我觉得spanner和aurora的区别其实还是在于成本,毕竟spanner要做的是跨大州级别的强一致性,虽然听起来很美,但是有几家公司有这个需求?而aurora这种share disk+兼容主流数据库的方式反而更加容易migrate+足够便宜。所以说技术上spanner是很强的,但商业上aurora绝对更有优势。

评分

参与人数 7大米 +17 收起 理由
爱丽丝和鲍勃 + 10 谢谢分享!
Jackyyyy- + 1 赞一个
linglingnvnv + 2 赞一个!
LeilaZLHD + 1 赞一个
BZH + 1 赞一个

查看全部评分

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表