楼主: zhong950419
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 聊聊大数据的前生今生

   
🔗
 楼主| zhong950419 2022-8-16 13:08:24 来自APP | 只看该作者
全局:
匿名用户 发表于 2022-08-15 21:57:03
对于第三点,一方面根据我的经验,传统 MPP 数据库的 scale 能力达不到支撑现代数仓数据量的规模 (PB~ EB 级数据量), 另一方面,MPP 数据库确实可以通过做更多 checkpoint
一看您这就是业内人士啊2333 聊的东西都特别专业。my 2 cents。我觉得哈 因为现在MPP也是丢在商业型硬件上而不是大型机了,所以fault tolerance肯定是更好了,而且双方都在学习互相的技术,其实某种意义上来讲双方都是混合架构了。至于PB-EB级别的分析,我个人觉得MPP数据库是可以handle的,比如FB在很长一段时间都有世界最大的vertica集群,大概分析的数据量级也是PB level。但是最终换掉还是因为价格原因,MPP感觉像是一个非常精致且全面的解决方案,他scale的灵活程度和hadoop比肯定是不足的。从解决方案的角度来看对很多企业尤其是互联网企业来说未必是最好的选择。但是对于传统企业来说还是有很大吸引力的

评分

参与人数 1大米 +1 收起 理由
yeya24 + 1 赞一个

查看全部评分

回复

使用道具 举报

🔗
x1nian 2022-8-16 13:09:27 | 只看该作者
全局:
看不懂,我进来凑凑热闹吧
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-LGVKN  | 添加认证 | 2022-8-16 13:17:23
zhong950419 发表于 2022-8-15 22:08
一看您这就是业内人士啊2333 聊的东西都特别专业。my 2 cents。我觉得哈 因为现在MPP也是丢在商业型硬件上 ...

关于 FB 的内容因为和 data infra team 比较熟有很多 context,FB 的数仓从 Hive 到 presto 到 Spark 一路走来,Vertica 可能内部其他部门可能有用到(不太清楚)但是数仓场景应该是没有用到的。另外一个重要的概念是存储 PB 级别数据和处理 PB 级别数据的区别, 对于 Vertica (以及其他任何 MPP 数据库) 能支持 PB 级别的数据处理我是严重怀疑的。
回复

使用道具 举报

🔗
hiUSA 2022-8-16 13:33:52 | 只看该作者
全局:
大数据技术上已经被行业接受,但企业服务端面临群雄纷战局面,现在还没有看得出谁能统领天下而且各自的日子都不太好过,cloudera已经退市私有化了,databrick,snowflake好像盈利前景也不明朗,AWS也有类似服务比如redshift给用户,各家都活的不是很好但也没到死的境地,总之都没有吃掉对方的能力,所以后面不出意外应该有一轮合并潮,之前cloudera和Hortonworks就merge了,之后服务和价格会慢慢上升到和TD差不多的地步,毕竟企业赚钱才能生存。

这也应验了合久必分,分久必合。
回复

使用道具 举报

🔗
wy178 2022-8-16 14:16:15 | 只看该作者
全局:
好文章,一文串起了多个迷惑已久的概念。特别是用传统DBMS的各个组件来类比介绍现在的各个热词(HIVE、ZooKeeper,Stome,Flink -- 可能有的已经没有那么热了)让人有醍醐灌顶的感觉。谢谢楼主分享
回复

使用道具 举报

🔗
tingkai 2022-8-16 14:26:49 | 只看该作者
全局:
这个贴子下面好多人都是匿名,没办法加好友。特别想认识做data engineering方面的朋友,欢迎加一个好友交流学习一下,
回复

使用道具 举报

🔗
npbhla 2022-8-16 14:44:30 来自APP | 只看该作者
全局:
赞好帖子 zszszs
回复

使用道具 举报

🔗
Lofman 2022-8-16 20:54:13 来自APP | 只看该作者
全局:
欢迎大家润欧洲 发表于 2022-08-15 13:11:15. ----
@Lofman 快来抱大腿。
Teradata曾经在芬兰有技术员工的,现在估计只剩销售了。
感谢@ 我,学习了,有类似的好帖子也@我哦,对了,你也是在芬兰呆过哈?
回复

使用道具 举报

🔗
sterlanUSA 2022-8-17 04:00:55 | 只看该作者
全局:
本帖最后由 sterlanUSA 于 2022-8-16 13:08 编辑
zhong950419 发表于 2022-8-15 22:08
一看您这就是业内人士啊2333 聊的东西都特别专业。my 2 cents。我觉得哈 因为现在MPP也是丢在商业型硬件上 ...

凑个热闹。
. .и
关于Presto和Spark, FACEBOOK有个presentation讨论两者的区别,基本观点是Spark的优势是scale 和fault tolerance, 而Presto 的优势是latency.

https://www.databricks.com/sessi ... computation-engines

个人觉得这两个framework 在超大数据的场景下会兼容并存。
回复

使用道具 举报

🔗
sterlanUSA 2022-8-17 04:15:14 | 只看该作者
全局:
我是酱油哥 发表于 2022-8-15 22:07
楼主太强 请问data warehouse 和 data lake 还有 data lakehouse有啥区别吗?

Databricks 有些还不错的入门FAQ:

https://www.databricks.com/blog/ ... data-lakehouse.html
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表