楼主: zhong950419
跳转到指定楼层
上一主题 下一主题
收起左侧

[自我提升] 聊聊大数据的前生今生

   
🔗
wolf452 2022-8-16 09:13:48 | 只看该作者
全局:
zhong950419 发表于 2022-8-15 12:39
对ML不是很了解。但就我了解的来看因为OLAP要做额外的denormalization schema design 所以很多数据不处理 ...

已加米,请问楼主说的DS是什么谢谢!
回复

使用道具 举报

🔗
tombbmot 2022-8-16 10:00:15 | 只看该作者
全局:
zhong950419 发表于 2022-8-16 06:31
my 2 cents
我觉得这个主要和生产力有关,自建dc可能看上去便宜,但是并不一定适合每个企业。举个例子,下 ...
. 1point 3 acres
对的,自建DC的话的确有很高的支出,所以租几台服务器(传统的VPS模式)也是可以接受的选择了。
云现在的问题是,对绝大多数中小企业看来,云的成本「看起来」的确是贵了,我观察到他们的动机也很复杂,比如:.1point3acres
- 云背后的高可用其实是7x24的高可用,而中小企业可能需要的就是每周40个小时不出问题就可以了,其他时间段内只要数据不丢(相应的,在备份数据这块,他们对b2/s3/本地磁带之类的方案是有刚性需求的)别的都好说;
- 云声称自己高可用,但并不会因为低可用而有相应的赔偿。大多数中小企业客户,从商务/代理商拿到的合同,并不会因为丢失可用性而对客户有「超出使用范围以外」(quote原话)的赔偿。

我觉得还是时间不够长,云对于中小企业的价值还不能凸显出来,而且现在对于云厂商来说,从传统大公司吃到的钱面子上算是足够多,说得过去,也不着急去开发SMB市场。
. Waral dи,
补充内容 (2022-08-16 10:01 +8:00):
. .и扯远了,专注大数据,哈哈,忽略我
回复

使用道具 举报

🔗
sterlanUSA 2022-8-16 11:18:28 | 只看该作者
全局:
为楼主的精妙总结点一个大大的赞!基本上涵盖了过去的20年的大数据业界演变。. ----

目前个人看到的还未完全完成的整合:
1) 实时数仓:这个主要是像基于 Presto之类的通用查询还不够快。而有新的实时OLAP 引擎例如 Clickhouse, Pinot, Starrocks, Druid 等等,配合基于spark streaming 或Flink 的实时倒入实现实时报表等功能。
2)Data lake 或者 lake house 解决方案的整合。Databricks 是公司名称,而其lakehouse是基于delta lake这个开源项目的企业级产品。而同时snowflake对于非结构化 数据的支持也在不断完善。再加上Hudi, Iceberg 都成立了自己的lake house 公司,所以未来几年这一块估计还会有整合。


楼主对以上两个方向有什么看法和体会?

评分

参与人数 1大米 +1 收起 理由
kevinkaizhou + 1 赞一个

查看全部评分

回复

使用道具 举报

地里匿名用户
🔗
匿名用户-LGVKN  | 添加认证 | 2022-8-16 12:08:12
本帖最后由 匿名 于 2022-8-15 22:06 编辑

楼主对历史的回顾非常棒,但是涉及到技术细节有很多问题,随便说几个:
.--
>MPP数据库整体是一个储存计算高度耦合的架构.--

-baidu 1point3acres大数据领域的 MPP 并不要求计算和存储耦合。就用楼主提到的 Presto 来说,Presto 大多数大公司部署的时候都是计算和存储分离的, 这也是目前 Cloud native 主流的发展方向。

. check 1point3acres for more.>而Presto则借用了MPP架构,再加上他并不奢求计算完所有的数据,而是只要算个大概就行

Presto 大多数时候并不只算个大概,Presto 和其他主流大数据引擎一样默认都是全量精确计算(这是主流的数仓使用场景)。

再回到楼主提到的为什么有了 MPP (e.g Presto) 还需要有 MR?
.google  и
MR 解决的核心问题只有一个: fault-tolerence , 更详细一点说就是怎么样在海量的计算节点 + 任何节点都可能失败的情况下做 fault tolerence. . 1point3acres.com

所以 MPP 和 MR 会因为应用于不同场景长期存在, 互相补充。这也是为什么 G/FB 都有 MPP 系统内部根据 workload 在 MPP 和 MR 之间切换的设计。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-LGVKN  | 添加认证 | 2022-8-16 12:15:52
匿名用户 发表于 2022-8-15 21:08
楼主对历史的回顾非常棒,但是涉及到技术细节有很多问题,随便说几个:. Waral dи,

>MPP数据库整体是一个储存计算高 ...

在补充一点对楼主提到的 Batch/Streaming 一体化的问题的看法,Google 提出的 dataflow 的概念从理论上确实把 Batch 和 Streaming 抽象到一个模型下,但是如果楼主做过相关的系统就会发现,理论的统一到系统实现上的统一有巨大的鸿沟,要在同一个系统下做好这两件事需要的代价很多时候不亚于直接用 Lambda 架构维护两套独立的系统。另外抛开技术从用户需求层面来说,大多数公司都会发现用户需要一体化的场景是及其有限的。所以总结起来,这个方向在目前可预见的未来内,ROI 很低。
回复

使用道具 举报

🔗
zxwmit12 2022-8-16 12:22:01 | 只看该作者
全局:
米其林级别的文章!
现在数据的火箭级别的增长,随着VR的普及和5G的搭建,未来的流量会被实时3D视频和4k的视频主导,同时需要AI补帧,AI美颜之类的技术。这种情况下,对数据库的要求会有什么新的调整?合久必分,会导致下一次分吗。
回复

使用道具 举报

🔗
 楼主| zhong950419 2022-8-16 12:46:38 来自APP | 只看该作者
全局:
匿名用户 发表于 2022-08-15 21:08:12
楼主对历史的回顾非常棒,但是涉及到技术细节有很多问题,随便说几个:. Χ

>MPP数据库整体是一个储存计算高度耦合的架构
2333 感谢您指出一些问题,可能这些东西我没有太说清楚,自己因为presto用的比较少,也出了一些错误

不过我上面说的是MPP数据库是一个高度耦合的架构。但presto是个MPP的计算引擎,我认为这个是有区别的但是没有说清楚。

关于你提出的第二点我自己去查了一下,你说的是对的,presto似乎把精确和非精确查询给分开了。我先入为主的认为presto和dremel implala一样只求速度可以允许一些错误,看来不是这样的
.--

第三个点 对于计算引擎,我同意您的看法,不过再重申一下,文章说的MPP大部分是MPP数据库 他们也是可以做transformation 的,他们也做checkpointing的,而且现在基本所有的计算引擎都会自带speculative execution了,所以传统的MPP数据库 fault tolerance不行这种说法我觉得也不再符合现在情况了
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-LGVKN  | 添加认证 | 2022-8-16 12:57:03
本帖最后由 匿名 于 2022-8-15 22:03 编辑
zhong950419 发表于 2022-8-15 21:46
2333 感谢您指出一些问题,可能这些东西我没有太说清楚,自己因为presto用的比较少,也出了一些错误. Waral dи,

不过 ...
. Χ
对于第三点,一方面根据我的经验,传统 MPP 数据库的 scale 能力达不到支撑现代数仓数据量的规模 (PB~ EB 级数据量), 另一方面,MPP 数据库确实可以通过做更多 checkpoint 来达到一定程度的 fault tolerence (先不说很多 MPP 数据库还做不到整个worker 级别的 fault tolerence), 但是加上 checkpoint 后的 MPP 还是传统意义上的 MPP 么 (checkpoint 的代价是很高的),和 MR 比又有什么本质区别呢 (MR 可以理解上在 M 和 R之间做 checkpoint)?
回复

使用道具 举报

🔗
 楼主| zhong950419 2022-8-16 13:01:32 来自APP | 只看该作者
全局:
sterlanUSA 发表于 2022-08-15 20:18:28
为楼主的精妙总结点一个大大的赞!基本上涵盖了过去的20年的大数据业界演变。

目前个人看到的还未完全完成的整合:
my 2 cents

我觉得实时数仓其实很data lake很像 区别在于用不同的计算框架来拼出来不同的解决方案,然后用户所直接面对的计算引擎有一些区别。
.
我个人觉得,大数据的技术已经走完了分这个过程,接下来可能就是合了。那么其实有一个有趣的问题是,和用户直接接触的,会是哪个系统?很明显这个入口要是抓住了,肯定背后的公司/产品获得更大的利益。

那么我觉得又有这样的思考,以现在Ansi SQL的表达能力,能否覆盖addhoc query,batch etl,流处理这三个人场景呢?

个人觉得是可以的,其实etl stream 无非就是materalize view + udf至于addhoc query就只是select了,很容易区分,在现在的这些计算引擎上面在建立一层抽象+一个query optimizer + 一个federation query,通杀,还是用简单的sql,岂不美滋滋?

我觉得这会是datalake的最终模式。用户用起来就是简单的SQL,实际产品里面根据pattern的不同,数据量的不同使用不同的计算引擎。





回复

使用道具 举报

全局:
楼主太强 请问data warehouse 和 data lake 还有 data lakehouse有啥区别吗?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表