楼主: newgpu
跳转到指定楼层
上一主题 下一主题
收起左侧

[职场感言] 谈谈Databricks和云计算(二)

   
🔗
 楼主| newgpu 2022-2-25 08:22:32 | 只看该作者
全局:
zdsdrdyhcdmz 发表于 2022-2-24 12:34
顶一顶,两个帖子都收藏了,想问下lz对于distributed storage system和distributed query engine这两个领域 ...

不好意思不太了解这两个领域。但是我认识有人去了Starburst(做query engine的),看起来这个公司发展非常不错
回复

使用道具 举报

🔗
zzz6222 2022-2-25 08:41:17 | 只看该作者
全局:
newgpu 发表于 2022-2-24 19:09
你说的图像和视频都属于non-structured data。

. Waral dи,semi-structured data就是花里胡哨格式的:比如list里 ...

你给的例子,我觉得如果要用table存也可以。难点就是需要做schema design,一个用户多个购买记录,normalize一下一个用户表,一个购买记录表,然后one-to-many relationship用foreign key链接一下。
-baidu 1point3acres
我的理解是,如果有真的有这样的table,我们要ETL成relational table,然后存入数据库。ETL不是就是为了处理这些格式比较乱的数据?

所以这里存这些semi-structure到data lake,是因为比如ML team觉得data engineer的ETL没有把好的feature抓出来,所以亲自来抓?ML team可不可以用ETL工具来处理semi structure?
回复

使用道具 举报

🔗
 楼主| newgpu 2022-2-25 08:50:00 | 只看该作者
全局:
本帖最后由 newgpu 于 2022-2-24 16:51 编辑
zzz6222 发表于 2022-2-24 16:41. .и
你给的例子,我觉得如果要用table存也可以。难点就是需要做schema design,一个用户多个购买记录,normal ...

DW里面是很少做normalize的,因为这里的数据真的很大,而且在上面跑SQL的时候往往要扫过大量的row(比如Data Scientist需要知道昨天有多少用户给我们系统付费了),所以不同table之间join特别贵。
. 1point3acres.com
你说的在Database里面做normalize是另外一个故事:那个一般是针对online使用场景的Database。Online的SQL query的特点是很少需要扫过大量的row,一般都是针对某个用户进行单个row的查询或者插入,而且Database的存储比DW的存储要贵多了。为了解决这些问题我们会在Database里面谈论normalize这个话题。. ----
另外在DW里面一般也不用foreign key的(我甚至不知道主流DW是否支持foreign key)

评分

参与人数 1大米 +2 收起 理由
zzz6222 + 2 欢迎分享你知道的情况,会给更多积分奖励!

查看全部评分

回复

使用道具 举报

🔗
Yeahan 2022-2-25 09:00:26 来自APP | 只看该作者
全局:
newgpu 发表于 2022-02-24 10:17:05
评论区那些从文化或者技术上说Databricks这个公司不行的人,我觉得都没问题,但是你们要言之有物啊。什么干货都没有只是说一句“culture奇差的一家公司”或者“你说的这些aws, azure都有
拿出干货很难,随便怼一下要容易得多,还能显得好像比较厉害 🐶
回复

使用道具 举报

🔗
zzz6222 2022-2-25 09:05:57 | 只看该作者
全局:
newgpu 发表于 2022-2-24 19:50
DW里面是很少做normalize的,因为这里的数据真的很大,而且在上面跑SQL的时候往往要扫过大量的row(比如D ...
. .и
有道理。
所以DW的SQL没有join会不会很局限啊,就是单表select + filter + aggregation?很多复杂的nested sql基本上都需要跨表?. ----
TPC-DS的query里面,大部分都是跨表的。
回复

使用道具 举报

🔗
 楼主| newgpu 2022-2-25 09:15:17 | 只看该作者
全局:
zzz6222 发表于 2022-2-24 17:05
有道理。
所以DW的SQL没有join会不会很局限啊,就是单表select + filter + aggregation?很多复杂的nest ...

DW的SQL当然是有join的,我只是说“在DW里面能不做join就尽量不做”,跟Database不一样。实际上没有哪个SQL query engine是不支持join的,无论是Database的query engine还是DW的query engine还是Databricks这种自研的基于开源数据格式的query engine

评分

参与人数 1大米 +2 收起 理由
zzz6222 + 2 欢迎分享你知道的情况,会给更多积分奖励!

查看全部评分

回复

使用道具 举报

🔗
 楼主| newgpu 2022-2-25 09:17:37 | 只看该作者
全局:
a0106660 发表于 2022-2-24 16:10
支持楼主, 帖子信息量是大的, 但是对于对databrick 产品不熟悉 或者对大数据仓库各个概念只是粗浅认识的人  ...

感谢建议!我为了写这篇文章,能比较简短地概括Databricks的所有产品,已经花了无数时间去读各种文档和博客了。然后写文章的时候需要组织语言,需要把整个东西串成一条线组织好,真的花了很多时间。。。你说的提议很好,等我有时间了考虑一下
回复

使用道具 举报

全局:
楼主总结的很详细,厉害👍🏽
回复

使用道具 举报

🔗
cynthiazhxu 2022-2-25 10:45:58 | 只看该作者
全局:
newgpu 发表于 2022-2-24 16:22
不好意思不太了解这两个领域。但是我认识有人去了Starburst(做query engine的),看起来这个公司发展非 ...

lz真的看好Starburst吗?Databricks的Photon出来之后应该对Startburst冲击很大吧
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
职场达人
  • ↑ 本版用于讨论职场各种干货话题,闲聊请去🔗聊聊或者🔗匿名版
  • ❌ 本版严禁水贴,引战,发布广告,拉群,贴个人联系方式,扣分无警告
  • ☑ 求职、面经等去 🔗北美求职和 🔗回国求职大区,刷题和学习请去 🔗终身学习大区
  • ☑ 请去专版发布 🔗内推, 🔗招聘信息,和讨论 🔗创业内容
  • ☑ PIP / DevList/ Need Support 等话题也已开设 🔗专版

本版积分规则

>
快速回复 返回顶部 返回列表