楼主: zzzlll404
跳转到指定楼层
上一主题 下一主题
收起左侧

下周snowflake上市,想听听大佬们对于snowflake的见解

   
🔗
data pipeline 2020-10-5 07:43:03 | 只看该作者
全局:
fatfatjoey 发表于 2020-10-5 02:38
AWS的文档和Wikipedia都说Redshift是基于早期Postgres版本进行了魔改,你说和Postgres没关系只是兼容语法 ...

Redshift有论文,虽然没说细节,但应该是复用Postgres了语法和语义分析的模块,然后把查询执行过程改成MPP,存储完全是自己研发的,其实执行器和存储这部分才是决定DW快慢的关键,据我所知,对于某些特定的执行阶段它还用了一些开源MPP的模块来极大的优化速度

评分

参与人数 1大米 +2 收起 理由
fatfatjoey + 2 很有用的信息!

查看全部评分

回复

使用道具 举报

🔗
niuweihai 2020-10-5 12:51:46 | 只看该作者
全局:
fatfatjoey 发表于 2020-10-5 02:38
AWS的文档和Wikipedia都说Redshift是基于早期Postgres版本进行了魔改,你说和Postgres没关系只是兼容语法 ...

"Because it addresses very different requirements, the specialized data storage schema and query execution engine that Amazon Redshift uses are completely different from the PostgreSQL implementation."

https://docs.aws.amazon.com/reds ... d-postgres-sql.html
回复

使用道具 举报

🔗
李浩泉 2020-10-5 23:06:25 | 只看该作者
全局:
data pipeline 发表于 2020-10-5 07:43
Redshift有论文,虽然没说细节,但应该是复用Postgres了语法和语义分析的模块,然后把查询执行过程改成MP ...

印度亚麻厂的几个烙印为了体现LP14,最开始开发红屎(Redshift)的初衷是想快速搞出一套自己的数据库系统,就像阿里把开源的MySQL摩改成自己的Ocean Database,华为把开源的安卓摩改成自己的鸿蒙。所以,2012之前早期的红屎(Redshift)并非是要做出一套data warehouse软件,更不是Cloud Data Warehouse,也没有和AWS S3这些协同整合。只是10年前,几个烙印为了走捷径,快速体现impact,把开源的PostgreSQL摩改了一下,起了个印度名字红屎(Redshift),然后送给姐夫,加官进爵。同期,印度亚麻厂也有人在摩改安卓,后来亚麻也出了自己的手机,也出了自己的安卓系统,不过后来彻底失败了。

毕竟是在美国,大家,尤其是那些principal的本地工程师还是要脸的,把开源软件改个名字,然后重新定义一下就说是自己的,太LOW。刚好2012-2015,亚麻内部也需要整合,信息贯通,开始研发自己的(Enterprise Data Warehouse),这个项目交给了AWS的人去做。出于政治目的,高层让AWS的人基于现有的红屎(Redshift)去做,总之就是不想让红屎(Redshift)挂掉。此后,红屎(Redshift)从PostgreSQL的摩改自定义版database,全面转向为基于AWS S3的cloud enterprise data warehouse。

2020年的今天,60万人的印度亚麻厂,红屎(Redshift)是全公司唯一一套所有部门可以通用的系统。但是,顾名思义,真的是一坨屎,里面乱七八糟。所以亚麻厂也是罕见的雇佣了超过2000多人的BIE,去做人肉SQL取数机,几乎一半以上的亚麻厂各类报表都需要每周手工操作,每次开会之前,一群一群的BIE就像小蜜蜂一样,疯狂的刷SQL,然后复制在EXCEL里面,导入Tableau做Dashboard或者PPT。

60万人的印度亚麻厂,除去45万人是仓库,物流,超市的小时工,剩下15万人坐办公室,2000多人的BIE,1000多人的DE,1000多人的DS,DA,加上各级经理,将近6000人。4%的办公室人员都在做数据分析工作,平均,1:25。每24个人就要配置一个SQL人肉取数机,你就想想红屎(Redshift)的BI是多么的有效率!!!

BLIND,上面最高票的吐槽,亚麻BIE和DE的苦恼:根本不知道数据源是否存在,如果存在在哪里?80%的工作时间,亚麻的BIE和DE都在找数据源在哪里,剩下的20%时间手工写SQL然后做EXCEL,PPT,仪表盘。80%的工作时间,亚麻的DS都在等数据,剩下20%的时候,基于残缺不全的数据编故事。

辽宁号是不是乌克兰瓦良格改造的???

换了动力系统
换了航电系统
换了武器系统

这些都是最最重要的系统。

不论怎么换,都不能改变辽宁号是从乌克兰瓦良格改造而来的事实。



回复

使用道具 举报

🔗
李浩泉 2020-10-6 00:30:43 | 只看该作者
全局:

微软:数据库 SQL Server -> 数据仓库 Azure Data Warehouse(擅长处理结构化数据,ERP,CRM) -> 微软云

亚麻:数据库 开源 PostgreSQL -> 数据仓库 Redshift Data Warehouse(什么都有,什么都不精) -> AWS云

谷歌:数据库 开源 MySQL -> BigQuery + MapReduce (PAAS,主要处理JSON,CSV flatfile,不擅长处理结构化数据,ERP,CRM) -> 谷歌云

甲骨文:数据库 自家 MySQL -> Autonomous Data Warehouse(擅长处理结构化数据,ERP,CRM) -> 甲骨文云

SNOWFLAE:顶层设计,可以在上面四个云里面都跑起来。因为它的底层用的是ANSI SQL,去除了微软的T-SQL,和甲骨文的PL/SQL里面的自定义公式和函数,只保留最基础的ANSI规范。所以可以在SQL Server,Oracel,MySQL和PostgreSQL里面都跑起来。有一定技术含量,但是也没那么高的技术含量。最大的亮点是:商业创新,而非技术创新。

搞BI的人,最基础的就是要精通ANSI SQL和对ERD实体关系有非常高的悟性,有了这个基础,就可以轻松上手SQL Server,Oracel,MySQL和PostgreSQL,然后就可以熟练操作Azure,Redshift,BigQuery和Autonomous。至于Power BI,Tableau,Qliksense和BO,这些前端软件本质上都差不多,熟练工种,用久了自然都会精通。
回复

使用道具 举报

🔗
李浩泉 2020-10-6 00:42:57 | 只看该作者
全局:
本帖最后由 李浩泉 于 2020-10-6 00:50 编辑

DATABRICKS和SNOWFLAKE两家公司有本质区别:

DATABRICKS:技术创新,给微软,亚麻,谷歌,甲骨文等提供后台技术支持,核心竞争力:Apache Spark,Spark SQL和Resilient Distributed Datasets。

SNOWFLAKE:商业创新,将微软,亚麻,谷歌,甲骨文的产品,打包出售。把单品变成组合,进行销售。

当年的SUN,真的是厉害:

JAVA:编程软件(被甲骨文吃了)

安卓系统:移动端系统(被谷歌吃了)

Mysql:数据库(被甲骨文吃了)

SPARK:底层ETL data pipeline工具(原型回到伯克利继续开发,然后团队重新组建DATA BRICKS公司)

关于安卓多说一句,谷歌利用开源的JAVA,把公共资源转化为自己私有的资产,性质和亚麻把开源的PostgreSQL数据库转化为私有的Redshift,是一个性质。和阿里云把Mysql改成私有的Ocean Database,华为把安卓进一步改成自己私有的鸿蒙,本质上都一样。所以,当年甲骨文74亿收购了SUN,转手向谷歌索赔了88亿。
回复

使用道具 举报

🔗
李浩泉 2020-10-6 01:03:26 | 只看该作者
全局:
本帖最后由 李浩泉 于 2020-10-6 01:06 编辑

DATA BRICKS和微软现在走的特别近,微软需要推出一款跨平台通用底层CLOUD ETL TOOL,所以有了AZURE DATA BRICKS。另外,DATA BRICKS的创始人之一是一个加拿大华裔,1986年的1.5代移民,中学时候和父母移民加拿大,后来从多大计算机系本科毕业,在IBM工作了一段时间,就来到伯克利读博士,三年读完博士,并成为DATA BRICKS联合创始人,首席架构师。
回复

使用道具 举报

🔗
WorkoutMonkey 2020-10-6 13:08:28 | 只看该作者
全局:
小丸几 发表于 2020-9-21 08:12
一开始我也这么想,可是刚看了个Blind的评论说DB貌似在走下坡路,每年大会赞助商越来越少,给参会者的餐 ...

作为利益相关人士,看到这条有点无语啊。
一个大会火不火,难道不是应该看参会人数的吗?毕竟参会人数侧面反应现存以及潜在客户数量。

看赞助商和伙食是什么原理?
从另一个角度也可以解读为Databricks觉得自己的品牌知名度已经不错了,不需要靠赞助商来壮门面,以及好伙食来吸引客人了啊?
回复

使用道具 举报

🔗
LugiaD 2021-8-5 22:36:02 | 只看该作者
全局:
fatfatjoey 发表于 2020-9-14 08:49
之前公司和snowflake有一些接触,给我们做了个demo,最终感觉也是和楼主差不多,没太明白他们有什么独特优 ...

欸听说snowflake是存算分离的
回复

使用道具 举报

🔗
fatfatjoey 2021-8-6 01:34:01 | 只看该作者
全局:
LugiaD 发表于 2021-8-5 07:36
欸听说snowflake是存算分离的

技术上是分离的,但是用的不是avro/parquet这样的开源文件格式,也就是说你在他们的平台上确实可以独立scale up存储或者计算,但前提是你要先把数据复制到他们的平台上。
回复

使用道具 举报

🔗
fatfatjoey 2021-8-6 01:58:04 | 只看该作者
全局:
李浩泉 发表于 2020-10-5 08:06
印度亚麻厂的几个烙印为了体现LP14,最开始开发红屎(Redshift)的初衷是想快速搞出一套自己的数据库系统 ...

哈哈哈哈哈哈哈原谅我挖个坟,之前跟Redshift作斗争的时候就一直在想这么过时的技术为什么还没有被淘汰,AWS还一直在给它加码,搞些什么ML自动优化之类的feature,每年reinvent都一大堆更新,直接淘汰了做个新的不是更好么。果然又是因为政治斗争。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表