2006 年的云改写了成本函数;Snowflake 用存算分离+按秒计费把数据仓库变成自来水公司(Capital One 实证);Databricks 用 Lakehouse 服务造 AI 的企业(Mastercard/诺和诺德);Fanatics vs FOX Sports 的同场景对照实验。
第三篇结尾,企业站在两难的路口:Teradata 稳定但贵到只有巨头用得起,Hadoop 便宜但乱到只有互联网公司玩得转。市场上留着一个空位——有没有一个「像数据仓一样好用、像数据湖一样便宜、还不用自己运维」的东西?两家公司从两个方向出发,几乎同时回答了这个问题。这一篇讲它们的崛起:Snowflake 怎么把数据仓库变成「自来水公司」,Databricks 怎么把数据湖变成「实验室」,以及一个绝妙的对照——两家公司的客户,正在用它们做几乎同一件事。
本篇要回答的问题
1. 2006 年的云到底改变了什么——为什么说没有 AWS S3 就没有 Snowflake?
2. Snowflake 的三个洞察是什么?它凭什么让 Capital One 把 Teradata 赶出家门?
3. 消费型计费(用多少付多少)的本质是什么——为什么它是 AI 时代的正确商业模式?
4. Databricks 的 Lakehouse 是什么?它和 Snowflake 抢的是同一批客户吗?
5. Fanatics 和 FOX Sports 用两家公司的产品做了几乎同款的事——那选型的逻辑到底是什么?
回看 Snowflake(2012 年成立)和 Databricks(2013 年成立)的创业时点,会发现它们都踩在同一个前提条件之上——这个前提不是某个天才的灵感,而是亚马逊在 2006 年上线的基础设施:S3(3 月,云存储)和 EC2(8 月,云算力)。
在 S3 之前,「存储」是有生命的成本:买磁盘阵列、配机房、算折旧、扛故障。S3 把它变成了一项服务:每 GB 每月几美分,无限弹性,永不丢失。EC2 把「算力」也变成了服务:一台服务器按小时租,用完销毁。这两件事对数据行业意味着成本函数的彻底改写——
| 成本项 | Teradata 时代 | 云时代 |
|---|---|---|
| 存储 | 磁盘阵列采购,按峰值容量买断 | 按实际存量按月付费,且单价持续下探 |
| 算力 | CPU 买断,闲置也是折旧 | 按小时/按秒租用,随开随关 |
| 扩容 | 采购流程,以月计 | 调大参数,以分钟计 |
| 容灾 | 自建异地备份 | 云厂商内建多副本 |
但云厂商自己并没有立刻兑现这个红利——AWS 的 Redshift(2013)最初仍是传统架构的云上版本,存储和计算绑定。真正的革命要等一个「纯云原生的架构设计」:既然存储已经便宜到可以随便存,那就把存储和计算彻底拆开——数据永远存在便宜的地方(云存储),需要计算时临时租算力来跑,跑完就退。
2012 年,三位前 Oracle 高管(Benoit Dageville、Thierry Cruanes 曾负责 Oracle 数据库架构,Marwit Zugnoni)与 CEO Mike Sperber、Bob Muglia 相继组成团队创办 Snowflake。他们的三个洞察,每一个都针对旧世界的一个具体痛点:
| 洞察 | 回应的旧痛点 | 给客户的体验 |
|---|---|---|
| 存算彻底分离:数据存云存储,计算节点是「虚拟仓库」,可独立开关、独立扩缩 | Teradata 扩容要采购整机;一个部门的查询挤占另一个部门 | 市场部大促分析临时开大算力,跑完关掉——财务部月结完全不受影响 |
| 按秒计费:计算用一秒付一秒的钱 | 授权买断制,闲置也是折旧 | 半夜没人查数就不花钱;新接入一个数据源试跑两周,成本几乎忽略 |
| 跨云中立:同样的产品跑在 AWS/Azure/GCP 三大云上,不做自己的应用与客户竞争 | 云厂商既是平台供应商又是竞品(数仓 vs 模型服务) | 企业敢把全部数据放进来——不会被绑死在某个云的生态里 |
表格里「跨云中立」四个字值得单独展开,因为它是 Snowflake 与云厂商数仓最本质的区别,也是企业选择它的第一理由。先看图:
三大云厂商各自有一个数仓产品(AWS 的 Redshift、微软的 Synapse、谷歌的 BigQuery),同时各自还有大模型服务(Bedrock、Azure OpenAI、Vertex)。这就产生了一个微妙的利益结构:企业若把全部数据放进某朵云的数仓,而未来 AI 应用的模型又恰恰选了同朵云的竞品服务——数据的「看门人」和「竞争者」是同一家公司。企业 CIO 对此的应对是多云策略:关键基础设施不押注单一云厂商。
Snowflake 的位置恰好卡在这个缺口上:它自己不卖算力、不卖大模型——同样的产品、同样的界面、同样的功能,跑在三大云之上(租用它们的算力再零售给客户)。客户用它,相当于买了一个「云上中立层」:数据池在 Snowflake 里,底层算力在哪个云、未来换到哪个云,客户都可以换,Snowflake 帮客户对冲了「绑死」风险。这也解释了它的一条产品铁律:永远不推出自己的大模型、不做与客户竞争的应用——一旦做,中立性这个最值钱的护城河就塌了。三大云厂商数仓与 Snowflake 长期共存而非被吞掉,中立性信任(加上存量迁移成本)是最重要的原因。
2015 年产品正式上线(GA),增长曲线陡峭得罕见:2019 年 ARR(年经常性收入)达 3.5 亿美元,2020 年上市完成当年最大软件 IPO,上市首日市值翻倍——巴菲特旗下伯克希尔在 IPO 前夜以「罕见」的方式买入了它的私募份额。到 2026 年,Snowflake 年产品收入指引已达 60.7 亿美元(+36%),服务 11,000+ 企业客户。
关于它的商业模式,值得单独强调一件事(这是理解后面所有分析的钥匙):Snowflake 卖的是「用量」,不是「授权」。客户每查一次数、每存一个 TB、每跑一次 AI 任务,付一笔钱。这带来两个推论:其一,客户的成功=Snowflake 的收入(客户业务越发展、AI 用得越多,消费越多)——不存在「签完约就见不到销售」的割裂;其二,收入即消费的真实刻度——电表走了才有钱,所以消费增长基本造不了假。这也是为什么资本市场格外看重「产品收入增速」与 NRR(老客户消费留存率)这两个指标。
Snowflake 官方案例库里最值得细读的是 Capital One——美国第一家宣布全面离开自建机房、进入公有云的银行。监管最严的行业都敢上,其余行业的顾虑就都可以商量了。
它的用法很有代表性:6,000 多名分析师、每天最多 400 万次查询,全部跑在 Snowflake 上。具体做了什么:
| 场景 | 怎么用 | 效果 |
|---|---|---|
| 反欺诈与授信 | 每天数千万笔刷卡交易的实时分析;欺诈模型重新训练(重计算)与客户分析团队(高并发查询)分属不同的虚拟仓库——互不抢资源 | 毫秒级 AI 授信决策;两团人马各自提速 |
| 数据接入 | 新数据源从「月度开发上线」变为自助接入 | 新数据集装载 24 小时 → 1 小时 |
| 外部数据 | 用 Data Marketplace 秒接第三方数据(如 Starschema 的疫情数据)做风险情景推演 | 疫情期风险模型的调整以天计而非以月计 |
| 成本治理 | 消费计费天然透明:每个部门用多少、花多少,报表清晰 | 自建治理工具后:省 50,000 小时人工、支出 -27%、单查询成本 -43% |
请特别注意最后一条,它揭示了消费型模式的一个隐藏优势:因为按用量计费,每一分钱都有迹可循——哪家部门、哪个项目、哪条查询花的钱清清楚楚。买断制的时代这笔账是算不清的(授权费摊在哪?谁也说不清)。这是「用量收费」在管理上的正外部性。
同样的故事在不同行业反复上演:资管巨头 BlackRock 把 Aladdin 平台的数据底座建在 Snowflake 上(每晚数百万数据文件汇入、每天 1,160 亿数据点);制药、零售、电信的案例在 Snowflake 官网排成一列。核心模式高度一致:把分散在各业务系统的数据集中入仓 → 各团队用独立算力各自分析 → 按用量付费,用多少算多少。
Snowflake 从「数据仓」这一端出发,把仓库搬上云、拆开存算;Databricks 则从「数据湖」那一端出发,把湖的「乱」治理出秩序。它的起点是 2009 年 UC Berkeley AMPLab 的 Spark 项目(第三篇提过:内存计算,比 MapReduce 快一到两个数量级),2013 年由 Spark 创始团队创办。
Databricks 给行业贡献了一个核心概念:Lakehouse(湖仓一体)——在数据湖的开放存储格式之上,补上数据仓的三大能力(事务一致性、高性能 SQL、完善治理)。数据湖的便宜与灵活保留了,数据仓的纪律与性能补齐了。2026 年它的产品线已经相当完整:Lakehouse 数据仓、Lakebase(交易与分析一体的 serverless Postgres)、Genie(自然语言分析)、Agent Bricks(企业 AI 智能体构建)、Unity Catalog(统一治理),外加 5ms 级实时流处理。规模上:20,000+ 客户,超过 60% 的 Fortune 500 在用。
它与 Snowflake 最根本的差异不在功能清单,而在基因:Databricks 是开源路线(Spark、Delta Lake、MLflow 都是开源项目),目标客户是「要自己动手造 AI 的企业」——有数据工程团队、Python/Spark 文化、希望在开放格式上构建自己的模型与智能体。两个典型客户案例:
| 客户 | 用法 | 效果 |
|---|---|---|
| Mastercard | 年 1,730 亿笔交易的欺诈检测与风险分析——海量实时流数据 + 机器学习工作负载 | 金融级欺诈检测的行业标杆;万圣节前夜的交易洪峰也扛得住 |
| 诺和诺德(Novo Nordisk) | 1,000 名研究员用 Genie(自然语言分析)直接查询临床试验数据 | 数周的数据分析变成数秒;临床试验优化贡献 $1.57 亿净新增价值 |
| adidas | 200 万+ 条商品评论的情感分析 | 分析效率 +30–40%,查询延迟 -60% |
注意 Mastercard 和诺和诺德的共同点:都不是「找分析师看报表」,而是在自己的数据上构建机器学习与 AI 应用。这就是 Databricks 客户画像与 Snowflake 的分野——这个分野在下一节的对照实验里表现得淋漓尽致。
要理解两家公司的差异,最好的素材是一个「近乎受控实验」的市场现象:体育行业的球迷个性化——这个需求同时被两家的客户用两家的产品满足了。
| Fanatics × Snowflake | FOX Sports × Databricks | |
|---|---|---|
| 业务 | 体育授权商品与球迷电商(1 亿+ 球迷,2B+ 每日信号) | 体育媒体(实时赛事内容) |
| 痛点 | 球迷分散在商品/收藏/游戏多条业务线,画像对不齐 | 赛事数据实时流式处理,比赛进行中就要出洞察 |
| 用法 | Snowflake 拼出 FanGraph(每球迷数百属性统一画像)+ CoWork 智能体:业务人员自然语言查数、圈人群、发营销 | Databricks 实时处理比赛数据 + 应用内聊天机器人:球迷随问随答,比赛每一刻生成个性化内容 |
| 成果 | 统一画像 → 广告受众网络(数据变成广告生意) | 实时流处理支撑比赛级时效 |
| 选型逻辑 | 业务团队自助分析、低运维、消费弹性——数据是「被消费」的 | 工程团队主导、实时流+ML 深度定制——数据是「被加工」的 |
行业对这两家的选型共识可以粗略总结成一句话:「SQL 团队选 Snowflake,工程团队选 Databricks」。Snowflake 的高并发 BI、零运维、业务自助更省心;Databricks 的开源自由度、ML 工具链(MLflow)、大规模分布式加工更强——但代价是需要 Spark/Python 专才(工程师年薪 $15 万美元起)和更复杂的成本管理(平台费与云资源费双账单)。两家甚至抢到同一个口号上:超过 60% 的 Fortune 500 同时是两家的客户——大部分大企业的数据版图里,两家并存、各管一摊工作负载。
把视角拉回 2015 年那个「两难路口」。Snowflake 和 Databricks 的崛起,精确地吃掉了两个旧霸主的午餐——而且吃法很有意思,是互相配合着吃的:
吃掉 Teradata 的午餐:Teradata 的核心价值是「全公司统一分析」,软肋是「贵 + 封闭 + 扩容慢」。Snowflake 用 1/10 的成本给出同样甚至更好的分析体验,还附赠弹性——银行、零售、制造业的数据仓迁移潮持续至今,Capital One 只是最著名的一例。
吃掉 Hadoop 发行版的午餐:Cloudera/Hortonworks(把 Hadoop 打包成企业发行版售卖的公司)曾融资数十亿美元,巅峰时合并抱团,最终在 2021 年被收购退出独立舞台——因为 Databricks 用 Lakehouse 提供了比「Hadoop 全家桶」整洁得多的开源路线,而云上的存算分离让 Hadoop 唯一的省钱优势也消失了。
到 2026 年,数据仓库市场的格局已经重排:Snowflake 与 Databricks 两大云原生平台双雄并立,Teradata 退守存量,Hadoop 发行版退场,三大云厂商的原生数仓(Redshift/BigQuery/Synapse)以捆绑策略自守一方。这个格局的下一幕——AI 时代数据层的重新洗牌——是第六篇的内容。
本篇数据与案例来源:Snowflake FY27 Q2 8-K(SEC)、Snowflake 官网案例库(Capital One/BlackRock/Fanatics)、Harvard Business Review 与 diginomica 的 Capital One 专稿、Databricks 官网案例库(Mastercard/诺和诺德/adidas/FOX Sports)、SiliconANGLE(Fanatics vs FOX Sports,Summit 26 采访)、7wData 平台评测、腾讯财经与 21 财经财报报道。Capital One 为 Snowflake 早期投资者(HBR 披露),引用时已留意其立场。两家公司客户数、收入指引均以各自 2026 年公开披露为准。
系列下一篇 · 《中国的路:数据中台的梦与国产替代》——2015–2021 年中国最激进的组织化尝试(数据中台)为什么没能长出 Snowflake?工行、招行、安踏们用什么解决了问题?以及中国版数据消费叙事的观察哨在哪里。