← 返回专题目录DR.04 · 2026-09-07公开资料研究 · 不构成投资建议
一级市场投资复盘 · 行业深度研究 · 数据的基础设施系列 04/8

云与两条路线:Snowflake 和 Databricks 的时代

2006 年的云改写了成本函数;Snowflake 用存算分离+按秒计费把数据仓库变成自来水公司(Capital One 实证);Databricks 用 Lakehouse 服务造 AI 的企业(Mastercard/诺和诺德);Fanatics vs FOX Sports 的同场景对照实验。

系列 数据的基础设施(第四专题) 发布 自媒体公开版 研究方法 公开财报 + 厂商案例库 + 行业对比

第四篇 · 云与两条路线:Snowflake 和 Databricks 的时代

第三篇结尾,企业站在两难的路口:Teradata 稳定但贵到只有巨头用得起,Hadoop 便宜但乱到只有互联网公司玩得转。市场上留着一个空位——有没有一个「像数据仓一样好用、像数据湖一样便宜、还不用自己运维」的东西?两家公司从两个方向出发,几乎同时回答了这个问题。这一篇讲它们的崛起:Snowflake 怎么把数据仓库变成「自来水公司」,Databricks 怎么把数据湖变成「实验室」,以及一个绝妙的对照——两家公司的客户,正在用它们做几乎同一件事。

本篇要回答的问题

1. 2006 年的云到底改变了什么——为什么说没有 AWS S3 就没有 Snowflake?
2. Snowflake 的三个洞察是什么?它凭什么让 Capital One 把 Teradata 赶出家门?
3. 消费型计费(用多少付多少)的本质是什么——为什么它是 AI 时代的正确商业模式?
4. Databricks 的 Lakehouse 是什么?它和 Snowflake 抢的是同一批客户吗?
5. Fanatics 和 FOX Sports 用两家公司的产品做了几乎同款的事——那选型的逻辑到底是什么?

本篇速览

12006 年 AWS 上线,存储降到每月几美分一 GB、算力按小时租——数据仓库最大的成本(买硬件)第一次变成了「不用买」
2Snowflake 的三个洞察:存储与计算各自独立计费、按秒计费随用随关、跨三大云保持中立——2015 年产品上线,2020 年完成当年最大软件 IPO。
4Capital One 用脚投票:6,000 分析师、每天 400 万次查询搬上 Snowflake,省 5 万小时人工、IT 支出 -27%——Teradata 的一体机从此退役。
5Databricks 从另一端出发:把数据湖的「乱」用开源架构治理成 Lakehouse,客户是自己动手造 AI 的企业——Mastercard 用它做欺诈检测,诺和诺德用它省出 $1.57 亿。
6最妙的对照:Fanatics 用 Snowflake、FOX Sports 用 Databricks,做的是几乎同款的「球迷个性化」——同一场景、两种工具,选型逻辑泾渭分明

一、2006:地基先于大楼

回看 Snowflake(2012 年成立)和 Databricks(2013 年成立)的创业时点,会发现它们都踩在同一个前提条件之上——这个前提不是某个天才的灵感,而是亚马逊在 2006 年上线的基础设施:S3(3 月,云存储)和 EC2(8 月,云算力)。

在 S3 之前,「存储」是有生命的成本:买磁盘阵列、配机房、算折旧、扛故障。S3 把它变成了一项服务:每 GB 每月几美分,无限弹性,永不丢失。EC2 把「算力」也变成了服务:一台服务器按小时租,用完销毁。这两件事对数据行业意味着成本函数的彻底改写——

表:云改写数据仓库的成本函数
成本项Teradata 时代云时代
存储磁盘阵列采购,按峰值容量买断按实际存量按月付费,且单价持续下探
算力CPU 买断,闲置也是折旧按小时/按秒租用,随开随关
扩容采购流程,以月计调大参数,以分钟计
容灾自建异地备份云厂商内建多副本

但云厂商自己并没有立刻兑现这个红利——AWS 的 Redshift(2013)最初仍是传统架构的云上版本,存储和计算绑定。真正的革命要等一个「纯云原生的架构设计」:既然存储已经便宜到可以随便存,那就把存储和计算彻底拆开——数据永远存在便宜的地方(云存储),需要计算时临时租算力来跑,跑完就退。

二、Snowflake 的三个洞察:把数据仓库变成自来水公司

2012 年,三位前 Oracle 高管(Benoit Dageville、Thierry Cruanes 曾负责 Oracle 数据库架构,Marwit Zugnoni)与 CEO Mike Sperber、Bob Muglia 相继组成团队创办 Snowflake。他们的三个洞察,每一个都针对旧世界的一个具体痛点:

表:Snowflake 的三个洞察——每个都是对旧痛点的精确回应
洞察回应的旧痛点给客户的体验
存算彻底分离:数据存云存储,计算节点是「虚拟仓库」,可独立开关、独立扩缩Teradata 扩容要采购整机;一个部门的查询挤占另一个部门市场部大促分析临时开大算力,跑完关掉——财务部月结完全不受影响
按秒计费:计算用一秒付一秒的钱授权买断制,闲置也是折旧半夜没人查数就不花钱;新接入一个数据源试跑两周,成本几乎忽略
跨云中立:同样的产品跑在 AWS/Azure/GCP 三大云上,不做自己的应用与客户竞争云厂商既是平台供应商又是竞品(数仓 vs 模型服务)企业敢把全部数据放进来——不会被绑死在某个云的生态里

展开:「跨云中立」到底在说什么

表格里「跨云中立」四个字值得单独展开,因为它是 Snowflake 与云厂商数仓最本质的区别,也是企业选择它的第一理由。先看图:

「跨云中立」图解:三大云的双重身份与 Snowflake 的位置先理解「绑死」(vendor lock-in):把数据存进某个云的专有格式之后——· 迁出 = 全量搬运 + 系统重写,成本以年计;不迁 = 接受对方随时调价· 云厂商对你的议价能力,取决于你的「离不开程度」AWSRedshift 数仓Bedrock 大模型数仓与模型是竞品AzureSynapse 数仓Azure OpenAI同上:双重身份GCPBigQuery 数仓Vertex 大模型同上:双重身份企业 CIO 的噩梦:核心数据放在一个「利益相关的对手」手里
「跨云中立」图解:三大云的双重身份与 Snowflake 的位置

三大云厂商各自有一个数仓产品(AWS 的 Redshift、微软的 Synapse、谷歌的 BigQuery),同时各自还有大模型服务(Bedrock、Azure OpenAI、Vertex)。这就产生了一个微妙的利益结构:企业若把全部数据放进某朵云的数仓,而未来 AI 应用的模型又恰恰选了同朵云的竞品服务——数据的「看门人」和「竞争者」是同一家公司。企业 CIO 对此的应对是多云策略:关键基础设施不押注单一云厂商。

Snowflake 的位置恰好卡在这个缺口上:它自己不卖算力、不卖大模型——同样的产品、同样的界面、同样的功能,跑在三大云之上(租用它们的算力再零售给客户)。客户用它,相当于买了一个「云上中立层」:数据池在 Snowflake 里,底层算力在哪个云、未来换到哪个云,客户都可以换,Snowflake 帮客户对冲了「绑死」风险。这也解释了它的一条产品铁律:永远不推出自己的大模型、不做与客户竞争的应用——一旦做,中立性这个最值钱的护城河就塌了。三大云厂商数仓与 Snowflake 长期共存而非被吞掉,中立性信任(加上存量迁移成本)是最重要的原因。

2015 年产品正式上线(GA),增长曲线陡峭得罕见:2019 年 ARR(年经常性收入)达 3.5 亿美元,2020 年上市完成当年最大软件 IPO,上市首日市值翻倍——巴菲特旗下伯克希尔在 IPO 前夜以「罕见」的方式买入了它的私募份额。到 2026 年,Snowflake 年产品收入指引已达 60.7 亿美元(+36%),服务 11,000+ 企业客户。

关于它的商业模式,值得单独强调一件事(这是理解后面所有分析的钥匙):Snowflake 卖的是「用量」,不是「授权」。客户每查一次数、每存一个 TB、每跑一次 AI 任务,付一笔钱。这带来两个推论:其一,客户的成功=Snowflake 的收入(客户业务越发展、AI 用得越多,消费越多)——不存在「签完约就见不到销售」的割裂;其二,收入即消费的真实刻度——电表走了才有钱,所以消费增长基本造不了假。这也是为什么资本市场格外看重「产品收入增速」与 NRR(老客户消费留存率)这两个指标。

三、Capital One:一家银行用它做什么

Snowflake 官方案例库里最值得细读的是 Capital One——美国第一家宣布全面离开自建机房、进入公有云的银行。监管最严的行业都敢上,其余行业的顾虑就都可以商量了。

它的用法很有代表性:6,000 多名分析师、每天最多 400 万次查询,全部跑在 Snowflake 上。具体做了什么:

表:Capital One 的 Snowflake 用法清单(来自 HBR 与 diginomica 报道)
场景怎么用效果
反欺诈与授信每天数千万笔刷卡交易的实时分析;欺诈模型重新训练(重计算)与客户分析团队(高并发查询)分属不同的虚拟仓库——互不抢资源毫秒级 AI 授信决策;两团人马各自提速
数据接入新数据源从「月度开发上线」变为自助接入新数据集装载 24 小时 → 1 小时
外部数据用 Data Marketplace 秒接第三方数据(如 Starschema 的疫情数据)做风险情景推演疫情期风险模型的调整以天计而非以月计
成本治理消费计费天然透明:每个部门用多少、花多少,报表清晰自建治理工具后:省 50,000 小时人工、支出 -27%、单查询成本 -43%

请特别注意最后一条,它揭示了消费型模式的一个隐藏优势:因为按用量计费,每一分钱都有迹可循——哪家部门、哪个项目、哪条查询花的钱清清楚楚。买断制的时代这笔账是算不清的(授权费摊在哪?谁也说不清)。这是「用量收费」在管理上的正外部性。

同样的故事在不同行业反复上演:资管巨头 BlackRock 把 Aladdin 平台的数据底座建在 Snowflake 上(每晚数百万数据文件汇入、每天 1,160 亿数据点);制药、零售、电信的案例在 Snowflake 官网排成一列。核心模式高度一致:把分散在各业务系统的数据集中入仓 → 各团队用独立算力各自分析 → 按用量付费,用多少算多少。

四、Databricks:从另一端出发的路线

Snowflake 从「数据仓」这一端出发,把仓库搬上云、拆开存算;Databricks 则从「数据湖」那一端出发,把湖的「乱」治理出秩序。它的起点是 2009 年 UC Berkeley AMPLab 的 Spark 项目(第三篇提过:内存计算,比 MapReduce 快一到两个数量级),2013 年由 Spark 创始团队创办。

Databricks 给行业贡献了一个核心概念:Lakehouse(湖仓一体)——在数据湖的开放存储格式之上,补上数据仓的三大能力(事务一致性、高性能 SQL、完善治理)。数据湖的便宜与灵活保留了,数据仓的纪律与性能补齐了。2026 年它的产品线已经相当完整:Lakehouse 数据仓、Lakebase(交易与分析一体的 serverless Postgres)、Genie(自然语言分析)、Agent Bricks(企业 AI 智能体构建)、Unity Catalog(统一治理),外加 5ms 级实时流处理。规模上:20,000+ 客户,超过 60% 的 Fortune 500 在用。

它与 Snowflake 最根本的差异不在功能清单,而在基因:Databricks 是开源路线(Spark、Delta Lake、MLflow 都是开源项目),目标客户是「要自己动手造 AI 的企业」——有数据工程团队、Python/Spark 文化、希望在开放格式上构建自己的模型与智能体。两个典型客户案例:

表:Databricks 客户案例两则(官网数据)
客户用法效果
Mastercard年 1,730 亿笔交易的欺诈检测与风险分析——海量实时流数据 + 机器学习工作负载金融级欺诈检测的行业标杆;万圣节前夜的交易洪峰也扛得住
诺和诺德(Novo Nordisk)1,000 名研究员用 Genie(自然语言分析)直接查询临床试验数据数周的数据分析变成数秒;临床试验优化贡献 $1.57 亿净新增价值
adidas200 万+ 条商品评论的情感分析分析效率 +30–40%,查询延迟 -60%

注意 Mastercard 和诺和诺德的共同点:都不是「找分析师看报表」,而是在自己的数据上构建机器学习与 AI 应用。这就是 Databricks 客户画像与 Snowflake 的分野——这个分野在下一节的对照实验里表现得淋漓尽致。

五、一个天然的对照实验:Fanatics vs FOX Sports

要理解两家公司的差异,最好的素材是一个「近乎受控实验」的市场现象:体育行业的球迷个性化——这个需求同时被两家的客户用两家的产品满足了。

表:同场景两种工具——Fanatics(Snowflake)vs FOX Sports(Databricks)
Fanatics × SnowflakeFOX Sports × Databricks
业务体育授权商品与球迷电商(1 亿+ 球迷,2B+ 每日信号)体育媒体(实时赛事内容)
痛点球迷分散在商品/收藏/游戏多条业务线,画像对不齐赛事数据实时流式处理,比赛进行中就要出洞察
用法Snowflake 拼出 FanGraph(每球迷数百属性统一画像)+ CoWork 智能体:业务人员自然语言查数、圈人群、发营销Databricks 实时处理比赛数据 + 应用内聊天机器人:球迷随问随答,比赛每一刻生成个性化内容
成果统一画像 → 广告受众网络(数据变成广告生意)实时流处理支撑比赛级时效
选型逻辑业务团队自助分析、低运维、消费弹性——数据是「被消费」的工程团队主导、实时流+ML 深度定制——数据是「被加工」的

行业对这两家的选型共识可以粗略总结成一句话:「SQL 团队选 Snowflake,工程团队选 Databricks」。Snowflake 的高并发 BI、零运维、业务自助更省心;Databricks 的开源自由度、ML 工具链(MLflow)、大规模分布式加工更强——但代价是需要 Spark/Python 专才(工程师年薪 $15 万美元起)和更复杂的成本管理(平台费与云资源费双账单)。两家甚至抢到同一个口号上:超过 60% 的 Fortune 500 同时是两家的客户——大部分大企业的数据版图里,两家并存、各管一摊工作负载。

六、它们共同终结了什么:两代霸主的黄昏

把视角拉回 2015 年那个「两难路口」。Snowflake 和 Databricks 的崛起,精确地吃掉了两个旧霸主的午餐——而且吃法很有意思,是互相配合着吃的

吃掉 Teradata 的午餐:Teradata 的核心价值是「全公司统一分析」,软肋是「贵 + 封闭 + 扩容慢」。Snowflake 用 1/10 的成本给出同样甚至更好的分析体验,还附赠弹性——银行、零售、制造业的数据仓迁移潮持续至今,Capital One 只是最著名的一例。

吃掉 Hadoop 发行版的午餐:Cloudera/Hortonworks(把 Hadoop 打包成企业发行版售卖的公司)曾融资数十亿美元,巅峰时合并抱团,最终在 2021 年被收购退出独立舞台——因为 Databricks 用 Lakehouse 提供了比「Hadoop 全家桶」整洁得多的开源路线,而云上的存算分离让 Hadoop 唯一的省钱优势也消失了。

到 2026 年,数据仓库市场的格局已经重排:Snowflake 与 Databricks 两大云原生平台双雄并立,Teradata 退守存量,Hadoop 发行版退场,三大云厂商的原生数仓(Redshift/BigQuery/Synapse)以捆绑策略自守一方。这个格局的下一幕——AI 时代数据层的重新洗牌——是第六篇的内容。

本篇小结:三个带走的概念

存算分离 + 按秒计费 = 把数据仓库变成自来水公司:Snowflake 的成功是成本函数的胜利,不是某个炫技功能。
消费型计费是 AI 时代的正确商业模式:AI 的成本结构天然按用量走(token/查询/存储),计费方式与之一致的平台自动承接 AI 支出流。
Snowflake 与 Databricks 的分野是客户画像的分野:用数据的企业 vs 造 AI 的企业——Fanatics vs FOX Sports 的同场景对照是最好的试金石。

数据来源与口径说明

本篇数据与案例来源:Snowflake FY27 Q2 8-K(SEC)、Snowflake 官网案例库(Capital One/BlackRock/Fanatics)、Harvard Business Review 与 diginomica 的 Capital One 专稿、Databricks 官网案例库(Mastercard/诺和诺德/adidas/FOX Sports)、SiliconANGLE(Fanatics vs FOX Sports,Summit 26 采访)、7wData 平台评测、腾讯财经与 21 财经财报报道。Capital One 为 Snowflake 早期投资者(HBR 披露),引用时已留意其立场。两家公司客户数、收入指引均以各自 2026 年公开披露为准。

系列下一篇 · 《中国的路:数据中台的梦与国产替代》——2015–2021 年中国最激进的组织化尝试(数据中台)为什么没能长出 Snowflake?工行、招行、安踏们用什么解决了问题?以及中国版数据消费叙事的观察哨在哪里。

本文首发:2026-09-07 | 期号 DR.04 | 版权归 头哥投研(touge.com.cn)所有
本文首发:2026-09-07 | 期号 DR.04 | 版权归 头哥投研(touge.com.cn)所有