数据中台与 Snowflake 诊断出同一张病历、开了不同的药方;工行/招行/安踏的国产替代实战;「中国造不出 Snowflake」的精确含义;以及中国版数据消费叙事的三个观察哨。
前四篇讲的都是美国故事:Teradata 的特权、Hadoop 的混乱、Snowflake 和 Databricks 的崛起。但中国并不是这个故事的旁观者——恰恰相反,2015–2021 年间,中国用一种更激进的方式尝试解决同一个问题:数据中台。这一篇正面回答三个问题:数据中台想解决什么(答案是:和 Snowflake/Databricks 一模一样的问题)?为什么它没有长成 Snowflake?以及,中国大型企业实际上用什么方式解决了数据问题——工行、招行、安踏们的真实路径,与「中国版数据消费叙事」的观察哨。
本篇要回答的问题
1. 「数据中台」到底是什么?它和 Snowflake/Databricks 是什么关系?
2. 数据中台热潮为什么兴起,又为什么退潮——它做成了什么、没做成什么?
3. 中国大型企业(工行、招行、安踏)实际用什么解决了数据问题?效果如何?
4. 为什么说「中国造不出 Snowflake」是商业环境问题而不是技术问题?
5. 中国版「数据消费」叙事的观察哨设在哪里?
在讲数据中台之前,要先理解中国企业的信息化路径与美国有几个结构性不同——这些不同决定了后面每一步的选择。
| 维度 | 美国 | 中国 |
|---|---|---|
| 起步时间 | 1960s–70s 起步,数仓 1990s 成熟,各代技术有充足消化期 | 2000 年前后起步,跨过主机/小型机阶段快速进入互联网时代——「跨越式」但每代技术消化不足 |
| 数仓市场 | Teradata/Oracle 霸权五十年,付费习惯成熟 | Teradata 只进入头部大行;多数企业从未买过传统数仓——直接从「没数仓」跳到「要上云」 |
| 监管环境 | 数据可以充分上公有云(Capital One 全量上 AWS) | 金融/政务/央企:数据不出行不出域(信创、等保合规) |
| 供给格局 | Oracle/Teradata/微软 + 三大云,生态开放兼容 | 阿里/腾讯/华为三大云生态割裂,互不兼容 |
| 付费文化 | 订阅+用量,为「使用权」持续付费 | 项目制:一次性建设款+后续压价,为「所有权」付费 |
特别注意第二行的那个「跨越」:因为多数中国企业从未拥有过传统数仓,所以当云时代到来时,它们对「替代 Teradata」没有历史包袱,却也没有「怎么用好一个数据仓库」的组织记忆。这个特点在数据中台热潮中会被反复放大。
数据中台概念的引爆点,业内公认为 2015 年:阿里巴巴管理层参观芬兰游戏公司 Supercell 后深受触动——这家公司只有两百多名员工,却能把游戏开发的公共能力(账号、支付、美术、引擎)沉淀成所有小团队随取随用的「中台」,因此可以同时快速试错几十个游戏项目。阿里随即提出「大中台、小前台」战略:把各业务线重复建设的数据与技术能力沉淀到中台,前台业务小团队快速迭代。
数据中台是其中最重要的一环。阿里的 OneData 方法论给出了一套完整蓝图:所有业务数据统一接入(OneData 体系)、统一口径(OneService 数据服务)、统一资产(数据地图/血缘/质量监控),前台业务「用数据像用电一样插上就用」。这套东西解决的痛,与 Snowflake/Databricks 解决的痛**逐字相同**:
| 病历(共同的痛) | 数据中台的药方(中国) | Snowflake/Databricks 的药方(美国) |
|---|---|---|
| 数据孤岛:各系统数据分散 | 统一接入所有业务系统的数据到中台 | 统一接入到云上 Data Cloud / Lakehouse |
| 口径分裂:「活跃客户」各说各话 | OneData 统一指标定义与数据地图 | 统一语义层(Snowflake Semantic Views / Open Semantic Interchange) |
| 重复建设:每个部门一套报表 | 数据服务 API 化,能力复用 | 数据共享(Marketplace/Zero-copy Sharing),分析自助化 |
| 取数排队:业务等分析师工单 | BI 工具+数据服务赋能业务(理想态) | 自然语言分析(Snowflake Intelligence / Genie)直接给业务自助 |
同一个诊断,两种药方。中国的药方是「组织+工程」:成立数据中台部门,把各业务线的数据团队收编,由中台统一开发数据管道与服务,业务线按需调用——重人力、重项目、重组织协同。美国的药方是「产品」:把同样的问题封装成一个自助式的软件产品,业务团队自己动手,厂商只提供平台——重产品、重自动化、按用量付费。
公平地说,数据中台热潮做成了不少事,尤其在头部大厂和大型集团:
| 领域 | 做成了什么 | 代表 |
|---|---|---|
| 超级大厂内部 | 阿里双 11 的实时数据大屏、字节跳动的增长分析体系——中台在单一强权组织内确实高效 | 阿里、字节、美团、滴滴 |
| 方法论输出 | OneData、数据资产目录、数据质量监控——这些概念沉淀进了后来所有数据产品 | 阿里云数据中台、袋鼠云、数澜科技、奇点云等创业潮(2018–2020) |
| 行业认知 | 「数据是资产」「统一口径」「数据服务化」成为全行业共识——为后来的云数仓采购完成了市场教育 | 各行业头部集团 |
在大厂内部,中台模式取得过真实的成功——因为阿里这类组织具备两个前提:CEO 级权力背书(中台能强制收编各业务线的数据权),以及足够大的内部业务多样性(规模效应摊薄建设成本)。但这两个前提,恰恰是大多数「想上中台」的企业不具备的。
2020 年之后,数据中台热潮明显退潮:阿里自身在 2021 年后进行组织调整、中台概念被「拆解」的报道频出;中小企业的中台项目大量烂尾;中台创业公司转型去做数仓产品或行业解决方案。退潮不是偶然,而是三个基因缺陷的必然:
| 缺陷 | 机制 | 与 Snowflake 模式的对照 |
|---|---|---|
| ① 项目化,不可复制 | 每家企业的中台都是「为这家企业定制」的工程:数据接入要写定制管道、口径梳理要做业务访谈、服务开发要单独排期——同一套能力在不同客户那里要从头再做一遍 | Snowflake 是同一个产品服务一万一千家客户——开发一次,复制无限次;客户的定制需求由平台的自助功能承接 |
| ② 交付驱动,没有消费飞轮 | 中台按项目验收:建设完成、验收通过、结项——之后用得越多,中台团队的维护成本越高但收入不变;没有「客户用得越多厂商赚得越多」的飞轮 | 消费型计费:客户业务增长 → 用量增长 → 收入增长,厂商的鼓励方向与客户利益完全一致 |
| ③ 组织政治与权力 | 中台的本质是「收编」各业务线的数据权力——谁的数据、谁的定义、谁的服务优先级,全部上收到中台部门。业务线抵触、扯皮、阳奉阴违;没有 CEO 级强力背书的中台,往往活不过第一次组织架构调整 | 产品不收编权力:每个团队开自己的虚拟仓库、算自己的费用——不碰组织权力,只提供统一工具 |
第三个缺陷最致命,也最少被讨论。数据中台之争表面上争的是技术架构,实质上争的是「谁是公司数据的权威」——这在中国企业的组织语境里是碰不得的权力再分配。Snowflake 的产品设计恰恰绕开了这个雷区:它不收编任何人的数据权力,只提供一个「大家都愿意用」的工具。用产品的方式解决组织的问题——这是软件业最深刻的智慧之一,也是数据中台最该从 Snowflake 身上学走的东西。
中台退潮的同时,另一条路走通了:国产数据仓库对 Teradata/Oracle 的替代。这不是概念,是一组有数字的实战:
| 企业 | 动作 | 成果 |
|---|---|---|
| 工商银行 | GaussDB(DWS) 全面替代 Teradata 一体机,从封闭一体机转向开放分布式架构 | 分析师平台承载 1.3 万名分析师在线探索;作业平均等待 300 分钟 → 1.5 分钟;灵活查询 30 分钟 → 50 秒 |
| 招商银行 | 建成国内首个大规模金融云数仓 | 全行数据应用链路时长缩短 15%+,批量处理提前 2 小时+,业务用户查询时长缩短 75% |
| 光大银行 | 数据分析大集中,汇聚全行数据资产 | 批量作业时长缩短 8 小时,数据服务时间窗延长 2 倍 |
| 兴业银行 | 新一代数字底座 MPP 平台 | 高可用空间增长 21 倍,单集群并发能力增长 24 倍 |
| 安踏电商 | 混合负载集群「一库两用」:交易与分析同集群 | 多个双十一/双十二稳健运行,免库间 ETL |
| 兴盛优选 | 四套开源组件(Kudu+Impala+Hive+ClickHouse)合一 | 复杂分析 10 分钟级 → 秒级,维护工作量 -50% |
行业面:据《金融数据仓库发展报告(白皮书)》,国有大行使用国产数据仓库产品或自研的比例达 83.33%,股份制银行为 66.67%;GaussDB(DWS) 在国有大行与股份制银行的部署比例达 55.6%。替代的前提是技术不丢人:GaussDB(DWS) 同样是云原生、存算分离架构——中美数据基础设施在技术方向上是趋同的。
但这组数字必须与两个结构性事实放在一起读:其一,这些替代项目全部是「License + 驻场共建 + 数据不出行」模式——华为与银行的关系是联合开发与长期服务,不是「银行自助订阅一个 SaaS」;其二,替代的动因排序是「自主可控 > 性能与成本」——技术好只是入场券,政策与安全才是决策的第一变量。这两点决定了中国数据基础设施生意的本质:**项目与许可(License)型生意**——收入按交付与许可确认,没有 NRR、没有消费加速、没有「客户用得越多我赚得越多」的飞轮。
事实做得好且在加速,但要分清量级。2026 年上半年,Snowflake Marketplace 上的数据与应用提供商总收入(gross bookings)超过 1 亿美元、同比 +277%,交易笔数 1,700+。提供商包括 S&P Global、FactSet、Nasdaq(第三方数据集)、Dun & Bradstreet(6.4 亿企业记录——已把数据变成 Cortex 智能体供客户自然语言查询)、Crunchbase、Equilar;应用类有 dbt Labs、Sigma、Sema4.ai、Penguin AI 等。42% 的 Snowflake 客户至少有一条稳定的数据共享关系。[Snowflake 官方博客,2026-07]
研究推断但量级要摆正:1 亿美元/半年,只占 Snowflake 总收入的约 3%——Marketplace 目前是生态粘性功能与新增长曲线的雏形,不是收入主力。它的价值有三层:其一,零拷贝共享(数据不搬家就能卖)让「数据变现」的技术门槛降到历史最低;其二,数据提供商与客户形成稳定关系后,会带动底层消费增长(共享的数据被查询,查询计费归平台);其三,2026 年起数据 listing 可以一键转成 AI 智能体——Marketplace 正在变成「Agentic Enterprise」的分发渠道。对照中国的结论不变:企业间数据交易的商业生态在美国由平台自然生长(已有真实交易额),在中国靠制度推进(交易所+入表)——差距在生态而非技术。
本系列一直强调一个区分,这里给出最精确的表述:「中国造不出 Snowflake」指的不是技术,而是商业模式与土壤。
| 维度 | 中国能造出吗 | 证据 |
|---|---|---|
| 数据仓库的技术能力(存算分离、分布式、高并发) | 能,且已经造出 | GaussDB(DWS)、OceanBase(蚂蚁)、TiDB(PingCAP)、StarRocks——性能指标与国际产品在同一量级,且在大行实战验证 |
| Snowflake 的商业模式(中立第三方 SaaS、订阅+用量、跨云自助) | 难,土壤问题 | 数据主权合规限制公有云 SaaS 的边界;云生态割裂使「跨云中立」价值打折;项目制付费文化使消费计费缺乏客户基础;独立厂商难以与云生态竞争 |
| 数据 Marketplace(企业间数据交易市场) | 未形成,走制度路径 | 上海/深圳数据交易所、数据资产入表(2024 年起)——由制度推动而非商业自然生长 |
这个区分对 A/H 投资的直接影响:中国数据基础设施公司的生意是「项目+License」型——收入由交付与许可确认,增长由签约项目驱动,缺乏消费型 SaaS 的「NRR/消费加速」类指标,估值逻辑必须与 Snowflake 式 SaaS 区分开。用 SaaS 的倍数去套中国数仓公司的估值,是常见的框架错配。
既然独立 SaaS 的土壤尚缺,中国版「数据消费」叙事的唯一入口,是云厂商内部的 AI 消费收入。这条路径有三个观察哨:
| 观察哨 | 要看什么 | 意义 |
|---|---|---|
| ① 云厂商财报的科目变化 | 阿里云/金山云/腾讯云财报中,「模型服务」「token 消费」「AI 相关收入」是否成为独立披露的科目并快速放量 | 阿里云百炼等大模型平台已按 token 计费——当这个数字大到值得单独披露,就是中国版「消费加速」的证据 |
| ② Agent 应用的数据访问架构 | 企业 Agent 的数据读写走「中央数据层」(利于平台化计费)还是「直连各 SaaS」(绕过数据层) | 决定 Snowflake 式「数据层收税」模式在中国是否成立 |
| ③ 星环科技等独立厂商的转型 | 星环(688031)向 AI 数据平台转型后,能否在金融信创场景拿到持续性的「使用量型」订单(而非一次性项目) | 独立厂商若能证明消费型收入的雏形,将打破「项目制」宿命 |
三个观察哨中任何一个触发,都值得栏目立刻立项跟踪——那就是 MM/ER/ND 递进链的中国分叉。
本篇数据来源:华为云开发者论坛与官方案例(工行/招行/光大/兴业/安踏/兴盛优选 GaussDB(DWS) 案例)、《金融数据仓库发展报告(白皮书)》(国有大行国产/自研比例 83.33%、GaussDB 渗透 55.6%)、数字经济发展网与 51CTO 报道、阿里巴巴「大中台小前台」战略公开报道(2015)、OneData 方法论公开资料、数据中台退潮的行业讨论(2021)。Supercell 组织模式参考为其官方与媒体公开报道。星环科技经营数据以其科创板公告为准。
系列下一篇 · 《AI 时代:向量数据库与 Agentic Enterprise》——AI 为什么需要一种全新的数据库?RAG 是怎么工作的?大平台如何把向量检索内嵌吞并?以及「Agent 读写企业数据」为什么是数据层的下一个王座之争。