向量是「意思的坐标」;RAG 是两个数据库的合奏;大平台如何内嵌吞并向量检索;Agent 数据访问接口的王座之争;以及全系列收束——数据层是 AI 时代用量与价值同向放大的基础设施。
系列前五篇讲了五十年:业务数据库、数据仓库、大数据、云数仓——它们处理的都是「规整的数据」:表格、行列、SQL。但 2023 年之后,AI 给企业数据世界带来了两种前所未有的东西:一种是「意思的坐标」(向量,让机器按语义而非关键词检索),一种是「会自己干活的数据工人」(Agent,让 AI 直接读写企业数据)。这两种东西催生了向量数据库这个新品类,也把数据层推到了 AI 竞争的最前排。这一篇回答:向量数据库到底是什么、它和传统数据库是什么关系、大平台如何把「吞并」它,以及为什么说 Agent 数据访问权是数据层的下一场王座之争——这也是整个系列的收束:从 Snowflake 的三层账本,到中国数据消费叙事的观察哨。
本篇要回答的问题
1. 「向量」和「嵌入(embedding)」到底是什么——为什么 AI 需要「意思的坐标」?
2. 向量数据库与 Snowflake 这类数据仓库是什么关系——竞争、互补,还是被吞并?
3. RAG 是什么?为什么它是企业 AI 落地的第一站?
4. Agent(智能体)为什么把数据层推向王座之争?MCP 协议在争什么?
5. Snowflake 与 Databricks 的 AI 攻势(Cortex vs Genie/Agent Bricks)各打什么牌?
6. 整个系列的结论:AI 时代重新理解数据层,对 A/H 投资意味着什么?
先解决最基础的问题:什么是向量(vector)和嵌入(embedding)?
大语言模型在处理文字前,会把每个词、每段话变成一串数字,比如 [0.12, -0.85, 0.33, …, 0.07]——可能是上千个甚至上万个数字。这串数字不是随便编码的,它是模型在阅读海量文本后学出的「意思的坐标」:两段意思相近的文字,坐标在空间中的距离就接近。「今天天气真好」和「今日晴朗宜人」的坐标几乎重叠;「今天天气真好」和「本季度应收账款逾期」的坐标相距十万八千里。
这个特性带来一种全新的检索方式。传统的检索是关键词匹配:搜「客诉」只会找到含「客诉」两个字的文档。而语义检索是:把问题和文档都变成向量,找坐标距离最近的——「这条工单的语气是不是像客户投诉」不需要出现「投诉」两个字,意思到了就能找到。更进一步,向量检索能处理「模糊、类比、跨语言」的查找:中文的问题可以匹配到英文的答案。
AI 应用几乎所有的「记忆与知识检索」,底层都是这个几何动作。而存这些坐标、高效做距离计算的专用系统,就叫向量数据库(Pinecone、Milvus、Weaviate、Qdrant 等)。
向量数据库被推上风口,是因为一个叫 RAG(Retrieval-Augmented Generation,检索增强生成)的技术组合——它是企业让大模型「懂自家业务」的标准方法。
大模型有一个致命短板:它只认识训练时见过的公开数据,不知道你公司去年的对账单、你们行业的内部规范、上个月那次事故的处理结论。直接问它,它要么答不出,要么一本正经地编(幻觉)。RAG 的解法是把企业的资料变成向量存进向量库;用户提问时,先做语义检索找出最相关的几段资料,把资料「塞进」大模型的提示词里,让它看着资料回答——回答有据可查,幻觉大幅下降。
| 系统 | 在这次查询里干什么 | 类比 |
|---|---|---|
| 向量数据库 | 语义检索:从十万份历史工单中找出「与本次提问意思最相近」的 5 份 | 图书馆的「语义检索台」:按意思找书 |
| 大模型(LLM) | 阅读找出的资料,组织成一段通顺的回答 | 「读资料写答案」的助理 |
| 数据仓库(Snowflake) | 精确核对:「这位客户的订单状态在系统里到底是什么」——给出唯一正确的事实 | 档案室:按编号调出唯一的原件 |
用一个客服 Agent 的例子串起来:客户问「我的订单怎么了」。向量库先从十万份历史工单里检索出语义最相近的五份处理记录(按意思相似);大模型基于这些记录生成一段解释;最后数据仓库核对这位客户订单的精确状态(「已发货,物流单号 SFxxx」)——语义检索给出「处理思路」,数据仓库给出「唯一事实」。
【研究推断】所以向量库与数据仓的关系不是替代,而是新的一层与旧的一层的配合:数据仓管「精确的事实」(唯一答案),向量库管「相似的知识」(模糊但相关)。AI 应用越普及,这一层组合越成为标配——这就是为什么向量库在 2023 年前后成为增速最快的基础设施品类,Pinecone 估值一度超过 7.5 亿美元,开源的 Milvus(中国团队创办的 Zilliz)也在全球 AI 应用中大规模部署。
独立向量库的窗口期并不长。逻辑很简单:向量库存的数据,本质上还是企业数据的一部分——而企业数据的主战场在 Snowflake、Databricks 和三大云的数据平台上。2023–2026 年,大平台的应对分三步:
| 步骤 | 动作 | 含义 |
|---|---|---|
| ① 内嵌向量类型与检索 | Snowflake 把向量数据类型与相似度检索做进核心引擎(Cortex Search);Databricks 在 Lakehouse 内置向量能力;各大云数据库(pgvector、BigQuery)同样跟进 | 「向量」不再是需要单独采购的品类,而是数据仓自带的功能——独立向量库的客户开始被截流 |
| ② 把 AI 套件做成平台功能 | Snowflake:Cortex Analyst/Search/Gateway、Snowflake Intelligence(自然语言企业分析)、CoWork/CoCo 智能体;Databricks:Genie、Agent Bricks、MLflow | RAG、智能问答、Agent 构建——企业 AI 落地三件套全部平台化,无需自选向量库 |
| ③ 把 AI 与数据消费挂钩 | Snowflake 披露 AI 收入「有意义跃升」并推动 CoCo 账户数季度 +2,000;Databricks 用 Genie 客户案例(诺和诺德 $1.57 亿价值)教育市场 | AI 直接拉动平台消费——向量检索是入口,平台消费是收入 |
【研究推断】这三步走的结果是独立向量库的生态位被挤压到「AI 原生新负载」:真正超高并发、超低延迟、以向量为核心业务的场景(推荐系统、图像检索、专业 Agent 记忆体)。这像极了当年 Hadoop 时代组件动物园的重演——独立品类解决先声问题,大平台负责规模化收编。独立向量库是否重蹈「先声被收编」的覆辙(被收购或边缘化),是 AI 基础设施投资的一个长期观察点。
向量库只是前哨,真正的王座之争在 Agent 层。逻辑链条如下:
企业部署 Agent(智能体)之后,Agent 要干活就必须访问企业数据:查订单、读合同、写工单、调报表。Agent 从哪里读、向哪里写,决定了谁对企业数据的每一次 AI 触达收费。如果 Agent 直接连各个 SaaS 应用(绕过中央数据层),数据层的飞轮就漏气;如果 Agent 统一经由某个数据平台读写(该平台成为「企业数据的 AI 网关」),平台就复制了 Snowflake 在 BI 时代的位置——而且这个时代的数据流量会比 BI 时代大几个数量级。
于是出现了接口标准的争夺:MCP(Model Context Protocol)——Anthropic 2024 年发布的开放协议,让 AI 应用以统一方式连接各类数据源与工具,2025 年起被 OpenAI、Google 等主要玩家跟进,迅速成为 Agent 数据访问的事实标准方向。Snowflake 在 2026 年收购 Natoma(MCP 平台)并推出 Cortex AI Gateway,Databricks 推出 Agent Bricks——两家的动作高度一致:把「Agent ↔ 企业数据」的网关做进自己的平台。谁定义了 Agent 访问企业数据的接口,谁就对 AI 时代的企业数据触达收税。
【研究推断】这也是理解 Snowflake「The Agentic Enterprise runs on Snowflake」口号的正确方式:它不是营销修辞,而是对王座之争的公开宣示。对比第五篇的数据中台——数据中台当年想做而做不到的「企业数据统一服务层」,正在以「Agent 数据网关」的形态被重新尝试,这一次的载体是产品化、全球化的,而且搭着 AI 的东风。
| Snowflake | Databricks | |
|---|---|---|
| AI 产品线 | Cortex 套件(Analyst/Search/Code/ Sense/Gateway)、Snowflake Intelligence、CoWork(个人工作智能体)与 CoCo(代码智能体) | Genie(自然语言分析)、Agent Bricks(智能体构建)、MLflow(模型全生命周期)、Lakebase(AI 时代的应用数据库) |
| 运营证据 | CoCo 账户 9,100+(单季 +2,000)、CoWork 5,800 账户、AI 收入「有意义跃升」(占比未披露) | 7,300+ 账户周活使用 AI 能力(FY26 Q3 披露口径)、$1 亿 AI 收入运行率提前达成、AI 影响 50% 的新签订单 |
| 生态动作 | 收购 Natoma(MCP)、与 SAP/Workday/Palantir 合作、牵头 Open Semantic Interchange | 整合 Anthropic/OpenAI 模型、Lakeflow 数据管道、Delta Sharing 开放共享协议 |
| 路径差异 | 让「用数据的人」(SQL 分析师、业务人员)直接获得 AI——低门槛、自助、中立 | 让「造 AI 的团队」(数据工程、ML 工程师)更快构建 AI——开源、深度、可控 |
值得记住的一个数据点:Snowflake 在 FY26 Q3 电话会上宣布 AI 收入运行率突破 1 亿美元——按消费型模式的口径,这是「企业真实用量」的直接信号。而两家都把「AI 影响了多少比例的新签订单」作为披露口径(Snowflake 50%、Databricks 类似)——AI 已经从叙事变成签单变量。
系列至此,把六篇的脉络收拢成一张地图:
| 时代 | 主角 | 解决的问题 | 商业模式 | 系列篇 |
|---|---|---|---|---|
| 1970s–1990s | 关系型数据库(Oracle/DB2/MySQL) | 多人共用数据不乱账(OLTP) | 授权+维护费 | 第一篇 |
| 1990s–2000s | 数据仓库(Teradata/Inmon 体系) | 分析不伤害业务(ETL+维度建模) | 一体机采购(百万美元级特权) | 第二篇 |
| 2006–2016 | Hadoop 生态与数据湖 | 海量数据的存与算(PB 级民主化) | 开源免费+自建运维 | 第三篇 |
| 2015–2026 | Snowflake / Databricks(云数仓+Lakehouse) | 存算分离、消费计费、湖仓一体、数据民主化 | 消费型计费(用量=收入) | 第四篇 |
| 2015–2021(中国) | 数据中台(OneData 等)与国产替代 | 同美国之痛,走组织+工程之路 | 项目+License(无消费飞轮) | 第五篇 |
| 2023–未来 | 向量数据库 / AI Data Cloud / Agent 网关 | AI 的记忆体与企业数据的 AI 触达 | 消费型计费的超级放大器 | 本篇 |
在这个地图上,AI 时代重新理解数据层,能看懂三件此前模糊的事:
第一,看懂 Snowflake 为什么贵得有道理:它不是「一个存数据的」,而是企业数据的消费层 + AI 网关——企业每一次 AI 触达数据都经过它,且按量计费。它的天花板不是「数据库市场」,而是「企业 AI 应用的用量市场」。
第二,看懂 Snowflake 与云厂商的博弈本质:Snowflake 批发云厂商的算力再零售(74% 产品毛利率是这条转售链的宽度),同时保持中立(不推自家大模型)以维持「企业敢把数据放进来」的信任。云厂商既想收编(用捆绑挤压它)又依赖它(它给云带消费)——这个张力决定了它不会被轻易杀死,也决定了它的毛利率天花板。
第三,看懂中国市场的观察哨在哪:独立 SaaS 土壤未熟(第五篇),AI 消费收入科目(阿里/金山云的 token 收入)是唯一可能长出「消费型叙事」的地方;星环们的转型是第二观察哨;Agent 数据网关的协议之争(MCP 类)是第三哨——哨响之日,就是栏目递进链(MM → ER.006 → ND.008《数据消费:AI 变现的第二曲线》)启用中国分叉之时。
本篇数据来源:Snowflake FY27 Q2 8-K 与 FY26 Q3 电话会(CoCo/CoWork 账户数、AI 收入运行率 $1 亿、AI 影响新签 50%)、Databricks 官网与 FY26 披露(7,300+ 周活 AI 账户、Agent Bricks、Lakebase)、Anthropic MCP 协议官方文档(2024)、Pinecone/Milvus/Zilliz 公开融资信息、诺和诺德与 adidas 官方案例(见第四篇来源)、RAG 技术原理为行业公认方法论。向量为科普化简写(真实维度远高于示意)。Snowflake FY26 Q3 电话会来源为 bullfincher.io 转录存档。
系列完 · 六篇至此收束。数据的基础设施系列目录:引言 燃料与精炼厂 · 01 一切从记账开始 · 02 数据仓库与分析的觉醒 · 03 大数据的十年 · 04 云与两条路线 · 05 中国的路 · 06 AI 时代 · 07 上市公司全景 · 08 Palantir 样本与 AI 数据库的未来。系列结论浓缩为一句话:数据层是 AI 时代少数「用量与价值同向放大」的基础设施——理解它,就是理解 AI 商业化的下半场。