← 返回专题目录DR.06 · 2026-09-07公开资料研究 · 不构成投资建议
一级市场投资复盘 · 行业深度研究 · 数据的基础设施系列 06/8

AI 时代:向量数据库与 Agentic Enterprise

向量是「意思的坐标」;RAG 是两个数据库的合奏;大平台如何内嵌吞并向量检索;Agent 数据访问接口的王座之争;以及全系列收束——数据层是 AI 时代用量与价值同向放大的基础设施。

系列 数据的基础设施(第四专题) 发布 自媒体公开版 研究方法 公开财报 + 厂商案例库 + 行业对比

第六篇 · AI 时代:向量数据库与 Agentic Enterprise

系列前五篇讲了五十年:业务数据库、数据仓库、大数据、云数仓——它们处理的都是「规整的数据」:表格、行列、SQL。但 2023 年之后,AI 给企业数据世界带来了两种前所未有的东西:一种是「意思的坐标」(向量,让机器按语义而非关键词检索),一种是「会自己干活的数据工人」(Agent,让 AI 直接读写企业数据)。这两种东西催生了向量数据库这个新品类,也把数据层推到了 AI 竞争的最前排。这一篇回答:向量数据库到底是什么、它和传统数据库是什么关系、大平台如何把「吞并」它,以及为什么说 Agent 数据访问权是数据层的下一场王座之争——这也是整个系列的收束:从 Snowflake 的三层账本,到中国数据消费叙事的观察哨。

本篇要回答的问题

1. 「向量」和「嵌入(embedding)」到底是什么——为什么 AI 需要「意思的坐标」?
2. 向量数据库与 Snowflake 这类数据仓库是什么关系——竞争、互补,还是被吞并?
3. RAG 是什么?为什么它是企业 AI 落地的第一站?
4. Agent(智能体)为什么把数据层推向王座之争?MCP 协议在争什么?
5. Snowflake 与 Databricks 的 AI 攻势(Cortex vs Genie/Agent Bricks)各打什么牌?
6. 整个系列的结论:AI 时代重新理解数据层,对 A/H 投资意味着什么?

本篇速览

1AI 读不懂「文字的意思」,但能算「坐标的距离」——把任何文本变成一串数字(向量),意思相近的文本坐标也相近,语义检索从此变成几何题
2向量数据库专门存这些坐标、专做「相似度搜索」——它是 AI 的记忆体:让大模型「想起来」企业自己的知识。
4但大平台正在内嵌吞并:Snowflake 的 Cortex Search、Databricks 的向量能力,都把向量检索做成数据仓的自带功能——独立向量库被迫上探 AI 原生场景
5更大的王座之争在 Agent 层:企业 Agent 读写数据的接口标准(MCP 等)由谁定义,谁就复制 Snowflake 在 BI 时代的位置——「Agentic Enterprise runs on 数据层」。
6对中国投资的启示:AI 消费收入科目(token/模型服务)是中国版数据消费叙事的起点;独立数据基础设施厂商的转型成败是第二观察哨。

一、AI 读不懂「意思」,但算得出「距离」

先解决最基础的问题:什么是向量(vector)和嵌入(embedding)?

大语言模型在处理文字前,会把每个词、每段话变成一串数字,比如 [0.12, -0.85, 0.33, …, 0.07]——可能是上千个甚至上万个数字。这串数字不是随便编码的,它是模型在阅读海量文本后学出的「意思的坐标」:两段意思相近的文字,坐标在空间中的距离就接近。「今天天气真好」和「今日晴朗宜人」的坐标几乎重叠;「今天天气真好」和「本季度应收账款逾期」的坐标相距十万八千里。

这个特性带来一种全新的检索方式。传统的检索是关键词匹配:搜「客诉」只会找到含「客诉」两个字的文档。而语义检索是:把问题和文档都变成向量,找坐标距离最近的——「这条工单的语气是不是像客户投诉」不需要出现「投诉」两个字,意思到了就能找到。更进一步,向量检索能处理「模糊、类比、跨语言」的查找:中文的问题可以匹配到英文的答案。

AI 应用几乎所有的「记忆与知识检索」,底层都是这个几何动作。而存这些坐标、高效做距离计算的专用系统,就叫向量数据库(Pinecone、Milvus、Weaviate、Qdrant 等)。

二、RAG:企业 AI 落地的第一站,两个数据库的合奏

向量数据库被推上风口,是因为一个叫 RAG(Retrieval-Augmented Generation,检索增强生成)的技术组合——它是企业让大模型「懂自家业务」的标准方法。

大模型有一个致命短板:它只认识训练时见过的公开数据,不知道你公司去年的对账单、你们行业的内部规范、上个月那次事故的处理结论。直接问它,它要么答不出,要么一本正经地编(幻觉)。RAG 的解法是把企业的资料变成向量存进向量库;用户提问时,先做语义检索找出最相关的几段资料,把资料「塞进」大模型的提示词里,让它看着资料回答——回答有据可查,幻觉大幅下降。

表:一次完整的 RAG 检索中,三种数据系统的分工
系统在这次查询里干什么类比
向量数据库语义检索:从十万份历史工单中找出「与本次提问意思最相近」的 5 份图书馆的「语义检索台」:按意思找书
大模型(LLM)阅读找出的资料,组织成一段通顺的回答「读资料写答案」的助理
数据仓库(Snowflake)精确核对:「这位客户的订单状态在系统里到底是什么」——给出唯一正确的事实档案室:按编号调出唯一的原件

用一个客服 Agent 的例子串起来:客户问「我的订单怎么了」。向量库先从十万份历史工单里检索出语义最相近的五份处理记录(按意思相似);大模型基于这些记录生成一段解释;最后数据仓库核对这位客户订单的精确状态(「已发货,物流单号 SFxxx」)——语义检索给出「处理思路」,数据仓库给出「唯一事实」。

【研究推断】所以向量库与数据仓的关系不是替代,而是新的一层与旧的一层的配合:数据仓管「精确的事实」(唯一答案),向量库管「相似的知识」(模糊但相关)。AI 应用越普及,这一层组合越成为标配——这就是为什么向量库在 2023 年前后成为增速最快的基础设施品类,Pinecone 估值一度超过 7.5 亿美元,开源的 Milvus(中国团队创办的 Zilliz)也在全球 AI 应用中大规模部署。

RAG 一次查询中三种数据系统的分工向量数据库语义检索:从十万份历史工单中找出「意思最相近」的几份给「处理思路」大模型(LLM)阅读检索出的资料,生成一段有据可查的回答给「表达」数据仓库精确核对:该客户订单在系统里的唯一真实状态给「事实」例:客服 Agent 答「我的订单怎么了」—— 向量库找相似工单 → LLM 组织回答 → 数据仓核订单状态三种系统各司其职:语义给「思路」,大模型给「表达」,数据仓给「唯一事实」
RAG 一次查询中三种数据系统的分工

三、大平台的吞并:向量检索从产品变成功能

独立向量库的窗口期并不长。逻辑很简单:向量库存的数据,本质上还是企业数据的一部分——而企业数据的主战场在 Snowflake、Databricks 和三大云的数据平台上。2023–2026 年,大平台的应对分三步:

表:大平台内嵌向量能力的三步走
步骤动作含义
① 内嵌向量类型与检索Snowflake 把向量数据类型与相似度检索做进核心引擎(Cortex Search);Databricks 在 Lakehouse 内置向量能力;各大云数据库(pgvector、BigQuery)同样跟进「向量」不再是需要单独采购的品类,而是数据仓自带的功能——独立向量库的客户开始被截流
② 把 AI 套件做成平台功能Snowflake:Cortex Analyst/Search/Gateway、Snowflake Intelligence(自然语言企业分析)、CoWork/CoCo 智能体;Databricks:Genie、Agent Bricks、MLflowRAG、智能问答、Agent 构建——企业 AI 落地三件套全部平台化,无需自选向量库
③ 把 AI 与数据消费挂钩Snowflake 披露 AI 收入「有意义跃升」并推动 CoCo 账户数季度 +2,000;Databricks 用 Genie 客户案例(诺和诺德 $1.57 亿价值)教育市场AI 直接拉动平台消费——向量检索是入口,平台消费是收入

【研究推断】这三步走的结果是独立向量库的生态位被挤压到「AI 原生新负载」:真正超高并发、超低延迟、以向量为核心业务的场景(推荐系统、图像检索、专业 Agent 记忆体)。这像极了当年 Hadoop 时代组件动物园的重演——独立品类解决先声问题,大平台负责规模化收编。独立向量库是否重蹈「先声被收编」的覆辙(被收购或边缘化),是 AI 基础设施投资的一个长期观察点。

四、王座之争:Agent 读写企业数据的接口归谁定义

向量库只是前哨,真正的王座之争在 Agent 层。逻辑链条如下:

企业部署 Agent(智能体)之后,Agent 要干活就必须访问企业数据:查订单、读合同、写工单、调报表。Agent 从哪里读、向哪里写,决定了谁对企业数据的每一次 AI 触达收费。如果 Agent 直接连各个 SaaS 应用(绕过中央数据层),数据层的飞轮就漏气;如果 Agent 统一经由某个数据平台读写(该平台成为「企业数据的 AI 网关」),平台就复制了 Snowflake 在 BI 时代的位置——而且这个时代的数据流量会比 BI 时代大几个数量级。

于是出现了接口标准的争夺:MCP(Model Context Protocol)——Anthropic 2024 年发布的开放协议,让 AI 应用以统一方式连接各类数据源与工具,2025 年起被 OpenAI、Google 等主要玩家跟进,迅速成为 Agent 数据访问的事实标准方向。Snowflake 在 2026 年收购 Natoma(MCP 平台)并推出 Cortex AI Gateway,Databricks 推出 Agent Bricks——两家的动作高度一致:把「Agent ↔ 企业数据」的网关做进自己的平台。谁定义了 Agent 访问企业数据的接口,谁就对 AI 时代的企业数据触达收税。

【研究推断】这也是理解 Snowflake「The Agentic Enterprise runs on Snowflake」口号的正确方式:它不是营销修辞,而是对王座之争的公开宣示。对比第五篇的数据中台——数据中台当年想做而做不到的「企业数据统一服务层」,正在以「Agent 数据网关」的形态被重新尝试,这一次的载体是产品化、全球化的,而且搭着 AI 的东风。

五、两家公司的 AI 攻势:同一个终点,不同的路径

表:Snowflake vs Databricks 的 AI 攻势对照(2026)
SnowflakeDatabricks
AI 产品线Cortex 套件(Analyst/Search/Code/ Sense/Gateway)、Snowflake Intelligence、CoWork(个人工作智能体)与 CoCo(代码智能体)Genie(自然语言分析)、Agent Bricks(智能体构建)、MLflow(模型全生命周期)、Lakebase(AI 时代的应用数据库)
运营证据CoCo 账户 9,100+(单季 +2,000)、CoWork 5,800 账户、AI 收入「有意义跃升」(占比未披露)7,300+ 账户周活使用 AI 能力(FY26 Q3 披露口径)、$1 亿 AI 收入运行率提前达成、AI 影响 50% 的新签订单
生态动作收购 Natoma(MCP)、与 SAP/Workday/Palantir 合作、牵头 Open Semantic Interchange整合 Anthropic/OpenAI 模型、Lakeflow 数据管道、Delta Sharing 开放共享协议
路径差异让「用数据的人」(SQL 分析师、业务人员)直接获得 AI——低门槛、自助、中立让「造 AI 的团队」(数据工程、ML 工程师)更快构建 AI——开源、深度、可控

值得记住的一个数据点:Snowflake 在 FY26 Q3 电话会上宣布 AI 收入运行率突破 1 亿美元——按消费型模式的口径,这是「企业真实用量」的直接信号。而两家都把「AI 影响了多少比例的新签订单」作为披露口径(Snowflake 50%、Databricks 类似)——AI 已经从叙事变成签单变量

六、全系列收束:重新理解数据层,然后看懂三件事

系列至此,把六篇的脉络收拢成一张地图:

表:数据基础设施五十年——从账本到 AI 记忆
时代主角解决的问题商业模式系列篇
1970s–1990s关系型数据库(Oracle/DB2/MySQL)多人共用数据不乱账(OLTP)授权+维护费第一篇
1990s–2000s数据仓库(Teradata/Inmon 体系)分析不伤害业务(ETL+维度建模)一体机采购(百万美元级特权)第二篇
2006–2016Hadoop 生态与数据湖海量数据的存与算(PB 级民主化)开源免费+自建运维第三篇
2015–2026Snowflake / Databricks(云数仓+Lakehouse)存算分离、消费计费、湖仓一体、数据民主化消费型计费(用量=收入)第四篇
2015–2021(中国)数据中台(OneData 等)与国产替代同美国之痛,走组织+工程之路项目+License(无消费飞轮)第五篇
2023–未来向量数据库 / AI Data Cloud / Agent 网关AI 的记忆体与企业数据的 AI 触达消费型计费的超级放大器本篇

在这个地图上,AI 时代重新理解数据层,能看懂三件此前模糊的事:

第一,看懂 Snowflake 为什么贵得有道理:它不是「一个存数据的」,而是企业数据的消费层 + AI 网关——企业每一次 AI 触达数据都经过它,且按量计费。它的天花板不是「数据库市场」,而是「企业 AI 应用的用量市场」。

第二,看懂 Snowflake 与云厂商的博弈本质:Snowflake 批发云厂商的算力再零售(74% 产品毛利率是这条转售链的宽度),同时保持中立(不推自家大模型)以维持「企业敢把数据放进来」的信任。云厂商既想收编(用捆绑挤压它)又依赖它(它给云带消费)——这个张力决定了它不会被轻易杀死,也决定了它的毛利率天花板。

第三,看懂中国市场的观察哨在哪:独立 SaaS 土壤未熟(第五篇),AI 消费收入科目(阿里/金山云的 token 收入)是唯一可能长出「消费型叙事」的地方;星环们的转型是第二观察哨;Agent 数据网关的协议之争(MCP 类)是第三哨——哨响之日,就是栏目递进链(MM → ER.006 → ND.008《数据消费:AI 变现的第二曲线》)启用中国分叉之时。

本篇小结:三个带走的概念

向量 = 意思的坐标:语义检索把「找资料」变成几何题——AI 的记忆与知识检索全部建立在这上面。
向量库与数据仓是新的一层与旧的一层:RAG = 向量库找思路 + 数据仓给事实。大平台的吞并动作(Cortex Search/Genie)让独立向量库退守 AI 原生新负载。
Agent 数据访问接口是下一场王座之争:MCP 类协议 + 平台网关(Cortex AI Gateway/Agent Bricks)决定 AI 时代企业数据触达的收费权——Snowflake 的口号是公开宣示。

数据来源与口径说明

本篇数据来源:Snowflake FY27 Q2 8-K 与 FY26 Q3 电话会(CoCo/CoWork 账户数、AI 收入运行率 $1 亿、AI 影响新签 50%)、Databricks 官网与 FY26 披露(7,300+ 周活 AI 账户、Agent Bricks、Lakebase)、Anthropic MCP 协议官方文档(2024)、Pinecone/Milvus/Zilliz 公开融资信息、诺和诺德与 adidas 官方案例(见第四篇来源)、RAG 技术原理为行业公认方法论。向量为科普化简写(真实维度远高于示意)。Snowflake FY26 Q3 电话会来源为 bullfincher.io 转录存档。

系列完 · 六篇至此收束。数据的基础设施系列目录:引言 燃料与精炼厂 · 01 一切从记账开始 · 02 数据仓库与分析的觉醒 · 03 大数据的十年 · 04 云与两条路线 · 05 中国的路 · 06 AI 时代 · 07 上市公司全景 · 08 Palantir 样本与 AI 数据库的未来。系列结论浓缩为一句话:数据层是 AI 时代少数「用量与价值同向放大」的基础设施——理解它,就是理解 AI 商业化的下半场。

本文首发:2026-09-07 | 期号 DR.06 | 版权归 头哥投研(touge.com.cn)所有
本文首发:2026-09-07 | 期号 DR.06 | 版权归 头哥投研(touge.com.cn)所有