AI 时代,数据是智能产生的燃料。但燃料不是倒进油箱就有用——它的存放与组织方式(数据层)决定发动机的效率。本系列终极问题:AI Agent 时代,数据层会被放大还是削弱?
这不是一篇技术文档的序言,而是一个研究问题的起点。AI 时代,数据是最重要的生产要素——如果说算力是发动机、模型是引擎,那么数据就是智能产生的燃料。但燃料不是倒进油箱就有用的:原油要经过精炼、配比、按标号配送,发动机才烧得动。这一层「精炼与配送」的问题——企业的数据到底放在哪里、怎么组织、由谁治理、被谁计费——决定了 AI 时代企业智能的真实产出,却极少被系统讲清。本系列要做的,就是把这层地基从头挖一遍。
AI 浪潮两年后,一个反直觉的事实越来越清楚:限制企业 AI 产出的,往往不是模型不够强,而是数据不够可用。同一款大模型,在数据规整的企业里能自动完成报表、预警、客服;在数据散落在二十个系统、口径各说各话的企业里,只能输出「看起来对」的幻觉。模型是公共品,数据的组织度才是企业 AI 的真实壁垒。
这就是为什么「数据层」值得花一个系列从头研究:它是 AI 时代少数同时影响价值创造与成本结构的基础设施。它决定 AI 能做多好(燃料质量),也决定 AI 做多少(燃料供应),还决定 AI 花多少钱(燃料价格)。
这是本系列真正的研究问题。直觉答案可能是「削弱」——云把存储变便宜了,AI 把分析变聪明了,数据层是不是会像当年的纸质档案一样,变成被时代冲走的旧货架?
但我们的推断恰好相反,且方向有精确的含义:数据层会被放大——但放大的位置会挪动。具体说:
| 数据层的部件 | 预判 | 原因 |
|---|---|---|
| 存储与算力 | 削弱(被云厂商商品化) | S3 式存储无限便宜,AI 优化让查询更省算力——这部分会变成水电煤,不再值钱 |
| 数据语义层(把数据组织成业务能理解的对象) | 放大 | Agent 每做一次决策都要「以业务语言」理解数据,否则 LLM 只剩幻觉——语义层成为 AI 时代最贵的层 |
| 数据治理(口径、质量、血缘) | 放大(且被 AI 自动化) | 治理过去靠人海成本,AI 让分类/血缘/口径自动化——治理从成本中心变成 AI 的准入门 |
| 数据访问网关(Agent ↔ 数据的接口) | 放大 | 企业 Agent 读写数据都要过一道闸——谁定义闸口,谁对每一次 AI 触达收费 |
| 数据资产化(计价/交易/保护) | 放大 | 数据作为 AI 生产资料被计价、被交易、被防 LLM 商品化地保护——新商业模式在此诞生 |
这张表是本系列第八篇(推断篇)的骨架。结论先行一句话:燃料本身会被无限廉价地供给(云存储),值钱的是燃料的精炼与配送(语义、治理、访问权、资产化)——所以 Snowflake、Databricks、Palantir 们的估值逻辑,正在从「存算平台」悄悄改写为「AI 数据操作系统」。
| 篇 | 主题 | 回答的问题 |
|---|---|---|
| 引言(本篇) | 燃料与精炼厂 | 为什么研究数据层?终极问题是什么? |
| 01 一切从记账开始 | 数据库的前世 | 数据库是什么、为什么从不记错账 |
| 02 数据仓库:分析的觉醒 | 分析的房间 | 为什么分析要单独盖房间、数据孤岛怎么来的 |
| 03 大数据的十年 | Hadoop 与数据沼泽 | 免费的大数据为什么乱 |
| 04 云与两条路线 | Snowflake vs Databricks | 两家公司分别解决什么、客户画像差在哪 |
| 05 中国的路 | 数据中台的梦与国产替代 | 为什么中国造不出 Snowflake(商业模式,不是技术) |
| 06 AI 时代 | 向量库与 Agentic Enterprise | AI 给数据层加了什么新的一层 |
| 07 上市公司全景 | 数据库世界的户口本 | 每家公司在哪个时代、AI 跟进没有、值不值得跟踪 |
| 08 Palantir 样本与 AI 数据库的未来 | 语义层与五个推断 | Palantir 如何帮企业组织数据用 AI、未来的 AI 数据库会长成什么样 |
以下 01–08 为正文。系列的观点立场一句话:数据层是 AI 时代少数「用量与价值同向放大」的基础设施——但价值的聚集点,正在从「存与算」向「语义与访问权」迁移。