Databricks Data+AI Summit 2026
从湖仓一体到统一智能层

30+ 产品公告 · 四大优先事项 · 企业 Agent 基础设施的赌注
2026年6月 · Data+AI Daily Brief
01

核心判断

Databricks Data+AI Summit 2026 不是在发布产品功能,而是在宣告一种企业数据架构的终结。Ali Ghodsi 在 keynote 中给出的核心判断是:当 Agent 成为企业劳动力的倍增器,数据平台必须从"湖仓一体"升级为统一智能层——在同一套开放格式上同时承载事务、分析、AI 三种工作负载,并提供 Agent 所需的上下文、成本控制和治理。

这个战略的前提是:数据管道的时代已经结束。如果这个前提成立,Databricks 在 Agent 时代的卡位就是不可替代的。

01

统一数据层是 Agent 基础设施的底层前提

02

上下文质量决定 Agent 的可用性天花板

03

成本失控是 Agent 规模化部署的最大阻碍

04

开放协议是 Agent 生态的默认基础设施

DAIS6/15–18 · 旧金山 · 3万+ 参会
公告30+ 项能力 · 4 大优先事项
ARR$54 亿 · +65% YoY
AI 产品 ARR$14 亿
估值$1650–1750 亿(谈判中)
02

具体观察

从产品细节中提炼的五个关键观察

数据架构正在从"分层"走向"统一",ETL 管道时代宣告终结。过去二十年,企业数据架构的默认模式是"操作数据 → ETL → 数据仓库 → BI"——层层复制、层层延迟。Databricks 用 LTAP(Lake Transactional/Analytical Processing)正面挑战这个范式:把 OLTP 和 OLAP 放在同一套开放格式(Delta Lake / Iceberg)的同一副本上,Agent 可以直接在事务数据上进行分析推理。这意味着"数据管道工程师"这个职业类别可能被大幅压缩,而"数据平台工程师"的定义将被重写。Lakebase 已经支撑 1200 万+ 数据库日启动量,80% 由 AI Agent 自动创建而非人类——这暗示了未来数据库的供给方式。

Agent 的 99% 工作不在核心循环,而在基础设施债务。Databricks 官方表述是"核心 agent loop 只是 1% 的工作,其余 99% 是 token 容量、部署、安全、评估、监控、上下文、共享"。这是一个来自生产环境的诚实判断。大多数企业在 POC 阶段只关心"LLM 能不能回答对",但上生产后才发现:记忆管理、身份验证、成本上限、审计追踪、模型回退——这些才是决定 Agent 能不能跑在真实业务里的硬约束。Databricks 把这一堆基础设施问题打包成平台能力(Agent Bricks + Unity AI Gateway + Managed Memory),本质上是把"Agent 工程"变成一项可外包的托管服务。

上下文层正在成为企业 AI 的"搜索排名"。Genie Ontology 被 Ghodsi 比作 Google 的 PageRank——持续在后台检索分析企业全部知识,为 Agent 构建一个实时、自改进的上下文层。这个定位的战略含义是:当模型能力趋同,谁能更准确地理解企业语义,谁就掌握了 Agent 的可靠性。Genie 的差异化卖点是"计算推理而非背诵复述"——从 governed 数据直接查 SQL 获取真实答案,而不是从文档片段中猜。这恰好击中了企业 AI 的最大痛点:一个自信的错误答案比没有答案更危险。

"开放"是 Databricks 的锁定策略,而且这套策略正在扩展。OpenSharing 将 Delta Sharing 从结构化表扩展到 agent skills、AI 模型、非结构化数据——交给 Linux Foundation 治理,Apache 2.0 许可。表面上是在拆墙,实际上是在定义 Agent 时代的交换标准。当 agent skills 的跨组织共享需要一个标准协议时,OpenSharing 想成为那个默认选项。这与 Snowflake 的 OSI 规范形成直接对位:两家都在争夺"企业语义交换标准"的定义权。唯一的区别在于 Databricks 的开放姿态更彻底——Unity Catalog 源代码在台上开源、Iceberg 和 Delta 双格式支持、on-prem 存储伙伴接入。

成本治理从"事后审计"变成"实时刹车"。Unity AI Gateway 的硬支出上限(hard spend caps)是一个标志性信号:Agent 的成本结构不可预测——一个失控的 Agent 一夜之间烧掉 $6,500+ 的案例已经成为行业共识。Databricks 把预算控制做到运行时层,按用户、团队、工具、用例自动停止超支请求。这不仅仅是省钱,而是让 CFO 敢批准 Agent 上生产。Ghodsi 在媒体沟通中坦承"每家企业都非常担心成本失控,这是我们被问到最多的问题"——这说明成本治理已经从技术议题升级为商业采纳的硬门槛。

03

产品全景

前述观察的事实支撑。DAIS 发布了 30+ 项产品能力,以下五个战略级产品定义了 Databricks 的路线方向,其余能力在末尾做紧凑收录。

Lakehouse//RT + Reyden(Beta)—— 实时数据仓库。全新引擎 Reyden 直接在 governed Delta Lake 和 Iceberg 表上提供毫秒级响应,无需单独 serving layer。小数据集低至 10ms,大数据集 sub-100ms,标准基准测试 12,000 QPS。客户反馈性能比现有实时服务架构最高提升 16x。消除 CDC 管道、ETL 流程和复制数据库——这是"统一数据层"的技术底座。

LTAP(Lake Transactional/Analytical Processing)(coming soon as part of Lakebase)—— 统一事务与分析架构。基于 Lakebase(serverless Postgres,12M+ DB 日启动),将事务数据直接写入 Delta / Iceberg 开放格式,让应用、分析系统和 AI Agent 共享同一份数据。客户包括 Block、Ensemble、Superhuman、Zillow。目标是彻底消除"操作数据 → 管道 → 分析"的分层架构。

Genie One + Genie Ontology(Genie One GA / Ontology 内置)—— 面向业务用户的 Agentic coworker。Genie One 覆盖 Web、iOS、Android,连接 Google Drive、Jira、Slack、Confluence、SharePoint 等 50+ 应用。Genie Ontology 是实时自改进的上下文层,持续从企业数据、文档、工单、聊天中提取和更新业务知识。Genie Agents 支持将对话保存为可复用 Agent,Genie App Builder 提供面向企业的 vibe coding 环境。

Agent Bricks(扩展平台)—— 开发者 Agent 平台。自发布以来已构建 100,000+ agents,年处理 1 quadrillion+ tokens。新增支持:任意 Agent 框架(LangGraph、OpenAI Agents SDK、自定义)、Supervisor Agent(多 Agent 编排)、Document Intelligence(GA,结构化数据提取)、Managed Memory(由 Lakebase 提供,支持 LangGraph checkpointers 和 OpenAI Agents SDK)。模型选择新增 Kimi、Grok(SpaceX 合作),以及通过 RL 训练的 custom model——在 Genie 任务上质量超越 Opus/Sonnet,成本显著更低。

Unity AI Gateway + OpenSharing(Gateway GA / OpenSharing 6/10 发布)—— AI 治理与开放生态。Unity AI Gateway 提供集中式治理:硬支出上限、智能路由、fallback 模型、上下文策略、MCP 治理、审计日志。OpenSharing 由 Linux Foundation 托管,扩展 Delta Sharing 到 agent skills、AI 模型、非结构化数据,支持 Iceberg IRC 客户端和 on-prem 存储伙伴(Everpure、MinIO、Qumulo 等)。54 家厂商参与 Delta Sharing 生态,包括 Amadeus、Atlassian、SAP、Stripe、TheTradeDesk。

展开其余 10+ 项产品公告 ▾
产品定位状态
LakebaseServerless Postgres,12M+ DB 日启动,80% 由 Agent 自动创建。应用交付时间缩短 75–95%GA
Managed Agent Memory由 Lakebase 提供,支持短/长期记忆,LangGraph/OpenAI SDK 原生集成GA
Custom ModelRL 训练数据专用 Agent,质量超越 Opus/Sonnet,成本显著更低GA
Document IntelligencePDF 和文档结构化数据提取,SQL-native 解析GA
7 模型家族OpenAI、Anthropic、Gemini、Qwen、Kimi、Grok(SpaceX 合作)、Llama 原生支持GA
AI Cost Monitoringtoken 消费追踪、预算执行、硬支出上限GA
SecureConnect跨云一键安全连接(AWS/Azure/GCP),无需防火墙规则Public Preview
Genie Agent Sharing向外部伙伴共享自然语言 AI 对话体验Beta
Databricks Apps在平台内构建和托管内部应用,无需外部云基础设施GA
AI Guardrails内置、自定义和第三方 guardrails,跨 prompt/response/AI 交互GA
04

客户实证

Agent 不是 PPT——来自生产环境的真实案例
PepsiCo
消费品/食品饮料
将 27 年历史的碎片化 BI 架构统一为 Azure Databricks SQL + Unity Catalog 的单一治理层。销售分析工作负载成本从约 $500K 降至 $175K,核心报表处理速度提升约 50%,正在逐步退役 Synapse 和 Teradata。
~80% 成本降低 · ~50% 处理速度提升
Ensemble Health Partners
医疗健康
将 800TB 碎片化收入周期数据统一为 Lakebase 上的 AI-ready 基础。处理 30+ 健康系统的 250 亿+ 笔交易,每 $10 亿健康系统收入流失减少 $3000 万+。KLAS 评分 95——收入周期管理领域历史最高。
800TB · 250 亿+ 交易 · KLAS 95
Ibotta
数字营销/零售科技
服务 2 亿+ 消费者的北美最大数字促销网络。ML 模型推荐引擎延迟降低 3–10x,serving 计算成本降低 90%,客户分析 API 平均响应时间从 3–5 秒降至 700 毫秒。迁移后零故障。
3–10x 延迟降低 · 90% 计算成本降低 · 零故障
AstraZeneca
制药/生物
在 Databricks Lakehouse 上构建可扩展的数据管道和知识图谱,驱动推荐引擎和科学文献 NLP 分析。基于 Agent Bricks 的 AI 药物发现平台,处理数百万数据点、数千来源,加速新药假设的时间到洞察。
100k+ agents built · 数百万数据点
Superhuman
生产力 SaaS
服务 4000 万+ 日活用户。用 Lakebase + Databricks Apps 替代了脆弱的 Redis/DynamoDB 自定义同步管道,功能上线周期从数月缩短到数周。销售团队从手动复制指标到 PPT 转向 Deckster(LLM 自动生成客户演示)。
4000 万+ 日活 · 功能上线从月→周
05

竞争格局

三方的 Agent 平台之战

6月是企业数据平台的决战月——三场大会密集上演:Snowflake Summit、Microsoft Build、Databricks Data+AI Summit。

Snowflake SummitDatabricks DAISMicrosoft Build
时间6月1–4日6月15–18日6月2–3日
核心定位数据仓库 → Agent 运行时湖仓一体 → 统一智能层Windows/Azure → Agent 平台
最强场景结构化数据 + 企业治理ML 训练 + 实时分析 + Agent知识工作 + 开发者工具
Agent 产品CoCo / CoWorkAgent Bricks / Genie OneWindows Agent Framework
数据形态结构化企业数据ML 训练数据 + 事务数据办公协作数据
开放策略Iceberg v3 / OSI / OpenflowDelta+Iceberg / OpenSharing / Unity Catalog 开源相对封闭
营收增速~29% YoY~65% YoYN/A
三方正在收敛,但起点不同
Snowflake 的赌注是数据仓库作为 Agent 运行时,最强场景是结构化数据且治理要求高的企业(金融、医疗、制药)。Databricks 赌统一数据层承载事务+分析+AI,最强场景是 ML 工作负载重、需要实时响应和 Agent 基础设施的组织。微软赌 Windows 和 Azure 是 Agent 平台,最强场景是深度使用 M365 和 Azure 的组织。
Databricks 的财务动量不可忽视
Databricks SQL(数据仓库产品)年化收入从一年前的 $6 亿增至超 $10 亿,增速 150%+。DB SQL 直接与 Snowflake 竞争数据仓库预算,且增速远超 Snowflake 整体。这暗示了一个结构性转移:企业正在把数据仓库预算从"纯分析"重新分配到"分析+AI+Agent"。
"数据重力"是三家共享的底层逻辑
三家的分歧不在要不要押注数据重力,而在各自数据的"形态"不同:Snowflake 是结构化企业数据,Databricks 是 ML 训练数据+事务数据,微软是办公协作数据。谁的数据形态最贴近 Agent 的高频场景,谁的重力就最强。Databricks 的优势在于:它的数据形态覆盖了从训练到推理到事务的完整链路。
Databricks 的独特优势与风险
优势:原生 ML/AI 基础设施(MLflow、Mosaic AI、GPU 集群)、开源生态(Spark、Delta Lake、Unity Catalog)、统一数据层(Lakebase + LTAP)、Agent 平台的先发规模(100k+ agents)。风险:私有公司的高估值($1650–1750 亿)能否在公开市场兑现、Snowflake 在结构化数据和治理上的十年积累、微软生产力生态(如果 Agent 交互发生在 Office/Teams 内,Databricks 可能被推到"数据管道"角色)。
06

行业延伸

DAIS 的技术叙事不仅影响 Databricks 自身,也在重塑四个相邻市场的边界
实时数据库市场正在重新洗牌
Lakehouse//RT 和 Reyden 的赌注是:企业不需要单独的实时 serving layer(Redis、Memcached、专用 OLAP 引擎)来处理低延迟查询,可以直接在湖仓上跑。如果这条路线被验证,传统实时数据库的独立市场地位将被削弱——不是消失,而是被整合进数据平台。Databricks 声称 Reyden 比现有专用实时栈快 16x,但这意味着它的竞争对手不只是 Snowflake,而是 Redis、Apache Pinot、ClickHouse 等专用引擎。关键在于:当"实时"和"分析"共享同一份数据、同一种治理,企业是否愿意为了单一场景的极致性能而维护一套独立系统?
LTAP 指向传统 OLTP 数据库的腹地
LTAP 统一 OLTP 和 OLAP 的野心,直接瞄准了 Oracle、SAP HANA、PostgreSQL+ETL 管道组合的市场。Lakebase 已经处理 1200 万+ 日启动量,客户包括 Block、Zillow、Superhuman——这些企业原本在 PostgreSQL 或托管数据库上运行事务工作负载。Databricks 的卖点不是"比 Postgres 更快",而是"事务数据和分析数据无需再复制"。如果企业接受这个 premise,那么 Oracle 和 SAP 的 OLTP 许可收入将面临结构性压力——因为企业不需要为"分析副本"再付一次钱。但风险在于:LTAP 目前 coming soon,真实企业环境中复杂的事务一致性(ACID 跨系统、分布式事务、遗留系统兼容性)能否被满足,还需要生产验证。
Agent 正在重新定义数据库的"消费者"
Lakebase 80% 的数据库由 AI Agent 自动创建而非人类开发者——这个数字暗示了一个更深层的变化:数据库的供给方正在从人类变成 Agent。当 Agent 需要存储记忆、状态、中间结果时,它会自动创建数据库,而不是向 DBA 提工单。这意味着数据库管理的范式从"人类设计 schema → 运维监控"转向"Agent 自动创建 → 平台自动管理"。对数据库市场的影响是:未来企业购买的可能不是"数据库实例",而是"Agent 运行时包"——数据库只是其中的基础设施组件。这对 MongoDB、CockroachDB 等独立数据库厂商的影响,可能比 Snowflake 更大。
企业 AI 的定价模式从"资源"转向"结果"
Unity AI Gateway 硬支出上限、智能路由、fallback 模型——这些功能的底层逻辑是:企业不再愿意为"AI 能力"按资源付费,而是要求按可控的结果付费。Databricks 的财务数据(AI 产品 ARR $14 亿)证明了这个趋势已经在发生。但定价模式本身还在演变:是按 token 付费?按 Agent 调用次数?按业务结果?Databricks 目前的策略是"把 AI 成本嵌入现有数据平台合同"——企业为 DB SQL 和 Lakehouse 付费,AI 能力是增量。这与 Snowflake 的 Cortex 定价模式(按查询+token 混合)和 OpenAI 的按 token 模式都不同。2026 H2 的定价实验将决定哪种模式成为主流。
开放格式的权力博弈正在升温
Databricks 同时支持 Delta Lake 和 Iceberg,并通过 OpenSharing 扩展数据交换协议到 agent skills 和模型。这种"双格式+开放协议"策略是在用开放性对抗 Snowflake 的治理深度。Delta Sharing 生态已有 54 家厂商(包括 Amadeus、Atlassian、SAP、Stripe),OpenSharing 的扩展目标是让 agent skills 跨平台流通。但风险在于:Iceberg 的社区 momentum(Netflix、Apple、Tabular)正在加速,如果 Iceberg 最终成为开放格式的事实标准,Delta 的差异化价值会被稀释。Databricks 的应对是 Unity Catalog 同时覆盖两种格式——这是 hedging,但也意味着它在两种格式的标准制定中都有话语权。

待验证的问题

问题 1

LTAP 的生产成熟度:LTAP 目前作为 Lakebase 的升级选项 coming soon,统一 OLTP+OLAP 的愿景很清晰,但面对真实企业环境中复杂的事务一致性要求和遗留系统迁移,"无需 ETL"的承诺能否在生产规模兑现?

问题 2

Genie Ontology 的规模化考验:"持续学习企业上下文"在演示中很 impressive,但面对数据质量参差不齐、文档缺失、业务规则未编码的真实企业环境,自动语义组装的准确率能否维持在可用水平?

问题 3

Agent 经济模型的清晰度:100k+ agents 和 1 quadrillion tokens 是规模信号,但"企业为 Agent 付多少钱"的商业模型仍不清晰。DB SQL 的 $10 亿+ 年化增长证明数据仓库预算在转移,但 Agent 本身的定价和盈利模式还需要 2027 年验证。

07

总结

30+ 项产品公告、一个实时引擎、一套统一架构、两个 Agent 产品线、一个开放协议——DAIS 2026 用一周时间勾勒了 Databricks 从湖仓一体到统一智能层的转型路线图。这条路线指向一个清晰的判断:数据平台竞争的下一个十年,将由"谁能把事务、分析、AI 三种工作负载统一在同一套开放数据层上"来定义
但一张 Keynote 不等于一个市场。这套叙事能否兑现,取决于三个时间窗口内的实际验证。
短期 · 6–12 个月

Lakehouse//RT 的 Beta 采用率和 LTAP 的生产就绪时间表是关键验证点。DB SQL $10 亿+ 年化增长和 65% 整体增速构成强劲财务叙事。但多数 AI 产品(Genie One、Agent Bricks 新功能)需要 2026 H2 的企业采用数据来验证。

中期 · 12–24 个月

竞争格局将决定性收窄。Databricks 的 IPO 预期($1650–1750 亿估值)是催化剂,也是压力测试。如果成功上市并维持估值,将验证"AI 基础设施公司值得溢价"的叙事;如果估值承压,整个 late-stage AI 赛道的定价都会受影响。

长期 · 24 个月+

如果统一数据层架构被验证、Agent 成为企业运营的主流方式、开放协议(OpenSharing)成为事实标准,那么 Databricks 的赌注成立。但最重要的一步不在 Databricks 手里:Agent 需要真正实质性地提升企业劳动力效率,而非停留在 POC 和炒作周期。