📊 Data+AI 全球日报

2026-05-18(含周末) · 时效窗口 05-15 08:00 ~ 05-18 08:00 CST

🔥 今日最重要的3个变化

  1. 数据管道的输出端正在从封闭的 Delta 表扩展到任意外部系统
  2. 列级数据血缘从分析型数据库延伸到了 Spark 集群处理链路
  3. 数据平台的 AI 能力开始嵌入治理和安全层,而非仅停留在查询层
总判断:数据平台本周集中补齐"最后一英里"能力——不论是管道输出到外部系统、血缘追踪到列级粒度,还是 AI 安全护栏的正式落地,方向一致:让数据平台从分析工具演进为企业数据操作系统的核心基础设施。
A

Top Signals

1. Databricks Lakeflow Spark Declarative Pipelines Sinks 正式 GA

Lakeflow Spark Declarative Pipelines 的 sink API 正式 GA,支持将管道转换后的数据写入 Unity Catalog 外部表、Apache Kafka、Azure Event Hubs 以及自定义 Python 数据源等外部目标。此前管道输出默认仅限 Delta 表。

💡 消除了 Databricks ETL 管道与外部操作系统之间的"最后一英里"断裂。企业不再需要在管道下游额外搭建 reverse ETL 或事件分发层,数据工程的端到端自动化程度显著提升。

2. Google Cloud Knowledge Catalog 列级血缘 for Dataproc 正式 GA

Knowledge Catalog(原 Dataplex)的列级血缘能力正式 GA,覆盖 Dataproc 集群和 Serverless for Apache Spark 处理的 BigQuery、BigLake 外部表及 Cloud Storage 数据流。同步更新的 Data Lineage API 支持多源多目标搜索和 Dataflow 来源标记。

💡 列级血缘是 AI 时代数据治理的刚需——当 Agent 自主访问数据时,精确追踪每一列的来源和变换链路是建立信任的前提。Google Cloud 率先在 Spark 处理层面实现这一能力的 GA。

3. Snowflake Snowpark Container Services ARM 实例 GA + Cortex AI Guardrails GA

Snowpark Container Services 新增 ARM 实例(GEN_ARM_G1)正式 GA,提供 1-28 vCPU 规格的通用 ARM 算力;同日 Cortex AI Guardrails 对 Snowflake Intelligence 和 Cortex Agents 全面 GA,为 AI 生成内容提供平台级安全护栏。

💡 ARM 实例为容器化数据工作负载提供更优性价比选项;Cortex AI Guardrails GA 意味着 Snowflake 在 AI 安全治理层面从"可选"升级为"内置",是企业大规模部署 AI Agent 查询数据的关键信任基础。
B

Product & Tech

1. Databricks Agent Bricks Supervisor Agent 支持 Vector Search Indexes 作为子 Agent 工具

Supervisor Agent 现可将 Vector Search indexes 注册为子 Agent 工具,多 Agent 协同系统可直接利用向量检索能力完成语义搜索任务,无需手动搭建 retrieval 逻辑。

💡 降低了在 Databricks 平台上构建 RAG 和多 Agent 数据应用的工程复杂度,向量检索从独立服务变为 Agent 编排框架的一等公民。

2. Databricks SQL Alerts GA + SQL Alert Task in Lakeflow Jobs Public Preview

Databricks SQL Alerts 最新版本正式 GA,新增 Markdown 编辑器自定义通知模板;Lakeflow Jobs 中的 SQL Alert Task 进入 Public Preview,可将 SQL 告警评估嵌入工作流并根据结果分支执行下游任务。

💡 数据质量监控从被动查询变为主动嵌入管道的自动化行为,实现"数据异常→告警→自动响应"的闭环。

3. Snowflake AI_CLASSIFY 支持文档分类(Public Preview)

Snowflake 内置 AI 函数 AI_CLASSIFY 新增文档分类能力(Public Preview),可直接在 SQL 查询中对非结构化文档进行分类处理。

💡 非结构化数据的分类和标注能力直接嵌入 SQL 层,降低了企业将文档数据纳入结构化治理体系的门槛。
C

Views & Research

本期窗口内未发现符合准入标准的机构报告或关键人物原始观点。
D

Capital & Corporate

本期窗口内未发现与数据平台直接相关的合格投融资/财报事件。
E

Watchlist

预告Apache Iceberg 1.11.0 RC4 投票通过,正式发布在即

为什么值得继续看:Iceberg 1.11 是 Iceberg v3 格式的首个完整特性版本——新增实验性 Variant type、纳秒精度时间戳、行级血缘等能力,对 Trino 481 已实现的 v3 写入支持形成完整生态闭环。

需要等待什么信号确认:正式 release 公告(PMC 已有足够 binding +1,预计数日内发布)。

降级Fivetran 宣布接管 Great Expectations 开源社区

为什么值得继续看:GX Core 是最广泛使用的开源数据质量框架之一,Fivetran 接管意味着数据质量验证将更紧密地嵌入 Fivetran+dbt 的数据基础设施栈。这延续了 Fivetran/dbt 合并后"Open Data Infrastructure"战略的执行。

需要等待什么信号确认:协议正式完成后的治理结构和路线图变化。

预告Databricks Lakebase 全面迁移至 Autoscaling 平台(6 月启动)

为什么值得继续看:所有 Lakebase Provisioned 实例将在 6 月起自动升级至 Autoscaling 平台,获得弹性伸缩、缩容到零、数据库分支等能力。这标志着 Databricks OLTP 层从固定资源模式全面转向 Serverless 弹性模式。

需要等待什么信号确认:6 月正式升级通知和定价影响。