📊 Data+AI 全球日报

2026-04-10 · 严格只包含过去24小时信息

🔥 今日最重要的3个变化

  1. 开放表格式进入能力统一时代,格式之争正在让位于治理与体验之争
  2. 数据平台全面拥抱 Agent 范式,从存储层安全到交互层重构都在加速
  3. 国内云厂商算力成本集体上行,大数据平台运营成本结构面临重估
总判断:Iceberg Summit 催化了一轮密集的产品落地,开放表格式不再是理念宣言而是工程事实;与此同时,Oracle 用可用性分层和 Agent 数据安全锁定关键工作负载,Snowflake 宣布从仓库向 Agent 平台转型——数据平台竞争正在从"格式之争"全面转向"谁能在统一格式上提供更好的治理、Agent 就绪度和跨平台体验"。
A

Top Signals

1. Databricks 宣布 Apache Iceberg v3 进入公开预览,统一 Iceberg 与 Delta 数据层

Databricks 在 Iceberg Summit 2026 上宣布 Apache Iceberg v3 在其平台进入公开预览。Iceberg v3 带来三项核心能力:行血缘(Row Lineage,每行携带永久 ID 和修改序列号,使 CDC 成为表的原生属性)、删除向量(Deletion Vectors,逻辑删除无需重写数据文件,写入性能比 copy-on-write 快最多 10 倍)、以及 VARIANT 类型(半结构化数据以原生列类型存储,无需 schema 迁移即可查询新字段)。通过 Delta Lake UniForm 实现"写一次 Delta,以 Iceberg 格式随处读取"。

为什么对数据平台重要:这是开放湖仓从"格式兼容"走向"能力统一"的标志性节点。行血缘使增量处理成为表的内置能力,删除向量消除了 Iceberg 在 UPSERT 场景的性能短板,VARIANT 类型挑战了 JSON 列需要预先 ETL 的传统模式。当 Iceberg v3 的能力矩阵与 Delta Lake 高度对齐后,竞争将从格式层上移到引擎优化和治理层。

2. Databricks 通过 Delta Sharing 共享外部 Iceberg 表进入公开预览

Databricks 4 月 9 日宣布通过 Delta Sharing 协议共享从外部 Iceberg Catalog 联邦的外部 Iceberg 表进入公开预览。数据提供方可将外部 Iceberg 表添加到共享中,接收方以只读格式访问,无需将数据复制到 Databricks 环境内。

为什么对数据平台重要:Delta Sharing 从 Delta 格式扩展到 Iceberg 表,打破了"同质平台"限制。多云、多平台环境下的企业可通过统一共享协议跨格式访问数据,数据留在原地即可安全共享,是"数据联邦"理念在工程层面的实质性落地。

3. Snowflake Data Clean Rooms Collaboration API 正式 GA,支持对称多方协作

Snowflake 4 月 9 日宣布 Data Clean Rooms 全新 Collaboration API 正式 GA(API 版本 14.3)。新架构支持完全对称的多方协作,具有灵活的角色分配和细粒度的数据访问控制,适用于任意数量的参与者。同步新增协作配置管理 API 和操作可靠性改进。

为什么对数据平台重要:Data Clean Rooms 从"两方数据匹配"进化为"任意多方对称协作",广告归因、联合风控、供应链协同等多方场景不再需要复杂的 hub-and-spoke 定制集成。Snowflake 正在将数据协作从功能模块升级为平台级基础设施。
B

Product & Tech

1. Oracle AI Database 26ai 发布三级可用性架构与面向 AI Agent 的深度数据安全

Oracle 在 AI World Tour(纽约)发布 26ai 重大更新,建立 Gold/Platinum/Diamond 三级可用性架构。Platinum 级灾难故障转移 <30 秒(比 19c 快 4 倍),无额外费用;Diamond 级 <3 秒零数据丢失。安全层面推出 Deep Data Security(专为 AI Agent 设计的细粒度数据授权)和后量子密码学支持。

对数据平台的影响:三级可用性分层是 Oracle 对关键工作负载市场的差异化策略——Platinum 免费升级降低迁移阻力,Diamond 瞄准金融交易等极端场景。Deep Data Security 专为 AI Agent 设计数据隔离策略,「Agent 时代数据安全」正在成为数据库竞争新维度。

2. Azure Databricks Unity Catalog 管道删除 API 新增 cascade 控制(Beta)

Azure Databricks 4 月 9 日在 Unity Catalog 管道的 Pipelines DELETE API 中新增 cascade 字段(Beta)。默认 cascade=true 删除管道时同时删除所有关联的物化视图、流式表和视图;设置 cascade=false 可在删除管道后保留关联表(表变为非活跃状态)。

对数据平台的影响:对于运行大量 DLT 管道的数据工程团队,管道生命周期管理一直是痛点——删除管道意味着丢失所有派生表。cascade 控制使管道删除变为可逆操作,降低了管道重构和迁移的风险成本。

3. Iceberg Summit 2026:V4 设计方向与高效列更新提案浮出水面

Iceberg Summit 2026(4月8-9日,旧金山)首次扩展为两天线下活动。核心技术讨论包括:V4 版本中 metadata.json 可选性设计、Russell Spitzer 推进的单文件提交(one-file commits)可大幅降低提交延迟,以及 Péter Váry 提出的高效列更新提案——仅写入更新列到单独文件、读取时拼接,直接面向 AI/ML 宽表场景。

对数据平台的影响:V4 的单文件提交将显著降低高频写入场景的元数据开销,列更新提案为 PB 级特征存储场景(如 embedding 更新)提供更高效路径,Iceberg 对 AI 工作负载的适配正在深化。

4. Apache Parquet ALP 浮点编码规范完成审查,正式投票在即

Parquet ALP(Adaptive Lossless floating-Point)编码规范已完成最终审查,正式接受投票预计本周内完成。ALP 通过分别编码浮点数的指数和尾数部分实现更优压缩率,直接提升 ML 特征存储和科学计算场景的存储效率。

对数据平台的影响:Parquet 作为湖仓架构的底层存储格式,ALP 编码将降低浮点密集型工作负载(向量 embedding、模型参数、传感器数据)的存储成本,属于基础设施层面对 AI 工作负载的直接优化。
C

观点与洞察

1. Snowflake CEO Sridhar Ramaswamy:聊天机器人时代落幕,智能体时代到来

核心观点:Snowflake CEO 在 TechCrunch Equity 播客中阐述公司战略转型方向:从数据仓库公司转变为「随数据交付」的 AI 平台。核心判断是聊天机器人时代正在结束,真正的价值在于能自主执行复杂业务任务的智能体。公司已推出数百项 AI 功能并对内部团队架构进行全面重组。

映射到数据平台的判断:这是 Snowflake 从「存储和分析数据」到「基于数据采取行动」的路线宣言,与 Databricks 的 Compound AI Systems、Oracle 的 AI Agent 数据安全形成呼应——头部数据平台厂商正在统一将 Agent 作为下一代产品的核心交互界面。

2. Constellation Research:Oracle Diamond 级可用性为 AI Agent 设立新基线

核心观点:Constellation Research 首席分析师 Holger Mueller 评价称,Oracle Diamond 级 MAA 达到可用性新巅峰——零停机、零数据丢失的可用性水平,不仅传统实时信用卡处理需要,需要 24/7 访问当前数据的 AI Agent 应用同样需要。这明确提高了 AI 时代真正关键任务数据架构的标准。

映射到数据平台的判断:分析师将 AI Agent 对数据可用性的要求与金融级交易系统并列,说明 Agent 驱动的工作负载正在重新定义数据库 SLA 基线——数据平台不仅要快,还必须「永不停」。
D

Capital & Corporate

财报发布 腾讯云跟进涨价,国内三大云厂商一个月内集体调价

核心数据:阿里云(3月18日,涨幅 5%~34%,CPFS 智算版涨 30%)、百度智能云(3月18日,5%~30%)、腾讯云(4月9日,AI 算力/TKE/EMR 统一涨 5%,5月9日生效)。

腾讯云成为一个月内第三家宣布涨价的主要云厂商。涨价从模型调用层(腾讯云 3 月混元涨价 463%)传导到底层算力层(4 月 EMR 涨 5%),核心驱动力是 AI Agent 爆发带来的算力供需失衡。IDC 预测到 2030 年全球活跃 AI 智能体将达 22.16 亿。

对数据平台的影响:EMR 等大数据计算层涨价直接影响企业数据平台运营成本。AI 训练/推理与大数据分析共用算力池的企业,成本压力双向叠加,混合部署(公有云+私有算力)的 ROI 重新成为架构决策焦点。
E

Watchlist

跟踪 Iceberg Summit 2026 催化多厂商密集发布,开放湖仓竞争进入新阶段

为什么值得继续看:4 月 8-9 日在旧金山举办的 Iceberg Summit 2026 汇聚了 70+ 场技术分享。Databricks 在此宣布 Iceberg v3 公开预览,Snowflake 同期公布 Iceberg V3 支持路线图和治理可移植性计划,Cloudera 发布含 Iceberg 优化器的混合平台升级。三大阵营在同一场活动上竞相展示 Iceberg 投入。

需要等待什么信号确认:Snowflake Iceberg V3 功能的实际 GA 时间、Databricks Iceberg v3 从公开预览到 GA 的节奏、各平台 Iceberg v3 功能的实际性能基准对比。

降级 Cloudera 混合数据平台重大升级:延长支持至 2032 年,Iceberg 表查询性能提升 38%

为什么值得继续看:Cloudera 4 月 8 日在 Iceberg Summit 上宣布平台重大升级,核心亮点包括:延长支持至 2032 年、Lakehouse Optimizer 自动优化 Iceberg 表(查询性能 +38%、存储开销 -36%)、Cloud Bursting(本地数据中心弹性扩展到云端无需数据复制)、跨平台实时 Iceberg 表共享。

需要等待什么信号确认:Cloud Bursting 和跨平台 Iceberg 表共享的实际可用时间和客户验证案例。

跟踪 Apache 生态 AI 贡献治理政策即将出台

为什么值得继续看:Iceberg 和 Arrow 社区同步在讨论 AI 生成代码的披露标准和代码溯源要求,预计 Summit 后将产出正式政策。这可能成为开源数据生态中 AI 辅助开发的第一个正式治理框架。

需要等待什么信号确认:正式政策文档发布,以及是否会被其他 Apache 项目(如 Spark、Flink)采纳。