📊 Data+AI 全球日报

2026-05-22 · 信息窗口 2026-05-21 08:00 ~ 2026-05-22 08:00 CST

🔥 今日最重要的3个变化

  1. 数据存储正从"后台仓库"升级为 AI 系统的核心运行基座,华为首推全栈 AI DC 数据基础设施方案
  2. Apache Iceberg 1.11.0 通过 File Format API 将表格式从"绑定 Parquet"推向可插拔多格式架构
  3. 腾讯云 TBDS 完成面向 Data+AI 的三层融合架构重构,联合信通院定义国产大数据平台新范式
总判断:数据基础设施层的架构假设正在被 AI 工作负载全面重写——存储要理解上下文语义、表格式要适配 AI 原生文件格式、大数据平台要从处理中心转向智能中心。这不是功能迭代,是基础架构的范式跃迁。
A

Top Signals

1. 华为 IDI Forum 2026 发布 AI DC 数据基础设施全栈方案:存储首次承担 AI 上下文记忆职责

5月21日,华为在巴黎 IDI Forum 2026 上发布 AI DC 数据基础设施全栈方案,覆盖企业 AI 堆栈五层架构。核心发布:① OceanStor Pacific 全闪分布式存储(11PB/2U 密度,千亿千维向量秒级检索);② 业界首个支持异构算力的上下文记忆存储 CMS(单卡 50GB/s、聚合 10TB/s,PB 级共享 KV Cache 池,降低推理首 Token 时延 90%);③ "3+1" AI 数据平台(知识库 >95% 检索精度 + KV Cache + 记忆库 + UCM);④ ModelEngine 模型工程平台(XPU 1:10 切分);⑤ Nexent 智能体平台(Agent 上线周期缩短 80%)。
💡 华为将存储从"数据湖"升级为"AI 的知识与记忆层",CMS 标志着存储系统开始原生承担 LLM 推理的 KV Cache 和 Agent 记忆职责。对传统存储厂商提出新命题:AI 时代存储的价值不仅是容量和吞吐,还包括语义理解和上下文管理。

2. Apache Iceberg 1.11.0 正式发布:File Format API 开启表格式可插拔文件格式时代

Apache Iceberg 1.11.0 于 2026 年 5 月正式发布。两条主线工作汇聚:① File Format API——将 Iceberg 核心与物理存储格式解耦为插件模型,Vortex(GPU 解压)、Lance(向量检索)、Nimble(ML 训练)已在集成中;② V3 Spec 特性生产就绪——Deletion Vectors(Roaring Bitmap 替代累积删除文件)、Variant Type(半结构化数据原生支持)、地理空间类型、纳秒精度时间戳。
💡 File Format API 是 Iceberg 史上最具结构性影响的变化——让 AI 原生文件格式可在 Iceberg 表中与 Parquet 共存。单一表可根据工作负载选择最优物理格式,元数据层保持统一。Deletion Vectors 直接解决高频更新场景的性能退化问题。

3. 腾讯云 TBDS 三层融合架构重构,联合信通院 TC601 发布 Data+AI 白皮书

腾讯云联合 CCSA TC601 发布《大数据平台在 DATA+AI 时代下的融合创新》白皮书。TBDS 完成三层融合架构重构:架构降本层、资源提效层、智能协作层,在全面适配国产芯片与操作系统基础上实现"Data for AI"与"AI for Data"双轮驱动。白皮书提出企业五步走转型路径。同步发布 DataBuddy 大数据智能体工作台。
💡 信通院级白皮书通常预示行业标准演进方向。TC601 参与定义"Data+AI 平台融合架构"意味着国产大数据平台将有标准化评价框架,"AI 就绪度"可能成为平台能力的正式评估维度。
B

Product & Tech

1. dbt Core v1.12 Beta 发布 + Developer Agent 进入 Preview

dbt Core v1.12 Beta:on_error: continue(上游失败不阻塞下游)、根级 vars.yml、选择器交叉引用、新语义层规范、JavaScript UDF、Python UDF 引入第三方 PyPI 包支持。Developer Agent Preview:自然语言构建/重构数据模型,自动生成 SQL/测试/文档。另有 Snowflake PrivateLink 自助配置 Beta、Connection Profiles GA、Cost Insights Beta。
💡 Developer Agent 标志数据工程工具从"人写代码"向"Agent 交付"转变。on_error: continue 解决大规模 DAG 单点失败级联阻塞痛点。

2. Databricks Lakebase Autoscaling 统一权限模型上线 + Provisioned 升级启动

5/11-21 完成 Lakebase Autoscaling 统一权限模型滚动发布。6 月起将所有 Provisioned 实例自动升级至 Autoscaling(支持 scale-to-zero、PITR、数据库分支)。Power BI 连接 7 月过渡至 ADBC。Runtime 19 采用统一发版模型(单版本号 + 按日期更新)。
💡 Scale-to-zero 使 Agent 应用数据库后端成本大幅下降;统一权限模型简化 AI Agent 访问数据库的权限管理复杂度。

3. 腾讯云 DataBuddy 大数据智能体工作台——数据任务 Agent 原生交付

来源:DoNews / bilibili
基于 WorkBuddy Harness 架构,通过 Skill 机制引入腾讯云大数据十余年经验。用户通过自然语言完成数据接入、开发、治理、分析全链路。Agent 自主拆解任务、规划执行路径、异常自动修正。三大场景:数据分析、数据治理、数据工程。
💡 不再是"AI 辅助补全 SQL",而是用户说清目标、Agent 自主交付结果。对数据从业者意味着操作型技能价值下降,定义正确目标的能力成为核心。
C

观点与洞察

1. IDC:AI 进入"超级周期",缺乏 AI-Ready 数据将导致 15% 生产力损失

全球已有超 3000 万个 AI Agent 协同工作,预计 2030 年超 22 亿。AI 从后台效率工具转变为商业模型本身。到 2029 年企业 AI 投资将增长至千亿美元规模。关键预警:到 2026 年底因缺乏高质量 AI-Ready 数据将导致 15% 生产力损失。数据就绪度是 Agent 系统的"生命线"。
💡 "15% 生产力损失"为数据质量投资提供量化参照系,正在成为平台厂商产品定位的核心依据。

2. 华为首席存储科学家:构建可解释、可逆、受约束的 AI 系统,六大存储技术方向

David Slik 提出存储三大 AI 时代使命:效率与成本、可信与可靠、隐私与安全。六大攻关方向:高带宽闪存(HBF)、归档存储成本突破、网内数据处理、防止知识表示格式碎片化、知识图谱与细粒度安全、存储生命周期可见性。新型 AI 接口——"知识服务"和"记忆服务"——让存储理解数据语义关系。
💡 "知识服务"和"记忆服务"将存储从传统接口扩展到语义层面,暗示未来存储层与数据平台语义层可能深度融合。
D

投融资

收购 Anthropic 超 $3 亿收购 Stainless,Agent 工具链"三件套"集齐

Anthropic 收购 SDK 自动生成工具公司 Stainless(红杉/a16z 投资),交易额超 3 亿美元。Stainless 为 OpenAI、Google、Cloudflare、Runway 等公司生成和维护多语言 SDK。收购后将关停所有托管产品,仅服务 Anthropic。至此 Anthropic 集齐 Agent 三件套:Claude(模型)+ MCP(连接协议)+ Stainless(接口工具链)。竞品失去关键 SDK 基础设施供应商。
💡 依赖 Stainless 生成 SDK 的数据平台 API 提供商需要自行维护。Anthropic 通过 MCP + Stainless 构建了从"Agent 调用什么"到"如何调用"的完整控制面,对数据平台 API 战略有启示意义。
E

Watchlist

1. 【跟踪】Databricks 季度产品路线图 Webinar(5/21)

预告内容:Lakebase for Serverless Postgres & AI Agents、会话式数据查询分析、企业级 AI Agent、Unity Catalog & Trust Layer 更新。正式发布细节待确认后可能升级为 B 板块。

2. 【跟踪】腾讯云"数据库+AI"产品发布会(5/29 预告)

预告 AI-In-Database 双轨路径(DB for AI + AI in DB),含 Agent"记忆大脑"、数据库 Agent 工具套件、多模态向量混合检索。预计为 TDSQL 引入原生 AI 能力的正式发布。