1. 华为 IDI Forum 2026 发布 AI DC 数据基础设施全栈方案:存储首次承担 AI 上下文记忆职责
5月21日,华为在巴黎 IDI Forum 2026 上发布 AI DC 数据基础设施全栈方案,覆盖企业 AI 堆栈五层架构。核心发布:① OceanStor Pacific 全闪分布式存储(11PB/2U 密度,千亿千维向量秒级检索);② 业界首个支持异构算力的上下文记忆存储 CMS(单卡 50GB/s、聚合 10TB/s,PB 级共享 KV Cache 池,降低推理首 Token 时延 90%);③ "3+1" AI 数据平台(知识库 >95% 检索精度 + KV Cache + 记忆库 + UCM);④ ModelEngine 模型工程平台(XPU 1:10 切分);⑤ Nexent 智能体平台(Agent 上线周期缩短 80%)。
💡 华为将存储从"数据湖"升级为"AI 的知识与记忆层",CMS 标志着存储系统开始原生承担 LLM 推理的 KV Cache 和 Agent 记忆职责。对传统存储厂商提出新命题:AI 时代存储的价值不仅是容量和吞吐,还包括语义理解和上下文管理。
2. Apache Iceberg 1.11.0 正式发布:File Format API 开启表格式可插拔文件格式时代
Apache Iceberg 1.11.0 于 2026 年 5 月正式发布。两条主线工作汇聚:① File Format API——将 Iceberg 核心与物理存储格式解耦为插件模型,Vortex(GPU 解压)、Lance(向量检索)、Nimble(ML 训练)已在集成中;② V3 Spec 特性生产就绪——Deletion Vectors(Roaring Bitmap 替代累积删除文件)、Variant Type(半结构化数据原生支持)、地理空间类型、纳秒精度时间戳。
💡 File Format API 是 Iceberg 史上最具结构性影响的变化——让 AI 原生文件格式可在 Iceberg 表中与 Parquet 共存。单一表可根据工作负载选择最优物理格式,元数据层保持统一。Deletion Vectors 直接解决高频更新场景的性能退化问题。
3. 腾讯云 TBDS 三层融合架构重构,联合信通院 TC601 发布 Data+AI 白皮书
腾讯云联合 CCSA TC601 发布《大数据平台在 DATA+AI 时代下的融合创新》白皮书。TBDS 完成三层融合架构重构:架构降本层、资源提效层、智能协作层,在全面适配国产芯片与操作系统基础上实现"Data for AI"与"AI for Data"双轮驱动。白皮书提出企业五步走转型路径。同步发布 DataBuddy 大数据智能体工作台。
💡 信通院级白皮书通常预示行业标准演进方向。TC601 参与定义"Data+AI 平台融合架构"意味着国产大数据平台将有标准化评价框架,"AI 就绪度"可能成为平台能力的正式评估维度。
1. dbt Core v1.12 Beta 发布 + Developer Agent 进入 Preview
dbt Core v1.12 Beta:on_error: continue(上游失败不阻塞下游)、根级 vars.yml、选择器交叉引用、新语义层规范、JavaScript UDF、Python UDF 引入第三方 PyPI 包支持。Developer Agent Preview:自然语言构建/重构数据模型,自动生成 SQL/测试/文档。另有 Snowflake PrivateLink 自助配置 Beta、Connection Profiles GA、Cost Insights Beta。
💡 Developer Agent 标志数据工程工具从"人写代码"向"Agent 交付"转变。on_error: continue 解决大规模 DAG 单点失败级联阻塞痛点。
2. Databricks Lakebase Autoscaling 统一权限模型上线 + Provisioned 升级启动
5/11-21 完成 Lakebase Autoscaling 统一权限模型滚动发布。6 月起将所有 Provisioned 实例自动升级至 Autoscaling(支持 scale-to-zero、PITR、数据库分支)。Power BI 连接 7 月过渡至 ADBC。Runtime 19 采用统一发版模型(单版本号 + 按日期更新)。
💡 Scale-to-zero 使 Agent 应用数据库后端成本大幅下降;统一权限模型简化 AI Agent 访问数据库的权限管理复杂度。
3. 腾讯云 DataBuddy 大数据智能体工作台——数据任务 Agent 原生交付
基于 WorkBuddy Harness 架构,通过 Skill 机制引入腾讯云大数据十余年经验。用户通过自然语言完成数据接入、开发、治理、分析全链路。Agent 自主拆解任务、规划执行路径、异常自动修正。三大场景:数据分析、数据治理、数据工程。
💡 不再是"AI 辅助补全 SQL",而是用户说清目标、Agent 自主交付结果。对数据从业者意味着操作型技能价值下降,定义正确目标的能力成为核心。
1. IDC:AI 进入"超级周期",缺乏 AI-Ready 数据将导致 15% 生产力损失
全球已有超 3000 万个 AI Agent 协同工作,预计 2030 年超 22 亿。AI 从后台效率工具转变为商业模型本身。到 2029 年企业 AI 投资将增长至千亿美元规模。关键预警:到 2026 年底因缺乏高质量 AI-Ready 数据将导致 15% 生产力损失。数据就绪度是 Agent 系统的"生命线"。
💡 "15% 生产力损失"为数据质量投资提供量化参照系,正在成为平台厂商产品定位的核心依据。
2. 华为首席存储科学家:构建可解释、可逆、受约束的 AI 系统,六大存储技术方向
David Slik 提出存储三大 AI 时代使命:效率与成本、可信与可靠、隐私与安全。六大攻关方向:高带宽闪存(HBF)、归档存储成本突破、网内数据处理、防止知识表示格式碎片化、知识图谱与细粒度安全、存储生命周期可见性。新型 AI 接口——"知识服务"和"记忆服务"——让存储理解数据语义关系。
💡 "知识服务"和"记忆服务"将存储从传统接口扩展到语义层面,暗示未来存储层与数据平台语义层可能深度融合。