📊 Data+AI 全球日报

2026-08-03 · 严格只包含过去24小时信息

🔥 今日最重要的3个变化

  1. 开放表格式从功能追赶转入架构引领,v4地基代码已落地
  2. 云厂商AI基建的天量投入开始转化为收入加速,市场疑虑正在消退
  3. 国产数据基建从卖硬件升级为定义AI操作系统和数据库Agent
总判断:本周核心信号:Iceberg 1.11以v4架构和表加密拉高开放格式上限,AWS 37%云增速验证AI基建回报,浪潮AI数据OS和阿里DB Agent代表国产厂商从硬件向软件定义层跃进。共同指向:数据平台正从为人而建,转向为Agent而建。
A

Top Signals

Apache Iceberg 1.11.0 正式发布:v4 架构基石落地,内置表级加密与服务端扫描规划

摘要: Apache Iceberg 1.11.0 于 7 月 31 日正式发布,来自 200+ 贡献者的 1,000+ 次提交构成 1.x 系列最大规模更新。同步发布 Iceberg Go 0.6.0、C++ 0.3.0、Rust 0.10.0 三个语言实现。核心变化包括:REST Catalog 首次支持服务端扫描规划(POST /plan),将元数据遍历从查询引擎卸载至 Catalog 层;内置信封加密(AES-GCM + KMS 三层密钥体系)实现表级零信任存储安全;File Format API 正式定型,为 v4 的 Column Families(列族垂直分区)铺路;SQL UDF 规范首次进入 Catalog 层;新增 Spark 4.1 和 Flink 2.1 支持。Breaking changes:Java 11 支持移除(最低 Java 17),Flink 1.19 和 Spark 3.4 支持移除,DataFusion Comet 集成移除。
为什么对数据平台重要: 这是 Iceberg 项目从"v3 时代的追赶者"转向"v4 时代的定义者"的分水岭版本。三个架构决策尤其值得关注:(1) 服务端扫描规划将计算从引擎侧转移到 Catalog 侧,实质上是将 Iceberg 从"被动元数据端点"升级为"主动查询优化服务",这改变了湖仓架构中 Catalog 的角色定位;(2) 表级加密填补了数据湖安全最后一块短板——此前对象存储桶级加密无法防御存储层直接访问,Iceberg 的三层密钥体系让开放格式首次具备企业级合规能力;(3) File Format API + TrackedFile 等 v4 基础类型已在代码中落地,配合社区正在推进的自适应元数据树和单文件提交,v4 不再是一份设计文档而是一组已编译的接口。对于采用 Iceberg 的企业,1.11 意味着可以开始规划 v4 迁移路径,但不应立即投入生产——Java 11 移除和 Flink 1.19/Spark 3.4 移除需要升级现有引擎版本。

AWS Q2 财报:云收入增速创 18 季度新高,全年资本开支上调至 2,200 亿美元

摘要: 亚马逊 7 月 31 日盘后发布 Q2 2026 财报,总营收 2,006 亿美元(+20%,超预期),净利润 626 亿美元(+245%)。AWS 云服务收入 422 亿美元,同比增长 36.7%,为 2021 年以来最快增速,超出华尔街 31% 增长预期;年化营收达 1,690 亿美元;运营利润 166 亿美元(+64%),利润率 39.4%。CEO Andy Jassy 将全年资本开支指引从 2,000 亿美元上调至 2,200 亿美元,并明确表示"即使达到这一水平,2026 年仍无法满足全部需求,2027 年同样存在算力缺口,2028 年订单已提前锁定"。自研芯片 Trainium 和 Graviton 年化收入各自突破 250 亿美元。Anthropic 和 OpenAI 已签署多年、多吉瓦规模的 Trainium 使用承诺。
为什么对数据平台重要: 这是 AI 基础设施投资逻辑从"投入期焦虑"转向"回报验证期"的关键节点。AWS 37% 的增速表明企业 AI 推理和训练负载正在大规模迁移至云平台,而云基础设施消费天然带动数据库、数据仓库、数据湖等上层数据平台服务——Jassy 在电话会中明确指出"AI 推理需求带动 CPU、数据库等基础资源消耗"。对于数据平台采购决策者,AWS 的资本开支信号意味着:(1) 短期算力供给仍然紧张,自建或混合部署的成本优势窗口在收窄;(2) 自研芯片(Trainium/Graviton)正在从差异化功能变成核心成本项,数据平台选型时需要评估对非 x86 架构的兼容性;(3) OpenAI 和 Anthropic 同时押注 Trainium 暗示模型训练基础设施的多供应商格局正在形成,降低了对单一芯片生态的锁定风险。

浪潮数据发布自研 AI 数据操作系统,战略升级为 AI 基础设施服务商

来源:证券日报
摘要: 浪潮数据 8 月 1 日在北京举办"Data Inspire AI"战略发布会,正式宣布从传统云计算和分布式存储服务商升级为 AI 基础设施服务商,并发布完全自研的 AI 数据操作系统。该系统采用"数据底座+算力引擎"双架构设计:"玄同"为面向 AI 的高性能全闪融合存储架构,"万象"为智能体运行环境,统一管理算力、算法、数据三位一体资源。发布会同步展示了生物医药(荣联科技)和超大规模互联网(快手)两个真实落地场景,并启动"Data Inspire AI"产业生态计划。浪潮数据董事长张东将行业痛点归纳为持续演进、数据就绪、生态协同、应用落地四大挑战。
为什么对数据平台重要: 浪潮此举标志着中国传统 IT 基础设施厂商在 AI 时代的一次系统性升维——不再满足于卖存储和服务器,而是以"操作系统"为锚点定义 AI 基础设施的软件控制面。这一定位与 NVIDIA AI Enterprise、Databricks Lakebase 形成不同层面的对位:浪潮从硬件往上走,定义的是"数据如何流入 AI 工作负载";而 Databricks 从数据平台往下走,定义的是"AI 工作负载如何在数据之上运行"。两条路径的交叉点在于"智能体运行环境"——浪潮的"万象"和 Databricks 的 Lakebase 都在争夺 Agent 的基础设施层。对国内企业而言,浪潮的方案提供了"私有化部署 AI 基础设施"的国产选项,但生态成熟度和第三方 ISV 支持仍是关键不确定性。
B

Product & Tech

Confluent Platform 8.3 发布:Flink 首次内置 MCP Server,流处理平台向 AI Agent 开放编程接口

摘要: Confluent Platform 8.3 于 7 月 31 日正式可用(IBM 同步发布),基于 Apache Kafka 4.3.0,配套 Confluent Platform for Apache Flink 2.4.0。核心新增能力包括:(1) Flink MCP Server——提供 16 个只读调试工具和 20 个写入管理工具,让 AI 编码助手(Claude Code、Codex 等)可直接检查和管理 Flink 资源,所有操作受现有 RBAC 约束;(2) Flink SQL 新增 UDF、Artifact Management 和 Custom Catalogs 支持,允许在不离开 SQL 工作流的情况下引入自定义逻辑和外部数据源;(3) Embedded MDS——将 RBAC 和认证从 Kafka 版本解耦,Flink 控制面可独立管理安全策略;(4) Queues for Kafka (KIP-932) GA,为 Kafka 引入原生队列语义。
对数据平台的影响: Flink MCP Server 是流处理领域首个面向 AI Agent 的标准化管理接口,其意义不限于运维自动化——它标志着流处理平台的控制面开始从"人工 CLI/API"向"Agent 可编程"转型。对于数据平台团队,这意味着流作业的生命周期管理(部署、监控、故障恢复、扩缩容)可以由 AI Agent 在 RBAC 约束下自主执行,降低流处理运维门槛。但企业需要评估:Agent 对生产流作业的写入权限是否已建立充分的变更审批和回滚机制。

腾讯云 PostgreSQL 推出数据库代理:明确标注"AI Agent 就绪",连接层进入 Agent 治理时代

摘要: 腾讯云数据库 PostgreSQL 于 7 月 31 日正式推出数据库代理(Database Proxy)服务,通过在数据库实例前端构建全托管高可用代理层,实现客户端连接与后端进程的解耦。核心能力包括:连接池复用化解高并发短连接瓶颈,零应用改造成本(标准 PostgreSQL 协议兼容),全托管免运维。值得注意的是,产品文档明确标注"AI Agent 就绪"——可承接 MCP 工具链、Coding Agent 的瞬时连接风暴,确保数据库实例在 Agent 密集调用场景下稳定运行。
对数据平台的影响: 这是数据库连接中间件首次将"AI Agent 就绪"作为产品定位的核心卖点,反映了数据库消费方的结构性变化:过去连接池主要解决 Web 应用的高并发短连接问题,现在新增了一类消费者——AI Agent——其工作负载呈现"连接突发性强、会话持有时间长"的独特模式。腾讯云的这一动作暗示,数据库代理正在从"Web 时代的连接治理工具"演变为"Agent 时代的连接基础设施"。对于已部署 AI Agent 访问数据库的企业,这意味着需要在数据库连接层引入专门的治理能力,而非简单复用传统的连接池方案。

阿里云 Databridge Agent 正式转商业化:AI 原生数据库 Agent 首次进入收费阶段

摘要: 阿里云 AI 原生数据库服务 Databridge Agent 于 8 月 1 日起正式结束公测、全面开启商业化计费。该产品深度融合大模型与数据库运维能力,可自动完成数据库异常排查、性能优化、智能运维等操作。此前公测阶段已吸引大量互联网、金融、制造企业客户参与测试。Databridge Agent 是国内首个从免费公测走向商业化收费的 AI 原生数据库运维 Agent。
对数据平台的影响: Databridge Agent 的收费标志着"AI 替代 DBA"从概念验证进入商业验证阶段。如果客户愿意为 AI 运维 Agent 付费,意味着市场认可了 AI Agent 在数据库管理场景中的可替代价值,这将加速数据库运维从"人驱动"向"Agent 驱动"的转变。但商业化也意味着客户需要衡量 ROI:Agent 订阅费 vs. 减少的 DBA 人力成本。对于数据平台采购方,这是一个值得跟踪的信号——如果 Databridge 的商业化数据(付费客户数、续费率)表现良好,可能触发更多云厂商跟进推出付费 AI 运维 Agent,改变数据库服务的定价结构。
C

Views & Research

今日无合格信息。窗口内(7/31-8/3)Gartner、Forrester、IDC 等机构无新发布的数据平台相关研究报告。Forrester Wave: Data Lakehouses Q3 2026(7/29 发布,Cloudera 获 Leader)略早于窗口,将在后续跟踪。
D

Capital & Corporate

今日无合格信息。窗口内(7/31-8/3)无独立的数据平台领域投融资、并购或 IPO 事件。此前 7/31 日报已覆盖的 DataBahn $40M B 轮属上一报告窗口。亚马逊 Q2 财报已纳入 A.2。
E

Watchlist

【降级】Databricks Serverless GPU Web Terminal 进入 Public Preview:GPU 开发工作流向 Web 原生体验迁移

为什么值得继续看: Databricks 于 7 月 31 日将 Web Terminal 功能扩展至 Serverless GPU 计算(AI Runtime),支持通过浏览器直接运行 shell 命令、监控 GPU 使用率(nvidia-smi)、安装库和管理文件。此前 Web Terminal 仅限标准计算,此次扩展至 GPU 环境意味着 AI/ML 工程师可以在 Databricks 内完成从数据准备到 GPU 调试的全流程,无需切换至本地终端或 SSH。同期发布的 OpenAI Connector(Lakeflow Connect Beta)允许将 OpenAI 组织管理数据(用户、项目、API 密钥、用量、审计日志)导入 Databricks,暗示数据平台正在将 AI 服务商的运营数据纳入治理视野。
需要等待什么信号确认: Web Terminal on GPU 目前为 Public Preview,距离 GA 的时间线未公布。OpenAI Connector 处于 Beta 阶段且需要 Workspace Admin 在 Previews 页面启用。两个功能的生产就绪度和企业安全合规能力(如 Web Terminal 的会话审计、命令白名单)有待 GA 时确认。