📊 Data+AI 全球日报

2026-07-27 · 严格只包含过去24小时信息

🔥 今日最重要的3个变化

  1. 数据与AI平台从双集群走向统一计算底座,分离架构开始被打破
  2. 湖仓架构正从分析导向转向Agent原生运行基座
  3. 高质量数据集标准化加速从国家层面向省级实践落地
总判断:国内数据平台正式进入Spark+Ray统一架构阶段,湖仓正从分析基础设施转向Agent运行基座,高质量数据集标准化从国家层面加速向省级落地。
A

Top Signals

腾讯云发布智能数据湖计算平台AI DLC,首次实现Spark+Ray生产级统一

来源: 腾讯云开发者社区
摘要: 7月25日,腾讯云在DataFun Agentic AI Summit上正式发布智能数据湖计算平台AI DLC,成为国内首个在同一平台上同时提供生产级Spark+Ray全托管服务的智能数据湖计算平台。平台搭载三大自研引擎(TCRay提供Ray全托管与GPU弹性调度、Xpark处理多模态数据、Meson提供C++原生加速),支持一份算力同时承载大数据处理与AI训练推理,统一数据、元数据与权限。据腾讯云大数据团队验证,统一平台将训练迭代周期从月级压缩至周级,运营成本降低约60%。
为什么对数据平台重要: AI DLC的发布标志着国内数据平台从"数据平台+AI平台"的双集群分离模式正式走向统一架构。此前Spark跑CPU集群做ETL、Ray跑GPU集群做训练,数据在OSS/HDFS/Iceberg之间反复搬运——高达80%的GPU算力空闲等待数据加载。AI DLC让Spark与Ray共享同一份数据、算力与权限,零拷贝完成从数据处理到模型训练的全流程。这也是国内厂商首次推出对标Databricks Lakehouse AI路线的生产级产品,可能加速国内企业从双集群架构向统一数据底座迁移。
B

Product & Tech

阿里云Dataphin V6.2发布,新增Milvus向量数据源与多项实时集成增强

来源: 阿里云Dataphin功能更新
摘要: 阿里云Dataphin V6.2于7月26日在上海区域发布。新增Milvus 2.6.x向量数据源支持,并扩展Kafka输入组件支持JSON格式消息体解析;离线集成增加DataHub Blob类型主题支持,飞书多维表格批量写入扩展至1000条;数据质量规则新增超时自动终止与失败自动重试,元数据中心新增TDSQL for PostgreSQL和DataWorks采集源。
对数据平台的影响: 新增Milvus向量数据源是此次更新的核心信号——数据平台开始将向量数据库作为标准数据源管理,这在Agent和RAG场景下意味着向量存储纳入了统一的数据治理和血缘体系。Kafka JSON消息体支持也降低了半结构化实时数据的接入门槛,配合质量规则的自动化增强,反映出数据平台在Agent场景下对实时性、向量化和自动化治理三个方向的同时投入。
C

Views & Research

今日无符合准入标准的机构观点或研究报告。
D

Capital & Corporate

今日无符合准入标准的资本与公司事件。
E

Watchlist

【降级】山东省发布首批46个高质量数据集产品,445家数据企业入库

来源: 山东发布
为什么值得继续看: 7月24日山东省大数据局发布首批46个高质量数据集产品(覆盖城市治理、医疗健康、自然资源等领域)及445家首批入库数据企业,数据集已在国家数据集管理服务系统上线。这是国家数据局《数据产权登记工作指引》发布后首个省级大规模落地的数据集产品清单,标志着高质量数据集标准化从顶层设计进入地方实操阶段。
需要等待什么信号确认: 其他省份是否跟进发布类似清单形成全国性数据集供给网络,以及数据集产品的定价、交易和质量评测机制是否配套建立。

【跟踪】Databricks工作区权限模型今日自动升级,精确授权替代继承式权限

来源: Databricks Docs
为什么值得继续看: 7月27日起,Databricks对未主动opt-in/opt-out的工作区自动启用新权限模型——从此前"所有用户默认继承workspace access和SQL access"改为"显式逐用户授权",并支持consumer-only用户角色。这是Databricks在数据治理粒度和安全合规方面的重大架构变更,影响所有使用SCIM/Terraform自动化管理权限的企业。
需要等待什么信号确认: 9月14日全面强制执行后,企业用户是否遇到SCIM同步、CI/CD权限脚本的兼容性问题,以及consumer-only角色在Agent/Genie场景下的实际权限边界是否清晰。