来源: Azure Databricks Release Notes摘要: Databricks 正式发布 VARIANT 数据类型及 Variant shredding 列式分解能力。VARIANT 专为半结构化数据设计,支持从 Kinesis、Event Hub、REST API 和 schemaless 数据库摄取 JSON 等灵活格式数据,同时通过自动列式分解实现接近结构化数据的查询性能。从 Databricks Runtime 17.3 起,新建含 VARIANT 列的表自动启用 shredding。
为什么对数据平台重要: VARIANT GA 意味着湖仓在半结构化数据处理上不再需要在灵活性和性能之间二选一。传统做法是将 JSON 存为 STRING 后查询时解析(性能差),或预先 ETL 为固定 schema(灵活性差)。VARIANT + shredding 将 schema-on-read 优势工程化,降低了流式半结构化数据入湖的门槛,是湖仓对传统数仓在数据类型覆盖上的关键补齐。