Databricks Runtime 推出 NEAREST BY join 原生批量向量搜索
Databricks 在 Runtime 中推出 NEAREST BY join 语法,把批量向量搜索实现为引擎原生的一等 top-k 排序连接,基于 Spark 与 Photon,提供 EXACT 与 APPROX 两种语义。
databricks.com · 网站与博客
Databricks 在 Runtime 中推出 NEAREST BY join 语法,把批量向量搜索实现为引擎原生的一等 top-k 排序连接,基于 Spark 与 Photon,提供 EXACT 与 APPROX 两种语义。
Databricks 推出 Genie Ontology,为 Genie 提供持续更新的企业业务上下文,包括业务定义、规则、关系与可信来源,并通过 OntoRank 按认证、使用量、作者等信号对上下文排序。
Databricks 在 Apache Iceberg REST catalog 规范中贡献 UNREGISTER 端点,配合已有的 REGISTER,让用户无需重写、导出或复制任何文件即可在 catalog 之间迁移表。
Databricks 的 Genie One 是一款基于业务上下文的数据智能 AI 同事,可帮助财务团队完成预算差异分析、现金流预测、财务结账和支出分析等工作流。
Databricks 基于数十个金融、能源、零售等行业 Genie Agents 落地经验,提出一个五维评分框架:业务影响、需求重复度、数据与元数据就绪度、范围清晰度、治理与风险匹配,20-25 分即可立即建设,14-19 分需先打磨,低于 14 分暂缓,且没有业务支持者时无论分数都应搁置。
Databricks 推出 Genie One,一款面向资管买方财务的数据智能 AI 同事,基于 Genie Ontology 提供可溯源答案,其底层 Genie Agents 可隔夜摄取托管文件、对账持仓并生成初版 NAV。BCG 2026 年全球资管研究估计,智能体工作流可将投资运营产能提升 55% 至 65%,运营成本降低约 40%。
Databricks 发布了一套基于 Lakebase 和 AI Search 的电商推荐系统参考架构,已在亚洲某时尚电商平台落地,服务超 100 万月活用户和 10 万+ SKU。
Apache Iceberg 社区为 Iceberg REST Catalog 推进两项新规范:read restrictions 与 catalog labels。
Databricks 的 Lakebase Postgres 推出基于分支的恢复机制,将恢复时间从数小时降至秒级,即使数据库规模达 100 TB。该架构将计算与存储解耦,数据库历史以可即时引用的形式存放在对象存储中,恢复只需在指定时间戳创建一个分支,属于元数据操作而非数据拷贝与 WAL 重放。
Databricks 提出以智能体营销打通客户上下文与可衡量 ROI,强调身份解析是基础:Acxiom 与 Lovelytics 合作将其数据与身份服务重建为 Databricks 上的原生应用层,可执行客户洞察的上市时间提升约 30%、运营成本降低约 15%,Acxiom 的 Real ID 身份解析引擎也已原生运行在 Databricks 上。
Databricks 发布 AI Function ai_decide,基于 TypeSafe AI 的决策模型 Jev,对非结构化文本在不到一秒内返回概率、命名选项或有序评分,延迟和成本低于 LLM。
Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。
Databricks 联合 OpenAI 和 Stellantis 探讨企业规模化智能体应用,核心是随智能体自主性提升,周边基础设施更关键,需提供模型与框架选择、受治理的企业上下文、以及贯穿每次行动的控制。Databricks 以 Agent Bricks、Omnigent 和 Unity Gateway 构建统一底座,让团队新增智能体和工作流时无需各自重复集成与治理。
Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。
推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。
Databricks 发布 Lakebase Search,通过 lakebase_vector(可扩展近似最近邻搜索)和 lakebase_text(BM25 全文搜索)两个扩展为 Lakebase Postgres 带来搜索能力,已在 AWS 和 Azure 正式可用。
Databricks 提出用 Data and AI Platform 打通制造业产品价值链,让跨阶段数据问题从人工查票变成一次查询。平台通过 zero-copy Open Sharing 和 Lakehouse Federation 直接访问源系统数据,无需为每个用例新建 ETL 管道或复制数据;需要镜像时可用连接器和云对象存储汇入 lakehouse。
Databricks 发文指出,健康保险公司的 BI 报表只能显示 MLR(医疗赔付率)发生变动,却无法解释原因。文章探讨如何用 AI 从数据中定位 MLR 波动的驱动因素,帮助健康计划在月末结账后更快归因。
Databricks 发文介绍 Lakeflow Connect 如何统一营销数据,这是该主题新系列的第一篇文章。
Databricks 介绍在 Open Lakehouse 中统一跨引擎、跨 catalog 治理的方案,延续其此前关于开放表格式、开放 API 与统一治理的讨论。该方案面向多引擎与多 catalog 并存场景,目标是让治理策略在开放湖仓架构下保持一致。
Databricks 分享了改进 Lakebase Postgres 计算缓存的方法。Lakebase Postgres 采用存算分离架构,此次优化针对其计算缓存。原文未披露具体性能数字与版本信息。
Databricks 总结了金融服务行业领导者当前最关心的五个 AI 问题。相比去年 Sibos 法兰克福年会时业界还在追问 AI 是否真的有效,今年的焦点已转向能否真正落地。
Databricks 提出一套在平台上完成端到端 Solvency II 报告的实用方法,强调 Solvency II 报告不只是监管报送,更是一项业务流程。
Databricks 探讨在面向客户的应用中嵌入 AI/BI Dashboard 时如何为每位查看者保障安全。嵌入本身相对简单,难点在于让不同查看者只能看到各自权限范围内的数据。
Databricks 发布 Consort,将测试驱动开发(TDD)带到分支数据库上。该产品面向在数据库上构建软件的开发者,把分支能力与测试驱动流程结合,让开发者可在数据库分支上先写测试再改数据逻辑。原文未披露模型参数、benchmark 分数或定价等细节。
Databricks 发布 Adaptive Instructed-Retriever,在保持前沿级检索质量的同时将延迟降低 2 倍。该方案面向企业数据智能体,旨在同时满足搜索的准确性与速度需求。
Zepto 基于 Databricks 和 MLflow 构建了评估优先(Evaluation-First)的 AI 智能体,用于扩展其实时客户支持。该方案面向印度快速增长的业务场景,强调在部署前对智能体进行系统化评估以保证可靠性。
Databricks 介绍如何用 Temporal 与 Lakebase 构建持久化智能体,并以个人贷款核保智能体为例:它需要收集证据、应用策略,还可能长时间等待。
Databricks 提出 LTAP,将 OLTP 与 OLAP 负载统一到同一系统,打破沿用 40 年的数据库分工规则。文章由 Jonathan Katz 撰写,讨论 AI 智能体如何推动这一架构变化。
Databricks 提出通过专用 GPU Kernel 生成来提升生产推理系统效率,替代传统依赖通用 kernel 处理多样化负载的做法。该方案针对特定计算模式自动生成定制化 kernel,以突破通用实现的性能瓶颈。
Databricks 介绍了营销团队使用 Genie One 的五种方式。营销团队坐拥广告活动效果指标、客户数据等数据金矿,可借助 Genie One 加以利用。
Databricks 提出,AI 数据治理不应只停留在安全层面,还需覆盖知识、上下文与本体(ontology)三个维度,并落在湖仓(lakehouse)之上。多数组织目前对 AI 数据治理的理解仍局限于安全。
Databricks 发布博客,阐述如何构建高质量且可信的数据产品,以支撑企业成为 AI 与数据驱动型组织。文章围绕数据产品建设展开,面向希望落地 AI 与数据驱动战略的组织。
Southern Company 在 Databricks Blog 发文介绍其风暴情报系统 SCOUT,称其补全了此前的风暴情报体系。文章回顾了早前一篇关于 Southern Company 的分享,并说明 SCOUT 如何在此基础上完善整体能力。
Databricks 在 Data and AI Summit 上宣布将 Genie Spaces 演进为 Genie Agents,并为其扩展深度分析、文件推理等能力。此次更新聚焦于让智能体在数据分析场景中处理更复杂的任务。
Databricks 发布《AgentOps 大书》,将 AgentOps 定义为构建、部署和运维 AI 智能体的运营方法论。该内容围绕智能体的全生命周期管理展开,目前正文仅给出这一定义性说明。
美国 FDA 正在 Databricks for Government 上构建安全、AI 就绪的联邦数据基础,以推进其数据平台现代化。文章将这一过程比作在远洋航行中一边驾驶航母一边重造引擎,说明联邦数据平台改造的复杂程度。
Databricks 工程师在一小时内定位并消除了每年 100 万美元的 AI 智能体浪费支出。该公司工程师高度依赖 AI 智能体来简化和加速工作,此次排查针对的是智能体使用中的无效开销。
Databricks 指出,最好的安全投入并不只是工具或扫描器,协作本身同样关键。文章以安全漏洞背后的故事为切入点,说明团队间的协作能让安全防御更有效。
Databricks 提出在数据栈中落地 Genie Ontology,为 AI 智能体构建超越语义模型的共享业务上下文。该方案面向大语言模型驱动的智能体场景,目标是在数据栈内统一业务语义。
Databricks 为 ISV 和数据提供商推出 Brickbuilder 合作伙伴网络新分级。该计划今年早些时候已针对 ISV 重新设计,此次新增分级进一步面向数据提供商开放。