Databricks 与 OpenAI、Stellantis 讨论企业规模化智能体应用时提出,基础设施需提供选择、上下文和控制三项能力。Databricks 用 Agent Bricks、Omnigent 和 Unity Gateway 分别承担统一平台、跨框架组合和集中管控,避免每个智能体各自形成独立集成与治理项目。
全部 AI 动态
按时间倒序的全量信息流
开发者将 Sparse VideoGen 的时空稀疏注意力在 TPU 上落地,通过跳过空 tile、仅对边界 tile 做精确掩码、把 token 布局改为时间主序,把 1440p 视频生成的去噪时间从 2471 秒降到 1461 秒,实现 1.69 倍端到端推理加速,同时保持 24.05 dB PSNR。
DoorDash 工程团队公开了其自建的 Agent Gateway 设计:它统一处理 AI 智能体发现和调用工具时的权限校验、凭证管理、工具目录筛选、请求转发与审计记录。该网关已承载超过 200 个注册 MCP 服务器、30 多个智能体和服务,每周处理数百万次工具调用。
Sebastian Raschka 梳理了文本分类从词袋、RNN/CNN 到 BERT、GPT 的演进,并实测 Jev 在 IMDb 测试集上 Choice API 达 96.47% 准确率、Noul API 达 96.20%,总成本约 0.63-0.65 美元。作者认为 Jev 的卖点不是新架构,而是无需逐任务微调即可在广泛任务上快速、廉价地分类。
Perplexity 发布自研 Rust 检索与排序引擎 Photon,已接管全部生产流量。其 p99 检索与排序延迟从约 800 ms 降至约 65 ms,服务机器比旧内容节点少约 20%,每文档存储数据量约为旧引擎的 2.5 倍。Photon 本身不开源,只能通过托管 API 使用。
DeepSeek 发布了一套昇腾工具包,包含 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,与其英伟达组件对齐。官方称训练中使用的每个 TileLang kernel 现在都有高性能昇腾实现,TileLang 支撑 V4 系列训练的大部分 kernel。DeepSeek 与华为还联合优化了 128 卡昇腾 950 超节点,关键计算和通信测试据称接近硬件极限。
Xcode 首次通过 MCP 开放 Preview 渲染能力,设计、开发、产品人员可以围绕一个本地启动的网页观摩 APP 的每个页面和细节。作者在生产实践中发现,MCP 渲染工具目前无法指定渲染设备,且修改依赖文件后可能返回旧截图,出现几率在 20%~40% 之间。
Audio8 ASR Infinite 是一个原生流式语音识别模型,每秒解码 12.5 次,通过滚动 KV Cache 在 24/7 运行中保持内存和延迟恒定。它提供 80/120/160 ms 可选音频时钟和 240–560 ms 转录延迟,支持中英双语,并包含语义 VAD 以区分停顿、口吃和真正的话轮结束。
DeepSeek 于 9 月 30 日宣布开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库和分布式通信库,与此前英伟达平台组件一一对应。TileLang 昇腾版本封装 Ascend C 底层指令,提供高级语言编程方式且不损失硬件性能;DeepSeek 训练中用到的每个 TileLang 算子都有对应的昇腾高性能实现。开源组件还包括 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,在多项关键测试用例中计算与通信性能已接近硬件上限。
作者实测国内 9 月 24 日上线的 Personal AI「Today」,它读取 iPhone 体重、步数和睡眠数据后,针对「没时间健身」给出诊断:指出用户凌晨 1 点睡、只睡 4 小时 38 分,并建议副业 23:15 收工。作者认为 Today 与 Muse 的差异在于先理解用户状态再主动介入,而非只执行浏览器操作。
一项研究在10个冻结的解码器模型(0.5B-72B)上刻画了推理时近似softmax的需求,发现可大幅削减softmax分配概率的位置数和行内分辨率,但同一位置的均匀加权有害。分辨率预算的放置位置与大小同等重要,靠近行最大值处始终更受青睐。基于此提出Rowmax-PoT和Rowmax-H15,在B200上FP8注意力前向在因果8K下快12.4%、非因果8K下快25.8%,因果16K下每次前向板级能耗降低8.4%。
OpenRouter 发布指南,介绍如何从生产流量构建黄金评测集:抽样、去重聚类、添加期望输出、首轮评测修正、提交 Git 并接入 CI。该评测集用于在每次部署前检测回归,并可通过同一 API 对多个候选模型运行同一评测集,依据自身流量证据而非榜单排名选择模型。
OpenRouter 发布了一份 AI 智能体回归测试指南,核心做法是在提示词、模型、工具定义或检索设置变化时,重跑一套锁定的用例集,并对照每个用例的行为契约检查工具调用与硬性不变量。指南强调模型交换时要用具体模型 slug 而非 latest 别名,并给出了 Python、TypeScript 和 Ori Eval 的完整实现示例。
OpenRouter 发布了一篇指南,介绍测试 AI 智能体工具调用准确率的三种方法:无参考 LLM 评判、确定性参数校验和轨迹比较。指南还提供了 Python 测试框架,可通过 OpenRouter 对多个支持工具的模型运行相同测试用例。
OpenAI 对 Codex CLI 进行了重大更新,新增全屏界面、更好的可读性,以及在终端内管理并行工作的方式。官方表示将继续为命令行开发者投入资源。
Codex 推出云环境,用户合上笔记本后智能体仍可继续运行。环境可复用,仓库、依赖、脚本和设置已预先就位,减少配置并加快启动。
InsForge 推出 InstaCloud,一个由 Y Combinator 支持的云平台,面向编码智能体,让智能体自行配置和运行 Postgres、S3 兼容存储及容器,同时由人类审查和批准关键变更。该平台针对智能体构建的应用在发布数月后出现的所有权问题:团队中无人编写过这些应用,因此无人负责修补运行时、监控错误率或扩容。
InstaCloud 发布了一款 agent-native 无服务器云,让 Claude Code、Codex 等编码智能体部署并运行它们构建的应用。智能体可处理资源调配、扩缩容和监控,关键变更由用户批准;服务可随流量伸缩、空闲时降至零,还能创建包含数据的完整环境分支来安全测试变更。
文章以退款政策被 AI 助手从 14 天错说成 30 天并虚构 5 天到账承诺为例,把 LLM 幻觉分为事实性错误、忠实性错误和凭空捏造三类,并解释逐 token 预测只优化文本合理性、不保证事实正确。随后给出 RAG、工具调用、允许“需要复核”状态、可核查引用与独立验证等缓解手段,同时指出这些方法只能减少、不能消除幻觉。
作者分享了一套用 Opus 5.5 驱动视频生成的工作流:在 Claude Code 中调用、经 OpenRouter 统一访问图像/视频/音频模型,并用 Gemini 3.8 TTS、Manim、Veo 3.1/Seedance 2.5、ElevenLabs 等工具分工完成配音、动态图形、关键帧与生成、配乐和字幕。提示词需明确内容、画幅、时长和风格偏好,ffmpeg 承担大部分实际视频操作。
卡兹克将月活百万的 AI 热点站 AIHOT 全盘开源,包含自动化抓取、独立双重打分、向量聚簇去重、中文摘要与每日 8 点日报生成的完整工业级系统。用户只需修改 industry/ 文件夹里的信源和提示词,配合 Docker 与 DeepSeek 或千问 API Key,即可在 10 分钟内搭建自己的垂直行业热点站。项目还原生支持 MCP 协议、llms.txt 和结构化 API,可供 Claude Code、Cursor 等 Agent 按需调取行业情报。
一个开源项目在 7 块 ESP32S3 组成的集群上运行 0.5B 的 1.58-bit BitNet 语言模型,采用分布式流水线推理:1 块作主节点处理分词、嵌入和输出,其余 6 块各负责 4 层 Transformer 块,节点间通过高速 SPI 菊花链通信。
Nereus 是一个面向 LLM 强化学习后训练的自适应并行运行时,用成本模型决定是否切换执行计划,并通过 Elastic Model Unit 和全局转换图协调跨模型、跨阶段的 GPU 转移。在基于真实数据的 trace 中,在线 TP/PP 自适应相对初始固定布局加 DP 扩展将平均步延迟降低 27.7%;在达到 1024 GPU 的 1000 步运行中,六次转换仅占总运行时间 0.079%。
作者用MiniMax昨天上线的M3.1-Flash-Preview,把X上刷屏的Opus 5.5机械沙虫概念视频复刻成一个单HTML文件的真3D网页,支持6个机位切换、X射线透视和24节蠕动驱动拆解。全程7轮对话、4个多小时,其中一轮模型自主运行55分38秒并声称已在真实浏览器验证。该模型默认思考档钉在max且不可关闭,出字速度282 token每秒,目前仅限MiniMax Code和Token Plan使用,未开放按量API。
SGLang Omni v0.1.7 发布,共合并 75 个 PR、迎来 8 位新贡献者。该版本新增 MiniCPM-o 4.5 的多模态输入与语音输出支持,并加入 NVIDIA PersonaPlex-7B 离线语音到语音模型和基于 MLX 流式 ASR 的 OmniTyper。
Anthropic 首次公开其内部 Prompt 优化、Agent 评测和自动调优方法论,并在 Claude Code 官方 Skill 中上线 build-eval 和 hillclimb 两个指令。build-eval 在代码库中自动构建评测集,hillclimb 则自动改代码、跑分、防过拟合,直到性能提升或成本下降。官方实测中,客服 Agent 在未见过的测试集上准确率从 78.6% 升至 90.5%,单次成本从 4.6 美分降至 1 美分。
OpenRouter 对比了 Veo 3.1、Seedance、Kling 和 Grok Imagine Video 四条图生视频产品线在时长、分辨率、首尾帧控制、生成音频、参考输入和每秒价格上的差异,并给出用 TypeScript SDK 提交图生视频任务的示例。
Anthropic 发布 Claude Sonnet 5.5,官方指南说明其比 Sonnet 5 更智能、更高效且快 30%,每 token 价格不变,但多数任务因所需 token 更少而总成本最多降低 30%。指南覆盖 Sonnet 5.5 与 Opus 5.5 的选型、从 Sonnet 5 迁移的破坏性变更,以及在 Claude Code 中的使用方式。
Claude 的 claude-api skill 新增 /claude-api build-eval 和 /claude-api hillclimb 两个命令:前者通过访谈在代码库内构建评估集、生成评分器并运行基线;后者把评估集随机分为训练集和测试集,逐轮提出一个补丁,在训练集提升但测试集持平或回退时自动回滚,防止过拟合。内部客服基准中,hillclimb 从 Opus 4.8 高努力档的 74.4% 决策准确率、每票 4.6 美分,最终用 Sonnet 5 低努力档达到 98.9%、约 1 美分,14 张留出票上从 78.6% 提升到 90.5%,成本约为原来的五分之一。
Lakebase 在 AWS 和 Azure 上正式发布两个 Postgres 搜索扩展:lakebase_vector 做可扩展近似近邻搜索,lakebase_text 做 BM25 全文搜索。在 VectorDBBench 100M 基准中,其吞吐是次优系统的两倍,成本比使用 pgvector 的云 Postgres 供应商低 4 倍;测试中 P99 延迟 71 毫秒、召回率 97%。
稀疏注意力只在 SDPA 运算中减少 KV cache 内存和带宽需求,并不降低整体内存容量占用;SGLang 的 HiSparse 通过 HBM 到 DRAM 的分层卸载来绕过这一容量瓶颈。在 InferenceX 基准中,GB300 以 150 tokens/s 达到最低建模服务成本,GB200 约 $0.044/百万总 tokens,比 MI355X ATOM 低约 82%。
GitHub Security Lab 用其开源的 Taskflow Agent 审计 Android 应用,已发现并报告 24 个漏洞。文中披露两个已公开案例:OsmAnd 的导出 Activity 可被无权限应用静默导入设置,从而回传用户位置和路线;Wikipedia 的 deeplink 解析缺陷可加载任意网页并泄露长期 cookie,组合后实现账户接管。作者同时指出 LLM 在漏洞严重性评估上仍不可靠,需安全研究员复核。
作者展示了一次多模型协作的编码流程:在同一个 Codex 会话中,Jev 负责路由切换,Opus 5.5 做规划、GPT-6 Astra 写后端、Kimi K3 写前端、DeepSeek 做测试、GLM 5.3 Flash 写文档。作者全程未手动选择模型,同一构建任务成本降低 40%、速度提升 15%。
Genie One 被定位为数据智能 AI 同事,可在受治理的企业数据上给出带引用的答案并触发多步工作。文章给出的落地路径是:先在一个受治理的数据域内用少量问题赢得早期用户信任,再逐步扩展到更多业务线,并配合 Genie Agents、Genie Ontology 和 Unity Catalog 分层治理。
作者用 Tavily 抓取近 7 天 arXiv 论文,由 Nebius Token Factory 上服务的 NVIDIA Nemotron 3 Ultra 读取并排序,在约 10 秒内于终端输出本周智能体记忆方向 Top 5 论文。整个实现是 24 行 Python,走 OpenAI 兼容 API,作者称试运行零成本。
社区为 MiniCPM5-2B 构建了 EXL3 4-bit 量化版本,量化后模型权重降至 1.61 GB。在 NVIDIA Tesla T4 上实测生成速度约 68–70 tokens/s,峰值显存 1.29 GB,并支持通过 ExLlamaV3 和 TabbyAPI 进行本地推理。
吴恩达发布了一门两小时Agent课程,按五个时间节点推进:9分钟搭建第一个可工作的代理,33分钟讲循环工程,1小时02分讲图工程,1.5小时讲能自我重写的代理,最后40分钟展示完整可运行图系统。课程核心观点是单代理在长任务中会遭遇上下文丢失、状态混乱和失败不可追溯,图工程把决策和控制流从模型黑盒中拉出,变成可检查、可复用、可并行的固定拓扑。
Anthropic 发布 Claude Opus 5.5 提示指南,说明其输出 token 速度比 Claude Opus 5 快 30% 以上,且默认中等努力水平在编码和知识工作评测上可匹配或超过 Claude Opus 5 的高努力水平。指南重点覆盖努力校准、API 与聊天中的思考行为、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、复杂视觉输入和前端设计等场景。
论文提出连续深度批处理(CDB),首个面向循环语言模型深度自适应推理的高效批处理方法。CDB 在循环步骤之间动态组建新批次、管理循环 KV 缓存,并提前预测退出循环的 token 以异步准备批次。在 Ouro 1.4B 和 Huginn 3.5B 上的实验显示,CDB 可实现最高 99% 的预估最大加速,剩余提升主要取决于模型架构和退出行为。