星期四 · 2 条
AI 评分 80
如何规模化智能体应用而不制造 AI 蔓延

Databricks 与 OpenAI、Stellantis 讨论企业规模化智能体应用时提出,基础设施需提供选择、上下文和控制三项能力。Databricks 用 Agent Bricks、Omnigent 和 Unity Gateway 分别承担统一平台、跨框架组合和集中管控,避免每个智能体各自形成独立集成与治理项目。

智能体 部署/工程 MCP/工具

推荐理由:Databricks Blog 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
AI 评分 84
TPU 上加速视频扩散的时空稀疏注意力:1440p 生成端到端提速 1.69 倍

开发者将 Sparse VideoGen 的时空稀疏注意力在 TPU 上落地,通过跳过空 tile、仅对边界 tile 做精确掩码、把 token 布局改为时间主序,把 1440p 视频生成的去噪时间从 2471 秒降到 1461 秒,实现 1.69 倍端到端推理加速,同时保持 24.05 dB PSNR。

视频 推理 部署/工程 模型发布

推荐理由:Google Developers Blog 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
星期三 · 15 条
B ByteByteGo @ByteByteGo
AI 评分 64
DoorDash 如何为 AI 智能体搭建企业级工具访问网关

DoorDash 工程团队公开了其自建的 Agent Gateway 设计:它统一处理 AI 智能体发现和调用工具时的权限校验、凭证管理、工具目录筛选、请求转发与审计记录。该网关已承载超过 200 个注册 MCP 服务器、30 多个智能体和服务,每周处理数百万次工具调用。

智能体 MCP/工具 部署/工程 Anthropic
从词袋到Jev:文本分类语言模型的技术演进与实测

Sebastian Raschka 梳理了文本分类从词袋、RNN/CNN 到 BERT、GPT 的演进,并实测 Jev 在 IMDb 测试集上 Choice API 达 96.47% 准确率、Noul API 达 96.20%,总成本约 0.63-0.65 美元。作者认为 Jev 的卖点不是新架构,而是无需逐任务微调即可在广泛任务上快速、廉价地分类。

模型发布 评测/基准 推理 教程/实践
X X:X.PIN @thexpin
AI 评分 84
DeepSeek 发布昇腾工具包:TileLang、DeepGEMM、DeepEP 等六组件对齐英伟达版本

DeepSeek 发布了一套昇腾工具包,包含 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,与其英伟达组件对齐。官方称训练中使用的每个 TileLang kernel 现在都有高性能昇腾实现,TileLang 支撑 V4 系列训练的大部分 kernel。DeepSeek 与华为还联合优化了 128 卡昇腾 950 超节点,关键计算和通信测试据称接近硬件极限。

DeepSeek 部署/工程 开源/仓库 模型发布
X X:赵纯想 @chunxiangai
AI 评分 55
Xcode 开放 MCP Preview 渲染,iOS 开发调试迎来新范式

Xcode 首次通过 MCP 开放 Preview 渲染能力,设计、开发、产品人员可以围绕一个本地启动的网页观摩 APP 的每个页面和细节。作者在生产实践中发现,MCP 渲染工具目前无法指定渲染设备,且修改依赖文件后可能返回旧截图,出现几率在 20%~40% 之间。

MCP/工具 教程/实践
AI 评分 79
DeepSeek 开源面向华为昇腾算力平台的基础设施组件

DeepSeek 于 9 月 30 日宣布开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库和分布式通信库,与此前英伟达平台组件一一对应。TileLang 昇腾版本封装 Ascend C 底层指令,提供高级语言编程方式且不损失硬件性能;DeepSeek 训练中用到的每个 TileLang 算子都有对应的昇腾高性能实现。开源组件还包括 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,在多项关键测试用例中计算与通信性能已接近硬件上限。

DeepSeek 开源/仓库 部署/工程 模型发布
AI 评分 67
Meta Muse 登顶美区后被亚马逊封杀,国内对标产品 Today 上线:先懂你再动手的 Personal AI

作者实测国内 9 月 24 日上线的 Personal AI「Today」,它读取 iPhone 体重、步数和睡眠数据后,针对「没时间健身」给出诊断:指出用户凌晨 1 点睡、只睡 4 小时 38 分,并建议副业 23:15 收工。作者认为 Today 与 Muse 的差异在于先理解用户状态再主动介入,而非只执行浏览器操作。

智能体 产品更新 教程/实践 现象/趋势
预训练LLM中近似Softmax:模型敏感性与内核加速研究

一项研究在10个冻结的解码器模型(0.5B-72B)上刻画了推理时近似softmax的需求,发现可大幅削减softmax分配概率的位置数和行内分辨率,但同一位置的均匀加权有害。分辨率预算的放置位置与大小同等重要,靠近行最大值处始终更受青睐。基于此提出Rowmax-PoT和Rowmax-H15,在B200上FP8注意力前向在因果8K下快12.4%、非因果8K下快25.8%,因果16K下每次前向板级能耗降低8.4%。

论文/研究 推理 部署/工程
从生产流量构建黄金评测集:五步流程与跨模型对比

OpenRouter 发布指南,介绍如何从生产流量构建黄金评测集:抽样、去重聚类、添加期望输出、首轮评测修正、提交 Git 并接入 CI。该评测集用于在每次部署前检测回归,并可通过同一 API 对多个候选模型运行同一评测集,依据自身流量证据而非榜单排名选择模型。

评测/基准 教程/实践 数据/训练
OpenRouter 发布 AI 智能体回归测试指南:锁定用例集与行为契约

OpenRouter 发布了一份 AI 智能体回归测试指南,核心做法是在提示词、模型、工具定义或检索设置变化时,重跑一套锁定的用例集,并对照每个用例的行为契约检查工具调用与硬性不变量。指南强调模型交换时要用具体模型 slug 而非 latest 别名,并给出了 Python、TypeScript 和 Ori Eval 的完整实现示例。

智能体 教程/实践 评测/基准
如何测试 AI 智能体的工具调用准确率

OpenRouter 发布了一篇指南,介绍测试 AI 智能体工具调用准确率的三种方法:无参考 LLM 评判、确定性参数校验和轨迹比较。指南还提供了 Python 测试框架,可通过 OpenRouter 对多个支持工具的模型运行相同测试用例。

智能体 教程/实践 评测/基准 MCP/工具
X X:Rohan Paul @rohanpaul_ai
AI 评分 54
YC 支持的 InstaCloud 发布:面向编码智能体的无服务器云,解决智能体构建应用的所有权问题

InsForge 推出 InstaCloud,一个由 Y Combinator 支持的云平台,面向编码智能体,让智能体自行配置和运行 Postgres、S3 兼容存储及容器,同时由人类审查和批准关键变更。该平台针对智能体构建的应用在发布数月后出现的所有权问题:团队中无人编写过这些应用,因此无人负责修补运行时、监控错误率或扩容。

智能体 产品更新 部署/工程
星期二 · 17 条
X X:Testing Catalog @testingcatalog
AI 评分 66
InstaCloud 推出面向智能体的无服务器云,Claude Code 和 Codex 可直接部署运行应用

InstaCloud 发布了一款 agent-native 无服务器云,让 Claude Code、Codex 等编码智能体部署并运行它们构建的应用。智能体可处理资源调配、扩缩容和监控,关键变更由用户批准;服务可随流量伸缩、空闲时降至零,还能创建包含数据的完整环境分支来安全测试变更。

智能体 部署/工程 产品更新 Anthropic
B ByteByteGo @ByteByteGo
AI 评分 59
LLM 为什么会说谎:幻觉的成因与可落地的缓解方法

文章以退款政策被 AI 助手从 14 天错说成 30 天并虚构 5 天到账承诺为例,把 LLM 幻觉分为事实性错误、忠实性错误和凭空捏造三类,并解释逐 token 预测只优化文本合理性、不保证事实正确。随后给出 RAG、工具调用、允许“需要复核”状态、可核查引用与独立验证等缓解手段,同时指出这些方法只能减少、不能消除幻觉。

推理 数据/训练 安全/对齐 教程/实践
AI 评分 66
用 Opus 5.5 搭建视频生成工作流的 10+ 小时实践清单

作者分享了一套用 Opus 5.5 驱动视频生成的工作流:在 Claude Code 中调用、经 OpenRouter 统一访问图像/视频/音频模型,并用 Gemini 3.8 TTS、Manim、Veo 3.1/Seedance 2.5、ElevenLabs 等工具分工完成配音、动态图形、关键帧与生成、配乐和字幕。提示词需明确内容、画幅、时长和风格偏好,ffmpeg 承担大部分实际视频操作。

教程/实践 视频 多模态 智能体
AI 评分 66
卡兹克开源月活百万的 AI 热点站 AIHOT:完整工业级系统,10 分钟改出垂直行业日报站

卡兹克将月活百万的 AI 热点站 AIHOT 全盘开源,包含自动化抓取、独立双重打分、向量聚簇去重、中文摘要与每日 8 点日报生成的完整工业级系统。用户只需修改 industry/ 文件夹里的信源和提示词,配合 Docker 与 DeepSeek 或千问 API Key,即可在 10 分钟内搭建自己的垂直行业热点站。项目还原生支持 MCP 协议、llms.txt 和结构化 API,可供 Claude Code、Cursor 等 Agent 按需调取行业情报。

开源/仓库 智能体 MCP/工具 教程/实践
Nereus:面向 LLM 后训练的自适应并行运行时

Nereus 是一个面向 LLM 强化学习后训练的自适应并行运行时,用成本模型决定是否切换执行计划,并通过 Elastic Model Unit 和全局转换图协调跨模型、跨阶段的 GPU 转移。在基于真实数据的 trace 中,在线 TP/PP 自适应相对初始固定布局加 DP 扩展将平均步延迟降低 27.7%;在达到 1024 GPU 的 1000 步运行中,六次转换仅占总运行时间 0.079%。

部署/工程 数据/训练 论文/研究
AI 评分 62
用MiniMax M3.1-Flash-Preview把《沙丘》机械沙虫复刻成单文件3D网页,提示词和参考图全部开源

作者用MiniMax昨天上线的M3.1-Flash-Preview,把X上刷屏的Opus 5.5机械沙虫概念视频复刻成一个单HTML文件的真3D网页,支持6个机位切换、X射线透视和24节蠕动驱动拆解。全程7轮对话、4个多小时,其中一轮模型自主运行55分38秒并声称已在真实浏览器验证。该模型默认思考档钉在max且不可关闭,出字速度282 token每秒,目前仅限MiniMax Code和Token Plan使用,未开放按量API。

编码 多模态 教程/实践
AI 评分 84
Anthropic 公开 Prompt 优化与 Agent 评测方法论,Claude Code 上线 build-eval 和 hillclimb 指令

Anthropic 首次公开其内部 Prompt 优化、Agent 评测和自动调优方法论,并在 Claude Code 官方 Skill 中上线 build-eval 和 hillclimb 两个指令。build-eval 在代码库中自动构建评测集,hillclimb 则自动改代码、跑分、防过拟合,直到性能提升或成本下降。官方实测中,客服 Agent 在未见过的测试集上准确率从 78.6% 升至 90.5%,单次成本从 4.6 美分降至 1 美分。

Anthropic 智能体 评测/基准 教程/实践
AI 评分 72
Claude Sonnet 5.5 发布:官方构建指南详解选型、迁移与 Claude Code 用法

Anthropic 发布 Claude Sonnet 5.5,官方指南说明其比 Sonnet 5 更智能、更高效且快 30%,每 token 价格不变,但多数任务因所需 token 更少而总成本最多降低 30%。指南覆盖 Sonnet 5.5 与 Opus 5.5 的选型、从 Sonnet 5 迁移的破坏性变更,以及在 Claude Code 中的使用方式。

Anthropic 模型发布 教程/实践 编码
AI 评分 54
Claude Code 新增 build-eval 与 hillclimb 命令,可自动构建评估并逐轮改进应用

Claude 的 claude-api skill 新增 /claude-api build-eval 和 /claude-api hillclimb 两个命令:前者通过访谈在代码库内构建评估集、生成评分器并运行基线;后者把评估集随机分为训练集和测试集,逐轮提出一个补丁,在训练集提升但测试集持平或回退时自动回滚,防止过拟合。内部客服基准中,hillclimb 从 Opus 4.8 高努力档的 74.4% 决策准确率、每票 4.6 美分,最终用 Sonnet 5 低努力档达到 98.9%、约 1 美分,14 张留出票上从 78.6% 提升到 90.5%,成本约为原来的五分之一。

Anthropic 智能体 评测/基准 教程/实践
AI 评分 68
Lakebase 为 Postgres 推出全文与向量搜索扩展,宣称 100M 基准吞吐翻倍

Lakebase 在 AWS 和 Azure 上正式发布两个 Postgres 搜索扩展:lakebase_vector 做可扩展近似近邻搜索,lakebase_text 做 BM25 全文搜索。在 VectorDBBench 100M 基准中,其吞吐是次优系统的两倍,成本比使用 pgvector 的云 Postgres 供应商低 4 倍;测试中 P99 延迟 71 毫秒、召回率 97%。

数据/训练 部署/工程 产品更新
X X:SemiAnalysis @SemiAnalysis_
AI 评分 51
GLM-5.3 稀疏注意力如何影响 HBM 内存占用与推理成本

稀疏注意力只在 SDPA 运算中减少 KV cache 内存和带宽需求,并不降低整体内存容量占用;SGLang 的 HiSparse 通过 HBM 到 DRAM 的分层卸载来绕过这一容量瓶颈。在 InferenceX 基准中,GB300 以 150 tokens/s 达到最低建模服务成本,GB200 约 $0.044/百万总 tokens,比 MI355X ATOM 低约 82%。

推理 部署/工程 评测/基准 模型发布
G GitHub Blog @Kevin Stubbings
AI 评分 75
GitHub 安全实验室用开源 AI 安全代理发现 24 个 Android 漏洞

GitHub Security Lab 用其开源的 Taskflow Agent 审计 Android 应用,已发现并报告 24 个漏洞。文中披露两个已公开案例:OsmAnd 的导出 Activity 可被无权限应用静默导入设置,从而回传用户位置和路线;Wikipedia 的 deeplink 解析缺陷可加载任意网页并泄露长期 cookie,组合后实现账户接管。作者同时指出 LLM 在漏洞严重性评估上仍不可靠,需安全研究员复核。

智能体 安全/对齐 开源/仓库 教程/实践
AI 评分 53
Genie One 企业落地分阶段指南:从单团队试点到全组织 AI 同事

Genie One 被定位为数据智能 AI 同事,可在受治理的企业数据上给出带引用的答案并触发多步工作。文章给出的落地路径是:先在一个受治理的数据域内用少量问题赢得早期用户信任,再逐步扩展到更多业务线,并配合 Genie Agents、Genie Ontology 和 Unity Catalog 分层治理。

智能体 教程/实践 数据/训练
星期一 · 5 条
AI 评分 59
吴恩达发布两小时Agent课程:从单代理到完全自动化的完整路径

吴恩达发布了一门两小时Agent课程,按五个时间节点推进:9分钟搭建第一个可工作的代理,33分钟讲循环工程,1小时02分讲图工程,1.5小时讲能自我重写的代理,最后40分钟展示完整可运行图系统。课程核心观点是单代理在长任务中会遭遇上下文丢失、状态混乱和失败不可追溯,图工程把决策和控制流从模型黑盒中拉出,变成可检查、可复用、可并行的固定拓扑。

智能体 教程/实践
AI 评分 68
Anthropic 发布 Claude Opus 5.5 提示指南:覆盖努力校准、思考行为与多智能体任务

Anthropic 发布 Claude Opus 5.5 提示指南,说明其输出 token 速度比 Claude Opus 5 快 30% 以上,且默认中等努力水平在编码和知识工作评测上可匹配或超过 Claude Opus 5 的高努力水平。指南重点覆盖努力校准、API 与聊天中的思考行为、无人值守智能体运行、安全拒绝、进度更新、多应用工作流、复杂视觉输入和前端设计等场景。

Anthropic 教程/实践 智能体 推理
连续深度批处理实现循环语言模型的深度自适应推理

论文提出连续深度批处理(CDB),首个面向循环语言模型深度自适应推理的高效批处理方法。CDB 在循环步骤之间动态组建新批次、管理循环 KV 缓存,并提前预测退出循环的 token 以异步准备批次。在 Ouro 1.4B 和 Huginn 3.5B 上的实验显示,CDB 可实现最高 99% 的预估最大加速,剩余提升主要取决于模型架构和退出行为。

推理 部署/工程 论文/研究