Sakana AI 宣布 Jürgen Schmidhuber 加入任首席科学顾问并参与 RSI Lab
Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,同时保留现职,并将参与新设的 RSI Lab。他将协助公司开发 Agent-Native World Models,用于在行动发生前安全模拟物理后果,服务于日本制造业与机器人应用,并定期赴东京支持团队和日本 AI 生态。
Sakana AI 宣布 Jürgen Schmidhuber 出任首席科学顾问,同时保留现职,并将参与新设的 RSI Lab。他将协助公司开发 Agent-Native World Models,用于在行动发生前安全模拟物理后果,服务于日本制造业与机器人应用,并定期赴东京支持团队和日本 AI 生态。
Cursor 官方博客介绍其智能体 harness 的多项 token 效率优化,整体将用户 token 成本降低 7% 且质量未下降。
推荐理由:Cursor 自述其 harness 层的多项 token 优化手段与量化收益,读者可以借鉴这些方法来降低长时智能体运行成本。
Cursor 推出 Rollouts 和 Security Reviewer 两款软件开发 Bots。
推荐理由:官方说明了两款 Bot 的具体工作机制和启用入口,读者可以对照自身部署与安全审查流程评估适用性。
千问(Qwen)推出 Qwen Intelligence,首发三个 Agent:Mobile Planner Agent 居 MobilePA-Bench 等榜单第一。
文章以小米 9 月开源的 MiMo-V2.6 系列为切入点,分析大模型「斩杀线」概念,即在智能和成本两个维度都被超过的模型会失去被选择的理由。
推荐理由:文章借小米 MiMo-V2.6 梳理了智能与成本双维度的行业竞争框架,读者可以据此理解 Agent 时代效率为何成为模型竞争的新坐标。
作者在云栖大会参加千问办公活动后,评析其新发布的「企业上下文」产品,该产品把企业分散在群聊、文档、知识库的信息整理成结构化上下文供 Agent 提取,并仰赖新模型 Qwen3.8-Omni-Flash 做全模态理解。
AINews 汇总 Claude Opus 5.5 发布:作为 Claude 5.5 家族首个模型,官方称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜约 40%,token 单价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的新默认模型。
推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日发布的基准、定价与第三方评测,含实际每任务成本与争议细节,便于对比两家宣传口径。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日周三在旧金山举办一场面向 coding agent 构建者的晚间交流活动,形式为非正式的 agentic show-and-tell。活动鼓励参与者分享正在尝试的实验、未公开的项目和尚未想清楚的问题,无需正式演讲,也不是产品推介。
NVIDIA 在新加坡 AI Day 上联合合作伙伴展示东南亚 AI 进展,新加坡 HTX 将研究使用 Nemotron 3 Super 和 Nemotron 3 Nano Omni 模型推进公共安全 AI。
Ant Group’s Ling 3.0 Flash Fin is a finance-specialized open-weight model that delivers strong financial analysis at budget-model pricing. On Finance Agent v2, it scores 54.9% at just $0.045 per task.
OpenRouter 发布 TypeScript 教程,讲解如何通过 Decisions API(模型 ID typesafe/jev-1.13,端点 POST https://openrouter.ai/api/alpha/decisions)用 TypeSafe 的 Jev 决策模型审核二手市场商品列表。
Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线提供智能体能力,建议机器配备 24GB 以上 VRAM 或统一内存。
推荐理由:原文给出本地运行智能体的具体配置方法和混合编排演示数据,开发者可以直接照此把智能体工作流搬到本地 GPU 上。
Gary Marcus 撰文称 Meta 新智能体 Muse 正在重复 Facebook 2015 年 Project M 的做法,如餐厅订位、代订票务等。Project M 因运行成本高只开放给约 1 万用户,后被曝幕后有真人参与,AI 实际处理的请求不超过 30%,于 2018 年 1 月在上线不到三年后取消。作者还批评扎克伯格在隐私问题上的态度,认为他在重犯当年的错误。
Latent Space 发布对 John Platt 的访谈,介绍其团队在 Google 开发的 Empirical Research Assistance(ERA)。
肝不动了....GPT的几个和后端/Agent性能测试明天再说吧.....
@karminski3 效率也太高了!你不睡觉的吗😳
Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。
推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。
在 Tesla 里对 @bot 说话!点咖啡、管理日程,甚至预订行程
.@Grok in your Tesla can now do meaningful work for you With Connectors, you can manage your inbox, clean up your calendar, or talk through existing files/chat/tasks – all hands-free
karminski 发布小米 MiMo-v2.6-pro 测试速报,向量数据库测试得分从 MiMo-v2.5-Pro 的 2505 升至 7810,接近 Claude Fable-5。



Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。
推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩容 Vercel 和 Snowflake。
Anthropic 宣布 Claude Marketplace 上线,把插件与连接器、智能体与产品以及服务合作伙伴聚合到一处。
推荐理由:Anthropic 官方宣布 Marketplace 上线,说明客户可用已承诺消费额度购买合作方工具,读者可据此了解生态采购方式的变化。
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。
a16z 宣布孵化 The Horowitz Andreessen Academy(HAA),一所位于旧金山、面向高中毕业生的全日制线下私立学校。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。
Parallel 借助 GPT-6 Astra 让智能体研究并综合劳动力市场数据,耗时和成本均降至此前模型的一半。
超聚变在 2026 国际探索者大会上提出"智企"概念,并发布 FusionOne AI 企业级 Token Factory 解决方案、FusionServer"无极"架构及首发产品 FusionServer V9 系列。
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
阶跃毫无预兆发布 Step 5 Preview,总参数量 600B、激活 27B,带视觉输入,称 Artificial Analysis 上涨 44 分、全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8。
推荐理由:作者与朋友实测了 Step 5 Preview 在可视化、金融、游戏等任务上的真实表现,补上了榜单分数之外的第一手体感参考。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
Latent Space 播客专访 TypeSafe AI CEO Diogo Almeida,介绍其新发布的 System One 模型 Jev,目标是面向软件而非聊天、优化每美元智能。
LangChain 博客介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准评估器和自动化发布门禁。
Anthropic 与 CEPI、WHO AFRO、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(近 8,000 确诊病例中近半死亡)中部署 Claude 辅助疫情响应。
Anthropic 发布 Claude Opus 5.5(claude-opus-5-5),面向长时运行的智能体编码与知识工作,默认 1M token 上下文窗口。
推荐理由:官方发布说明列出了价格、上下文窗口和 API 行为变化,可为长期智能体编码工作流的迁移提供具体参考。
NVIDIA 提出 AI 安全是工程问题,需要明确的安全需求、可执行的管控、指定负责人和防护有效的证据。其开源安全运行时 NVIDIA OpenShell 在智能体可控范围之外执行策略并提供沙箱化执行,Cisco DefenseClaw 在其上增加治理层,JFrog 则集成 OpenShell 扫描并验证智能体技能。