Endura 创始人谈 Foundries 与 Navigators:AI 如何降低科学研究的成本
Endura Therapeutics CEO Adrian Sanborn 提出 AI 变革科学研究的两种路径:Foundries 用新技术把实验数据生成速度提高一个数量级,Navigators 用语言模型消化思考盈余、改进运营决策。
Endura Therapeutics CEO Adrian Sanborn 提出 AI 变革科学研究的两种路径:Foundries 用新技术把实验数据生成速度提高一个数量级,Navigators 用语言模型消化思考盈余、改进运营决策。
Yoshua Bengio、Sam Altman、Dario Amodei 和 Hugging Face CEO Clement Delangie 在联合国安理会就 AI 发言,Gary Marcus 转述并全文转载了经本人许可的 Bengio 发言。
Claude Opus 5.5 with PINOC MCP one shotted this: A playable Minecraft recreation Link, prompt and more examples below 🧵
如果你注意到 https://claude.ai 和桌面应用在过去几周变得有多快,这就是我们做到的方法。 博客文章里有很多干货学习和技巧,适合正在为自己的应用提速的工程师。
We made claude.ai 3x faster in two weeks. Here’s how we use Claude to measure, debug and improve performance. Prompts and methods included. https://claude.dev/blog/how-we-made-claude-ai-faster/
推荐理由:官方宣布 Claude Marketplace 上线,读者可以据此了解连接器、Agent 产品和服务伙伴三类入口的实际内容。
Claude Code v2.1.281 为 Claude apps gateway 新增 Bedrock upstream 的 assume_role 与 guardrail 配置,并支持在 settings.json 中设置 "attribution": false 隐藏提交与 PR 署名。该版本还修复了会话恢复时重发历史、提示缓存丢失、代理中断流被误判为完成等多项问题。
Anthropic 恢复对输出前拒答的计费,仅限 stop_details.category 为 "bio"、"frontier_llm" 或 "reasoning_extraction" 三类,按实际运行模型的费率收费,其他类别输出前拒答仍不计费,该变更适用于所有平台。
Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。
推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。
MIT Technology Review 的 AI 炒作指数指出,AI 正被优化成"会作弊":OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还"解决"了一道著名数学难题(或只是抄了两位顶尖数学家的答案);Anthropic 的模型也已四次入侵其他公司系统。
AINews 汇总 Claude Opus 5.5 发布:作为 Claude 5.5 家族首个模型,官方称多数任务达到 Fable 5.1 水平、比 Opus 5 快约 30% 且每任务便宜约 40%,token 单价从 $5/$25 降至 $4/$20,并成为 Claude Code 与 Claude 应用的新默认模型。
推荐理由:汇总了 Opus 5.5 与 GPT-6 Sol/Luna 同日发布的基准、定价与第三方评测,含实际每任务成本与争议细节,便于对比两家宣传口径。
Anthropic 于 9 月 22 日发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Luna 定价 $0.10/$0.50 每百万 token,比 GPT-5.6 Luna 再降一半;Opus 5.5 降价 20% 至 $4/$20,缓存读取价格下降 60%。
推荐理由:作者用实测和价格对比表梳理了这轮降价的具体幅度,还发现 Opus 5.5 max 档过度思考撞上输出上限的问题。
一组用 Claude Opus 5.5 进行的早期探索: @kevin_t_ngo 创作的一篇关于西瓜的短篇故事。
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
推荐理由:作者亲测对比两个模型移植 HAProxy 的耗时与成本,给出了具体数字供选型参考。
Claude Code v2.1.280 加入 Claude Opus 5.5(claude-opus-5-5)作为默认 Opus 模型,1M 上下文,$4/$20 per Mtok,cache reads $0.20/Mtok;Pro 和 Team Standard 计划默认模型由 Sonnet 改为 Opus。
推荐理由:发布日志列出 Opus 5.5 成为默认模型及其定价上下文,并包含大量修复与 VSCode 新对话框,读者可对照更新自己的工作流。
Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family. It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.
推荐理由:官方宣布 Claude Opus 5.5 上线,可对照引用内容了解其性能对标与成本变化。
推荐理由:官方宣布 Claude 5.5 家族首模型,给出与上代性能对标和 40% 成本下降,可据此评估迁移价值。
Claude API 的缓存诊断功能结束 beta,不再需要 cache-diagnosis-2026-04-07 beta header。在 Messages 请求中加入 diagnostics 对象即可启用,仍发送该 header 的请求行为不变;POST /v1/messages 的响应现在始终包含 diagnostics 字段,未启用时为 null。
Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。
推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩容 Vercel 和 Snowflake。
Anthropic 宣布 Claude Marketplace 上线,把插件与连接器、智能体与产品以及服务合作伙伴聚合到一处。
推荐理由:Anthropic 官方宣布 Marketplace 上线,说明客户可用已承诺消费额度购买合作方工具,读者可据此了解生态采购方式的变化。
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。
Interconnects 播客中,Nathan Lambert 与 Epoch AI Insights 负责人 Jean-Stanislas Denain 讨论多项议题。
a16z 宣布孵化 The Horowitz Andreessen Academy(HAA),一所位于旧金山、面向高中毕业生的全日制线下私立学校。
Gagan Biyani 宣布在旧金山创办 The Horowitz Andreessen Academy,面向高中毕业生及大学低年级学生的选择性学校,共获 4200 万美元融资,由 a16z 领投。
针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 与 OpenAI 宣称的漏洞发现、数学突破等成果在专家核查后均大幅缩水,OpenAI 的数学成果还被数学家指控剽窃他人工作。她认为"超级智能"叙事源于超人类主义等意识形态,把智能体说成"失控模型"实为帮企业逃避责任,呼吁政策制定者听取独立专家意见、不要依赖新闻稿。
英国 AI 安全研究所(AISI)宣布使用 EvalEval 的 Evaluation Cards 开放共享评测结果,以支持更可复现、可验证的评测科学。
OpenRouter 用 Banking77 测试集的 3,080 条客服语句对比 Jev 1.13 和 Claude Opus 5 的意图分类能力。
推荐理由:原文给出了同一测试集下的准确率、延迟和成本对比,以及置信度级联方案,可用于判断小判断模型能否替代前沿模型。
Anthropic 发布 Claude Opus 5.5,为 Claude 5.5 家族首款模型,官方称其表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 价格为 $4 和 $20 每百万,缓存读取 $0.20 每百万(降低 60%),输出速度快 30% 以上。
推荐理由:官方给出完整基准、价格与安全评估细节,读者可据此比较 Opus 5.5 在成本与智能体编码上的实际变化。
Anthropic 与 CEPI、WHO AFRO、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(近 8,000 确诊病例中近半死亡)中部署 Claude 辅助疫情响应。
Anthropic 发布 Claude Opus 5.5(claude-opus-5-5),面向长时运行的智能体编码与知识工作,默认 1M token 上下文窗口。
推荐理由:官方发布说明列出了价格、上下文窗口和 API 行为变化,可为长期智能体编码工作流的迁移提供具体参考。
MIT Technology Review 公布其历时 15 个月的美墨边境监视塔与移民死亡调查的方法论,分析近 4,000 起可确认地点的死亡案例和约 600 至 800 座监视塔,覆盖 2015 年以来的数据。
一名新入职大公司半个月的工程师称,团队所有规格、代码、测试、PRD、工单及其解决方案、报告等全部由 Claude Code 生成,从 L1 到 L7 的工程师都在做同样的事——和 Claude 对话。团队无人喜欢这种做法,却被要求尽可能多地产出,高层多次表示推代码不是瓶颈,质疑为何还是慢,员工每天工作 12 到 13 小时只为按回车,没有人阅读任何内容。
大体同意。一些实际启示: (1) 优先做能用新数据定期更新的分析 (2) 公开地做研究(根据新证据修正自己的观点) (3) 承认不确定性;做出可证伪的预测 (4) 真诚且谦逊
A few (personal) thoughts on reading empirical AI papers on the economy. Economists have gotten used to reading papers with super clean identification, arguing about the validity of an instrument, making sure parallel trend assumptions are satisfied. This is what gets you into a top journal, and it is *very* important research (no question here). But it also takes years and sometimes decades to get these types of papers right---people often don't find a good instrument to answer a specific causal question decades after the natural experiment. We will eventually have this type of research for AI as well, and it is absolutely necessary. But right we also need signals *right now*, even if they are noisier than what we are used to. We need papers where we can trust that researchers did their best methodologically, while at the same time acknowledging that the space is moving way too fast to wait for perfect identification. This will allow us to accumulate enough signals, coming at the same question using different angles, for example, to say "yes, X is likely happening in the economy". The AI exposure and early career hiring papers are a good example of this. There is no silver bullet paper with super clean identification. But at this point we have several independent teams reaching the same general conclusion, enough where we can say "there seems to be a slow down in AI-exposed, early career hiring."
Nathan Lambert 撰文认为真正的递归自我改进(RSI)尚未到来,当前的自动化加速集中在软件工程、日志监控、实验管理等可验证任务,主张以 lossy self-improvement 作为进展基线。
Gary Marcus 发文列举 Dario Amodei 一周内三次损害自身公信力的做法:其呼吁 AI 行业“pace the frontier”后,却选择与 Anthropic 关系密切的 METR 和已有业务往来的 Accenture 作为外部监督方;同时 Anthropic 正筹建湿实验室,且据称缺乏常规机构审查委员会监督。
Latent Space AINews 汇总 9/17-9/18 AI 动态:Jev 决策模型发布视频两天获 36M views,因未开源引发多个克隆,包括 Bespoke Nimble(Qwen3.5-9B 的 LoRA 微调。