Anthropic 的 Opus 5 Prompt 与上下文工程指南
Anthropic 的 Claude Code 负责人 Thariq Shihipar 在官方博客中说明,面向 Opus 5、Fable 5 等新模型,他们把 Claude Code 的系统提示词删掉了八成以上,编码评测上测不出损失。
按公众号阅读文章与观点
Anthropic 的 Claude Code 负责人 Thariq Shihipar 在官方博客中说明,面向 Opus 5、Fable 5 等新模型,他们把 Claude Code 的系统提示词删掉了八成以上,编码评测上测不出损失。
AIE World's Fair 上举行题为《伟大的 Loops》的辩论,正方 Geoffrey Huntley(Ralph Loop 创造者)与 Keycard CEO Ian Livingstone 认为 Loops 已不可避免。
被 OpenAI 收购的 Python 工具公司 Astral 创始人 Charlie Marsh 在播客中反思 AI 编程,讲述自己一行代码都没读就发布、随后被同事打醒的经历。他认为提交一个看似合理的 PR 成本已降到零,但审查验证的成本依然很高,这种失衡正在冲击开源生态。他还表示优秀工程师使用 Agent 更高效,而初级工程师处境最难,因为只能被 AI 带着走。
迪卡侬中国执行副总裁肖路在 WAIC 虎嗅闭门会上指出,AI Coding 让一个人生成大量代码后,反而出现 5 个人审核不过来的新瓶颈。虎嗅邀请阶跃星辰、施耐德等约 30 位企业决策者讨论后认为,Token 降价只降低使用门槛,价值正转向用户上下文、垂直工作流和结果交付,AI 产品持续付费需满足高频任务×可验证结果×可控成本×流程嵌入。
吴恩达开源了个人桌面 Agent 项目 OpenWorker,采用 MIT 许可证,目前可在 Mac 上运行,Windows 版本即将上线。它可连接 GitHub、Slack、Jira、Notion 等超过 25 种工具,用户自备 API Key 即可接入不同模型,也能通过 Ollama 运行本地模型。涉及发送消息、修改日历或执行终端命令等关键操作前,它会先暂停并请求确认。
科沃斯在苏州成立「八界开源智创空间」,将具身智能机器人「八界」的硬件与底层系统源码免费开放给开发者、高校师生和科研人员。八界采用轮式底盘加六自由度机械臂,臂展800毫米、机身升降44厘米,搭载两颗双RK3588融合SoC,可在本地带动7B参数大模型,并内置AI智能体OpenClaw和Hermes。源码已挂上Atomgit和GitHub,无需申请审核即可使用。
清华大学与腾讯混元团队提出 TRACE(Tree Rollout Allocation for Contrastive Exploration),一个面向 Agentic RLVR 的 rollout 预算分配框架,把 Agent 轨迹视为树,将预算优先分配给更易产生成功/失败对比的 prompt 根节点和中间前缀节点。
佛罗里达大学团队提出 GeoLAN,将三维挂谷猜想证明中的"粘性挂谷集"概念转化为训练约束,缓解大模型表征坍塌。该方法在 Llama-3-8B 上把锥形表征空间重塑为球形,在 Gemma-3-4B 上把 MMLU 准确率从 0.59 提升到 0.60,并显著改善 TruthfulQA 语义稳定性。论文还发现"金凤花区"现象:该约束只对 4B 至 80B 参数的中等体量模型有效。
Reddit 与 Google 的数据授权协议即将到期,双方就续约展开谈判,若无法达成一致,Reddit 可能限制 Google 将平台内容用于 AI。消息传出后 Reddit 股价一度下跌近 9%,市场担心其失去每年约 6000 万美元的数据授权收入。
DoorDash 公开了对话式 AI 助手 Ask DoorDash 的架构,该助手由 LLM、各领域专用代理和基于 MCP 的工具组成,业务功能通过共享 MCP 层以可复用工具的形式提供,而非直接写进提示词。
Anthropic 发布 Opus 5 模型,在公告列出的多项基准中表现优于 Fable 5,而 API 价格仅为后者的一半,维持每百万输入 token 5 美元、每百万输出 token 25 美元。
推荐理由:原文给出定价、基准对比与安全策略变化,读者可据此判断 Opus 5 在成本与可用性上的取舍。
WAIC 2026 圆桌讨论中,昆仑万维方汉、L2F 吉星、北电数智郭文、DeepKernel 刘卓涛判断 AI 产业正从“看模型能力”转向“算总账”。吉星称基础设施侧总投入已达 7000 亿美元量级而同期收入约 500 亿美元,单 token 价格降至去年的约八分之一到十分之一,但任务消耗 token 总量上升导致总成本不降反升。
东方嘉富创始合伙人徐晓在2019年寒武纪最困难时投了5000万元,2021年寒武纪上市解禁后即卖出,错过此后国产GPU浪潮,但他认为这只是"在一个大的β下面恰巧碰到了个α"。徐晓2007年入行美元PE,2012年转做人民币VC并投新材料,他主张投资应追求β而非逆势突围,并称"VC只能决定投资策略的30%,70%由资金属性决定"。
Anthropic 正式发布 Opus 5,定价与上一代 Opus 4.8 持平,为每百万 token 输入 5 美元、输出 25 美元,只有 Fable 5 的一半。
推荐理由:Opus 5 以 Fable 5 一半的价格在多项编程评测上反超,读者可以据此比较这代模型的性价比。
Kimi K3 以 1414 分在 Design Arena 单次生成前端榜单中位列第一,超过 Fable 5 和 GPT-5.6 Sol。Design Arena 分析认为其优势源于思维链,K3 消耗的思考 Token 接近 Claude Opus 4.8 的 12 倍,推理过程中编写的代码量是其他 Kimi 模型的 10 倍以上,并靠内部数据索引完成自校验。
硅星人联合30个社区和高校AI社团举办AgenTank World Cup,14天内450名选手、500多辆Agent坦克消耗近千亿Token,完成一次大规模Agent众测。
PPIO 创始人姚欣在 WAIC 上把公司定位从 AI 云升级为 Agentic Cloud,并发布智能模型网关和 Agent Harness 两款新品,主张 Token 更像 92/95/98 号汽油而非水电煤,定价应从 Token 单价转向"任务成功总成本"。
Mind Lab 发布基于 GLM-5.2 后训练的模型 Macaron V1,采用混合 LoRA 架构,原生支持持续学习。V1 使用 Mixture-of-LoRA 架构,在 744B 参数的冻结基座上搭载对话、Agent、编程和生成式 UI 四个 1B LoRA 专家,新能力以插件式 LoRA 加入。
Claude Opus 5 发布,Anthropic 定位其在多个领域已逼近 Fable 5,输入每百万 Token 5 美元、输出 25 美元,与 Opus 4.8 同价,另有速度约 2.5 倍、价格翻倍的 Fast Mode。
Claude Opus 5 正式发布并已在全平台上线,定价与 Opus 4.8 一致,输入每百万 Token 收费 5 美元、输出每百万 Token 收费 25 美元。
Anthropic 发布 Opus 5,支持 1M 上下文、最大 128k 输出,网页版已可直接使用,API 与 Claude Code 中的模型名为 claude-opus-5。
推荐理由:原文梳理了 Opus 5 的官方评测与 System Card 细节,读者可对照价格和单任务成本理解其定位。
Anthropic 发布 Opus 5,定价与 Opus 4.8 相同,多项测评成绩大幅优于 Opus 4.8,且相当多成绩高于 Fable 5。
推荐理由:给出了与 Opus 4.8 和 Fable 5 的逐项测评对比,可看这一代在 Agent 编程与电脑操作上的位置。
黄仁勋开设个人 Twitter 账号并发表第一篇帖子,力挺开源模型和开源生态,认为美国不应把 AI 领导力理解为保护几家头部巨头的领先地位,否则可能输掉整个 AI 战争。
原生全模态大模型公司智象未来完成新一轮15亿元融资,这是其近三个月内的第三轮,累计融资超过21亿元,投后估值超10亿美元。该轮由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本领投,上影新视野基金、华策影视等跟投。公司坚持图像与视频双模并进,自研原生全模态(UiT)架构,并在2026 WAIC发布无限时长内容创作智能体vivago R1。
卫夕盘点今年上半年发布的多篇劳动经济学论文后认为,AI对就业的冲击先体现在招聘岗位内容和劳动力定价规则上,而非失业率数据。普渡大学基于美国全行业招聘启事算出岗位任务平均AI可替代率为0.396;Upwork数据显示在AI高替代类目中,资历、口碑、自我展示对需求的解释力下降而价格上升。MIT等团队分析标普500十年年报发现,到2025年只有21%的公司跨过AI深度采用门槛。
华夏基金中期投资策略会上,多位基金经理与经济学家刘煜辉判断AI产业周期仍处早期,当前核心矛盾是产业趋势确定性与局部估值偏高之间的张力。华夏基金国际投资团队援引数据称,2026年北美四大云厂商资本支出合计接近8000亿美元,2027年有望接近1.2万亿美元,并提示美联储加息与涨价抑制需求两大风险。
智象未来(HiDream.ai)7月23日宣布完成15亿元C轮融资,近三个月内三轮累计融资超21亿元,估值超过10亿美金。本轮由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,安徽、上海、浙江等地国资以及上影股份、华策影视等机构跟投,老股东合肥产投、东方富海等持续加注。
Vivix(灵动时刻)发布实时交互多模态模型 A1 及 W1,用户可像打视频电话一样与屏幕中的虚拟角色持续交流。A1 拥有近30B激活参数,通过 MJD 多维联合蒸馏把视频扩散从 8-Step 压到 2-Step,并配合原生 NVFP4 训推、Encoder/Decoder 解耦与计算通信显存协同调度,实现消费级 GPU 实时生成。
魔法原子在 WAIC 发布旗舰人形 MagicBot X1 升级款、工业轮式 MagicBot D1 和轻工业四足 MagicDog T1,主张机器人形态应由场景回本周期而非技术信仰决定。其具身大模型 Magic-VLA K02 在叠盒封胶组合式长程任务上成功率超过 90%,公司已掌握超 100 万小时高质量数据、日均采集约 1.6 万条。大健康方向已拿下 1.5 亿元战略订单并进入真实交付。
腾讯混元团队联合 UNSW 提出生成式奖励模型 E-GRM,用模型自身多次采样的答案一致性判断输入复杂度,收敛则直答、不收敛才触发 CoT。在 RM-Bench、RMB、RewardBench 三个基准上,约 58% 样本被路由到直答,延迟降低 62%,准确率还有提升。该工作入选 ACL 2026。
清华大学王鑫教授团队同时入选 IJCAI 2026 两场 Tutorial,分别为 T9《Beyond Graph Distribution Shifts》与 T11《OOD Generalized Generative AI》。
AI科技评论用同一个3D世界杯网站生成任务对比小米 MiMo-V2.5-Pro 与 MiMo-V2.5-Pro-UltraSpeed,后者耗时46.3秒,标准版约15分35秒,速度约快20倍。
OpenAI 将 GPT-Live 驱动的 ChatGPT Voice 语音模式正式带到 macOS 和 Windows 桌面应用(即原来的 Codex),用户可通过纯语音控制电脑并指挥多个 AI 代理协同工作,无需打断当前工作节奏。
蓝思科技与拓元智慧(X-Era Lab)签署战略合作框架协议,X-Era Lab 成为蓝思科技首家世界模型战略合作伙伴,双方将打通“基础模型+整机本体+制造场景”全栈闭环并合作量产机器人产品。合作首批落地玻璃磨机上下料、快递包裹翻面与分拣等场景,X-Era Lab 的 VWA 世界动作模型与 PhyAgentOS 将在蓝思真实产线中验证和进化。
星炽动力推出 PULSE 具身大脑架构,将认知拆为物理环境与用户状态"双轨",在特征层交叉验证,并锚定信念、意图、偏好三个维度建模用户状态。该架构采用结构化规则、RAG 语义与参数化模型三层记忆,端侧跑测试时适应(TTA)做本地调优,云端负责全局迭代,并已与海尔智家、涂鸦智能打通。
阿里硬核少年技术节5.0博见社首次设置北京工业场与杭州学术场两场对话:北京场主题为“AI下一站:从生成内容到构建世界”,群核科技分享将横店部分线下片场扫描重建为线上3D影视基地,并提出视频模型负责审美与语言控制、3D模型负责一致性。杭州场则讨论“从生成式AI到智能体进化”,有嘉宾以电力革命类比,称当前Agent只相当于电灯泡刚被发明。
兔展智能联合北大、鹏城实验室研发的 UniWorld-View 登顶李飞飞团队的世界模型榜单,支持按指定相机轨迹从单张图或一段视频生成新视角视频,单图3D生成与视频4D生成使用同一套代码、同一个模型。该模型已适配国产昇腾算力,训练数据来自北大系初创企业元空智能,代码和权重已全部开源。
Kimi K3 即将开源,被美国科技圈形容为「斯普尼克」时刻,X 上相关讨论浏览量滚成千万级话题。投行研报绕开模型冲击,转而把 Kimi K3 解读为存储需求利好,Roundhill 存储 ETF 单日涨 10.91%、闪迪涨 14.27%、美光涨 12%。
刚获得菲尔兹奖的数学家 Jacob Tsimerman 在获奖新闻发布会上表示已开始转向 AI 安全,并很快入职 OpenAI 安全部门。他因把数理逻辑工具 o-minimality 引入算术几何、解决 Griffiths 猜想而获奖,目前已停止招收博士生,并认为 AI 很快会在做数学上强于数学家。
文章以巴甫洛夫定律作比,描述得知 Tibo 重置后不自觉打开 Codex 的条件反射式行为。原文未提供更多关于 Tibo 重置或 Codex 的具体细节。