跳到正文
@hongming731· @hongming731 · X·· 14 天前AI 评分35
AI 导读

Anthropic 发布 Claude Opus 5.5,官方称典型任务成本较 Opus 5 低 40%,并引入行动前分类器、可审计沙箱和合并前代码审查。小米 MiMo-V2.6 以大规模 RL 训练,两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹,并公开训练框架与轻量 Harness。本期早报还涵盖美团推荐基座大模型落地、千问办公企业上下文等议题。

正文

BestBlogs 早报 · 09-23

# Claude Opus 5.5 / MiMo V2.6 / 任务级评估 / Agent Harness / 企业上下文

[1] ★ 精讲|Anthropic 发布 Claude Opus 5.5,长任务成本降四成
Anthropic 把 Opus 5.5 的重点放在更长、更可控的真实工作流:官方称其典型任务成本较 Opus 5 低 40%,并引入每次行动前的分类器、可审计沙箱和合并前代码审查。它同时承认预发布评估仍难覆盖真实部署,适合拿来审视高能力 Agent 的效率提升与治理边界如何并行落地。
来源:Hacker News
https://t.co/RT7jmZEnJe

[2] ★ 精讲|Xiaomi MiMo-V2.6:扩展强化学习,迈向自我提升
小米把 MiMo-V2.6 的重点放在可验证复杂任务上的大规模 RL,而非只展示单项榜单:两种模型在 6 天 Live RL 中各完成 30 步、累计约 75 万条轨迹,并公开了训练框架、任务环境和轻量 Harness。文章也保留与最强闭源模型仍有差距的判断;对开发者而言,更值得看的是把训练过程和复现资源一并开放的做法。
来源:Xiaomi MiMo
https://t.co/2Wk0eIkDvf

[3] ★ 精讲|MTFM:美团统一推荐基座大模型在外卖多业务场景的落地实践
美团将外卖首页、拼好饭等长期独立建模的场景放进一个推荐基座:用异构 Tokenizer 和动态 Mask 处理不同特征与时序,以混合注意力控制长序列成本。文章称多个业务已全量,最显著业务订单增长超过 6%,推理成本降低 24%。这份实践的价值在于同时交代统一建模、训练稳定与训推优化如何相互配合,而非只报告线上结果。
来源:美团 · 技术团队
https://t.co/ayVxIKQukA

[4] 腾讯 15 年资深后台工程师,转战大模型推理的抉择
本文分享了一位腾讯 15 年资深后台工程师在 AI 时代转型大模型推理工程的心路历程、技术路径及对未来趋势的深度思考。
来源:腾讯技术工程
https://t.co/2Vx28egsGb

[5] 高级评估: 如何在产品中发现并修复隐藏的 AI 失败
大多数 AI 团队会跳过错误发现并直接写入指标,但审查跟踪以找到值得测量的失败是最高效的步骤,编码代理可以自动化大部分工作,约 30 分钟。
来源:Lenny's Newsletter
https://t.co/jIABehodeI

[6] Impeccable:用技能工程构建可靠智能体执行框架 [视频]
Paul Bakaus 展示了 Impeccable 如何借助独立评审、反吸引子、任务路由、持久记忆、可执行上下文、Hooks、实时交互和模型专属构建,将设计提示转化为可靠的智能体 Harness。
来源:AI Engineer
https://t.co/u57bRSCQFJ

[7] 提效约 70%!去哪儿网 AI Coding 驱动大型系统重构实践
去哪儿网分享如何通过构建 Harness(约束系统)与 Loop(反馈系统),将 15 万行代码的大型核心系统重构转化为可拆解、可验证的工程化 AI Coding 实践,实现交付效率提升 70% 及显著的性能优化。
来源:dbaplus 社群
https://t.co/0lzNIxCCaY

[8] 千问办公押注的企业上下文,是 Agent 时代的组织语言
千问办公发布企业上下文(Enterprise Context)及相关产品,旨在通过构建结构化的组织知识体系、赋予 Agent 明确的组织身份与安全审计机制,将 AI 从通用办公工具升级为能深度嵌入企业业务流程的数字员工。
来源:爱范儿
https://t.co/JFsTs4aRYr

[9] AI 进入生产阶段之后, 智能、算力、芯片 会走向哪里? [播客]
庄明浩以单口 PPT 形式整理 AICC2026 人工智能计算大会,从需求侧结构性跃迁、智能重新定义、算力芯片生态三层,论证 AI 进入生产阶段比的是「谁能让每个任务跑完」。
来源:屠龙之术
https://t.co/HVPBbAAeRs

[10] 有效第三方评估的优先事项和原则
OpenAI 承诺支持独立评估,提供训练、评估和部署的深度访问,并提出了四个评估优先事项。
来源:OpenAI News
https://t.co/azEqRSSryU

---
https://t.co/88ZBr47sdT · 发现真正适合你的高质量内容
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。
在线阅读:https://t.co/F9cPeGfVuA

引用@hongming731@hongming731
https://t.co/oTtFcJaF24
在 X 查看被引用的帖子

来源:@hongming731 · x.com