跳到正文

#编码

今日 27 条
8月8日周六
8月4日周二
  1. Microsoft Research69

    Microsoft Research 发布开源智能体框架 Orchard

    Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。

8月3日周一
  1. OpenRouter Announcements68

    OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型

    OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。

    推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。

7月31日周五
7月30日周四
  1. Cursor Blog66

    Cursor 团队讲解如何搭建云端智能体开发环境

    Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。

7月27日周一
7月26日周日
  1. Berkeley AI Research44

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月24日周五
7月21日周二
7月20日周一
  1. Every latest articles61

    为什么有些 AI 工作流能坚持下来而另一些不能

    Every 作者 Katie 复盘自己放弃和留下的多个 AI 工作流,结论是关键在于工作流回报的速度与是否匹配真实工作习惯。她为 CEO 的 Tend 需求搭建的 Attention Desk 因问题不存在而弃用,管理日程的 Margot 因维护成本过高被搁置,而即时给到回报的 compound writing 插件成为日常核心。

7月17日周五
7月16日周四
  1. Sierra Blog64

    Sierra 推出内部云 Agent 平台 Pinecone

    Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。

    推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。

7月14日周二
7月10日周五
  1. Sierra Blog66

    Sierra 全员推行 Agent Pinecone 的五条经验

    Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。

    推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。

7月6日周一
7月1日周三
6月22日周一
  1. Nathan Lambert: Interconnects82

    Nathan Lambert:GLM-5.2 是开源智能体模型的台阶式跃迁

    Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。

    推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。

6月18日周四
  1. Claude Blog65

    Claude Code 推出 artifacts,可将工作进展生成实时可分享的网页

    Anthropic 宣布 Claude Code 支持 artifacts,可基于会话完整上下文(代码库、连接器、对话)生成 PR walkthrough、仪表盘、发布清单等实时网页,并随会话进展自动更新。页面默认组织内私有,支持版本历史和管理员权限控制,目前以 beta 形式面向 Claude Team 和 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用使用。

    推荐理由:官方说明给出 artifacts 的工作方式、调试场景和组织级权限设置,团队用户可据此评估是否引入协作流程。

6月13日周六
6月12日周五
  1. Linear Now72

    Linear 推出 coding sessions、自动化 triage 和 Diffs,让 Linear Agent 直接完成编码

    Linear 发布 coding sessions、自动化 triage 和 Diffs,Linear Agent 可以从 issue 直接触达实现:阅读 issue 与讨论、调查代码库、提出方案、写代码并开 PR,全程在云端用 Claude Code 或 Codex 等模型与 harness 完成。

    推荐理由:Linear 官方给出从 issue 到 PR 的完整执行闭环细节,并附自用数据与 Ramp、Coinbase 案例,读者可评估其对工程流程的影响。

6月11日周四
6月10日周三
  1. Linear Now50

    Linear 如何用 Diffs 在智能体时代做代码审查

    Linear 推出 Diffs 功能,用于应对智能体生成代码带来的审查压力:2026 年 1 月至 3 月,其团队新建 issue 与合并 PR 数量均上升 50%。该功能把审查集中到 Linear 内,支持一键查看代码变更背后的客户反馈或 bug 报告,并将改动分组为可读的叙事块,作者可直接在 Linear 中用智能体处理评论。

6月2日周二
5月29日周五
  1. Sierra Blog68

    Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化

    Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。

    推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。

5月28日周四
  1. Mistral AI71

    Mistral 发布统一智能体 Vibe,Le Chat 升级为 Work 与 Code 双模式

    Mistral 将 Le Chat 升级为统一智能体 Vibe,一个账号覆盖工作与编码场景,已上线 chat.mistral.ai。Work Mode 面向长时多步任务,支持企业知识搜索、数据分析、文档起草、定时任务和可复用技能;Code Mode 提供远程编码会话并推出 VS Code 扩展,CLI 新增技能命令、会话权限控制和 /teleport 迁移。

    推荐理由:原文是 Mistral 官方发布,完整列出 Work 与 Code 两种模式的能力、集成入口和各档定价,读者可据此评估是否替换现有工作流。

  2. Linear Now63

    Linear 发布 Diffs,主打快速代码评审

    Linear 发布代码评审产品 Diffs,面向所有套餐开放,目标是让代码评审在不牺牲严谨性的前提下保持快速。评审在 Linear 内打开并关联对应的 issue 和项目,优先级可见;Guided reviews 把大 diff 按工作的推理顺序拆成章节,先展示核心改动,结构化 diff 高亮会剥离格式改动,让 2000 行的 PR 在一次阅读中变得可读。

    推荐理由:Linear 官方解释了 Diffs 针对的评审痛点与具体设计,读者可以对照自己团队被 agent 大量 PR 拖慢的评审流程判断是否适用。

5月22日周五
  1. Mistral AI69

    Mistral 发布 Mistral Medium 3.5 并在 Vibe 和 Le Chat 推出云端远程智能体

    Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。

    推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。

5月15日周五
  1. Linear Now60

    Linear 发布 Code Intelligence,为 Linear Agent 引入代码上下文能力

    Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。

    推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。

5月14日周四
5月4日周一
4月29日周三
4月22日周三
  1. Sierra Blog61

    Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试

    Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。

    推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。

4月17日周五
  1. Linear Now34

    Output isn't design:AI 生成界面不等于设计

    针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。

4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

3月31日周二
  1. Mistral AI57

    Mistral AI 发布 Spaces CLI,面向人类与 Agent 双重用户

    Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。