#编码
#编码
今日 27 条
Barret李靖@Barret_ChinaAI 评分4343
Barret李靖@Barret_ChinaAI 评分4747
Microsoft Research精选AI 评分6969 Microsoft Research 发布开源智能体框架 Orchard
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
OpenRouter Announcements精选AI 评分6868 OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型
OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。
推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。
DeepSeek API updates精选AI 评分6666 DeepSeek-V4-Flash 正式版 API 上线,Agent 基准远超 V4-Pro-Preview
DeepSeek-V4-Flash 正式版 API 上线公测,调用方式不变,模型名设为 deepseek-v4-flash 即可使用。
推荐理由:官方给出完整的 Agent 基准分数和调用方式,读者可以直接评估是否切换到 deepseek-v4-flash 正式版。
Cursor Blog精选AI 评分6666 Cursor 团队讲解如何搭建云端智能体开发环境
Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
Import AIAI 评分6363 Import AI 466:机器人学的苦涩教训、AI完成周级编程任务与OpenAI模型意外黑客事件
本期Import AI覆盖多件事:Epoch与METR发布MirrorCode基准,Claude Opus 4.7用14小时、251美元推理成本重实现人类需2至17周完成的程序。
Berkeley AI ResearchAI 评分4444 Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
Microsoft AI News精选AI 评分6161 Microsoft 发布面向 GitHub Copilot 和 Excel 的专用 MAI 模型
微软宣布 MAI 模型落地 GitHub Copilot 和 Excel,通过 hill-climbing 方法从 MAI-Code-1-Flash 出发训练出更高效的专用模型。
推荐理由:微软用自家产品数据展示小模型在 Copilot 和 Excel 的效率与成本对比,读者可据此评估专用小模型替代大模型的路径。
Google DeepMind精选AI 评分7777 Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 发布三款 Gemini 模型:3.6 Flash 在 Artificial Analysis Index 上输出 token 用量比 3.5 Flash 减少 17%。
推荐理由:官方博客给出三款 Flash 模型的 token 效率、价格和多项基准数据,可帮助开发者评估选型与 agent 成本。
Every latest articlesAI 评分6161 为什么有些 AI 工作流能坚持下来而另一些不能
Every 作者 Katie 复盘自己放弃和留下的多个 AI 工作流,结论是关键在于工作流回报的速度与是否匹配真实工作习惯。她为 CEO 的 Tend 需求搭建的 Attention Desk 因问题不存在而弃用,管理日程的 Margot 因维护成本过高被搁置,而即时给到回报的 compound writing 插件成为日常核心。
Google DeepMind精选AI 评分6666 Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于更快地发现、验证和修补漏洞。
推荐理由:原文给出基准对比、内部落地和受限开放方式,读者可以据此评估轻量安全模型在漏洞发现中的取舍。
Sierra Blog精选AI 评分6464 Sierra 推出内部云 Agent 平台 Pinecone
Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。
推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。
LMSYS BlogAI 评分4040 SGLang 服务 GLM-5.2 NVFP4 智能体负载:两周内达到 500 TPS
SGLang 在 8xB300(bs=1)上为 GLM-5.2 NVFP4 智能体负载实现超 500 TPS,两周内完成从 day-0 支持到 v0.5.15.post1 的优化。
Sierra Blog精选AI 评分6666 Sierra 全员推行 Agent Pinecone 的五条经验
Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
Import AIAI 评分5959 Import AI 464:Fable 写出 GPU kernel,AI 自动化与模拟计算
Jack Clark 在 Import AI 464 期中汇总多项进展:Fable 在 KernelBench-Mega 上提交了首个也是最快的 megakernel。
Hugging Face BlogAI 评分5252 IBM 发布 ScarfBench:评测 AI 智能体的企业级 Java 框架迁移能力
IBM Research 发布开放基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的企业 Java 框架迁移任务,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Nathan Lambert: Interconnects精选AI 评分8282 Nathan Lambert:GLM-5.2 是开源智能体模型的台阶式跃迁
Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。
推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。
Claude Blog精选AI 评分6565 Claude Code 推出 artifacts,可将工作进展生成实时可分享的网页
Anthropic 宣布 Claude Code 支持 artifacts,可基于会话完整上下文(代码库、连接器、对话)生成 PR walkthrough、仪表盘、发布清单等实时网页,并随会话进展自动更新。页面默认组织内私有,支持版本历史和管理员权限控制,目前以 beta 形式面向 Claude Team 和 Enterprise 组织开放,可从 Claude Code CLI 和桌面应用使用。
推荐理由:官方说明给出 artifacts 的工作方式、调试场景和组织级权限设置,团队用户可据此评估是否引入协作流程。
Claude Platform release notesAI 评分4646 Claude 多语言 SDK 支持 code_execution_20260120 代码执行工具
Anthropic 的 Python、TypeScript、Go、Java、Ruby、PHP 和 C# SDK 现已支持 code_execution_20260120 代码执行工具版本,该版本新增 REPL 状态持久化,并且是程序化工具调用的最低版本要求。
Linear NowAI 评分5454 Linear 工程师复盘如何让 Linear Agent 自动修复 bug
Linear 工程师分享用 Linear Agent 自动修复进入 triage 的 bug 的经验。通过 Datadog 监控发现死 feature flag(任务形状固定,几乎每次一次修复成功)和失败的后台任务(失败率超 0.2% 时建 issue,约三分之一修复命中),并加入门控让 agent 先证明理解问题以节省 token。
Linear Now精选AI 评分7272 Linear 推出 coding sessions、自动化 triage 和 Diffs,让 Linear Agent 直接完成编码
Linear 发布 coding sessions、自动化 triage 和 Diffs,Linear Agent 可以从 issue 直接触达实现:阅读 issue 与讨论、调查代码库、提出方案、写代码并开 PR,全程在云端用 Claude Code 或 Codex 等模型与 harness 完成。
推荐理由:Linear 官方给出从 issue 到 PR 的完整执行闭环细节,并附自用数据与 Ramp、Coinbase 案例,读者可评估其对工程流程的影响。
Claude Platform release notesAI 评分3737 Claude 代码执行与网页搜索/抓取工具更新:新增 90 秒单元格时限披露与 response_inclusion 参数
Claude 平台的代码执行工具现已支持 code_execution_20260521,在工具描述中披露每单元格 90 秒执行时限,便于 Claude 为长耗时单元格做预算,且无需 beta header。
Linear NowAI 评分5050 Linear 如何用 Diffs 在智能体时代做代码审查
Linear 推出 Diffs 功能,用于应对智能体生成代码带来的审查压力:2026 年 1 月至 3 月,其团队新建 issue 与合并 PR 数量均上升 50%。该功能把审查集中到 Linear 内,支持一键查看代码变更背后的客户反馈或 bug 报告,并将改动分组为可读的叙事块,作者可直接在 Linear 中用智能体处理评论。
Microsoft AI News精选AI 评分7979 Microsoft Build 2026 发布 MAI 系列七款新模型,含首个推理模型 MAI-Thinking-1
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
Microsoft AI NewsAI 评分5656 Microsoft 发布编码模型 MAI-Code-1-Flash,基准全面领先 Claude Haiku 4.5
Microsoft 发布面向开发者的编码模型 MAI-Code-1-Flash,训练直接使用 GitHub Copilot 生产 harness,以适配真实智能体编码工作流。
Sierra Blog精选AI 评分6868 Sierra 工程师复盘如何独自用 AI 编码智能体在 4 个月内完成产品本地化
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体独自完成产品本地化,耗时不到 4 个月,而他在 Slack 参与的同类项目需 10 人团队 9 到 12 个月。他经历 IDE 智能体、云端智能体、批量调用 Claude 脚本三轮迭代,并发现技能文档过长会超出上下文窗口反而推高错误率,最终把工作重心从执行迁移转向设计反馈循环。
推荐理由:作者复盘个人用 AI 编码智能体完成本地化的完整工作流,提炼出批处理脚本、反馈循环与上下文管理等可迁移方法。
Mistral AIAI 评分5353 Mistral 在 AI Now Summit 2026 发布工业工程 AI 栈、Vibe 智能体与 Les Ulis 数据中心
Mistral 在 AI Now Summit 2026 宣布面向工业工程的整体 AI 栈,并与 Airbus、BMW 和 ASML 合作,覆盖设计、仿真和生产场景。
Mistral AI精选AI 评分7171 Mistral 发布统一智能体 Vibe,Le Chat 升级为 Work 与 Code 双模式
Mistral 将 Le Chat 升级为统一智能体 Vibe,一个账号覆盖工作与编码场景,已上线 chat.mistral.ai。Work Mode 面向长时多步任务,支持企业知识搜索、数据分析、文档起草、定时任务和可复用技能;Code Mode 提供远程编码会话并推出 VS Code 扩展,CLI 新增技能命令、会话权限控制和 /teleport 迁移。
推荐理由:原文是 Mistral 官方发布,完整列出 Work 与 Code 两种模式的能力、集成入口和各档定价,读者可据此评估是否替换现有工作流。
Linear Now精选AI 评分6363 Linear 发布 Diffs,主打快速代码评审
Linear 发布代码评审产品 Diffs,面向所有套餐开放,目标是让代码评审在不牺牲严谨性的前提下保持快速。评审在 Linear 内打开并关联对应的 issue 和项目,优先级可见;Guided reviews 把大 diff 按工作的推理顺序拆成章节,先展示核心改动,结构化 diff 高亮会剥离格式改动,让 2000 行的 PR 在一次阅读中变得可读。
推荐理由:Linear 官方解释了 Diffs 针对的评审痛点与具体设计,读者可以对照自己团队被 agent 大量 PR 拖慢的评审流程判断是否适用。
Claude Platform release notes精选AI 评分8383 Anthropic 发布 Claude Opus 4.8,默认支持 1M token 上下文窗口
Anthropic 发布 Claude Opus 4.8,为其最强模型,在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上默认支持 1M token 上下文窗口,最大输出 128k token。
推荐理由:原文完整列出 1M 上下文、采样参数限制和各端可用性等迁移要点,接入方可以直接对照判断升级路径。
Mistral AI精选AI 评分6969 Mistral 发布 Mistral Medium 3.5 并在 Vibe 和 Le Chat 推出云端远程智能体
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型(modified MIT 许可),256k 上下文窗口,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,自托管最少只需四块 GPU,API 定价每百万输入 token $1.5、输出 token $7.5。
推荐理由:官方同步发布模型与云端异步智能体,给出基准分数、定价和开源权重,可对照评估其编码与长程任务能力。
Linear Now精选AI 评分6060 Linear 发布 Code Intelligence,为 Linear Agent 引入代码上下文能力
Linear 推出 Code Intelligence,作为 Linear Agent 的新功能,让智能体可以按需或自动对代码库进行研究,现在面向 Business 和 Enterprise 计划开放公测,公测期间免费。
推荐理由:官方说明了产品如何把代码上下文引入问题分诊、支持与产品规划流程,并给出内部使用量增长数据,可帮助读者评估其适用场景。
Sierra BlogAI 评分5757 Sierra 发布 𝜏-knowledge 基准,评测智能体的真实知识库检索与多步工具调用能力
Sierra 发布 𝜏-knowledge,扩展其 𝜏-bench 对话基准,新增 𝜏-Banking 域,包含 698 篇文档、21 个产品类别(约 195K tokens),任务平均需查阅 18.6 篇文档和 9.5 次工具调用。
Import AIAI 评分6767 Jack Clark 撰文判断 2028 年底前无人类参与 AI 研发概率超 60%
Jack Clark 在 Import AI 455 中判断,到 2028 年底出现无人类参与的 AI 研发(模型自主训练出后继版本)的概率超过 60%,2027 年约为 30%。
Claude Platform release notesAI 评分5252 Anthropic 发布 Claude API 开源 Agent Skill,覆盖 8 种语言的 Messages API 与 Managed Agents 参考资料
Anthropic 发布 Claude API skill,这是一个开源 Agent Skill,为 Claude 提供构建 Messages API 和 Claude Managed Agents 的最新参考资料,覆盖 8 种语言。该 skill 随 Claude Code 捆绑提供,也可在 Anthropic skills 仓库获取。
Sierra Blog精选AI 评分6161 Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试
Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。
推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。
Linear NowAI 评分3434 Output isn't design:AI 生成界面不等于设计
针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。
Claude Platform release notes精选AI 评分8484 Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Mistral AIAI 评分5757 Mistral AI 发布 Spaces CLI,面向人类与 Agent 双重用户
Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。