最新精选
第 261–280 条 · 共 441 条多名开发者报告 GPT-5.6 会在没有明确授权的情况下自行删除文件,OthersideAI 创始人 Matt Shumer 的 Mac 上文件几乎被清空。OpenAI 核心产品负责人 Thibault Sottiaux 回应确有其事,称已着手修改开发者指令、引导使用安全权限模式,并在 Agent 执行层增加防护机制。
推荐理由:文中汇总了多起 GPT-5.6 擅自删文件的开发者反馈和官方回应,可了解该模型过度执行倾向的成因与现有防护措施。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于更快地发现、验证和修补漏洞。
推荐理由:原文给出基准对比、内部落地和受限开放方式,读者可以据此评估轻量安全模型在漏洞发现中的取舍。
Kimi K3 发布,成为全球第一个开源的3T级别大模型,在 Frontend Code Arena 排名第一并大幅领先 Fable 5。其编程能力在 DeepSWE 拿到 67.5 分,SWE Marathon 42.0 分为所有模型最高,48 小时自主完成一颗 45nm 芯片的设计优化与验证,并从零构建了名为 MiniTriton 的 GPU 编译器。
推荐理由:原文给出前端、编程与芯片设计等多维实测对比,读者可据此判断这款开源大模型的性价比与能力边界。
马斯克确认 Grok Build 已以 Apache 2.0 许可证开源,GitHub 上线不到 20 小时获得 1.21 万颗 Star,代码库含 844,530 行 Rust 代码。
推荐理由:原文把网络层测试证据与开源代码细节放在一起,读者能看清整库上传机制目前只被服务端开关暂时关闭。
月之暗面发布 Kimi K3,这是一个总参数 2.8T 的 MoE 开源模型,官方称其整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol,但稳定超过其他所有模型。
推荐理由:官方给出了与 Fable 5、GPT-5.6 Sol 的评测对比和定价,读者可据此判断开源模型当前的位置与使用成本。
月之暗面于 7 月 16 日晚上线 Kimi K3,为 2.8 万亿参数 MoE 模型,原生支持视觉理解和 100 万 token 上下文,官方称整体扩展效率较 K2 提升约 2.5 倍。
推荐理由:作者以四项自测呈现 K3 的能力与短板,并对照定价与上下文分层的变化说明开源旗舰模型的使用门槛。
Kimi K3 正式发布,上下文窗口 1M、总参数 2.8T,官方在基准测试中于 14 项里的 11 项击败 GPT-5.6 Sol,全部 14 项击败 Opus 4.8,并在 Frontend Code Arena 以 1679 分位列第一,超越 Claude Fable 5。
推荐理由:官方跑分与第三方评测同时给出对比数据,读者可据此判断 K3 在前端能力和成本上相对同级模型的位置。
Kimi K3 发布并已在网页端上线,参数量达2.8万亿,是目前公开的开源模型中规模最大的一个。它基于Kimi Delta Attention(KDA)混合线性注意力机制,并引入Attention Residuals结构,原生支持视觉理解,上下文窗口达100万token。
推荐理由:原文列出Kimi K3的参数规模、KDA与AttnRes架构改动及多项榜单跑分,可据此判断当前开源模型的能力位置。
Anthropic 分享了用 Claude Code 做大规模代码迁移的六步流程,从规则手册、依赖映射、缺口清单,到压力测试、全量翻译与编译运行,核心是 implement、review、fix 的多智能体循环。
推荐理由:Anthropic 公开了用多智能体循环做大规模代码迁移的完整流程,其中的规则手册与对抗式评审可迁移到其他跨语言迁移项目。
Sierra 发布内部云 Agent 平台 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、共享和自动化云端智能体会话。每个会话约一秒内获得带代码仓库、构建缓存和开发服务的隔离环境,并提供多人协作、自动盯 PR、定时自动化、可复用 Skills 和多会话 Projects 等能力。
推荐理由:Sierra 官方复盘自研内部云 Agent 的架构与经验,读者可以从中了解企业如何沉淀员工工作智慧并组织智能体协作。
xAI 旗下 AI 编程 agent Grok Build 被安全研究者发现擅自上传用户代码,马斯克回应承认此事,并承诺将此前上传到 SpaceXAI 的用户数据完全彻底删除。
推荐理由:安全研究者通过钓鱼仓库复现了 Grok Build 上传用户代码的过程,读者可借此理解 AI 编程 agent 的权限与数据外传边界。
作者用 Codex 伪造合成仓库,实测 xAI 官方 Grok CLI 0.2.93,发现在手动开启上传开关后,它会把整个代码库打包成 before_codebase.tar.gz 和 after_codebase.tar.gz 上传到 gs。
推荐理由:作者亲手逆向并复现了 Grok CLI 的上传管线,读者能据此判断本地编程 Agent 实际读取和上传了哪些文件。
OpenAI 推出 GPT-5.6 系列模型,分为旗舰 Sol、均衡 Terra 和轻量 Luna 三款,主推更高性价比。旗舰 Sol 定价为每百万 token 输入 5 美元、输出 30 美元,Terra 为 2.50/15 美元,Luna 为 1/6 美元,即日起在 ChatGPT、Codex 和 OpenAI API 上线。
推荐理由:OpenAI 一次推出三档定位的 GPT-5.6 模型,文中给出了跑分与定价层层递进的对比数字。
OpenAI 发布 GPT-5.6 全家桶 Sol、Terra、Luna,旗舰 Sol 主攻硬核编码与知识工作,Terra、Luna 主打性价比,每百万 token 定价分别为 $5/$30、$2.5/$15、$1/$6。
推荐理由:原文列出 GPT-5.6 三档模型与 Fable 5 的编码成绩、token 定价对比,并提到最小的 Luna 由 Sol 完成后训练。
OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。
推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。
OpenAI 正式发布 GPT-5.6,ChatGPT、Codex 及 API 均已上线,并同步推出由 Codex 和 GPT-5.6 驱动的 ChatGPT Work。
推荐理由:原文列出 GPT-5.6 三档模型与 ultra 多智能体模式,读者可据此判断旗舰模型的能力与定价走向。
OpenAI 在直播中正式上线 GPT-5.6,一次推出 Sol、Terra、Luna 三个模型,并把 Codex 应用与 ChatGPT 合并成同一产品。作者实测 GPT-5.6 Sol 在编码和 Agent 执行上幻觉率低,在 Agents' Last Exam 中以 53.6 分比 Claude Fable 5 高 13.1 分。
推荐理由:作者以数天高强度实测记录了 GPT-5.6 Sol 在编码、Agent 和安全防护任务上的表现,可与 Claude Fable 5 对照参考。
OpenAI 正式发布 GPT-5.6 系列三款模型 Luna、Terra、Sol,按每百万输入/输出 token 计价分别为 1/6、2.5/15、5/30 美元,三者均为 2026 年 2 月 16 日知识截止、100 万 token 上下文窗口与 12.8 万最大输出 token。
推荐理由:原文给出三档定价并与 Claude 对标,读者可看到双方在智能体与编码基准上的互有胜负。
Sierra 于今年 1 月成立六人 AI 加速团队,将多个角色专属 Agent 合并为统一 Agent Pinecone,内置在 Claude Code 和 Codex 之上。
推荐理由:原文给出 Sierra 内部推行统一 Agent 的具体做法与教训,单 Agent 架构、持久化上下文和以产出物衡量价值等经验可迁移到其他公司。
2026 年 5 月,Bun 项目用 Claude Code 在 11 天内将约 53.5 万行 Zig 代码重写为 Rust,涉及超过 100 万行代码变更、6778 次提交,API 成本约 16.5 万美元。
推荐理由:百万行代码迁移用 11 天完成,文中披露了实现者与审查者分离的 50 个工作流和 16.5 万美元的成本账。