最新精选 第 301–320 条 · 共 500 条 23:48 Moonshot AI 于7月16日发布旗舰模型 Kimi K3,为 2.8T 参数 MoE 模型,权重定于7月27日开放,是 DeepSeek R1 之后离前沿最近的开源模型。作者分析其多项榜单表现、中国实验室的资本效率优势、习近平在 WAIC 表态支持开源,并讨论开源模型对封闭实验室的经济冲击及政策风险。
推荐理由:作者走访过月之暗面团队,结合榜单和政策动向分析开源前沿模型的格局变化,给出资本效率与开放封闭平衡的独特视角。
15:32 Hugging Face 披露其生产基础设施在 7 月 13 日当周遭一个自主 AI 智能体系统入侵,攻击者滥用数据集处理管道中的远程代码数据集加载器和模板注入两条代码执行路径,收割云和集群凭证并横向移动。
推荐理由:Hugging Face 的处置过程显示,托管模型的安全护栏会挡住防御方取证,自托管开放权重模型可绕开这一限制。
13:11 月之暗面发布旗舰模型 Kimi K3,在 Arena 前端代码/Web Dev 榜单以 1679 分登顶,领先 Fable 5 48 分、高于 GPT-5.6 Sol 61 分。
推荐理由:Kimi K3 登顶 Arena 前端榜单并提价近 4 倍,读者可对照其稀疏 MoE 架构与真实任务成本的差异。
08:00 Anthropic 分享了用 Claude Code 做大规模代码迁移的六步流程,从规则手册、依赖映射、缺口清单,到压力测试、全量翻译与编译运行,核心是 implement、review、fix 的多智能体循环。
推荐理由:Anthropic 公开了用多智能体循环做大规模代码迁移的完整流程,其中的规则手册与对抗式评审可迁移到其他跨语言迁移项目。
08:05 作者用 Codex 伪造合成仓库,实测 xAI 官方 Grok CLI 0.2.93,发现在手动开启上传开关后,它会把整个代码库打包成 before_codebase.tar.gz 和 after_codebase.tar.gz 上传到 gs。
推荐理由:作者亲手逆向并复现了 Grok CLI 的上传管线,读者能据此判断本地编程 Agent 实际读取和上传了哪些文件。
09:21 OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。
推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。
08:25 OpenAI 正式发布 GPT-5.6,ChatGPT、Codex 及 API 均已上线,并同步推出由 Codex 和 GPT-5.6 驱动的 ChatGPT Work。
推荐理由:原文列出 GPT-5.6 三档模型与 ultra 多智能体模式,读者可据此判断旗舰模型的能力与定价走向。
03:01 OpenAI 发布 GPT-5.6,包含 Sol、Terra、Luna 三款模型,并推出对标 Claude Work 的 ChatGPT Work。旗舰款 Sol 在 Agents' Last Exam 测试的 55 个行业长程工作流上得分 53.6,比 Claude Fable 5 高 13.1 分。
推荐理由:原文梳理了 GPT-5.6 三款模型的分档与命名规则,读者可以据此了解这次发布的产品结构与能力分层。
19:20 2026 年 5 月,Bun 项目用 Claude Code 在 11 天内将约 53.5 万行 Zig 代码重写为 Rust,涉及超过 100 万行代码变更、6778 次提交,API 成本约 16.5 万美元。
推荐理由:百万行代码迁移用 11 天完成,文中披露了实现者与审查者分离的 50 个工作流和 16.5 万美元的成本账。
15:50 Bun 项目于 2026 年 5 月借助 Claude Code,用 11 天完成从 Zig 到 Rust 的代码迁移,涉及超 100 万行代码变更、6778 次提交和约 50 个动态工作流。
推荐理由:Bun 借助 Claude Code 在 11 天内把 53 万行 Zig 重写为 Rust,文中给出多工作流协作方式与 16.5 万美元成本账,可供评估 AI 大规模重构的现实边界。
14:00 工业和信息化部网络安全威胁和漏洞信息共享平台(NVDB)发布风险提示,指出 Anthropic 的 AI 编程工具 Claude Code 存在安全后门,可在未经用户同意的情况下向远程服务器回传地域、身份标识等敏感信息,受影响版本为 2.1.91 至 2.1.196。
推荐理由:原文给出受影响版本区间和此前检测机制争议的来龙去脉,读者可据此核查开发环境并了解企业禁令背景。
11:27 Anthropic 发布论文,称在 Claude 内部发现一块训练中自发涌现、只用于思考而不对外输出的区域 J-space。研究者用基于雅可比矩阵的 J-lens 读出其中概念,删掉该区域后 Claude 说话仍流利,但多步推理接近归零。论文还展示了用它监控敲诈实验与 Opus 4.6 发布前审计,完整论文、开源代码与 Neuronpedia 交互 demo 已放出。
推荐理由:原文完整转述 Anthropic 的全局工作空间论文,读者可了解 J-space 如何被读出并用于安全监控。
08:00 AI 公司在 12 个月内向前向部署工程(FDE)投入 97.5 亿美元,相当于 Accenture 年度服务成本的约五分之一。文中归纳出三种模式,Microsoft 与 Amazon 用既有编制组建团队,OpenAI 与 Anthropic 成立由外部私募支持的独立实体,Google Cloud 则投入 7.5 亿美元做合作伙伴基金。
推荐理由:文中把 FDE 投入拆成三种结构模式,读者可借融资与人员数字判断这套模式为何被各实验室采用。
08:00 Anthropic 技术人员 Thariq Shihipar 发布 Claude Fable 5 使用指南,提出用提示词让 Claude 帮自己发现未考虑到的信息。文章把未知信息分为已知的已知、已知的未知、未知的已知和未知的未知四类,并给出 blind spot pass、头脑风暴与原型、访谈、代码参考、实施计划、实施笔记、讲解文档和测验等模式及对应示例提示词。
推荐理由:作者把发现未考虑到的信息拆成一套可复用的提示词模式,读者能直接照着改善与 Claude 的协作。
22:22 据 404 Media 从六家企业获取的内部资料,Atlassian、Adobe、亚马逊、花旗等公司开始限制员工使用高性能大模型,以控制按调用量计费后的 AI 开销。
推荐理由:多家企业泄露的内部资料显示按量计费后 AI 开销激增,读者可据此了解企业如何管控模型调用额度。
09:26 Fable 5 回归,目前可在 Claude 中使用。Pro、Max、Team 和 Enterprise「高级版」每周使用量限额的 50% 可用于 Fable 5,7 月 7 日之后改为按使用积分(usage credits)计费,标准 Enterprise 席位没有免费额度、全部按积分计费。
推荐理由:原文列出 Fable 5 回归后的可用平台、额度规则与按量计费价格,可与 Opus 4.8 对比使用成本。
08:00 Anthropic 宣布 Claude Fable 5 重新部署并面向全球所有用户开放,同时公布其网络安全安全分类器的细节和一份 AI 越狱严重性框架草案。分类器把网络安全用途分为禁止使用、高风险双用途、低风险双用途和良性使用四类,分别对应拦截、监控或放行,并设有比以往模型更大的安全边界。
推荐理由:Anthropic 披露 Fable 5 安全分类器的四类用途边界,并提出按能力增益与可利用性打分的越狱危害评级草案。
17:02 Reddit 用户逆向发现 Claude Code 在 2.1.196 版本中内置监控程序,通过篡改系统提示词日期格式和替换特殊标点等隐写手段标记中国用户并回传信息。
推荐理由:爆料与官方回应并列呈现,读者可看到 Claude Code 风控逻辑的具体运作方式及回滚说法。
13:03 Anthropic 的 Fable 5 在出口管制解除后恢复全球访问,7 月 1 日恢复上线后,Pro、Max、Team 和高级版 Enterprise 每周使用限额的 50% 可用于 Fable 5,7 月 7 日后改为按 usage credits 计费,标准 Enterprise 席位没有免费额度。
推荐理由:文章结合官方公告梳理 Fable 5 解除出口管制的协议条件、越狱分级框架与计费变化,呈现前沿模型与监管协作的落地细节。
12:06 Anthropic 发布 Claude Sonnet 5,官方称其在推理、工具调用和编程上相比 Sonnet 4.6 明显提升,整体能力接近 Opus 4.8 但价格更低。
推荐理由:文章对比了 Sonnet 5 与 Opus 4.8 的定价,并提示新 tokenizer 可能增加 token 消耗,便于读者评估迁移成本。
上一页 1 … 14 15 16 17 18 … 25 下一页