最新精选 第 241–260 条 · 共 456 条 12:39 Anthropic 宣布 5 天后所有 Claude Code 将默认启用自动模式,分类器每次工具调用额外消耗的 token 不再向用户收费。文中数据显示用户对权限提示的拒绝率仅 3%,在 1053 名付费测试者的受控实验里人工拦下危险命令的比例为 13.6%,auto mode 为 89%。
推荐理由:用受控实验和生产数据对比人工审批与自动模式的拦截率差异,可看清这次默认变更的取舍依据。
07:08 OpenAI 宣布因网络安全风险延缓 Astra 模型发布,内部与专家评估显示该模型在智能体编程和网络安全领域取得重大突破,并被列为公司首个在网络安全领域达到关键风险级别的模型。
推荐理由:OpenAI 因 Astra 在网络安全与智能体编程上的能力突破而延缓发布,读者可了解触发关键风险级别的条件与相应管控措施。
08:00 Anthropic 宣布从 8 月 14 日起 Claude Code 在 Pro、Max 和 Team 计划的新会话默认启用 auto mode,并停止向这些计划用户收取分类器开销。
推荐理由:文中对照了 auto mode 与人工审批在拦截危险命令上的差异,读者可据此判断默认权限模式的取舍。
09:30 阿里巴巴 8 月 3 日正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4T、激活 95B,支持视觉理解与 1M Tokens 上下文。
推荐理由:原文列出 2.4T 总参数、激活 95B 与 API 定价,读者可据此比较旗舰模型的规模与成本取舍。
23:55 Claude Code 的 auto mode 通过一个单独的分类器逐条筛查每个操作,代替用户逐次确认,从而减少打断、完成长时间任务。视频解释该分类器的工作方式,以及为什么 Claude 不会批准自己的操作,还介绍了如何按自身环境和团队配置 auto mode,并附有官方博客链接。
推荐理由:视频拆解 Claude Code 自动模式如何用独立分类器逐条筛查操作,并给出按环境与团队配置的入口。
00:00 Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
12:24 阿里巴巴正式发布新一代基座大模型 Qwen3.8,旗舰版 Qwen3.8-Max 总参数量 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,支持视觉理解,上下文长度达 1M Tokens。
推荐理由:原文给出 2.4T MoE 旗舰模型的参数规模、编程能力表现和 API 定价,便于比较其性价比定位。
10:00 Qwen 官方发布 Qwen3.8-Max,称为 Qwen 家族迄今最强模型,参数规模达 2.4 万亿,基于 Qwen3.5 架构,在编码、办公和研究等方面全面提升。官方还将首次开源 Qwen-Max 级模型权重,开放权重定于下周发布。
推荐理由:Qwen 官方宣布新旗舰模型并开源 Max 级权重,读者可据此关注其编码与协作能力变化。
08:00 OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。
推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。
13:30 Claude Code 创始人 Boris Cherny 建议每半年删除一次自己的 CLAUDE.md、Skills 和 Hooks,看看最新模型自己会怎么做。
推荐理由:Claude Code 创始人解释了为何每代新模型都要清空提示词和 Skills,以及为什么验证比提示词工程更关键。
08:00 Together AI 发布 Kimi K3 开发者指南。Kimi K3 是月之暗面 2.8 万亿参数开源权重模型,首个 3 万亿参数级的开源模型,支持 1M 上下文,在 Together 上以 OpenAI 兼容 API 提供服务。
推荐理由:Together AI 给出 Kimi K3 的完整接入指南,覆盖推理控制、工具调用、缓存和计费细节,可据此优化实际调用成本。
20:00 Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。
23:14 月之暗面开源 Kimi K3 模型,参数规模 2.8 万亿,同步放出模型权重、技术报告以及 MoonEP、FlashKDA、AgentEnv 三项支撑训练的 Infra 技术。
推荐理由:2.8 万亿参数开源模型把权重、技术报告与训练 Infra 一并放出,可对照开源模型的规模上限与工程路径。
11:37 Anthropic 发布 Opus 5 模型,在公告列出的多项基准中表现优于 Fable 5,而 API 价格仅为后者的一半,维持每百万输入 token 5 美元、每百万输出 token 25 美元。
推荐理由:原文给出定价、基准对比与安全策略变化,读者可据此判断 Opus 5 在成本与可用性上的取舍。
11:05 Anthropic 正式发布 Opus 5,定价与上一代 Opus 4.8 持平,为每百万 token 输入 5 美元、输出 25 美元,只有 Fable 5 的一半。
推荐理由:Opus 5 以 Fable 5 一半的价格在多项编程评测上反超,读者可以据此比较这代模型的性价比。
07:48 Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,并继续提供价格为基础模型两倍的 fast mode。发布帖提到,它在某个 Frontier-Bench 任务中无法直接查看图纸,于是自建计算机视觉流程,从原始像素中提取几何并重建出完整零件;它在发现安全漏洞方面接近 Mythos 5,但利用漏洞的能力仍明显落后,因为未被训练相关攻击任务。
推荐理由:文中援引发布帖里的零件重建案例,呈现了模型在缺少直接视图时自行搭建视觉流程的过程。
06:42 Anthropic 发布旗舰模型 Claude Opus 5,已成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最高能力模型,输入每百万 token 5 美元、输出每百万 token 25 美元,与 Opus 4.8 价格一致。
推荐理由:Opus 5 以约 Fable 5 一半的价格提供接近的能力,可用于比较现有旗舰模型的性价比取舍。
02:10 Anthropic 发布 Opus 5,支持 1M 上下文、最大 128k 输出,网页版已可直接使用,API 与 Claude Code 中的模型名为 claude-opus-5。
推荐理由:原文梳理了 Opus 5 的官方评测与 System Card 细节,读者可对照价格和单任务成本理解其定位。
上一页 1 … 11 12 13 14 15 … 23 下一页