Google 发布 Gemini 4 首款旗舰模型 Argon,18 项评测领先 12 项,先开放给网络安全团队
Google 于当地时间 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,暂不面向普通用户,先通过 Fairwind 项目开放给受信任的网络安全防御机构。
推荐理由:文章汇总了 Gemini 4 Argon 的基准成绩、定价和分阶段开放策略,并指出其在部分基准上仍有落后,便于比较各家旗舰模型差距。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
当前仅显示精选新闻Google 于当地时间 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,暂不面向普通用户,先通过 Fairwind 项目开放给受信任的网络安全防御机构。
推荐理由:文章汇总了 Gemini 4 Argon 的基准成绩、定价和分阶段开放策略,并指出其在部分基准上仍有落后,便于比较各家旗舰模型差距。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
谷歌发布Gemini 4 Argon,单次输出Token上限从64K提升到100万。模型在DeepSWE v1.1取得77.9%的SOTA成绩,AutomationBench拿下51.3%头名,但Terminal-bench4.0仍落后。Argon百万输入Token收费2美元、输出10美元,目前通过Fairwind计划向受信任的网安人员开放,并参与美国政府发布前审查。
推荐理由:文章汇总了模型能力、价格与内部落地数据,读者可以据此评估它在软件工程和网安场景的适用性。
谷歌发布新一代模型 Gemini 4 Argon,输出 Token 上限从 64K 提升至 100 万,在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%、AutomationBench 以 51.3% 排名第一。
推荐理由:文章汇总了模型跑分、内部工程案例和先向受信任团队开放的分阶段发布策略,能帮助读者了解能力之外的开放节奏问题。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
OpenAI 在旧金山举办 DevDay,发布一直在线的个人 agent Dots、协作空间 ChatGPT Space 和价格仅为 GPT-6 Astra 五分之一的 GPT-6.1 Sol,合计 25 项发布。
推荐理由:文章按演讲顺序逐一梳理全部发布项,读者可以对照自己的工作流快速定位值得跟进的新能力。
OpenAI在DevDay上发布由GPT-6 Astra驱动的24小时个人智能体dots、协作套件Space与Pages,以及主打长程任务的GPT-6.1 Sol,其缓存价格降至0.10美元/百万Token。
推荐理由:汇总了OpenAI DevDay多项发布的具体额度数字、定价与权限设计,还给出Pro 200降配等社区争议细节。
OpenAI 在 DevDay 2026 发布个人 Agent 产品 Dots,向 ChatGPT Pro、Business Premium 和 Enterprise 用户推出,ChatGPT 生态已有超过 4000 个应用可与其协作。
推荐理由:作者通宵整理了 OpenAI DevDay 2026 的全部发布,读者可以用一篇了解 Dots、GPT-6.1 Sol、订阅与生态的主要变化。
OpenAI 在旧金山 Fort Mason 举行史上规模最大的 DevDay,官方列出 25 项发布,包括由 GPT-6 Astra 驱动的 7×24 常驻智能体 Dots。
推荐理由:一文梳理 OpenAI DevDay 全部要点,把模型定价、Dots 安全边界和平台策略放进同一框架,方便读者对照判断。
GPT-6.1 Sol 在 Amazon Bedrock 正式可用,聚焦智能体编码、计算机使用和专业工作负载的更强推理。
推荐理由:官方公告给出与 GPT-6 Astra 对比的每任务成本约五分之一等数据,读者可据此评估在 Bedrock 上运行智能体任务的性价比。
OpenAI 在旧金山 DevDay 发布 25 项内容。核心包括一直在线的个人 agent Dots(向 Pro、Business Premium 开放)、人机协作空间 ChatGPT Space 与新文档类型 Pages。
推荐理由:文章按演讲顺序梳理 25 项发布的价格、规格和上线范围,读者可以据此评估 OpenAI 新工具对现有工作流的影响。
OpenAI 发布 GPT-6.1 Sol,定位为接近 Astra 智能水平的模型,主打编码、计算机使用和专业工作场景,价格为 Astra 标准 API 输入和输出 token 价格的五分之一。
推荐理由:原文明确了模型定位与五分之一的价格对比,读者可以据此评估在不同工作负载下替换现有模型API的成本空间。
Manus 发布 2.0 版本并推出独立智能体应用 Cue。2.0 重构底层 Agent 架构 Cascade,内部测试中 Token 消耗减少 23.2%、任务完成时间缩短 28.2%。
推荐理由:原文梳理了 Manus 2.0 的架构升级、新应用 Cue 及具体数字,读者可据此评估其对现有 Agent 工作流的改变。
AMD 收购李飞飞创立的空间智能公司 World Labs,因 AMD 是上市公司,收购价格 82 亿美元得以确认。World Labs 发布的 Atlas 是从零训练的全域模型架构,能从 2D 图像输入预测下一个视角,结合生成模型与多视角几何解决了计算机视觉中长期存在的稀疏重建问题,应用于机器人 RL 环境、场景生成和房产设计等领域。
推荐理由:原文补充了公开公司可查的收购价格,并梳理 Atlas 的稀疏重建能力,读者可了解这笔交易背后的技术底细。
数字生命卡兹克宣布将月活百万的AI热点资讯网站 AIHOT(https://aihot.news/)正式开源,仓库地址为 https://github.com/KKKKhazix/AIHOT。
推荐理由:作者完整给出从旧代码库蒸馏功能文档到多模型协作重写的12步流程,外行借助AI重构项目的路径可以直接参考。
Anthropic发布Claude Sonnet 5.5,速度比Sonnet 5快30%以上,单任务成本最多降低30%,定价与Sonnet 5相同。
推荐理由:原文整理了Sonnet 5.5的速度、成本、编程与知识工作评测数据,并给出强度档位与定价细节,方便读者对比选型。
推荐理由:指南覆盖模型选型、迁移调参和 Claude Code 使用三方面,开发者可直接对照迁移工作流。
Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。
推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。