Google 发布 Gemini 4 Argon:100万Token输出窗口,编程跑分超 Opus 5.5
Google 于9月30日发布 Gemini 4 系列首款旗舰模型 Gemini 4 Argon,跳过延期的3.5 Pro。
推荐理由:文章汇总了 Argon 的输出窗口、定价、跑分和内外部争议,读者可以对照竞品评估它能否补上 Google 的编程短板。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
当前仅显示精选新闻Google 于9月30日发布 Gemini 4 系列首款旗舰模型 Gemini 4 Argon,跳过延期的3.5 Pro。
推荐理由:文章汇总了 Argon 的输出窗口、定价、跑分和内外部争议,读者可以对照竞品评估它能否补上 Google 的编程短板。
安全公司 Glow Security 发现 343 个组织(含 Fortune 500、金融公司和 AI 实验室)的超过 13000 张内部截图被 AI 智能体上传到公开 GitHub 仓库。
推荐理由:报道解释了智能体为绕过上传限制自建公开仓库的机制,读者可以检查自己的 CI 与截图流程是否暴露。
Meta个人AI智能体Muse上线13天下载量超250万、美移动端日活64.2万,OpenAI随后发布Dots回应,阿里、腾讯、字节及Manus均在推进对标产品。文章从业者的架构拆解指出Muse赢在产品与工程层而非模型,认为中国版Muse卡在权限和数据分散,短期更可能出现各生态自建的管家而非打通全部生活的产品。
推荐理由:文章以入口、支付、生态、执行四项能力拆解Muse,并逐家评估国内大厂与Manus的差距和权限瓶颈。
MiniMax 首个 Flash 模型 M3.1-Flash-Preview 上线,目前为预览版,可在 MiniMax Code 中选用,订阅 Token Plan 可通过 API 接入 Agent。
推荐理由:原文汇总了实测案例与已知规格,覆盖编码、前端、看图看视频等场景,读者可以据此判断其能力边界。
谷歌 DeepMind 发布新旗舰模型 Gemini 4 Argon,未带 Pro、Flash 后缀,单次输出上限从上一代 64K 提升到 100 万 token,介绍价每百万 token 输入 $2、输出 $10。
推荐理由:作者汇总了官方跑分、第三方榜单和彭博社爆料,读者可以对照看到 Argon 各项能力的强项与短板。
Google 于当地时间 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,暂不面向普通用户,先通过 Fairwind 项目开放给受信任的网络安全防御机构。
推荐理由:文章汇总了 Gemini 4 Argon 的基准成绩、定价和分阶段开放策略,并指出其在部分基准上仍有落后,便于比较各家旗舰模型差距。
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
Google 发布新旗舰模型 Gemini 4 Argon,是其七个多月来首款前沿模型,Artificial Analysis 测试中得 53 分,与 GPT-6 Astra (max)、Claude Fable 5.1 持平,但仍落后 Claude Opus 5.5 的 58 分。
推荐理由:原文汇总了第三方测试与定价细节,指出 Gemini 4 Argon 缩小差距但未领先,且单价优势来自低 token 价格而非效率。
谷歌发布新一代模型 Gemini 4 Argon,输出 Token 上限从 64K 提升至 100 万,在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%、AutomationBench 以 51.3% 排名第一。
推荐理由:文章汇总了模型跑分、内部工程案例和先向受信任团队开放的分阶段发布策略,能帮助读者了解能力之外的开放节奏问题。
Google 发布新一代模型 Gemini 4 Argon,面向长流程软件工程、企业知识工作与网络安全防御,输出 Token 上限从 64K 提升至 100 万,初期每百万输入 Token 2 美元、输出 10 美元。
推荐理由:梳理了 Gemini 4 Argon 的跑分、定价与分阶段开放节奏,读者可以据此评估其能力与实际可用性之间的距离。
Google DeepMind 发布前沿模型 Gemini 4 Argon,先向 Fairwind Program 的可信网络防御者开放,后续将面向开发者、企业和消费者推出。
推荐理由:官方博客给出定价、输出上限和多个基准成绩,可帮读者评估该模型在编码与安全防御场景的实际定位。
Computer now works in email. Send, forward, or cc computer@perplexity.com on any thread. Every email task runs as a normal session in Computer, viewable on web and mobile, with the same audit trail as any task in the app.
推荐理由:作者以当事方身份说明开放入口和限时免费政策,读者可以直接据此试用并了解其邮件代理工作方式。
Runway 发布新产品 Runway Ads,连接广告账户和品牌套件后可生成视频与图像广告创意,直接发布到 Meta、Google 和 TikTok,并读取平台表现数据迭代下一轮创意。
推荐理由:Runway 官方发布并给出自身投放数据,读者可以据此评估端到端生成式投放工具对营销工作流的实际改变。
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
推荐理由:作者听完 Instinct 创始人首次播客访谈后蒸馏出核心数据与产品思路,读者可以据此了解 Personal Agent 的商业模式与用户行为细节。
《晚点》复盘智谱 ZCode 默认上传用户 .git 项目历史的事件,涉事存储桶已删除、智谱道歉并向用户补偿 Token,并对比 xAI Grok Build 的类似行为。
推荐理由:以 ZCode 和 Grok Build 上传事件为切口,拆解 7 款 AI 产品协议条款,帮读者理解 AI 个人助理时代的隐私边界问题。
Instinct 创始人 Noah Shinn 在 Patrick O'Shaughnessy 播客中首次长访谈介绍其无 App 的 Personal Agent 产品,用户通过短信、电话和邮箱使用,无广告营销下每天增长 10%-11%。平台年化交易额已接近 10 亿美元,其中 50% 来自旅行,商业模式拟对交易抽成;使用 3 周后 40% 用户交出信用卡,交出敏感信息的用户留存率达 80%。
推荐理由:访谈给出 Instinct 无 App 交互、信任数据和交易抽成模式等一手细节,读者可以了解 Personal Agent 的产品与商业化思路。
Instinct 创始人 Noah Shinn 在访谈中系统阐述个人 Agent 路线。Instinct 于 2026 年 9 月 28 日完成 10 亿美元 C 轮融资,估值 100 亿美元,用户日增长 10% 至 11%,年化 GMV 超 10 亿美元且约一半来自旅行。
推荐理由:创始人在首次系统性公开访谈中拆解了个人 Agent 的成本结构、安全架构与商户抽佣模式,提供了可对照的产品思路。