IT之家 10 月 1 日消息,谷歌昨日(9 月 30 日)发布 Gemini 4 Argon,称其为公司迄今最先进的 AI 模型,但目前并未面向公众全面开放。 定位方面,Gemini 4 Argon 是谷歌当前“最先进”模型,重点是长流程软件工程、企业知识工作和网络安全防御。官方称其在真实世界软件工程测试创纪录,网络安全基准并列第一,并在金融、法律等专业任务基准领先。 模型特性方面,Gemini 4 Argon 单次输出上限达到约 100 万 tokens,高于此前的 64,000 tokens,适合处理大型代码库、长文档和多阶段任务。 谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 表示:“Argon
精选最新精选
2026年10月1日星期四 · AI 自动挑选的高价值内容
当前热点 今日热点
完整榜单 →Magnitude 是一个面向智能体的开源推理引擎,会在你的设备上编译并调优内核,使开放模型运行速度最高达到 llama.cpp 的 2 倍。它支持 Apple Silicon、NVIDIA、AMD 或纯 CPU,提供 macOS、Windows、Linux 桌面应用,可一键连接 Pi、OpenCode、Hermes、Codex 等智能体。官方称 Metal 上解码快 92%、CUDA 上快 19%,每个智能体内存占用减少 27%,且提示、文件和模型均留在本机。
Gemini 4 Argon 是 Google 七个多月来首个前沿模型。独立测试中它追平 GPT-6 Astra,但不及 Anthropic 的 Claude Opus 5.5。每 token 价格虽低,但每个任务消耗的 token 数是 Astra 的两倍多。首批仅限特定测试者访问,API 和付费层级随后开放。
Google DeepMind 发布 Gemini 4 Argon,单次响应最多可生成 100 万 token,此前 Gemini 模型为 64K。该模型面向长周期软件工程、法律与金融企业知识工作以及网络安全防御。定价为输入每百万 token 2 美元、输出 10 美元,优惠期后升至 4 美元和 20 美元。
OpenAI 发布 GPT-6.1 Sol,定位 GPT-6 家族中端模型,在 DeepSWE v1.1 编码基准上以约五分之一成本追平 GPT-6 Astra,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点。标准 API 定价为每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.10 美元,缓存输入较 GPT-6 Sol 降低 50%。
Google 公布下一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中达到前沿性能。初期访问仅限一组“可信网络防御者”,Google 表示正参与美国政府预发布模型访问的自愿流程,并将在更广泛推出前加强关键前沿防护。
Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 软件工程基准上取得 77.9%,在长视频理解 LVBench 上取得 91.7%,在 CWE-bench v1 漏洞修复上以 68% 并列第一。定价为每百万输入 token 2 美元、每百万输出 token 10 美元,输出上限从 64K 提升至 1M token。
Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 得 77.9%、LVBench 得 91.7%、CWE-bench v1 得 68%,并在 Google 内部量子算法优化中将已发布基线提升 40%。输出 token 上限从 64K 扩至 1M,定价为每百万输入 token 2 美元、输出 10 美元。
OpenAI 与 Synopsys 正在联合开发 GPT-Synopsys,这是一款面向芯片设计的专用 AI 模型,目标是像资深工程师一样操作 Synopsys 的 EDA 工具并自主优化设计。目前该模型已开始与半导体客户进行早期测试。
Claude Code v2.1.286 发布,集中修复了 MCP 错误信息泄露凭据值、Bearer 令牌部分脱敏、远程控制会话在策略关闭后仍保持连接等问题。同时改进权限提示、全屏列表鼠标操作和 VSCode 书签功能。
OpenAI 在 Dev Day 上公布了 Decisions API,功能类似 TypeSafe AI 本月发布的 Jev 模型:让模型在预定义选项中输出概率,以极快速度和低成本完成分类或智能体行为选择。Altman 称聚焦选择可保持图像理解、多语言支持和安全保护。Jev 用于监控智能体动作时成本为 2.94 美元,而前沿 LLM 需 372 美元。
论文提出 FRAC,一种基于分数阶动力学的选择性状态空间模型架构,用幂律长记忆替代传统 SSM 的指数遗忘。FRAC 以有限状态、对数间隔的指数模态之和近似重尾目标核,实现并行训练与预填充,同时保留有界状态的自回归解码。在含 1.3B 参数语言建模的实验中,FRAC 在长上下文性能上持续优于最先进的 SSM 基线,短上下文保持竞争力。
ElevenLabs 宣布允许员工以 220 亿美元估值出售部分既得股权,较今年 2 月融资时的 110 亿美元翻倍。此次 3 亿美元员工要约收购由 Wellington 和 T. Rowe Price 共同领投。这是该公司第二次为员工提供二级交易,上一次是 2025 年 9 月以 66 亿美元估值完成的 1 亿美元要约。
Google 正在 Gemini 聊天中用 Skills 取代 Gems。Skills 是详细、可复用的提示词,用户输入“/”即可调用,或由 Gemini 自动运行,其格式基于 Anthropic 的开放标准。Gems 将从 11 月起逐步淘汰,现有 Gems 会自动迁移。
Meta 和 OpenAI 计划在未来一年内推出专用 AI 硬件,路径都是先用可爱软件智能体测试市场。OpenAI 与 Jony Ive 合作的设备不早于 2027 年 2 月发货,Meta 的 Muse Charm 吊坠式设备目标在今年假日购物季前推出。此前 Friend 和 Humane AI Pin 等专用 AI 设备主要引发失望和反弹。
Reddit 宣布将于 11 月 13 日终止 RSS 支持,理由是 RSS 已成为大规模抓取和自动化滥用的常见入口。同时,Reddit 计划在 2027 年 3 月关闭公共 API,影响依赖程序化访问 Reddit 对话的研究工具、社交聆听产品和 AI 助手。
There’s a reason frontier labs have gotten gun-shy about consumer AI — and it’s not because the tech isn’t good enough.
Meta 将 AI 数据中心归类为“试点模型”、把 Nvidia 芯片列为实验材料,以此节省联邦税款,仅 2025 年就累计 39 亿美元。该税收抵免可追溯至 1981 年,Meta 自己的会计师也认为这一策略存在法律风险。
特朗普周二与六位科技领袖会面后,宣布以“道德约束”性质的《前沿责任联合承诺》取代联邦 AI 监管,由企业自行监管自身 AI 技术,且违反协议似乎没有后果。签署者包括 Sundar Pichai、Dario Amodei、Mark Zuckerberg、Greg Brockman、Elon Musk 和 Jensen Huang,六人均公开称赞这一自我监管方案。
NVIDIA 研究生奖学金项目进入第 26 年,现面向全球开放 2027-2028 学年申请,每名学生最高可获 6 万美元资助。申请者须在提交时已完成至少一年博士学习,并须在 2027 年暑期到 NVIDIA 研究办公室完成强制实习。申请截止日期为 2026 年 10 月 30 日。
Databricks 发布新的 AI 函数 ai_decide,由决策模型驱动,可在几分之一秒内对文本评估一个或多个问题,并返回概率、命名标准中的选项或有序评分。它面向模型路由、文档处理、智能体评估等场景,相比 LLM 在类似任务上延迟和成本更低。目前以 Beta 形式提供,可通过 SQL 或 REST API 调用。
一项研究指出,分块 KV 缓存压缩会引入新的位置坐标——token 相对压缩窗口边界的相位,同一信息在不同相位上的检索难度存在系统性差异。在采用此类压缩的大规模开放权重模型中,长上下文检索准确率跨相位最多可相差 40 个百分点,平均基准分数可能掩盖这些周期性弱点。作者从头预训练了多个采用不同 KV 压缩设计的 transformer,并借助因果干预发现不同注意力组件对检索不同源相位信息的贡献不对称。
Databricks 与 OpenAI、Stellantis 讨论企业规模化智能体应用时提出,基础设施需提供选择、上下文和控制三项能力。Databricks 用 Agent Bricks、Omnigent 和 Unity Gateway 分别承担统一平台、跨框架组合和集中管控,避免每个智能体各自形成独立集成与治理项目。
An interview (my questions in italics) with Zephyr Teachout, attorney, author, and law professor that could not be more timely: What’s your background, legal and otherwise, and what makes you interested in these issues? I’m a law professor at Fordham Law School, I’ve drafted tech legislation that has been enacted and p
The AI Race Just Got Awkward ( insufferable.dev ) 09-30 ↑ 179 HN Points
Ling-3.1-flash 公布,总参数约 560B、每 token 活跃参数约 25B,上下文最高 1M token。官方计划近期开源。该模型在 GDPVal-AA v2.1 上取得 1,673 Elo,FrontierSWE 得分 75.16,HealthBench Professional 得分 65.35。
Ideogram 发布了 Ideogram 4.5 图像模型,主打精准编辑。该模型已在 Ideogram 平台、API 及合作服务上线,团队还计划很快公开模型权重。原生 2K 分辨率下,每张图像价格在 0.8 到 22 美分之间。
Ideogram 4.5 已上线 Krea。该模型针对重复编辑场景设计,旨在解决多次编辑通常产生的伪影、像素偏移和色彩漂移问题。
Meta 反驳记者 Jason Aten 关于 Muse AI 在 Mac 上未经许可读取其私信的指控。Meta 通讯副总裁 Andy Stone 表示,Muse 的 Messages 集成完全可选,用户必须同时开启 Full Disk Access 和 Messages 连接器,否则无法读取消息内容。Meta 高管还称相关权限涉及三步应用级授权和 macOS 系统级保护,即使应用存在漏洞也无法绕过。
arXiv 论文提出 Org-Agent,一个面向组织场景的约束中心推理框架,将任务分解为原子子任务并构建依赖图,按拓扑顺序调度执行,同时处理用户身份、权限、信息时效与冲突解决等组织约束。在 MUSES-Bench 和 GroupMemBench 上的实验验证了其在跨用户交互决策与跨用户记忆知识使用两项能力上的有效性,消融实验支持依赖建模与工具使用的贡献。
开发者将 Sparse VideoGen 的时空稀疏注意力在 TPU 上落地,通过跳过空 tile、仅对边界 tile 做精确掩码、把 token 布局改为时间主序,把 1440p 视频生成的去噪时间从 2471 秒降到 1461 秒,实现 1.69 倍端到端推理加速,同时保持 24.05 dB PSNR。
美国联邦贸易委员会(FTC)正式调查 OpenAI、Anthropic 及其他头部 AI 实验室,关注其是否存在消费者保护违规。FTC 计划通过具有法律约束力的要求强制企业交出文件和高管证词。该调查在 Hugging Face 遭黑客攻击前已启动,范围超出此前要求企业为其智能体行为担责的举措。
AMD Helios (partial co-design): AMD revealed the TH6 scale up switch design publicly for the first time. If you look close enough, you can spot all the Broadcom ethernet retimers next to the flyover cables coming from the backplane into the switch ASIC. This design demonstrates AMD's lack of complete silicon product po
y'all keep releasing models faster than I can bench them, but here's the latest pending results for SCB on Sol 6, Opus 5.5, and more (5.5 Max still chugging along) https://t.co/ZDTxKMIvS5
一项研究提出 LibraryDesignBench,用两阶段基准评测智能体为其他智能体设计代码库的能力:设计者按规格实现库,再由三个不同模型家族的用户智能体基于该库写程序,以正确性和简洁性衡量库的质量。基准覆盖 4 种语言、15 个库设计任务、242 个专家验证的编程问题。结果显示,15 个任务中有 11 个设计者复现了人类生产库的抽象;下游智能体对智能体写的库和人类写的库采用率相近,但都使用不足,会重新实现库已提供的能力。
微软研究院开发了一个机器学习系统,可提前30-60分钟预测太空天气对美国本土66935个变电站的损害风险。该系统结合太阳风观测、AE和Dst指数预报、地质导电率和电网数据,在评估期内检测到近80%的重大太空天气事件。
Gemini 推出 Skills 功能,将针对特定任务的指令保存为可复用的快捷方式,用户无需反复输入相同提示词即可直接获得结果。原文仅给出这一功能描述,未提供可用范围、设置方式或效果数据。
DoorDash 周三宣布推出文本点餐 AI 智能体,用户可通过 Apple Messages 发送“点我常点的”等指令,智能体会理解其指周五晚上的订单,并支持指定菜品、本地推荐、发送食物照片,以及处理多人混合饮食偏好和不同数量。该功能在美国开放候补名单。
Google DeepMind 发布 SynthID Bio 概念验证,可在 AI 生成的蛋白质序列和 3D 结构中嵌入不可察觉的水印,同时保持生物功能。湿实验显示,针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三种靶蛋白,带水印的蛋白结合物在命中率、结合亲和力和天然序列多样性上与非水印版本相当。
CoreWeave 在 Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统上线,Cognition 成为首个在生产环境运行该系统的客户。Cognition 用真实软件工程负载测试,Vera Rubin NVL72 的 SWE-2 推理总 token 吞吐较 GB200 NVL72 最高提升 4.8 倍。