IT之家 10 月 1 日消息,谷歌昨日(9 月 30 日)发布 Gemini 4 Argon,称其为公司迄今最先进的 AI 模型,但目前并未面向公众全面开放。 定位方面,Gemini 4 Argon 是谷歌当前“最先进”模型,重点是长流程软件工程、企业知识工作和网络安全防御。官方称其在真实世界软件工程测试创纪录,网络安全基准并列第一,并在金融、法律等专业任务基准领先。 模型特性方面,Gemini 4 Argon 单次输出上限达到约 100 万 tokens,高于此前的 64,000 tokens,适合处理大型代码库、长文档和多阶段任务。 谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 表示:“Argon
全部 AI 动态
按时间倒序的全量信息流
Magnitude 是一个面向智能体的开源推理引擎,会在你的设备上编译并调优内核,使开放模型运行速度最高达到 llama.cpp 的 2 倍。它支持 Apple Silicon、NVIDIA、AMD 或纯 CPU,提供 macOS、Windows、Linux 桌面应用,可一键连接 Pi、OpenCode、Hermes、Codex 等智能体。官方称 Metal 上解码快 92%、CUDA 上快 19%,每个智能体内存占用减少 27%,且提示、文件和模型均留在本机。
Gemini 4 Argon 是 Google 七个多月来首个前沿模型。独立测试中它追平 GPT-6 Astra,但不及 Anthropic 的 Claude Opus 5.5。每 token 价格虽低,但每个任务消耗的 token 数是 Astra 的两倍多。首批仅限特定测试者访问,API 和付费层级随后开放。
PreviewDiff 是一种免训练、测试时搜索方法,在去噪过程中的选定检查点解码部分预览,由多模态评判器打分并给出自然语言批评,据此分支到语义提示编辑和局部重噪的潜变量延续。在图像和视频生成基准上,它一致优于预算匹配的 Best-of-N 选择和强标量搜索基线。消融显示更早干预和更大搜索宽度带来最大收益。
一项针对循环语言模型(LoopLMs)的受控实验系统考察了循环何时有益、应放在哪里以及条件化方式如何影响性能。研究发现,循环能在训练视野之外提升推理能力,但会损害知识表现;非循环输出层可提高欠展开鲁棒性,而输入输出层的优选位置随推理预算变化。作者提出通道级历史状态注入结合时间步条件化,能以低成本在延长展开下更好保留知识并提升跨预算鲁棒性。
Google DeepMind 发布 Gemini 4 Argon,单次响应最多可生成 100 万 token,此前 Gemini 模型为 64K。该模型面向长周期软件工程、法律与金融企业知识工作以及网络安全防御。定价为输入每百万 token 2 美元、输出 10 美元,优惠期后升至 4 美元和 20 美元。
OpenAI 发布 GPT-6.1 Sol,定位 GPT-6 家族中端模型,在 DeepSWE v1.1 编码基准上以约五分之一成本追平 GPT-6 Astra,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点。标准 API 定价为每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.10 美元,缓存输入较 GPT-6 Sol 降低 50%。
Google 公布下一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中达到前沿性能。初期访问仅限一组“可信网络防御者”,Google 表示正参与美国政府预发布模型访问的自愿流程,并将在更广泛推出前加强关键前沿防护。
Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 软件工程基准上取得 77.9%,在长视频理解 LVBench 上取得 91.7%,在 CWE-bench v1 漏洞修复上以 68% 并列第一。定价为每百万输入 token 2 美元、每百万输出 token 10 美元,输出上限从 64K 提升至 1M token。
Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 得 77.9%、LVBench 得 91.7%、CWE-bench v1 得 68%,并在 Google 内部量子算法优化中将已发布基线提升 40%。输出 token 上限从 64K 扩至 1M,定价为每百万输入 token 2 美元、输出 10 美元。
OpenAI 与 Synopsys 正在联合开发 GPT-Synopsys,这是一款面向芯片设计的专用 AI 模型,目标是像资深工程师一样操作 Synopsys 的 EDA 工具并自主优化设计。目前该模型已开始与半导体客户进行早期测试。
Claude Code v2.1.286 发布,集中修复了 MCP 错误信息泄露凭据值、Bearer 令牌部分脱敏、远程控制会话在策略关闭后仍保持连接等问题。同时改进权限提示、全屏列表鼠标操作和 VSCode 书签功能。
OpenAI 在 Dev Day 上公布了 Decisions API,功能类似 TypeSafe AI 本月发布的 Jev 模型:让模型在预定义选项中输出概率,以极快速度和低成本完成分类或智能体行为选择。Altman 称聚焦选择可保持图像理解、多语言支持和安全保护。Jev 用于监控智能体动作时成本为 2.94 美元,而前沿 LLM 需 372 美元。
论文提出 FRAC,一种基于分数阶动力学的选择性状态空间模型架构,用幂律长记忆替代传统 SSM 的指数遗忘。FRAC 以有限状态、对数间隔的指数模态之和近似重尾目标核,实现并行训练与预填充,同时保留有界状态的自回归解码。在含 1.3B 参数语言建模的实验中,FRAC 在长上下文性能上持续优于最先进的 SSM 基线,短上下文保持竞争力。
ElevenLabs 宣布允许员工以 220 亿美元估值出售部分既得股权,较今年 2 月融资时的 110 亿美元翻倍。此次 3 亿美元员工要约收购由 Wellington 和 T. Rowe Price 共同领投。这是该公司第二次为员工提供二级交易,上一次是 2025 年 9 月以 66 亿美元估值完成的 1 亿美元要约。
Google 正在 Gemini 聊天中用 Skills 取代 Gems。Skills 是详细、可复用的提示词,用户输入“/”即可调用,或由 Gemini 自动运行,其格式基于 Anthropic 的开放标准。Gems 将从 11 月起逐步淘汰,现有 Gems 会自动迁移。
Meta 和 OpenAI 计划在未来一年内推出专用 AI 硬件,路径都是先用可爱软件智能体测试市场。OpenAI 与 Jony Ive 合作的设备不早于 2027 年 2 月发货,Meta 的 Muse Charm 吊坠式设备目标在今年假日购物季前推出。此前 Friend 和 Humane AI Pin 等专用 AI 设备主要引发失望和反弹。
Reddit 宣布将于 11 月 13 日终止 RSS 支持,理由是 RSS 已成为大规模抓取和自动化滥用的常见入口。同时,Reddit 计划在 2027 年 3 月关闭公共 API,影响依赖程序化访问 Reddit 对话的研究工具、社交聆听产品和 AI 助手。
There’s a reason frontier labs have gotten gun-shy about consumer AI — and it’s not because the tech isn’t good enough.
Databricks 发布新的 AI 函数 ai_decide,由决策模型驱动,可在几分之一秒内对文本评估一个或多个问题,并返回概率、命名标准中的选项或有序评分。它面向模型路由、文档处理、智能体评估等场景,相比 LLM 在类似任务上延迟和成本更低。目前以 Beta 形式提供,可通过 SQL 或 REST API 调用。
一项研究指出,分块 KV 缓存压缩会引入新的位置坐标——token 相对压缩窗口边界的相位,同一信息在不同相位上的检索难度存在系统性差异。在采用此类压缩的大规模开放权重模型中,长上下文检索准确率跨相位最多可相差 40 个百分点,平均基准分数可能掩盖这些周期性弱点。作者从头预训练了多个采用不同 KV 压缩设计的 transformer,并借助因果干预发现不同注意力组件对检索不同源相位信息的贡献不对称。
Databricks 与 OpenAI、Stellantis 讨论企业规模化智能体应用时提出,基础设施需提供选择、上下文和控制三项能力。Databricks 用 Agent Bricks、Omnigent 和 Unity Gateway 分别承担统一平台、跨框架组合和集中管控,避免每个智能体各自形成独立集成与治理项目。
The AI Race Just Got Awkward ( insufferable.dev ) 09-30 ↑ 179 HN Points
Ling-3.1-flash 公布,总参数约 560B、每 token 活跃参数约 25B,上下文最高 1M token。官方计划近期开源。该模型在 GDPVal-AA v2.1 上取得 1,673 Elo,FrontierSWE 得分 75.16,HealthBench Professional 得分 65.35。
Ideogram 发布了 Ideogram 4.5 图像模型,主打精准编辑。该模型已在 Ideogram 平台、API 及合作服务上线,团队还计划很快公开模型权重。原生 2K 分辨率下,每张图像价格在 0.8 到 22 美分之间。
arXiv 论文提出 Org-Agent,一个面向组织场景的约束中心推理框架,将任务分解为原子子任务并构建依赖图,按拓扑顺序调度执行,同时处理用户身份、权限、信息时效与冲突解决等组织约束。在 MUSES-Bench 和 GroupMemBench 上的实验验证了其在跨用户交互决策与跨用户记忆知识使用两项能力上的有效性,消融实验支持依赖建模与工具使用的贡献。
开发者将 Sparse VideoGen 的时空稀疏注意力在 TPU 上落地,通过跳过空 tile、仅对边界 tile 做精确掩码、把 token 布局改为时间主序,把 1440p 视频生成的去噪时间从 2471 秒降到 1461 秒,实现 1.69 倍端到端推理加速,同时保持 24.05 dB PSNR。
美国联邦贸易委员会(FTC)正式调查 OpenAI、Anthropic 及其他头部 AI 实验室,关注其是否存在消费者保护违规。FTC 计划通过具有法律约束力的要求强制企业交出文件和高管证词。该调查在 Hugging Face 遭黑客攻击前已启动,范围超出此前要求企业为其智能体行为担责的举措。
AMD Helios (partial co-design): AMD revealed the TH6 scale up switch design publicly for the first time. If you look close enough, you can spot all the Broadcom ethernet retimers next to the flyover cables coming from the backplane into the switch ASIC. This design demonstrates AMD's lack of complete silicon product po
y'all keep releasing models faster than I can bench them, but here's the latest pending results for SCB on Sol 6, Opus 5.5, and more (5.5 Max still chugging along) https://t.co/ZDTxKMIvS5
一项研究提出 LibraryDesignBench,用两阶段基准评测智能体为其他智能体设计代码库的能力:设计者按规格实现库,再由三个不同模型家族的用户智能体基于该库写程序,以正确性和简洁性衡量库的质量。基准覆盖 4 种语言、15 个库设计任务、242 个专家验证的编程问题。结果显示,15 个任务中有 11 个设计者复现了人类生产库的抽象;下游智能体对智能体写的库和人类写的库采用率相近,但都使用不足,会重新实现库已提供的能力。
月之暗面的 Kimi K3 和智谱的 GLM-5.3 现已在 OpenAI 的 Codex 内销售,费用从现有 OpenAI 承诺额度中支付。提供服务的美国公司 Baseten 称模型运行在美国服务器上,不保留提示词。中国媒体称这是首次:中国开放权重模型出现在 OpenAI 账单上。
Kled 发布 V3,定制 AI 数据采集任务可在 72 小时内部署到 50 万以上贡献者。平台提供 108 个可配置任务模板,覆盖图像、视频、音频、文本和标注,每天可采集 800 万个数据点。
一项研究考察在线策略蒸馏(OPD)在弱到强、同基座、强到弱三种师生配置下的规模特性。结果显示,早期训练中留出准确率(gold score)随学生初始化反向KL散度的平方根近似线性上升;在所有弱到强配对中,学生的峰值gold score都超过其教师。
DoorDash 工程团队公开了其自建的 Agent Gateway 设计:它统一处理 AI 智能体发现和调用工具时的权限校验、凭证管理、工具目录筛选、请求转发与审计记录。该网关已承载超过 200 个注册 MCP 服务器、30 多个智能体和服务,每周处理数百万次工具调用。
这篇论文提出,持续学习中数据归因、遗忘和可塑性损失由同一种演化的更新-行为交互支配。作者对单 token 学习如何改变另一 token 预测做了 token 级和层级分解,分离 softmax 力、共享读出几何与残差连接后得到两个交互通道和一个可前向计算的近似。正向交互标识有用经验,负向交互产生集中碰撞或累积侵蚀,长期更新会重塑共享几何、削弱未来学习信号传输。
论文提出轨迹自适应进度-波动调度器(TAPS),在线跟踪循环更新中持续进展与中心化波动的平衡并自适应调整步长。理论上给出TAPS降低期望终端损失、以更少循环达到目标质量的充分条件;实验显示无需重训练即可提升结构化推理任务的终端精度,将进度-波动原则纳入训练后,在匹配基线精度下最高获得1.56倍墙钟加速。
ALICE 是一个互信息估计基础模型,仅在合成分布上训练,即可对未见分布进行上下文内零样本估计,无需逐分布训练。它通过估计整流流速度场,再用固定恒等式积分联合与条件场差的平方得到互信息。在标准基准上,单个模型首次缩小了与逐分布训练神经估计器的差距,并支持不同数据维度和样本基数,已应用于生物学、遗传学和神经科学。
网络安全研究机构 Glow Security 发现,多个 AI 智能体创建的公开 GitHub 仓库中存在超 1.3 万张屏幕截图,部分包含科技公司敏感信息。这种泄密方式被称为“PixelLeak”,源于智能体为展示项目修改前后对比图而将截图上传到公开仓库。目前已有 343 家公司以这种方式泄露敏感信息。
发布了一个新的 /tools API,允许智能体从 Server Tools Marketplace 获取数据,包括市场最优价格,并以编程方式使用这些数据。