星期四 · 12 条
T The Decoder @Matthias Bastian 精选
AI 评分 87
Google Gemini 4 Argon 缩小与 OpenAI 和 Anthropic 的差距,但未取得明显领先

Gemini 4 Argon 是 Google 七个多月来首个前沿模型。独立测试中它追平 GPT-6 Astra,但不及 Anthropic 的 Claude Opus 5.5。每 token 价格虽低,但每个任务消耗的 token 数是 Astra 的两倍多。首批仅限特定测试者访问,API 和付费层级随后开放。

Google 模型发布 评测/基准 OpenAI

推荐理由:The Decoder 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
M MarkTechPost @Asif Razzaq 精选
AI 评分 90
Google DeepMind 发布 Gemini 4 Argon:单次响应可输出 100 万 token,面向编码、知识工作和网络防御

Google DeepMind 发布 Gemini 4 Argon,单次响应最多可生成 100 万 token,此前 Gemini 模型为 64K。该模型面向长周期软件工程、法律与金融企业知识工作以及网络安全防御。定价为输入每百万 token 2 美元、输出 10 美元,优惠期后升至 4 美元和 20 美元。

Google 模型发布 编码 安全/对齐

推荐理由:MarkTechPost 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
M MarkTechPost @Michal Sutter 精选
AI 评分 90
OpenAI 发布 GPT-6.1 Sol:编码与计算机使用接近 Astra,价格仅为其五分之一

OpenAI 发布 GPT-6.1 Sol,定位 GPT-6 家族中端模型,在 DeepSWE v1.1 编码基准上以约五分之一成本追平 GPT-6 Astra,并比 GPT-6 Sol 最佳成绩高 6.4 个百分点。标准 API 定价为每百万 token 输入 2 美元、输出 10 美元、缓存输入 0.10 美元,缓存输入较 GPT-6 Sol 降低 50%。

OpenAI 模型发布 编码 智能体

推荐理由:MarkTechPost 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
T The Verge AI @Jay Peters 精选
AI 评分 89
Google 发布 Gemini 4 Argon,初期仅限“可信网络防御者”使用

Google 公布下一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御等复杂工作流中达到前沿性能。初期访问仅限一组“可信网络防御者”,Google 表示正参与美国政府预发布模型访问的自愿流程,并将在更广泛推出前加强关键前沿防护。

Google 模型发布 安全/对齐

推荐理由:The Verge AI 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
AI 评分 75
Google 发布 Gemini 4 Argon:面向网络防御者的新一代前沿模型

Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 软件工程基准上取得 77.9%,在长视频理解 LVBench 上取得 91.7%,在 CWE-bench v1 漏洞修复上以 68% 并列第一。定价为每百万输入 token 2 美元、每百万输出 token 10 美元,输出上限从 64K 提升至 1M token。

模型发布 安全/对齐 推理 Google

推荐理由:Hacker News popular via buzzing.cc 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
AI 评分 92
Google 发布 Gemini 4 Argon:面向长程推理与网络安全防御的前沿模型

Google 宣布推出前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放。该模型在 DeepSWE v1.1 得 77.9%、LVBench 得 91.7%、CWE-bench v1 得 68%,并在 Google 内部量子算法优化中将已发布基线提升 40%。输出 token 上限从 64K 扩至 1M,定价为每百万输入 token 2 美元、输出 10 美元。

Google 模型发布 推理 安全/对齐

推荐理由:Google DeepMind Blog 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
T The Decoder @Matthias Bastian 精选
AI 评分 86
OpenAI 与 Synopsys 合作开发 GPT-Synopsys,让 AI 像资深工程师一样设计芯片

OpenAI 与 Synopsys 正在联合开发 GPT-Synopsys,这是一款面向芯片设计的专用 AI 模型,目标是像资深工程师一样操作 Synopsys 的 EDA 工具并自主优化设计。目前该模型已开始与半导体客户进行早期测试。

OpenAI 模型发布 行业动态

推荐理由:The Decoder 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
T TechCrunch AI @Tim Fernholz 精选
AI 评分 78
OpenAI 推出 Decisions API,对标 TypeSafe 的 Jev 快速决策模型

OpenAI 在 Dev Day 上公布了 Decisions API,功能类似 TypeSafe AI 本月发布的 Jev 模型:让模型在预定义选项中输出概率,以极快速度和低成本完成分类或智能体行为选择。Altman 称聚焦选择可保持图像理解、多语言支持和安全保护。Jev 用于监控智能体动作时成本为 2.94 美元,而前沿 LLM 需 372 美元。

智能体 模型发布 OpenAI

推荐理由:TechCrunch AI 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
AI 评分 82
FRAC:用分数阶状态转移为长序列建模引入幂律长记忆

论文提出 FRAC,一种基于分数阶动力学的选择性状态空间模型架构,用幂律长记忆替代传统 SSM 的指数遗忘。FRAC 以有限状态、对数间隔的指数模态之和近似重尾目标核,实现并行训练与预填充,同时保留有界状态的自回归解码。在含 1.3B 参数语言建模的实验中,FRAC 在长上下文性能上持续优于最先进的 SSM 基线,短上下文保持竞争力。

论文/研究 数据/训练 模型发布

推荐理由:Hugging Face Daily Papers 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
X X:蚂蚁百灵 @AntLingAGI 精选
AI 评分 87
Ling-3.1-flash 发布:约 560B 总参数、25B 活跃参数,计划开源

Ling-3.1-flash 公布,总参数约 560B、每 token 活跃参数约 25B,上下文最高 1M token。官方计划近期开源。该模型在 GDPVal-AA v2.1 上取得 1,673 Elo,FrontierSWE 得分 75.16,HealthBench Professional 得分 65.35。

模型发布 开源/仓库 评测/基准

推荐理由:X:蚂蚁百灵 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
X X:Testing Catalog @testingcatalog 精选
AI 评分 83
Ideogram 发布 4.5 图像模型,主打精准编辑,2K 原生分辨率每张 0.8 至 22 美分

Ideogram 发布了 Ideogram 4.5 图像模型,主打精准编辑。该模型已在 Ideogram 平台、API 及合作服务上线,团队还计划很快公开模型权重。原生 2K 分辨率下,每张图像价格在 0.8 到 22 美分之间。

图像生成 模型发布 开源/仓库

推荐理由:X:Testing Catalog 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
AI 评分 84
TPU 上加速视频扩散的时空稀疏注意力:1440p 生成端到端提速 1.69 倍

开发者将 Sparse VideoGen 的时空稀疏注意力在 TPU 上落地,通过跳过空 tile、仅对边界 tile 做精确掩码、把 token 布局改为时间主序,把 1440p 视频生成的去噪时间从 2471 秒降到 1461 秒,实现 1.69 倍端到端推理加速,同时保持 24.05 dB PSNR。

视频 推理 部署/工程 模型发布

推荐理由:Google Developers Blog 发布的新动态包含 AI 产品、模型或工程信号;摘要可帮助先判断是否需要打开原文深读。
星期三 · 28 条
Google DeepMind 推出 SynthID Bio:为 AI 生成蛋白质嵌入可验证水印

Google DeepMind 发布 SynthID Bio 概念验证,可在 AI 生成的蛋白质序列和 3D 结构中嵌入不可察觉的水印,同时保持生物功能。湿实验显示,针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三种靶蛋白,带水印的蛋白结合物在命中率、结合亲和力和天然序列多样性上与非水印版本相当。

安全/对齐 模型发布 Google 论文/研究
AI 评分 59
蚂蚁百灵发布 Ling-3.1-flash:约 560B 总参数、25B 激活参数,免费体验两周

蚂蚁百灵发布 Ling-3.1-flash 模型,总参数约 560B,每个 Token 激活约 25B 参数,上下文窗口上限为 1M。官方称围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景提升能力。模型将开放为期两周的免费体验,期间服务长度为 256K;付费后计划开放 1M 上下文,并计划同步开源。

模型发布 智能体 开源/仓库
改进的分布扩散模型:ImageNet-256 上 4 步 FID 达 4.48

该论文提出两项改进让分布扩散模型(DDM)可用于现代图像生成:把多粒子扩展推迟到 Transformer 后期层,并引入随时间变化的评分规则调度。在 DiT-XL/2 与类条件 ImageNet-256² 上,单一模型从头训练、无教师或自蒸馏,4 步 FID 为 4.48,50 步为 2.38,且采样预算从 4 增至 50 NFE 时 FID 不退化。

图像生成 论文/研究 模型发布
T The Decoder @Maximilian Schreiner
AI 评分 76
Anthropic 称智谱开源模型 GLM-5.3 构建漏洞利用能力接近 Claude Mythos Preview

Anthropic 称智谱开源权重模型 GLM-5.3 在编写网络漏洞利用方面几乎与 Claude Mythos Preview 相当。其较小的 Flash 变体按智谱 API 价格仅花 20.40 美元就组装出一个可靠的 Chrome 攻击。该模型的安全防护容易被剥离,未锁版本已在流传。美国机构 CAISI 支持这些发现。

安全/对齐 模型发布 开源/仓库 行业动态
AI 评分 75
中国大模型首次进入 OpenAI 企业付费结算体系,Kimi K3 接入 Codex 企业通道

Baseten 宣布与 OpenAI 合作,成为其 B2B 市场首批开源模型推理服务提供商之一。企业用户可通过 Codex 或 Responses API 调用 Kimi K3 和 GLM 5.3,这是中国开源模型首次进入 OpenAI 企业采购体系。Kimi K3 参数规模达 2.8 万亿,原生支持视觉能力,上下文窗口为 100 万 Token。Baseten 承诺所有模型运行在美国服务器,并对所有提示词实行零数据保留。

OpenAI 模型发布 行业动态 开源生态
X X:小北 @frxiaobei
AI 评分 84
Anthropic 评估智谱 GLM-5.3:网络攻击能力已接近 Claude Mythos Preview

Anthropic 发文评估智谱 GLM-5.3,称其在 Chrome V8 漏洞利用任务中 410 次尝试成功 50 次,接近 Claude Mythos Preview 的 56 次。案例中,GLM-5.3 在隔离环境里发现浏览器多个未知漏洞并串联成读取电脑文件的网页;GLM-5.3-Flash 用 8 小时、约 20 美元 API 费用做出可用攻击链,人类只投入约 20 分钟。

安全/对齐 评测/基准 Anthropic 模型发布
AI 评分 71
微软研究院推出多模态 AI 研究系统 Project Quine,目标加速药物发现

微软研究院与哈佛大学、博德研究所共同推出实验性多模态 AI 研究系统 Project Quine,用于生物学研究,覆盖基因组学、蛋白质、化学、细胞状态和生物成像的联合表征,并与交互式推理框架结合。微软称该系统目前仅限科研使用,不用于临床,所有结果须经严格人工评估。在胰腺导管腺癌细胞系测试中,系统用一个周末筛选出能推动细胞状态从经典型向基底样型转变的化合物。

多模态 智能体 模型发布 Microsoft
X X:X.PIN @thexpin
AI 评分 84
DeepSeek 发布昇腾工具包:TileLang、DeepGEMM、DeepEP 等六组件对齐英伟达版本

DeepSeek 发布了一套昇腾工具包,包含 TileLang、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,与其英伟达组件对齐。官方称训练中使用的每个 TileLang kernel 现在都有高性能昇腾实现,TileLang 支撑 V4 系列训练的大部分 kernel。DeepSeek 与华为还联合优化了 128 卡昇腾 950 超节点,关键计算和通信测试据称接近硬件极限。

DeepSeek 部署/工程 开源/仓库 模型发布
X X:Rohan Paul @rohanpaul_ai
AI 评分 71
阶跃星辰发布 StepAudio 3 Music:文本描述加歌词直接生成完整歌曲

阶跃星辰发布音乐生成模型 StepAudio 3 Music,可将文本描述和歌词合成为完整歌曲。技术报告比较了单码本与残差向量量化方案,最终分词器采用 50 Hz 单码流、65,536 个条目,后接 flow-matching DiT 渲染器。一个关键工程发现是:更好的音频重建并不必然带来更好的音乐生成。

模型发布 多模态
Chinese-Jev:面向中文任务的 System One 决策模型

Chinese-Jev 是一个面向中文决策任务的 System One 模型,采用统一数据处理与训练流程,将异构中文标注转为候选选项上的概率目标。模型使用轻量 encoder-only 骨干,先在 1000 万示例通用语料上预训练,再分别针对医疗、法律、金融领域微调。首阶段预训练后在通用任务上比闭源 Jev 准确率高 1.24%,速度提升 20.3 倍;领域微调后在医学上比 Jev 高 4.0%,平均延迟仅 15 ms。

模型发布 端侧 数据/训练 评测/基准
TabFM:面向表格数据的零样本基础模型,400M 参数在 TabArena 51 个基准上排名第一

TabFM 是一个 400M 参数的表格基础模型,把监督式表格预测表述为上下文学习,单次前向传播即可给出校准的零样本预测,无需任务特定调优。它完全在结构因果模型生成的合成表上训练,在 TabArena 全部 51 个基准数据集(38 个分类、13 个回归)上,零样本 TabFM 在默认表格基础模型中排名第一,并优于调优后的 AutoML 流程。

论文/研究 数据/训练 模型发布
PrismQuant:面向分组量化器的最优零空间旋转方法

PrismQuant 提出一种量化器感知的旋转框架,将激活主特征空间与非对称分组 INT4 的常量组子空间对齐,并把旋转设计形式化为 Ky Fan 迹最大化问题,给出可证明最优的闭式解。在 Llama-3.1-70B 上,W4A4KV4 量化达到 3.85 困惑度和 72.46% 平均零样本准确率,仅比全精度低 0.22 个百分点。

模型发布 推理 论文/研究 开源/仓库
AI 评分 79
DeepSeek 开源面向华为昇腾算力平台的基础设施组件

DeepSeek 于 9 月 30 日宣布开源面向华为昇腾算力平台的基础设施组件,包括 TileLang 高级语言编译工具、计算库和分布式通信库,与此前英伟达平台组件一一对应。TileLang 昇腾版本封装 Ascend C 底层指令,提供高级语言编程方式且不损失硬件性能;DeepSeek 训练中用到的每个 TileLang 算子都有对应的昇腾高性能实现。开源组件还包括 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,在多项关键测试用例中计算与通信性能已接近硬件上限。

DeepSeek 开源/仓库 部署/工程 模型发布
X X:Kim @kimmonismus
AI 评分 83
Anthropic 称智谱可下载 GLM-5.3 接近 Claude Mythos Preview 的漏洞利用能力,安全护栏易被绕过

Anthropic 表示,智谱可公开下载的 GLM-5.3 在漏洞利用能力上接近 Claude Mythos Preview。在 ExploitBench 上,GLM-5.3 在 410 次尝试中构建了 50 个可用的浏览器漏洞利用,Mythos Preview 为 56 个。另一项受控实验中,研究人员用 GLM-5.3 发现未知浏览器漏洞并组合成可读取测试机文件的网页。Anthropic 还报告在不同护栏绕过条件下,恶意请求的响应率为 64% 到 100%。

安全/对齐 模型发布 Anthropic
M MarkTechPost @Asif Razzaq
AI 评分 66
Liquid AI 发布 d1 决策模型:零输出 token 返回校准概率

Liquid AI 发布 d1,一个面向结构化选择的决策模型,不生成文本。用户提供上下文和一组带类型的问题,模型在单次调用中返回固定结果集上的校准概率,usage.output_tokens 始终为 0。目标场景包括分类、工单路由、评分、审核、重排序和 LLM-as-judge 检查。目前以托管 API 形式提供,模型名为 d1:free,无自托管权重。

模型发布 推理 产品更新