跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 1–20 条 · 共 27 条
今天10月2日周五
  1. Google Cloud: Databases66

    Google 威胁情报 group 报告:AI 时代漏洞披露翻倍、高危漏洞利用激增

    Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。

    推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。

10月1日周四
  1. The Decoder78

    OpenAI 称已阻止窃取其模型推理内容的行动,但同样手法在 Azure 上仍然有效

    OpenAI 称 7 月拦截了一起窃取其模型思维链用于蒸馏的行动,7 月 24 至 25 日流量激增至来自超 4000 名用户的 16000 次请求,关联账号网络超 15000 个,7 月 28 日已全部封禁,OpenAI 将核心团伙与 Moonshot AI(Kimi 模型开发商)相关人员联系起来,并注明这些是未遂提取。

    推荐理由:原文串起 OpenAI 的蒸馏攻击拦截和研究者的复测结果,能帮读者看清同一模型在不同云平台防护不一致的问题。

9月30日周三
  1. Anthropic Research73

    Anthropic 研究测量机器人对工作的暴露度:74% 物理任务可由机器人完成但仅 0.3% 具成本竞争力

    Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。

    推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。

9月26日周六
  1. Anthropic65

    Anthropic 发文称,Claude 在收到单个九圈问题提示词后,在 Claude Science 中基本无人监督地运行数天,用 Dixon 等人的方法完成求解,总成本几千美元,突破了此前八圈的纪录(平面 N=4 超杨-米尔斯简化模型)。物理学家 Lance Dixon 独立验证了结果,von Hippel 为该博客撰写了经历回顾。

    推荐理由:九圈散射振幅计算由 Dixon 独立验证,计算成本仅几千美元,为学界评估 AI 科研能力提供了一个可核验的案例。

9月24日周四
  1. Anthropic Research64

    Anthropic Project Swap 实验:Claude 智能体在交易市场代用户换书的表现

    Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。

    推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。

9月23日周三
  1. Anthropic Newsroom76

    Anthropic:Claude 发现类似 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。

    推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。

9月17日周四
  1. Anthropic Research75

    Anthropic:Claude 四周内将 30 多个开源生物分子模型平均加速约 4 倍并开源代码

    Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。

    推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。

9月10日周四
  1. Anthropic Research74

    Anthropic 红队发布 AI 模型战术情报定位与常规武器能力评测报告

    Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。

    推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。

9月9日周三
  1. Eric70

    OpenAI 宣布给出纳维-斯托克斯千禧年大奖难题的一个解,证明由一组智能体使用比 GPT-6 Astra 能力更强的 OpenAI 下一代模型产出。该问题关注纳维-斯托克斯方程描述的光滑三维流体运动是否会崩溃,约 90 年来未获解决。转发作者以在 OpenAI 工作的口吻感叹又是一个疯狂的日子。

    引用OpenAI@OpenAI

    We’re sharing a solution to the Navier-Stokes Millennium Prize Problem, one of the deepest problems at the frontier of mathematics. The proof was produced by a group of agents, using an OpenAI next-generation model significantly more capable than GPT-6 Astra. The problem concerns whether the description of smooth three-dimensional fluid motion modeled by the Navier-Stokes equations can break down. It has remained unresolved for roughly 90 years.

    推荐理由:OpenAI 官方宣布用下一代模型的智能体群产出纳维-斯托克斯千年问题证明,读者可以关注智能体做数学研究的这一路径。

9月8日周二
9月4日周五
  1. Anthropic Research80

    Anthropic:Claude 用 11 天完成费马大定理首个完整机器验证证明

    Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。

    推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。

  2. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

8月21日周五
8月12日周三
  1. Google Research62

    Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。

    推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。

  2. Google Research66

    Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。

    推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。

8月6日周四
  1. Google DeepMind83

    Google DeepMind 开源 WeatherNext 气旋预报模型,Nature 论文显示精度领先一天

    Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。

    推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。

8月5日周三
  1. AI as Normal Technology67

    Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文

    Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。

    推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。

7月23日周四
  1. Google Research67

    Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估

    Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。

    推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。

7月9日周四
  1. Google Research61

    Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练

    Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。

    推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。