跳到正文

#论文/研究

今日 1 条
今天10月2日周五
  1. Google Cloud: Databases66

    Google 威胁情报 group 报告:AI 时代漏洞披露翻倍、高危漏洞利用激增

    Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。

    推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。

10月1日周四
9月30日周三
  1. Apple Machine Learning Research41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

  2. Google Research44

    Google Research 提出 Diffusion Controller:统一并简化 AI 图像生成控制

    Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的闭源模型上实现定制控制。

  3. Anthropic Research73

    Anthropic 研究测量机器人对工作的暴露度:74% 物理任务可由机器人完成但仅 0.3% 具成本竞争力

    Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。

    推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。

9月29日周二
  1. Hugging Face Blog49

    Hugging Face 发布 ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。

  2. Apple Machine Learning Research45

    Apple 研究:语言模型树结构表达式序列化的通信瓶颈

    Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。

9月28日周一
9月27日周日
9月25日周五
9月24日周四
  1. Apple Machine Learning Research39

    Apple 用潜空间蒸馏压缩流式神经音频编码器,2.8 倍压缩下 WER 仅升 1.9%

    Apple 研究团队提出潜空间蒸馏方法压缩流式神经音频编码器(tokenizer),以教师模型量化前的逐帧潜表示为监督目标,仅训练学生编码器做回归,并用单层仿射层吸收师生宽度差异。在 2.8 倍压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方法同时适用于独立预训练和与语言模型联合训练的 tokenizer。

  2. Apple Machine Learning Research26

    Apple 提出半监督联邦 ASR 实用方案:在线伪标签配合服务端更新稳定化

    Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务端标注数据锚定更新两条耦合设计轴,解决伪标签误差跨序列、跨轮次累积导致的训练发散问题。该方案在 11 组对比中 9 组优于此前最强方法,域内平均提升 20.8%、跨域提升 10.0%,缩小了与全监督联邦学习的差距。

  3. Anthropic Research64

    Anthropic Project Swap 实验:Claude 智能体在交易市场代用户换书的表现

    Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。

    推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。

9月23日周三
  1. Apple Machine Learning Research46

    Apple 提出 probe guidance:用冻结内部状态引导流匹配模型

    Apple 研究团队提出 probe guidance,利用现有扩散模型冻结的内部状态构建引导信号,无需在推理时增加额外前向计算。该方法在连续扩散语言模型的无条件生成上刷新 SOTA,应用于 1.7B 扩散语言模型时持续提升多项选择题基准表现。研究还发现,autoguidance 中的弱模型必须来自训练的低熵区域。

  2. Anthropic Newsroom76

    Anthropic:Claude 发现类似 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。

    推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。

9月21日周一
9月19日周六
9月17日周四
  1. Anthropic Research75

    Anthropic:Claude 四周内将 30 多个开源生物分子模型平均加速约 4 倍并开源代码

    Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。

    推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。

9月16日周三
  1. Google Research43

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现单次非自回归的查询扇出,无需推理时的 CoT 思考 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调,旨在解决零样本 LLM 在数据库感知查询分解中的复述坍缩与自回归延迟瓶颈。

9月15日周二
9月13日周日
  1. Sakana AI Blog50

    Sakana AI 提出 PC-ALM:无需反向传播训练 1000 层网络

    Sakana AI 提出 PC-ALM,一种仅靠局部动力学、无需反向传播即可训练 1000 层神经网络的局部学习替代方案。该方法将预测编码推广为使用增广拉格朗日,引入对偶神经元(拉格朗日乘子)参与层内动力学,使每层成为 PI 反馈控制系统以最小化局部预测误差。PC-ALM 能将信号传播到近乎任意深度,在标准预测编码难以学习的深层窄网络中尤其有效,并可能为神经形态硬件上的深度学习提供参考。

9月11日周五
  1. Runway News53

    Runway 详解实时视频生成研究:从 Gen-4.5 后训练到流式输出

    Runway 分享其实时视频生成研究的整体思路,目标是把视频模型从整段生成转向优化首帧时间和随提示流式输出。方法上基于 Gen-4.5 等基础模型做后训练,先将架构改为时间因果、逐帧自回归生成,再通过两阶段分布匹配蒸馏(先 off-policy 后 on-policy)把每帧压缩到几步推理,配合渐增序列长度课程减少误差累积,同时针对并发会话构建推理服务栈。

9月10日周四
  1. Anthropic Research74

    Anthropic 红队发布 AI 模型战术情报定位与常规武器能力评测报告

    Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。

    推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。

9月8日周二
9月4日周五
  1. Google Research44

    Google Research 研究跨人群基因组预测的迁移学习策略

    Google Research 利用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;而遗传相关性高的性状可继续受益于欧洲数据直至目标样本达 25-40k+。

  2. Anthropic Research80

    Anthropic:Claude 用 11 天完成费马大定理首个完整机器验证证明

    Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。

    推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。

  3. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

9月2日周三
  1. Hugging Face Blog52

    Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力

    Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。

8月28日周五
8月27日周四
8月26日周三
  1. Google Research44

    Google 研究 AgentHands:为 XR 中的智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的推理输出映射为 XR 中与语音同步的手势,让 AI 智能体在 3D 空间里用手演示而非仅靠语言描述。系统包含环境感知、手势事件库、手势嵌入推理和 XR 同步执行四个模块,手势按左右手、空间锚定、时序动效等维度分类。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指向上取得显著提升。

8月25日周二
8月22日周六
  1. Google Research41

    Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中优先筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数等新复合特征。

8月21日周五