跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

当前仅显示精选新闻

最新精选

第 141–151 条 · 共 151 条
4月1日周三
  1. Factory 研究 / 产品61

    Factory 发布 Legacy-Bench 基准,检验 AI 智能体维护遗留软件的能力

    Factory 发布 Legacy-Bench 基准,用涵盖 COBOL(46%)、Java 7(32%)等六类遗留语言的数百个任务测试 AI 智能体,12 个模型-智能体组合的通过率为 16.9% 至 42.5%,而这些模型在 SWE-bench Verified 等现代基准上得分超过 70%。

    推荐理由:原文用真实遗留代码任务填补现有基准的盲区,给出各模型在 COBOL 等语言上的具体分数和失败模式,可帮助读者评估 AI 智能体处理关键遗留系统的实际能力。

3月18日周三
  1. Google Research77

    Google Research 发表两篇 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查流程

    Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。

    推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。

3月12日周四
  1. Google Research67

    Google AMIE 完成 BIDMC 真实门诊前瞻性可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作完成 AMIE 对话式诊断 AI 的前瞻性单中心可行性研究,100 名成人在初级保健就诊前与 AMIE 对话采集病史,全程由医生实时监督,未发生一次安全中止。

    推荐理由:这是 AMIE 首次在真实门诊流程中开展的前瞻性可行性研究,给出安全性、诊断质量和医患体验的具体数据。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

10月27日周一
  1. Thinking Machines Lab Blog67

    Thinking Machines Lab 提出在线策略蒸馏方法,用更少算力复现 RL 后训练效果

    Thinking Machines Lab 发布关于在线策略蒸馏(On-Policy Distillation)的研究:从学生模型采样轨迹,由教师模型逐 token 计算反向 KL 作为密集奖励,结合 RL 的在线策略相关性与蒸馏的密集信号。

    推荐理由:Thinking Machines 亲自实验并给出复现代码,读者可以据此评估这种训练方法在自己场景下的成本收益。

9月29日周一
  1. Thinking Machines Lab Blog66

    Thinking Machines Lab 发表 LoRA Without Regret:LoRA 在多数后训练场景可追平全量微调

    Thinking Machines Lab 发布 John Schulman 署名的研究,发现在满足两个条件时 LoRA 的样本效率与最终性能与全量微调相当:一是应用于全部权重层尤其是 MLP/MoE 层,二是不受容量限制即数据集规模不超过 LoRA 参数容量。

    推荐理由:原文系统实验给出 LoRA 追平全量微调的两个条件和最优学习率为其 10 倍等可操作结论,可直接指导微调选型。

9月10日周三
  1. Thinking Machines Lab Blog77

    Thinking Machines Lab 解析 LLM 推理不确定性根源并发布批不变内核

    Thinking Machines Lab 发文指出,LLM 推理不确定性的主因不是并发与浮点加法,而是服务器负载变化导致批大小改变,使缺乏批不变性的内核产生不同数值结果。

    推荐理由:原文指出 LLM 推理不确定性的真正来源是批大小变化破坏了批不变性,并给出可实现确定性推理的内核方案与代码。

7月1日周二
  1. Microsoft AI News68

    Microsoft 发布 MAI-DxO,在 NEJM 病例序列诊断基准上正确率达 85%

    Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。

    推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。

4月15日周二
  1. AI as Normal Technology65

    Arvind Narayanan 发布长文论文《AI as Normal Technology》,将 AI 视为常态技术

    Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。

    推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。

8月20日周二
  1. PromptArmor:Threat Intelligence72

    PromptArmor 披露 Slack AI 可经间接提示词注入窃取私有频道数据

    PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者在公开频道发布恶意指令,即可诱使 Slack AI 将用户私有频道中的 API 密钥等敏感数据嵌入钓鱼链接并渲染给用户,且引用不显示攻击者消息导致难以追踪。

    推荐理由:原文给出了完整的攻击链和可操作的缓解设置,读者可以据此评估自己工作区里 Slack AI 的暴露面。

6月26日周二
  1. Sam Altman Blog68

    OpenAI 用 PPO 训练 Dota 智能体击败半职业选手

    OpenAI 用自研强化学习算法 PPO 训练 5 个智能体组成的团队打 Dota,击败了半职业选手。智能体对两周前的旧版本胜率达 90-95%,训练不使用人类对局数据,仅靠自我对弈和人工设计的奖励函数学会游戏。作者认为这说明深度强化学习在算力足够且模拟环境贴合问题时能解决极难问题,有望推广到更像真实世界的场景。

    推荐理由:作者作为当事方说明了不依赖人类对局、靠自我对弈训练的路线,读者可以借此理解强化学习对算力和模拟环境的依赖。