跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

最新精选

第 21–28 条 · 共 28 条
7月9日周四
  1. Google Research61

    Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练

    Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。

    推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。

5月16日周六
5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月17日周五
  1. AI as Normal Technology74

    Sayash Kapoor 等人提出开放世界评测并发布 CRUX 项目,AI 智能体成功上架 iOS 应用

    Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。

    推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。

3月18日周三
  1. Google Research77

    Google Research 发表两篇 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查流程

    Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。

    推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。

2月24日周二
  1. AI as Normal Technology70

    AI as Normal Technology 团队发布论文《Towards a Science of AI Agent Reliability》

    Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。

    推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。

7月1日周二
  1. Microsoft AI News68

    Microsoft 发布 MAI-DxO,在 NEJM 病例序列诊断基准上正确率达 85%

    Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。

    推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。

4月15日周二
  1. AI as Normal Technology65

    Arvind Narayanan 发布长文论文《AI as Normal Technology》,将 AI 视为常态技术

    Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。

    推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。