跳到正文

论文研究

值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。

当前仅显示精选新闻

最新精选

第 101–120 条 · 共 130 条
6月18日周四
6月17日周三
  1. Google Blog: AI69

    Google 在 Nature 发表 AMIE 研究:医疗 AI 从诊断对话扩展到长期疾病管理

    Google 在 Nature 发表研究,展示医疗 AI 系统 AMIE 从一次性诊断对话扩展到使用药物目录和临床指南的长期疾病管理,该系统基于 Gemini 模型的长上下文能力,包含共情对话智能体和深度思考的管理推理智能体。

    推荐理由:盲测中 AMIE 的整体疾病管理推理与 21 名全科医生持平,计划精确度和指南一致性更高。

6月12日周五
  1. Anthropic Newsroom63

    Anthropic 发布首份 Public Record 调查:64% 美国人担忧 AI 导致失业

    Anthropic 公布首轮 Anthropic Public Record 调查结果,2025 年 11 月至 12 月面向 51,993 名美国人开展,48% 将治愈癌症、阿尔茨海默病等疾病列为对 AI 的前三期待,36% 选择帮助残障人士。

    推荐理由:调查覆盖近5.2万名美国人,给出公众对AI的希望与担忧分布,可作为后续态度变化的基线。

6月8日周一
  1. Google DeepMind64

    Google DeepMind 发布塞拉利昂 Gemini Guided Learning 教学试验结果

    Google DeepMind 公布在塞拉利昂开展的预注册试验结果,使用 Guided Learning 的学生数学成绩较对照组提升 0.258 个标准差,约合 1.2 到 1.7 年的典型学习进度,八周内完成。

    推荐理由:预注册试验给出了量化学习增益和保护批判性思维的交互数据,为评估 AI 辅助教学提供了可对照的证据。

6月6日周六
  1. @kimmonismus69

    剑桥大学研究人员开展了其所称的全球首个由 AI 设计的疫苗成分人体试验,共 39 人参与,主要测试安全性。该疫苗使用 AI 设计的超级抗原,研究人员把多种已知冠状病毒的基因数据喂给 AI,由其设计出可覆盖整个冠状病毒家族的抗原,以应对病毒变异或从动物传人。

    推荐理由:剑桥团队把 AI 设计的超级抗原推进到人体试验阶段,免疫反应有限,但验证了这条路径可被测试。

6月5日周五
  1. 数字生命卡兹克 · 微信公众号79

    Anthropic 发布万字长文《当 AI 开始构建自己》,讨论递归自我改进

    Anthropic 研究院发布长文《当 AI 开始构建自己》,用公开基准和此前未披露的内部数据说明 AI 已在加速 AI 系统自身的开发。文中称 Anthropic 工程师平均每季度交付的代码量是 2021 至 2025 年间的 8 倍,Claude 在最开放任务上的成功率在 2026 年 5 月达到 76%,六个月内提高 50 个百分点。

    推荐理由:Anthropic 用内部数据展示 Claude 在写代码和做研究上的进展,读者可据此理解递归自我改进这一趋势的早期证据。

5月25日周一
5月23日周六
  1. @berryxia66

    Anthropic 上月启动的 AI 网络安全合作项目 Project Glasswing,一个月内与合作伙伴在生产环境中发现超过一万条高危或关键漏洞,均来自核心软件而非实验室模拟。

    引用Anthropic (@AnthropicAI)@AnthropicAI

    Last month we launched Project Glasswing, our collaborative AI cybersecurity initiative. Since then, we and our partners have found more than ten thousand high- or critical-severity vulnerabilities in essential software.

    推荐理由:Anthropic 披露 Glasswing 项目一个月在生产环境扫出上万条高危漏洞,可对照传统安全团队的发现量级。

5月21日周四
  1. @kimmonismus86

    OpenAI 称其内部推理模型自主推翻了数学家 Paul Erdős 在 1946 年提出的平面单位距离问题猜想,找到了比正方形网格更优的新点构型,性能提升为固定多项式因子。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:OpenAI 称推理模型自主推翻 Erdős 猜想,作者补充了选题由 OpenAI 决定这一前提,便于读者评估结论边界。

  2. @AYi_AInotes69

    AI 处理数学问题的思维链长达125页,大部分时间用于构造反例,而非死磕证明,OpenAI 目前已公开精简版。数学家 Gowers 在审稿中表示,评估 AI 生成证明的重要性时他会问它是否教给我们关于这个问题的新东西,他认为答案是肯定的,这显示代数数论在离散几何里还有大量我们从未发现的连接。

    推荐理由:材料点出 AI 解题的思维链长达125页且多在构造反例,并附上数学家 Gowers 的审稿评价,可看到 AI 参与数学研究的实际形态。

  3. @AYi_AInotes79

    OpenAI 宣布其模型推翻了数学界近 80 年对平面单位距离问题的判断,找到一整族比方格子效率更高的新构造。该问题由 Paul Erdős 在 1946 年提出,模型借助无限类域塔、Golod–Shafarevich 理论等代数数论工具求解,125 页思维链已公开并经数学家验证。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:原文呈现 AI 自主解决数学开放问题的过程,读者可了解它如何把冷门数论工具带入几何难题。

  4. @polynoamial79

    OpenAI 分享称,一个通用内部模型在平面单位距离问题上取得突破,推翻了数学界近 80 年来认为最优解近似方格网格的看法,发现了一族性能更优的全新构造。该问题由 Paul Erdős 于 1946 年提出,OpenAI 称这是 AI 首次自主解决数学领域一个著名开放问题。作者提到不到 1 年前前沿 AI 模型还处于 IMO 金牌水平,并预期这一进展速度会持续。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:OpenAI 称其内部通用模型推翻平面单位距离问题近 80 年的网格假设,读者可据此判断 AI 自主做数学研究的进度。

  5. @SherylHsu0276

    OpenAI 表示其模型在平面单位距离问题上取得突破,推翻了数学家近 80 年来认为最优解接近方格网的判断,并发现了一类表现更好的全新构造。该问题由 Paul Erdős 于 1946 年提出,OpenAI 称这是 AI 首次自主解决数学领域一个重要开放问题。转发此消息的作者称训练这个模型的经历让当下成为特别的时刻。

    引用OpenAI (@OpenAI)@OpenAI

    Today, we share a breakthrough on the planar unit distance problem, a famous open question first posed by Paul Erdős in 1946. For nearly 80 years, mathematicians believed the best possible solutions looked roughly like square grids. An OpenAI model has now disproved that belief, discovering an entirely new family of constructions that performs better. This marks the first time AI has autonomously solved a prominent open problem central to a field of mathematics. Video

    推荐理由:OpenAI 模型推翻了数学界近 80 年的判断,可作为观察 AI 自主数学发现能力的一个参照。

  6. @OpenAI69

    OpenAI 表示,一项离散几何猜想的证明由一个通用推理模型给出,而不是专门为解数学题或该问题构建的系统。该结果被视为数学与 AI 社区的一个重要里程碑,详情见 https://openai.com/index/model-disproves-discrete-geometry-conjecture/。

    推荐理由:OpenAI 说明该证明出自通用推理模型而非专为数学问题打造的系统,读者可据此了解结果在数学与 AI 交叉领域的意义。

5月20日周三
5月16日周六
  1. @kimmonismus67

    三位研究者用 Anthropic 的 Mythos 构建出可用的 macOS 内核漏洞利用,绕过了 Apple M5 的内存完整性强制(MIE)机制。该漏洞 4 月 25 日发现、5 月 1 日做出可用利用,团队没有破解 MIE 而是绕过它,属于无指针操作的数据型攻击,从非特权用户直达 root,并前往 Apple Park 当面提交报告。55 页技术报告将在 Apple 完成修复后发布。

    引用International Cyber Digest (@IntCyberDigest)@IntCyberDigest

    Video of exploit in action. Source: blog.calif.io/p/first-public… Video

    推荐理由:三位研究者用 AI 模型做出绕过 Apple M5 MIE 的内核漏洞利用,读者可看到 AI 辅助安全研究的一条具体路径。

5月15日周五
  1. @berryxia66

    Prime Intellect 让 Claude Code(Opus 4.7)和 Codex(GPT 5.5)在 nanoGPT speedrun 的 optimizer track 上完全自主运行,使用闲置算力完成约 1 万次实验、共约 1.4 万 H200 小时,Claude Code 把记录推进到 2930 steps,低于人类基准 2990 steps。

    引用Prime Intellect (@PrimeIntellect)@PrimeIntellect

    Automating AI research is the next major step in AI We let Claude Code (Opus 4.7) and Codex (GPT 5.5) run autonomously on the nanoGPT speedrun optimizer track using our idle compute. ~10k runs, ~14k H200 hours Opus now holds the record at 2930 steps vs the 2990 human baseline

    推荐理由:Prime Intellect 用闲置算力让智能体自主优化 nanoGPT 训练,显示其擅长组合已有方法但在创新上受限,实验日志已开源。

5月11日周一
  1. Thinking Machines Lab Blog73

    Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览

    Thinking Machines Lab 发布交互模型研究预览,模型原生处理音频、视频和文本的实时交互,而非依赖外部 harness。TML-Interaction-Small 为 276B 参数 MoE(12B 激活),采用 200ms 微轮次多流设计和无编码器早期融合,并配合异步后台模型处理深度推理。

    推荐理由:原文给出交互模型的技术路线、架构细节和基准对比,读者可据此评估原生交互与外挂式实时方案的能力差距。