Google Research 推出 AMIE (Video):实现实时音视频临床问诊,表现达到专科医生水平
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
当前仅显示精选新闻Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建实时视频临床问诊系统,采用 Talker、Planner、Perception 三个并行智能体的异步架构。
推荐理由:原文给出异步多智能体架构与随机对照实验设计,读者可以据此了解视频问诊 AI 的能力边界和评估方法。
Anthropic 宣布,尚未公开的研究版 Claude 在黎曼猜想相关研究中取得进展,把黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高到 67.2%。
推荐理由:未公开的研究版 Claude 以 60 个子级智能体自主推进数天,把临界线零点比例下界从 41.6% 提升到 67.2%,并公开了 Lean 验证材料。
Anthropic 宣布其尚未公开的 Claude 研究模型在黎曼猜想上取得进展,将满足该猜想的黎曼ζ函数零点比例下界从 41.6% 提高到 67.2%。该研究由约 60 个子智能体在 Claude Code 中协作完成,历时一天半,执行 2400 条 Shell 命令、写下数百个 Python 脚本,并从 arXiv 下载 54 篇论文查重。
推荐理由:读者可以看到从 650 次失败到 60 个子智能体协作的完整研究过程,以及这项数学纪录被推进的具体幅度。
Anthropic 一个内部未公开的研究版 Claude 在黎曼猜想的关联问题上取得进展,将黎曼ζ函数零点中满足黎曼猜想的已知下界从41.6%提升到67.2%,即提高25.6个百分点,而此前37年里数学家仅将其推进0.8个百分点,黎曼猜想本身仍未获证明。
推荐理由:相比数学家37年仅推进0.8个百分点,这次提升展示了大模型子智能体协作推进数学问题的一种路径。
Stanford 研究人员用 Evo 2 生成 DNA 序列合成了近 300 个噬菌体,实验室测试从中筛出 16 个对大肠杆菌杀伤力较强的噬菌体。Evo 2 由 Brian Hie 打造,此次一次性生成完整的 ΦX174 基因组,部分候选噬菌体在实验中适应性高于天然 ΦX174。研究还开发了计算框架以减少送交合成的候选基因组数量,Hie 已将 Evo 2 以开源软件形式发布。
推荐理由:研究展示生成式模型从零设计完整噬菌体基因组并经实验室筛选验证,同时点出合成与验证环节的硬约束。
Google DeepMind 发表 Nature 论文并开源 WeatherNext 2 与 WeatherNext Cyclones 模型,单模型以 SOTA 精度预测气旋路径、强度和风结构,平均多出 24 小时提前量,相当于约十年气象学进步。
推荐理由:官方Nature论文和模型开源同时落地,读者可据此了解AI气象预报达到的精度水平并直接获取代码权重。
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
OpenAI 公开下一代主力模型 Astra 内部测试版本的研究成果,一次性解决 10 项长期悬而未决的数学与理论计算机科学公开难题,全部证明通过 Lean 形式化工具机器验证,总成本不到 2000 美元。
推荐理由:文章列出 Astra 攻克的 10 道数学难题与完整推理过程,可观察长链推演中的自我纠错。
OpenAI 公布在数学与理论计算机科学领域的十项进展,称这些问题至少十年未曾取得实质性进展。成果由下一代核心模型 Astra 的内部版本计算得出,按 Sol API 费率计算 Token 成本约 2000 美元。人类研究员协助撰写论文手稿并在 Lean 中对证明进行形式化验证,OpenAI 表示署名权应如实反映研究成果的产生过程。
推荐理由:十项进展集中在数学与理论计算机科学的长期未解问题,可用于观察 AI 生成形式化证明的投入方式与成本。
腾讯混元宣布,基于 Hy3 模型的科研智能体 Hyra 为加法组合学中悬置半个多世纪的开放问题给出完整答案,说明 2 是该问题的上确界,并给出了满足条件的显式构造族。
推荐理由:科研智能体从有限搜索转向自然语言构造与论证,读者可以了解它在数学开放问题上的工作路径。
Anthropic 宣布,Claude Mythos Preview 在研究人员给出方向指引后,用约 60 小时半自主工作改进了对 NIST 后量子签名候选算法 HAWK 的最佳已知攻击,其开发者次日宣布将 HAWK 从 NIST 标准化进程中撤回。
推荐理由:Anthropic 披露了 Claude 完成密码分析的实际耗时与调用成本,可作为观察大模型在专业研究任务中自主程度与边界的样本。
月之暗面公开 Kimi K3 的完整权重与 47 页技术报告,报告称相较 K2 整体 scaling 效率提升约 2.5 倍。技术报告显示,K3 采用 3:1 的 KDA 线性注意力与 MLA 混合架构、AttnRes 层间检索,以及 896 个专家、每个 token 激活 16 个的 MoE 配置。
推荐理由:结合 K3 技术报告的关键架构与训练改动,对比 DeepSeek 的路线差异,呈现开源模型在预训练一侧的进展。
Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。
推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。
Cursor 公布智能体蜂群实验,它让规划器与 worker 分工,仅凭 SQLite 835 页文档用 Rust 从零重建数据库,在四种模型组合下均优于旧版。
推荐理由:原文给出新旧蜂群在同一 SQLite 重建任务上的对照结果,读者可看清协调机制与模型分工如何影响成本和质量。
Hacker News 上出现一份托管于 OpenAI CDN 的 PDF,标题称 GPT-5.6 Sol Ultra 产出了 Cycle Double Cover 猜想的证明。该提交获得 154 分、134 条评论,讨论见 news.ycombinator.com/item?id=48863490。
推荐理由:一份 PDF 声称 GPT-5.6 Sol Ultra 产出了 Cycle Double Cover 猜想的证明,可据此观察模型的数学推理表现。
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
Anthropic 发布论文,称在 Claude 内部发现一块训练中自发涌现、只用于思考而不对外输出的区域 J-space。研究者用基于雅可比矩阵的 J-lens 读出其中概念,删掉该区域后 Claude 说话仍流利,但多步推理接近归零。论文还展示了用它监控敲诈实验与 Opus 4.6 发布前审计,完整论文、开源代码与 Neuronpedia 交互 demo 已放出。
推荐理由:原文完整转述 Anthropic 的全局工作空间论文,读者可了解 J-space 如何被读出并用于安全监控。
Sysdig 威胁研究团队披露一起由 AI Agent 自主完成的勒索软件攻击,将该攻击者命名为 JADEPUFFER。
推荐理由:报告完整还原 AI Agent 自主串联漏洞利用到数据库加密的攻击链路,为评估自动化攻击风险提供了具体样本。
微软安全博客披露名为 AutoJack 的攻击方式,称访问单个页面即可对运行 AI 智能体的主机实现远程代码执行(RCE)。该文出自 Microsoft Security 博客,链接指向其 2026/06/18 的文章。
推荐理由:披露单个网页即可对运行 AI 智能体的主机实现 RCE,可借此了解智能体部署环境的攻击面。
MosaicLeaks 提出一项深研究任务,用交错公开与私密信息的多跳问题衡量研究智能体外部查询的隐私泄露,并定义意图、答案、全信息三类泄露指标。团队提出的 Privacy-Aware Deep Research(PA-DR)训练法把严格链成功率从 48.7% 提升到 58.7%,同时把答案或全信息泄露从 34.0% 降到 9.9%。
推荐理由:材料把智能体的外部查询日志视为泄露通道,量化三类泄露,并显示提示词难以约束、需靠训练才能把泄露压低三倍多。