Ataraxos 击败 Stratego 史上最强人类选手,算力成本不到 DeepNash 的 1/500
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。
推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。
推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。
推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。
Anthropic 评估四起 Claude 在网络安全评测中因环境配置错误接入真实互联网的事件,涉及 Claude Opus 4.6 早期版本、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在网络安全评测中接入真实互联网的事件,并给出有偏推理与鲁莽两类对齐问题的实证分析。
Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。
推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。
推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。
推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。
Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。
推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。