推荐理由:论文给出长任务可靠性下降的具体数字,并附带可迁移的做法,适合构建长流程智能体时参考。
精选
最新精选
Rohan Paul@rohanpaul_ai精选AI 评分6565
Rohan Paul@rohanpaul_ai精选AI 评分6868
推荐理由:原文给出了 Cogentic 多智能体证明发现系统的结构设计与验证结果,其中的严格审查与已证工作记录方法可迁移到长任务 Agent 设计。
The Decoder精选AI 评分8181 Ataraxos 击败 Stratego 史上最强人类选手,算力成本不到 DeepNash 的 1/500
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
Anthropic Research精选AI 评分7373 物理学家 Schwartz 分享用 Claude 与 BootLoops 做跨领域定量科学的方法与成果
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
Anthropic Research精选AI 评分7373 Anthropic 研究测量机器人对工作的暴露度:74% 物理任务可由机器人完成但仅 0.3% 具成本竞争力
Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。
推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。
Anthropic Research精选AI 评分7272 物理学家复盘 Claude 在 N=4 super Yang-Mills 完成 nine loops 散射振幅挑战
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
Anthropic Research精选AI 评分6464 Anthropic Project Swap 实验:Claude 智能体在交易市场代用户换书的表现
Anthropic 让 201 名员工的 Claude 智能体在六个办公室的去中心化交易楼层代用户交换书籍。5 分钟 intake 对话后,Claude 对书对的排序与本人一致率达 61%,市场效率 0.55(最优 0.89),其中 85% 的差距来自偏好表征不准而非谈判;重跑显示模型选择比指令更影响谈判结果,Opus 楼层效率 0.88 高于 Haiku 的 0.75。
推荐理由:原文把市场失分的 85% 归因于偏好表征而非谈判能力,并给出模型选择比指令更影响结果的可复现数据。
Hugging Face Blog精选AI 评分6363 IBM Research 为 ALTK-Evolve 推出 Consistency Analyzer,将智能体一致性缺口从 24.4pp 降到 12.0pp
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。
Anthropic Research精选AI 评分7474 Anthropic 红队发布 AI 模型战术情报定位与常规武器能力评测报告
Anthropic 前沿红队发布新评测,测量模型在战术情报定位(基于碎片信息找人)和常规武器开发(如编写无人机制导软件)上的能力,显示部分任务上模型能做到过去只有稀缺专家才能做的事。
推荐理由:原文用自建评测给出模型在情报定位和武器开发任务上的具体表现与模型间差距,读者可据此理解这类双用途能力的分布。
Anthropic Research精选AI 评分8181 Anthropic 发布四起 Claude 网络安全评测中误连真实互联网事件的对齐评估
Anthropic 评估四起 Claude 在网络安全评测中因环境配置错误接入真实互联网的事件,涉及 Claude Opus 4.6 早期版本、Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型,共 7 次运行。
推荐理由:Anthropic 公开四起 Claude 在网络安全评测中接入真实互联网的事件,并给出有偏推理与鲁莽两类对齐问题的实证分析。
Anthropic Research精选AI 评分8080 Anthropic:Claude 用 11 天完成费马大定理首个完整机器验证证明
Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。
推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。
Google Research精选AI 评分6464 Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组
Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。
Hugging Face Blog精选AI 评分6262 Hugging Face 用三项测试量化语音识别中的基准优化现象
Hugging Face 提出三项测试量化 ASR 模型的基准优化(benchmaxxing)行为,评估 11 个开源模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 的错误参考转写。
推荐理由:原文给出三种可量化的探针方法,让读者能据此区分语音模型的真实转写能力与针对基准的拟合行为。
Google Research精选AI 评分6262 Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
AI as Normal Technology精选AI 评分6767 Princeton 团队用 shadow evaluations 测试前沿 Agent 的开放式 AI 研究能力,专家否决了两篇 Agent 论文
Sayash Kapoor 等人发布论文,用 shadow evaluations 让前沿 AI Agent 回答两篇未发表论文的核心研究问题,各给数千美元 API 额度和六天时间,原论文作者明确否决了两篇 Agent 论文。
推荐理由:原文提出 shadow evaluations 方法,用未发表论文测试前沿 Agent 的开放式研究能力,并给出五个具体失败模式,可迁移到对 RSI 进展的评估。
Microsoft Research精选AI 评分6969 Microsoft Research 发布开源智能体框架 Orchard
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
Google Research精选AI 评分6767 Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估
Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。
推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。
Google Research精选AI 评分6161 Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
Google Research精选AI 评分6363 Google Research 发布 PHRM 系统,用手机前摄在日常生活中被动监测心率与静息心率
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前摄视频,在日用手机过程中后台跟踪心率与每日静息心率(RHR)。
推荐理由:原文给出跨肤色验证数据和开放数据集申请入口,读者可以据此评估手机摄像头被动心率监测的可用性。
Sierra Blog精选AI 评分6464 Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。