#编码
#编码
今日 2 条
Rohan Paul@rohanpaul_aiAI 评分4141
Hugging Face Daily PapersAI 评分3838 AgSpec:突破检索式推测解码在编码智能体流水线中的极限
AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。
Apple Machine Learning ResearchAI 评分4343 Apple 提出 RLTL;DR:通过内化自生成反馈实现自我提升
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
Apple Machine Learning ResearchAI 评分5555 Apple 与 EPFL 研究:强模型做自主 ML 工程时复杂 harness 不占优势
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
AK@_akhaliqAI 评分2525LEGO-Anything 面向 3D 场景重建的编码智能体 论文:https://huggingface.co/papers/2609.36380

Anthropic Research精选AI 评分7373 物理学家 Schwartz 分享用 Claude 与 BootLoops 做跨领域定量科学的方法与成果
物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。
推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。
Hugging Face Daily PapersAI 评分3333 Rules to Tools:为科学计算中的 LLM 智能体提供可执行检查
Rules to Tools(R2T)为科学计算场景的 LLM 智能体提供公开科学需求的可执行检查,在 SciCode 修复任务中,工具组完整修复达 29/30,纯文本组为 26/30。
Hugging Face Daily PapersAI 评分3333 CorrGRPO:面向多奖励学习的相关性归一化 GRPO
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
Hugging Face Daily PapersAI 评分4343 CUA-SWE:当 Computer-Use Agent 遇上可视化软件工程
研究者推出 CUA-SWE,一个面向"计算机使用+软件工程"的 benchmark、环境与评测流水线,覆盖四个软件工程领域,要求智能体在同一任务内改代码与配置、执行命令、操作运行中的软件并查看视觉反馈。每个任务配有确定性的专属测试,用于验证软件是否满足需求并保持既定行为。该工作评测前沿智能体如何结合源码级执行与应用截图、图形交互,产出经过验证的软件改动。
Microsoft Research@MSFTResearchAI 评分2424
Microsoft Research精选AI 评分6969 Microsoft Research 发布开源智能体框架 Orchard
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
Import AIAI 评分6363 Import AI 466:机器人学的苦涩教训、AI完成周级编程任务与OpenAI模型意外黑客事件
本期Import AI覆盖多件事:Epoch与METR发布MirrorCode基准,Claude Opus 4.7用14小时、251美元推理成本重实现人类需2至17周完成的程序。
Berkeley AI ResearchAI 评分4444 Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。
Hugging Face BlogAI 评分5252 IBM 发布 ScarfBench:评测 AI 智能体的企业级 Java 框架迁移能力
IBM Research 发布开放基准 ScarfBench,用于评估 AI 智能体在 Spring、Jakarta EE、Quarkus 之间的企业 Java 框架迁移任务,包含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Sierra BlogAI 评分5757 Sierra 发布 𝜏-knowledge 基准,评测智能体的真实知识库检索与多步工具调用能力
Sierra 发布 𝜏-knowledge,扩展其 𝜏-bench 对话基准,新增 𝜏-Banking 域,包含 698 篇文档、21 个产品类别(约 195K tokens),任务平均需查阅 18.6 篇文档和 9.5 次工具调用。