无需训练的长度自适应解码:Entropy-Valley 提升掩码扩散机器翻译
研究者提出 Entropy-Valley(EV),一种无需训练的长度选择器,通过全掩码前向传播的平均预测熵为候选目标画布打分,选出骨干模型最易填充的长度。相比基于训练语料长度统计的基线,EV 在 En→Zh、Zh→En、En→De 上分别恢复了参考目标长度所带来 COMET-22 增益的 64.9%、65.3% 和 33.0%。
项目更新、模型与开源社区动态
研究者提出 Entropy-Valley(EV),一种无需训练的长度选择器,通过全掩码前向传播的平均预测熵为候选目标画布打分,选出骨干模型最易填充的长度。相比基于训练语料长度统计的基线,EV 在 En→Zh、Zh→En、En→De 上分别恢复了参考目标长度所带来 COMET-22 增益的 64.9%、65.3% 和 33.0%。
研究提出 Best Practice Critic Optimization(BPCO),通过结合 DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化策略优势和长度自适应广义优势估计,解决 critic 训练不稳定的问题。
AutoSaddler 提出自动 harness 优化框架,把 harness 改进建模为离线学习问题,利用 mini-batch 的失败信号迭代更新 harness,并结合失败轨迹诊断、把 harness 当作代码的结构化补丁生成和基于验证的更新筛选。
研究者提出 OPDVR,将 on-policy 蒸馏(OPD)与可验证奖励强化学习(RLVR)无缝结合且不引入任何额外超参数。该方法先基于轨迹正确性重构采样 token OPD 的隐式奖励,再用 ReLU 门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而把采样 token OPD 变成标准 RLVR 方法,可直接搭配 GRPO 等策略梯度算法。
研究提出 Recuris,一种面向长程智能体框架的递归经验工作记忆架构,由工作记忆跟踪任务进度,并从经验记忆中引导技能选择,使技能调用贴合当前需求而非完整历史。
研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。
Meta^n 提出一种保持元操作 Ω 固定、对其自身产物递归的自我改进方法,深度由收敛而非预设决定,并用进化档案搜索层链。在两个骨干模型上,Meta^n 在全部八个基准系列上超越此前的自我改进智能体,在 ARC-AGI-2 上是唯一得分高于零的方法。消融实验显示递归收益主要来自各层传递给下一层的条件信息,且随深度涌现出未被提示词规定的层角色。
研究者提出 CAFE(Coupled Agent–Feedback Evolution)框架,让共享参数模型在搜索智能体与 critic 两种角色间交替,先基于基础智能体自身失败轨迹初始化反馈条件下的纠错,再耦合在线与离线优化。
研究者推出 LongRCA Bench,包含来自五个来源的 1,140 条完整失败轨迹,全部人工标注责任角色与最早决定性根因步骤,参考根因距任务完成中位数为 48 步,28.4% 的轨迹后续步骤超过 100 步。在 DeepSeek-V4-Flash 上,五个基线中最强者仅达 13.2% 根因步骤精确准确率;提出的免训练方法 RCTA 将这一指标提升至 24.1%,责任角色准确率达 51.1%。
研究提出一种前缀不变性审计方法,只需两次前向传播、无需训练或梯度,即可给出逐层分数定位因果性断裂位置。在八个 checkpoint 的 192 次注入故障试验中,掩码检查未检出任何一例,该审计将 192/192 全部定位到确切层。对 transformers 分块扫描代码的静态与动态分析还在 Zamba2 和 Nemotron-H 中发现同一跨块轴错误,并通过参考实现修复。
Claude Code 发布 v2.1.246,为 `/permissions` 新增 Auto mode 标签页,用于查看和编辑 auto mode 分类器规则,并在回合耗时行末尾显示完成时间。该版本还修复了全屏模式缩放后空白、超长单行 diff 导致转录卡顿、后台会话启动失败等问题,并修正 MCP 工具参数在空 schema 下被当作 JSON 字符串发送的错误。
研究者用训练于数百万张星系图像的 Transformer 模型 AstroPT 作为校准测试平台,发现星系属性的涌现顺序固定且与已知难度一致:直接写入像素的波段星等训练早期即可解码,红移和比恒星形成率等推断量则出现更晚、位于更深层。该顺序不受测试的训练目标影响,随模型容量在幅度上扩展但顺序不变,线性探针方向还能恢复星系属性间已知的物理结构。
ClawProBench 是一个基于 OpenClaw 实时智能体运行时的轨迹感知基准,包含 102 场景完整版与 68 场景冻结留出集两条赛道,按正确性、过程质量与效率的安全门控公式从执行轨迹打分。
针对 RAG 证据利用率测量失真与上下文预算分配不佳两大瓶颈,研究者提出因果留一探针,揭示标准相关性代理在难负样本上的"诊断幻觉",并证明一味扩大上下文会因相关性衰减而受罚。
研究团队提出量化感知修复(QAH),将 4-bit 学生模型直接从原始未压缩模型蒸馏,替代默认的量化感知训练(QAT)。在 GPT-OSS 120B 到 60B 再到 MXFP4 的流水线上,QAH 学生模型在 9 项基准中的 7 项追平或超过其 bfloat16 源模型,权重内存约为原来的 1/4,参数量为教师模型的一半,并以 Hypernova-60B 开源发布。
研究者提出 EvoMap,将验证器确认的执行轨迹固化为结构化 Gene,并发布 LongWoF-Bench,包含代码生成、智能体环境合成、数学推理和规则遵循四类共 778 个机器可验证任务。
AutoResearch 是一个两阶段自主研究系统,将想法生成与想法执行打通:生成阶段融合新兴研究信号与领域知识,用多模型生成和交叉评审产出可验证的研究计划;执行阶段由智能体拆解实验并做独立证据评审。在 RSICD 基准上,其生成的想法将平均 Recall 从 32.84 提升至 34.69,审计确认的问题事件仅 5 起,其他自主研究系统为 11-27 起。
研究者构建了无脸呈现攻击数据集 TPO,用番茄、土豆和洋葱的活体、打印与重放录像替代人脸,基于基础模型的检测器在四个标准跨数据集人脸 PAD 基准上平均 AUC 达 92.70%,优于合成人脸训练并与真实人脸数据集训练相当。
EXPL-FR 通过轻量适配器将 VLM 图像编码器对齐到冻结的人脸识别(FR)空间,仅用人脸图像训练、不使用文本,同一适配器可直接作用于文本编码器,把 22 个类别共 978 条属性提示词转为 FR 空间锚点。
WorldToken 将每个时间步的观测编码为单个 world token,用因果 Transformer 处理历史并以扩散动作头生成动作块,仅 85M 参数就在 RoboCasa 上取得 59.4% 平均闭环成功率,接近 3.35B 参数的 π0.5。
研究对比了混合量子启发式 Kolmogorov-Arnold 网络(HQKAN)与 MLP 在联邦平均(FedAvg)下进行心电信号分类的效果。在 MIT-BIH 五分类任务上,HQKAN 可训练参数减少 37.35%、通信成本降低 24.89%;在 INCART 三分类任务上分别减少 44.81% 和 36.41%,同时多数聚合指标与少数类指标均有提升。
针对十亿级容量下原始用户行为数据扩展收益递减的问题,研究提出 User Behavioral Densing Law,刻画数据规模与最小充分 tokenization 容量之间的定量关系。
研究者发布 Industrial-Instruction 框架,基于 906 份 Panasonic 公开技术报告(7,525 页)构建两个开放问答数据集,各含约 13.6k 条 QA 对及留出基准测试集。
RIBOSPAN 是一个 1.61B 参数的双向 RNA 基础模型,原生预训练上下文长度达 10,240 nt,结合密集双向自注意力、单核苷酸 tokenization 与注意力隔离序列打包,实现完整长 RNA 的单核苷酸分辨率建模。
一项能力导向研究以传统模拟器的八项能力为标尺,梳理了 2018 年至 2026 年 6 月的 200 篇代表性工作,覆盖 latent dynamics、视频生成与联合嵌入预测三条技术路线。
研究者提出 Environment-Regularized Policy Optimization(ERPO),用 Query-KL(QKL)项约束训练查询分布漂移,替代动作侧的 Policy-KL 正则化,从而保留响应侧的探索空间。
EchoWM 是一个全模态世界模型,面向可进入的生成式媒体,在连续导航下联合生成 720p 视频、环境声音、音乐和语音。它围绕摄像机意图组织交互,把离散指令与连续位姿映射到统一的米制尺度相对 6-DoF 轨迹,并通过数据引擎、渐进训练和自回归后训练支持长时程生成。公开世界模型基准上的评测显示其轨迹跟随与视觉质量较强,可支持第一人称和第三人称交互,并保持环境声音与语音的同步。
论文提出 Thinkingbox,一个面向工具、智能体与用户交互的沙箱,提供隔离的 MCP 兼容工具会话、完整执行轨迹以及基于终端后端状态的结果评测。
Block3D 是一种分块扩散框架,将离散形状 token 序列切分为连续块,自回归逐块生成并联合去噪块内所有 token,同时引入置信度引导的块内修正来缓解误差累积。在 TRELLIS-500K 的留出集上,Block3D 将平均端到端生成时间从 25.71 秒降至 4.99 秒,相比微调后的自回归基线实现 5.15 倍加速,且不牺牲几何保真度。
论文提出 FORGE 基准,在 15 个品类 225 个真实产品、5 类消费场景上测试 12 款商用与开源 LLM,发现单页被污染网页就能造成最高 27% 的受骗率,将 top-3 检索结果全部替换为假产品后升至 73.8%。
MobilePA-Bench 是一个交互式、有状态、以工具调用为核心的移动规划智能体基准,运行在可执行沙箱中,覆盖 13 个功能领域和 212 个真实移动工具。除基础工具使用外,它还从子智能体协作、记忆使用和技能使用三个维度评估规划智能体。实验显示,当前前沿 LLM 在严格工具顺序、权限限制和运行时错误下表现明显下降。
研究发现,实体图链接与迭代改写这两种 RAG 扩展会放大 ASR 错误:在 HotpotQA、2WikiMultiHopQA 和 MuSiQue 三个多跳 QA 基准上,两者组合时从干净文本到最高 WER 口音的 F1 差距比朴素稠密检索大 36-67%。
Claude Code 发布 v2.1.245,修复了在搭载 glibc 2.44 的 Linux 发行版(如 Arch Linux、CachyOS 和 Fedora Rawhide)上的启动崩溃问题。
Task-CoEvolve 通过让验证任务与 harness 协同演化,用基于历史结果的方差加权采样聚焦能力前沿附近的任务,并从部分评估中估计全集分数。在在线文本分类和 Terminal-Bench 2.1 上,它匹配全量搜索的最终性能,同时将优化过程中的评估次数减少 80%。代码将开源。
针对开放域交互中同一组 rollout 行为不可比导致奖励偏好扭曲相对优势的问题,研究者提出训练方案 ARC(Advantage Regularization via Conditioning),通过策略条件化分组、混合奖励与熵正则恢复更公平的相对比较。
研究者推出 GameXpert-Bench,用 GameGen、GameFix、GameOpt 三条赛道分别评测编程智能体的游戏生成、缺陷诊断修复与多轮优化能力,共含 11 类 97 个生成任务、50 个游戏关卡衍生的 100 个修复任务(每个注入 19-27 个 bug)以及 17 条六轮优化链、102 个请求。
针对图像编辑中编辑概念粒度关注不足与稀疏监督导致训练低效的问题,研究者构建了包含超 1,000 个细粒度编辑概念的分层分类体系,并通过改进的合成框架搭建了 1,200 万高质量编辑对数据集 ConceptEdit-12M。同时提出密集监督训练策略,将多个互不干扰的概念合成到单张图像对中,显著提升训练效率与模型性能,并推出细粒度评测套件 ConceptEdit-Bench。
Prime Agent 是一个面向长程评估与编码智能体工作流的开源 harness,用持久 IPython REPL 实现递归语言模型抽象,Continual Harness 跨轨迹保留历史、记忆、技能、提示词和子智能体规范,递归子智能体之间可直接通信。
针对 On-policy 蒸馏(OPD)中教师奖励与真实推理进展不一致的问题,研究者提出 R2-OPD,通过构建教师奖励与独立估计的进展奖励两种轨迹内排序,在两者不一致时选择性抑制蒸馏奖励。该方法在推理表现上持续优于标准 OPD。论文编号 arXiv:2608.19408。
ReWorld 是一个交互式世界模型,通过混合注意力窗口与随机头路由分离控制与记忆,推理时用固定预算的 KV cache 加姿态索引地标库实现长时记忆。它经 LoRA 分布匹配蒸馏将采样压缩至 4 步,可实时流式生成 704x1280 视频。在 64 秒往返 rollout 中,其 12 chunk 固定缓存仍能重建起始视角,旋转误差 11.95°。