跳到正文

#论文/研究

今日 31 条
9月29日周二
  1. Hugging Face Daily Papers41

    Tacit-TTS:从自回归解码到掩码预测的高效无转写语音克隆

    Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。

  2. Hugging Face Daily Papers36

    FlexRouter:为灵活 LLM 路由学习互补模型集合

    FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。

  3. Hugging Face Daily Papers36

    RASO:通过跨 Harness 适配的检索增强技能优化

    研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。

  4. Hugging Face Daily Papers35

    音频-视觉大语言模型中的“问题接力”机制与 SECRET 去幻觉方法

    音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。

  5. Hugging Face Daily Papers40

    LoopVL:循环视觉智能

    LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。

  6. Hugging Face Daily Papers38

    NEEDLE:通过权重正交化移除 LLM 后门

    NEEDLE 提出一种无需训练的后门移除方法,在识别触发词后,通过激活向量估计后门方向和拒绝子空间,并应用顺序权重正交化来抑制后门,同时防止拒绝相关表征发生变化。该方法无需干净参考模型或原始中毒训练数据。在多个模型家族和攻击类型上的评估中,NEEDLE 取得了最低的平均攻击成功率(ASR),在具有挑战性的代码注入攻击上达到 0%,且 KL 散度最低,能力和安全性变化最小。

  7. Hugging Face Daily Papers36

    TERRA:面向肌肉骨骼运动的地形感知重建、重定向与控制

    TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。

  8. Hugging Face Daily Papers33

    E-MoE:面向非因子化扩散语言模型的增强型混合专家架构

    E-MoE提出将反向生成过程构建为基于MoE骨干网络专家路由决策的离散共享隐变量上的因子化分布混合,在不增加活跃参数的前提下提升少步生成质量。在合成多模态基准、二值化MNIST和LM1B上,E-MoE均优于因子化基线模型,缓解了掩码扩散模型在少步场景下因位置因子化导致的样本质量限制。

  9. Hugging Face Daily Papers32

    自注意力在竞争下的检索容量研究

    研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。

  10. Hugging Face Daily Papers45

    Prompt2Skill:仅凭自然语言指令实现无监督技能优化

    Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。

  11. Hugging Face Daily Papers33

    CorrGRPO:面向多奖励学习的相关性归一化 GRPO

    CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。

  12. Apple Machine Learning Research45

    Apple 研究:语言模型树结构表达式序列化的通信瓶颈

    Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。

  13. Hugging Face Daily Papers42

    针对黑盒 LLM 的受控解码攻击

    研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

9月28日周一
  1. Hugging Face Daily Papers37

    Endless Exam:面向超级智能的数学构造基准,覆盖 14 类参数化问题族

    研究者推出 Endless Exam 基准,覆盖 14 个参数化数学构造问题族,用可验证的相对质量分数衡量模型在已发表数学前沿之前与之后的进展,且不将改进上限封顶为 1。在 69 个实例上评测 9 个模型,连续质量分数能区分表现差异,但 30 个已发表前沿参考无一被超越。该基准已开源生成器、验证器、参考基线、模型回答与分析,并新增 Claude Opus 5.5 评测。

  2. Hugging Face Daily Papers42

    Tex-Zero:无需 3D 资产也能训练原生 3D 纹理生成模型

    研究团队提出 Tex-Zero,证明高保真原生 3D 纹理生成框架无需 3D 资产即可训练。该方法将高质量 2D 图像表示为 3D 空间中的平面,并通过分块随机旋转与聚合构造复杂几何结构,生成训练样本。基于这些数据训练的 Tex-Zero VAE 和 Tex-Zero DiT 在未见过真实 3D 资产的情况下,仍能生成细节精细的高保真 3D 纹理。

  3. Hugging Face Daily Papers35

    FAR:面向世界模型的自适应多线索情景记忆召回框架

    研究者提出 Future-Aware Recall(FAR),一个从未来感知预测监督中学习情景记忆召回的框架,通过负扩散预测损失近似条件对数似然来衡量记忆的预测效用,并训练一个推理时对未来盲的检索器。该检索器能学习各线索的相关性,自动决定每个查询该信任时间、姿态、视觉、音频中的哪些线索。在三种互补设置下,FAR 即使使用相同检索线索也优于手工设计的召回方法。

9月27日周日