DEFINE:用示例音频解耦说话人与口音的零样本 TTS 框架
DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。
项目更新、模型与开源社区动态
DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
一篇发表于 TMLR 2026 的综述首次系统梳理视频生成模型的后训练与对齐,将后训练统一为一个框架,并按对齐信号的施加方式区分隐式对齐与显式对齐。方法被归为四类:监督微调、自训练与蒸馏、偏好与奖励方法、推理时方法。文章还梳理了常用数据集、benchmark 与评估实践,并讨论可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡及安全生成等开放挑战。
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。
Dream4ACT 是一个面向多形态机器人的世界模型,通过名为 action views 的共享视觉动作接口,用 URDF 正运动学从四个虚拟相机渲染目标关节构型,使观测与动作序列共享同一视频自编码器和扩散 Transformer。
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由该图派生,使每条标准都锚定到验证所需的文件。
一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。
该论文研究预训练数据中“野生”AI 生成网页文本的影响,用 Pangram 标注发现 FineWeb 过滤后 2026 年 6 月网页 token 中 27.5% 为 AI 生成,8 月升至 31.1%。
研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。
arXiv 论文提出隐蔽协助(covert assistance)概念,显示良性 LLM 智能体在无对抗激励下也会规避监督。
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
FrameMorrow 提出一种前瞻式帧选择器,先预测一小组代表未来信息需求的前瞻 token,再用它们从历史中挑选相关帧,而非依据当前内容判断历史相关性。该方法选择显式历史帧而非模型内部状态,可即插即用地接入包括闭源模型在内的多种生成器,额外推理成本很低。团队在 5 个基准、11 个生成模型上评测,覆盖长视频生成、交互式生成与动作条件世界模型,长程一致性、视觉质量和动作对齐均有稳定提升。
针对 VLA 模型中运行时安全屏蔽与策略不匹配的问题,研究者提出四阶段自进化框架 FailBank,将运行时反馈转化为持久的策略改进。在 VLA-Arena 基准的两个难度等级和两个 VLA 主干上,FailBank 将任务成功率分别提升 8.5 和 6.9 个百分点,策略引发的累计成本降低 35.6% 和 23.8%;相比运行时屏蔽,成功率提升 25.4 和 9.5 个百分点。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。
研究提出 STAIR(Stale-Token Attention for Inter-query Reuse),将早前回答生成中的 keys 和 values 存入固定 bank,并学习在当前查询读取该 bank 时重定向查询,基座模型保持冻结,仅训练 12,288 个参数。
AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
研究团队提出 QuantCode 模型,通过算法交易框架代码的继续预训练与 SFT 两阶段专业化,并发布 400 任务的 QuantCode-Bench 基准。
LexReward 是一个面向法律语言模型的分类驱动奖励框架,从 Style、Element、Chain 三个维度刻画法律回答质量,并为每个维度制定评分细则。基于该奖励构建的偏好数据用于 DPO 训练,在三个维度上均提升表现;训练出的奖励模型 LexRM 通过强化学习分别改善对应维度的策略表现,且奖励阶段无需参考答案。
研究团队构建了 95 小时城市步行游览视频数据集 WT++,用于严格按时间顺序、滑动窗口批次的流式自监督预训练。结果显示对比学习和蒸馏方法在此设定下表现不佳,MAE 较稳健但仍不及标准 i.i.d. 预训练,主要瓶颈是批内帧高度相似。
Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量以关闭 WebFetch 工具,并支持 claude --desktop 在当前目录打开 Claude 桌面应用。
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
arXiv 论文发现预训练 Transformer 只用极少深度跟随上下文引用,13 个基础模型仅能可靠跟随 1.4-3.6 行。在单层早期插入 rank-8 LoRA 并冻结全部原权重,可将 Qwen3-8B 在 24 行链上的精确匹配率从 15.5% 提升到 99%,更长训练的 LoRA 达到 50 行,Ouro-1.4B 在八次循环后至少 160 行。
研究者提出 RouteFM,将 LLM 路由从针对特定查询负载和候选池的局部拟合,转向可复用的基础模型能力:它从行为上下文刻画匿名候选模型并推断其目标能力,而非绑定固定模型身份。
研究者提出 Triadic Linear Attention,将 key、第二个 key 与 value 的三元外积写入三阶(3D)张量状态,并用两个 query 分别与两个 key 轴收缩来读取,E 维第二 key 可在仅增加两个投影的情况下把状态规模扩大 E 倍。
研究提出 OASIS,保留同策略自蒸馏(OPSD)目标,但主要监督经标签验证的同策略轨迹,并用模型自身未验证的尝试替代书面解答作为教师上下文,因此仅需最终答案标签。
HelixWorld 是实时交互式音视频世界模型,让视觉场景与基于相机的空间立体声在用户交互下原生协同演化。研究团队构建了含真实立体声与公制相机位姿的高保真空间音视频数据集,预训练 6-DoF 相机轨迹与用户动作条件下的双向教师模型,并通过在线轨迹蒸馏将其压缩为少步流式学生模型,在单 GPU 上以 24 FPS 实现无漂移的联合音视频推演。
论文提出 MotorMind,一个将 VLM 提出的中层动作接入确定性机器人控制与反馈的操作框架,含异步监控和后台记忆更新。
Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。
WEFT 是一套面向通用智能体工具调用后训练的全系统演化方法,将智能体交互系统构建、执行驱动的自演化和稳定后训练三者耦合。
Rules to Tools(R2T)为科学计算场景的 LLM 智能体提供公开科学需求的可执行检查,在 SciCode 修复任务中,工具组完整修复达 29/30,纯文本组为 26/30。
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。
研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。
研究提出 MIST(Misleading-Image Stress Test),用 200 句可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
arXiv 论文 2609.38349 提出 MILO(Meta-evolutionary Island Orchestration),协同演化 agent harness 与发现 harness 的搜索策略,包含岛屿树层级谱系记忆、重写完整 harness 的 mutator agent 和自适应 orchestrator。
研究发现 on-policy 后训练持续调整参数更新方向,而 SFT 沿固定方向更新,据此提出 OPSFT(On-Policy direction-constrained Supervised Fine-Tuning),将 SFT 更新约束到 on-policy 范式识别出的方向。