SourceLearn:让 LLM 智能体从知识访问转向来源学习
针对 LLM 智能体反复使用同一外部来源却只当作重复访问的问题,研究者提出 SourceLearn,通过自导向来源学习和任务引导来源学习两种机制构建并持续优化持久化来源模型。在五个 benchmark 和三个 LLM 后端上,SourceLearn 在 15 个设置中的 13 个取得最佳表现,相比 Hybrid RAG 最高提升 22.6 分。
huggingface.co · 开发者平台
针对 LLM 智能体反复使用同一外部来源却只当作重复访问的问题,研究者提出 SourceLearn,通过自导向来源学习和任务引导来源学习两种机制构建并持续优化持久化来源模型。在五个 benchmark 和三个 LLM 后端上,SourceLearn 在 15 个设置中的 13 个取得最佳表现,相比 Hybrid RAG 最高提升 22.6 分。
SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,从准确性、输出质量、机制保真度、控制与因果完整性、运行域鲁棒性和动态响应六个维度评估智能体。对六个智能体系统的评测显示,最佳系统总分仅 42.86,结构相似度无法代表工程性能,部分高分模型仍存在严重的视觉布局混乱问题。
Latent-MOPD 是首个面向 LLM 的表征级多教师同策略蒸馏(OPD)方法,无需额外教师训练即可同时利用专家的预测分布与隐藏状态进行监督。在同族教师设置下,它在数学、代码、逻辑共 9 个基准上全面超越仅 token、仅表征和均匀平均基线,且参数量与单个教师相同时多数基准超过最佳教师;跨族教师下也在全部基准上优于单通道基线。
ProWAM 是一种渐进式世界动作模型,通过联合预测动作与有序稀疏视觉子目标,为动作生成提供显式视觉引导。它只需单次视频骨干前向传播缓存子目标特征,避免迭代式全视频生成。在 LIBERO-Plus 上达到 85.8%、随机化 RoboTwin 上 75.7%,零样本真实场景成功率 70.0%,较最强基线提升 15.0 个百分点。
研究者提出 Local Support Learning(LSL),一种无需访问旧数据即可在梯度训练中保留模型原有能力的通用框架,通过权重适配器与基于高斯混合模型(GMM)的门控函数配合,使更新仅作用于当前训练分布。该方法可在最高 70 亿参数的 LLM 上缓解灾难性遗忘,跨多个训练阶段同时保留预训练与微调能力,且内存与计算高效、对超参数稳健并具备扩展潜力。
CANOPY 是一个面向多模态 RAG 的自适应粒度检索后证据压缩框架,将检索项表示为层级结构,用基于 gold evidence 微调的节点编码器对区域打分,并通过父级相对细化在不同粒度上选取多个区域,无需 LLM 调用即可完成节点级剪枝。
OctLLM 将几何以八叉树占用 token 的显式 3D 序列输入模型,通过随机清空倒数第二层节点并省略后代,生成更短的 S-Octree 用于位置感知掩码建模生成与 3D 理解。
研究者提出 SBERT2S1,将 Sentence-Transformers 编码器转换为双编码器、cross-head(C)与 prior-fused residual(PFR)决策模型,并发布生物医学类型化决策套件 BIODECIDE 及源自 NLM 索引的 243k 条训练决策 MEDLINE-S1。
VeriHarness 将生成用的 LLM 变为智能体验证器,通过工作区、证据工具和可复用验证技能,对多次采样结果做分歧消解与共识挑战。在五个长时程工作区基准和两个前沿模型上,它取得最高选择分数,证据支撑的修订让 Gemini 3.5 Flash 和 Claude Opus 4.8 相比单次 rollout 分别提升 6.2 和 6.4 分。
研究者推出 EditHero,据称是首个面向长程、部件级 3D 编辑的基准,提供自然语言指令以及几何与纹理的目标图像,由确定性装配引擎在每次编辑后生成精确目标,每条序列均经人工审核。基于该基准的对比显示,非智能体方法常漏改并扰动应保持不变的区域,而 LLM/VLM 智能体通过代码自底向上编辑,指令遵循更准、更能保留未编辑部分,但每次编辑耗时数分钟。装配引擎与编辑序列将开源发布。
研究提出 LOOM,通过缩放残差更新、每轮重注入输入嵌入及逐循环路由器,解决循环 MoE 的深度诅咒与专家选择坍缩问题,实现 100M-1.7B 模型稳定扩展至 9-12 次循环。
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
Architect-Ant 提出一种从真实户型图学习专业家具布置知识的框架,无需依赖昂贵的迭代智能体推理即可生成满足约束的布局。其配套数据集 AntPlan 包含 505 张真实专业建筑户型图,覆盖 92 类物体和十类住宅房间。
视频世界模型 Honeycomb 提出低秩表示 HexMemory,用六个空间与时空平面以固定大小存储场景特征,生成过程中存储量不随视频长度增长。其前馈写入器只处理新生成片段,通过置信度加权池化与学习式残差校正融合历史平面,读取器再取回 latent 条件生成。
Diptych 是一个 AI 辅助的音乐参考聆听对比系统,允许用户自定义对比范围——整首曲目或独立选取的片段,并查看结构化音频特征与针对该范围的 AI 解读。在 12 名音乐人参与的受试者内研究中,参与者借助该系统发现了更多差异,其中十分之九获得专家至少部分支持,同时报告了良好的可用性。研究认为,面向创意对比的 AI 支持应优先考虑用户自定义范围、可检查的证据和可操作的指引。
论文提出 SciSlopBench,用 Structure、Argument、Artifacts 三类六项指标评估 390 篇 AI 生成论文与配对人类论文,检测准确率 85.9%,高于 Binoculars 的 68.7%。
JEPA-TTT 在测试阶段持续自适应预训练动作条件 JEPA 世界模型的潜动态预测器,自监督更新跨回合累积,视觉编码器与奖励头保持冻结,规划无需目标图像或在线环境奖励。方法采用密集回放,在每个时间偏移构造预测窗口并存入增长缓冲区采样更新。在四个连续控制环境的八种动态变化下,500 个测试回合后自回归潜预测误差平均降低 83%,规划性能较冻结 JEPA 世界模型提升 153%。
JevSpawn 是一种组合式策略,将自然语言任务描述与有限域概率探索连接起来,通过并行动作生成配合反馈驱动的分支选择、表示修正和备选方案恢复,在无需额外训练的情况下减少重复生成与上下文计算。在八项基准任务上对比七种智能体基线和一种 TypeSafe Jev 变体,JevSpawn 取得了更优的任务表现和更快的导航速度。
研究发现非侵入式脑信号解码单词的主要性能提升可在无脑数据时复现,固定长度窗口重叠隐式泄露词间时长信息,合成无脑信号达 22.0% balanced accuracy,接近真实脑记录的 22.3%。作者改为独立处理各窗口以消除该捷径,提出的 SimpleB2T 在感知语音基准上达到 36.6% 词错率(每词五次观测)。
小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。
研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。
零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
PhysVista提出一个闭环认知框架基准,联合评估视觉语言模型的物理状态感知、物理动态推理与物理合理性判断,并区分事件级与尺度级推理。该基准同时纳入真实世界与AI生成视频,覆盖多样领域与新兴生成场景。对多种VLM的实验显示,模型在物理推理与合理性评估上存在显著局限,视觉识别与真实物理理解之间仍有明显差距。该研究被NeurIPS 2026主会议接收。
研究者构建了蛋白质衍生的问答数据集 FoldingCorpus 和后训练方案 Fold2Reason,通过离散结构答案与连续 3D 几何两种信号进行训练。
SemanTok 是一种灵活视频 tokenizer,将冻结的 DINO 特征输入编码器,并用轻量 head 从每个保留的 token 前缀单独重建这些特征。201M 的 SemanTok AR 模型在保真度上追平或超过 3.4 倍规模的 VideoFlexTok AR 模型,更大模型还能进一步提升保真度。它在分布外类别上保持语义对齐,并在包括纯噪声在内的每个噪声水平上为解码器提供更高的语义对齐。
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
PixelDense 提出用稠密预测模型替代纯语义编码器作为像素扩散的表征对齐目标,将 DINOv2 与 SAM2 归入语义投影流、Depth Anything v2 与 Metric3D v2 归入几何投影流,并加入权重空间正交惩罚使两流处于不相交子空间。
研究者提出 ATLAS 训练目标,通过将编码器表示中的归一化成对结构迁移到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布,从而在变换中保留规划相关的关系几何。
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。
DEFINE 是一个端到端零样本 TTS 框架,通过分别以不同音频示例作为说话人身份和目标口音的条件,将两者解耦,并用单一推理期引导权重连续控制口音强度而无需重训练。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
一篇发表于 TMLR 2026 的综述首次系统梳理视频生成模型的后训练与对齐,将后训练统一为一个框架,并按对齐信号的施加方式区分隐式对齐与显式对齐。方法被归为四类:监督微调、自训练与蒸馏、偏好与奖励方法、推理时方法。文章还梳理了常用数据集、benchmark 与评估实践,并讨论可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡及安全生成等开放挑战。
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。