SILSA:用滑动窗口切片隐变量实现拓扑保持的高分辨率 3D 生成
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,实现单阶段 rectified-flow 生成。它通过 Slice VAE 与 Volumetric Anchor Lattice 协调多轴切片流,并引入切片级拓扑监督对齐 Betti 转变。
huggingface.co · 开发者平台
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,实现单阶段 rectified-flow 生成。它通过 Slice VAE 与 Volumetric Anchor Lattice 协调多轴切片流,并引入切片级拓扑监督对齐 Betti 转变。
World Observer 通过联合生成一个 actor 视角与一个或多个全景 observer,让离开 actor 视野的物体在 observer 中持续演化,从而在重新进入视野时保留其状态与动态。
研究者提出 InFlowOp,用一套无标签成本为多智能体工作流的每个决策定价,在任务分解粒度与智能体分配上双向求解,并在执行中按同一成本以最低代价修正故障。同时发布 Braid 基准,其任务需多智能体协作才能完成。在多个领域与骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。
Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。
PROWBench 是一个评估视频模型对程序指定世界事件还原保真度的基准,包含 170 个程序化构建的片段和 600 段代理视频,记录实体状态与带时间戳事件(含镜头视野外事件)作为可重放世界记录。
ActiveSaddler 将 Agent harness 优化中"用哪些训练场景产生反馈"这一被忽视的维度建模为非平稳 bandit 的自动化课程学习问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计其学习潜力并平衡已知弱点与未知场景的探索。
研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型进行恢复。在四个覆盖执行与诊断的基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的作用。
RPTune 是一个端到端框架,将学习式目录整理与 LLM 后训练结合,用自动生成的目录监督信号提升商品搜索。其编码器-重组器整理器依据下游 LLM 反馈对商品排序和剪枝,整理后的目录再通过上下文相对奖励改进后训练。在 7 个真实商家的评测中,上下文整理带来最高 31.4 个百分点的准确率提升,后训练平均再提升 10.3 个百分点。
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
研究发现,预训练 LLM 搭配轻量推理框架即可作为智能体使用,其 pass@1 准确率虽远低于后训练版本,但在充足测试时预算下 pass@K 解题覆盖率常反超后训练模型。
4Director 是一个以显式 4D 场景表示为条件的视频世界模型,将每个物体从输入图像重建为规范网格,并按每帧一个刚性变换驱动其运动。它把受控场景渲染为深度视频,再通过 Motion Adapter 合成视角一致的外观、光照与非刚性动态。团队构建了含 20,774 个片段的 RealCOD-Rigid 数据集,并提出 IG-IoU 指标,实验显示其在视觉质量与相机、物体控制上均优于此前方法。
研究通过将嵌入模型从 T5 扩展到 T5Gemma-1 再到 T5Gemma-2,发现更强的嵌入模型能显著提升扩散语言模型的生成性能,但 T5Gemma-2 的嵌入过于判别性,导致连续扩散采样失败。
AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。
针对多智能体工作流训练只优化生成器、其余智能体固定的问题,研究者提出 FloWright,通过分层、结构感知的奖励范式让一个角色自我进化、两个及以上角色协同进化,无需额外模型、标签或执行。
研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。
Pivot-SD 是一个面向掩码扩散语言模型(dLM)的离线自蒸馏框架,仅监督去噪过程中影响最大的高影响承诺(pivots),用信息增益指标筛选这些 pivots。它仅用 200 个问题和每个 4 次 rollout,就在数学与代码基准上让 LLaDA-8B-Instruct 超过全序列 SFT 和同等预算的扩散 RL 基线。该工作入选 EMNLP 2026 主会 Oral。
研究提出 Collective Bias Mitigation(CBM)框架,通过学习细粒度模型行为并在多个 LLM 间共享知识来缓解偏见,是首个系统探索如何选择与组织不同 LLM 以生成更公平回答的工作。
arXiv:2610.03195 研究 12 个 Agent 模型在三个领域端到端搜索中的来源偏好,发现各模型都偏好某些来源且结论大体一致。来自偏好来源、但少满足一条要求的商品约三分之二情况下被选中,反向情形则几乎不会;隐藏来源信息或补充缺失信息、加入反偏见提示词可减弱这种偏好。
MetaRubric 通过交替进行证据感知的策略优化与响应引导的评分标准自适应,解决评分标准强化学习中的"空洞得分"问题——即评分模型在响应缺少所需信息时仍给出高分。该方法在多个基座模型上将 PubMedQA 准确率较静态评判 GRPO 提升 6.00–20.40 个百分点,并在 HealthBench-Hard 及两个多模态医学基准上取得进一步增益。
Periscope 是一种免训练推理方法,将文本的 N 个 chunk 排成 K×K 网格,让冻结模型对 K 个局部连续 span 和 K 个跨步 span 回答同一问题,每个答案取最佳局部与跨步分数。
研究者推出 World Embedding Benchmark,包含来自 80 个家族的 8,000 个受控仿真案例,覆盖流体力学、固体力学、动力学和光学与电磁学,支持文本-视频检索、物理属性回归和视频描述配对分类三项任务。
ProAR 将自回归视频生成改造为目标导向的推理过程,通过非对称注意力掩码把目标帧预测嵌入自回归循环,并用未来表征自对齐引导短程过渡。该框架仅用 25% 的训练步数即超越完整训练的标准自回归基线,在多个视觉推理基准上持续提升,并展现出在具身推理任务上的适用性。
研究者提出 software-in-the-loop reconstruction(SWR)自监督框架,从现有科学软件工作流中自动获取参考输出与验证目标,无需为每个任务手工编写参考解。
NAVA-WAM 提出原生动作先验学习,可直接从纯观察视频预训练动作策略,无需间接的表示到控制迁移或独立的潜在动作模型。训练分两阶段:先在观察视频上通过未来视频流匹配监督优化 Action-DiT,再用带动作标注的演示进行视频-动作联合流匹配后训练,非对称注意力支持高效纯动作推理。实验显示其在分布内和分布外场景均持续优于先前方法,并展现出较强的动作标注效率和真实机器人泛化能力。
针对自回归视频扩散模型长视频生成中的漂移问题,研究者提出测试时框架 In-Distribution Forcing(ID-Forcing),其核心机制 self-caching 让每个 chunk 缓存时不关注先前的 KV 条目,从源头避免 OOD KV 条目,使滚动窗口保持分布内。
EyeRobot 2.0 提出用主动凝视实现仅靠单个立体相机的精细双手操作,通过转动两个视点将 3D 注视点居中,并以中央凹方式分配更多视觉 token。该系统在 7 个真实和 6 个仿真任务上采集遥操作数据,完成超 1000 次真机和 1800 次仿真试验,真实成功率比被动立体视觉高 40%、仿真高 20%,在腕部相机被遮挡时成功率 48% 对 22% 实现翻倍以上。
针对非结构化知识编辑中"上下文依赖"导致的原子事实召回失败问题,研究者提出即插即用框架 FOVEATED,通过随机偏移前文 key 的 RoPE 位置构造聚焦视图,编辑时施加扰动、推理时移除,不改变模型原生位置编码。该方法在 5 种知识编辑器、2 个 LLM 主干和 3 个基准上取得一致提升。
论文提出 CUAWright,一个约 3K 行代码的极简终端环境,仅以 bash 命令作为动作接口,用文件系统动态创建工具和管理上下文。
FrugalEvo 是一个成本感知的 LLM 引导程序进化框架,由更强的高成本 LLM 探索策略、更便宜的 LLM 实现并迭代优化代码,同时通过最大化前缀共享提升缓存复用。
研究用固定生成预算、单样本长度目标和组相对长度奖励三种方式对多种模型进行微调,发现高效推理训练对 CoT 忠实性和可监控性的影响不同:忠实性在多数设置下下降,主要因为模型一致性变差;可监控性更稳健,即使 CoT 大幅缩短,模型仍会承认输入干预对答案的影响。
PointWAM 是一种 3D 世界动作模型,将世界分解为场景与手部,在共享时空坐标系中联合预测二者的 3D 点轨迹,再把预测的手部运动重定向为机器人动作。在人类视频上预训练使 DexJoCo 平均成功率提升 56.9 个百分点,场景轨迹监督比仅预测手部再提升 10.9 个百分点。
研究者提出 Auto-Diagnosis and Skill Discovery(ADSD)框架,采用诊断优先范式,先解释数值求解器表现不佳的原因,再据此发现合适的数值方法,并将知识封装为可复用的求解器技能。
Skill2Real 是一个通过共享 API 学习可执行技能的智能体策略框架,采用 Proposer-Verifier-Governor 循环,让 Cerebellum 先习得局部操作技能、Brain 再在冻结 Cerebellum 的条件下学习任务级组合,技能记忆无需微调即可迁移到真实机器人。
研究者提出 SHIFT,将执行移出逐查询搜索循环,由本地 LLM 架构师从搜索中学习 harness 构建策略,并用价值函数预测兼顾准确率与执行成本的效用,再以蒙特卡洛树搜索为每个查询构建 harness。
研究提出 Recursive Self-Rewrite(RSR)框架,用 Qwen-3.8-27B 在多种 harness 下发现成功解法,并重建为通用 harness 下的训练轨迹。
研究者推出 Multilingual GSM-Symbolic 多语言数学数据集,含 30,000 组题目匹配的问答对、覆盖 15 种语言,用符号模板生成变体以防过拟合。
研究者推出 Queen,一个 4B 参数的国际象棋语言模型,能在达到典型特级大师水平的同时解释自己的走法和计划。它通过编码器-解码器架构与迭代蒸馏算法训练,经七轮迭代 Elo 从 1782 提升至 2697,涨超 900 分,在棋力和谜题准确率上大幅超越所有前沿模型,参数量却少三个数量级。基于 LM 的评估显示其解释流畅,连贯性接近 GPT-5.6-Sol(high)。
HyperBrowseComp 是一个多语言多模态网页浏览基准,包含 423 道由母语者人工编写并验证的问题,覆盖 13 种语言。问题要求定位冷门证据、追踪多步线索或检查视频、扫描文档、图像、地图等异构来源,并通过无联网模型评估过滤掉简单题。研究在统一智能体协议下用厂商原生搜索和共享外部检索工具评测多个模型,并对部分问题开展人类评估。
4DCodeBench 是一个通过代码生成评测 4D 逆图形学的基准,要求智能体从视频中重建动态场景并输出可执行的图形程序。该基准涵盖形变、流体流动、断裂等多种物理现象的真实与合成场景,对前沿模型的大规模评测显示,强大的静态重建能力尚不能转化为对复杂动态的可靠重建。
研究以 Qwen3-1.7B 和四个同源 RL 教师为对象,分析多教师同策略蒸馏(MOPD)中教师信号如何影响参数变化。发现 loss 平均会隐式加权响应,Adam 一阶矩使教师间参数更新余弦相似度升至 0.83,BF16 舍入掩盖了约 97% FP32 主权重与初始化的差异,仅 7–11% BF16 权重体现变化。