PAWBench:视频生成模型距离概率对齐的世界建模还有多远?
研究提出 PAWBench 基准与 PAWEval 评估协议,将概率对齐形式化为世界模型的分布级判据,用重复生成视频的经验分布检验模型能否还原同一初始观测与动作下的行为概率分布。在 50 个场景、11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。研究还测试了语言提示词、初始噪声采样与模型训练能否重塑模型的预测分布。
huggingface.co · 开发者平台
研究提出 PAWBench 基准与 PAWEval 评估协议,将概率对齐形式化为世界模型的分布级判据,用重复生成视频的经验分布检验模型能否还原同一初始观测与动作下的行为概率分布。在 50 个场景、11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。研究还测试了语言提示词、初始噪声采样与模型训练能否重塑模型的预测分布。
Self-OPD 提出一种无需教师模型的流匹配模型同策略蒸馏框架,将学生模型自身的探索转化为逐步监督信号。该方法在每个时间步将确定性下一状态预测分支为 K 个随机 SDE 候选,用 ODE 采样器展开并与确定性自参考基线比较奖励,得到归一化优势,再以全分支 pull-push 目标优化速度场。在单一与混合奖励基准上,Self-OPD 无需任务专用教师即优于此前的 RL 与 OPD 方法。
Magpie 是一个面向交互式游戏的实时生成式世界渲染系统,将玩法执行与视觉生成分离:游戏引擎负责解析玩家操作并维护世界状态,独立的 Render Server 则基于引擎输出的白盒帧生成画面。该方案保留了游戏的可设计性与可复现性,并降低早期游戏原型对完整视觉资产的依赖。
一篇 arXiv 论文提出用两级框架梳理 LLM 智能体的数据生成:把智能体数据表示为(环境、任务信号、交互实现、可选验证器)的因子化对象,并按主要锚点与依赖结构归类生成范式。作者进一步提出 Accuracy-Complexity-divErsity(ACE)视角,将生成视为受约束的分布设计,分别对应可行支撑、相对学习者的难度与覆盖冗余控制。
WikiSkill 是一个让 AI 智能体技能与持久知识库(wiki)协同演化的框架,它将原始执行经验、累积知识与可执行技能分离,并持续把经验整合进 wiki 供后续技能更新使用。
研究者提出 UrbanGround,一个基于香港全境 3D 地理空间数据构建的城市沙盒,让 MLLM 智能体通过第一人称观察和交互地图执行从局部问答到长程导航的任务。测试显示,智能体在视觉识别和短距离空间推理上具备可用的原子能力,但方向感和行人感知移动仍不可靠。核心失败出现在长时程探索中:局部能力无法组合成持续的目标导向行为,错误不断累积且缺乏有效纠正。
一项研究系统分析了 Evolution Strategies(ES)用于 LLM 推理后训练的优化机制,理论与实验均显示 ES 能带来比 GRPO 更广的推理覆盖,在提升 Pass@1 的同时取得更高 Pass@K,而 GRPO 会出现熵坍缩。
淘宝 Live 团队提出 Harness-Aware Training(HAT),通过 Harness-State Augmentation(HSA)对 Skill 标识与内容、工具 schema、提示词结构和 Hook 函数做任务保持变换,训练紧凑模型适应不断变化的 Harness。
GigaBrain-0.7 是采用三系统架构统一理解、预测与动作的具身基础模型,预训练规模超 37,000 小时异构具身数据,并引入一阶段对齐训练联合优化视觉语言理解与多本体动作生成。
研究者提出 MoTE(Mixture of Task Experts)解码器架构,将大语言模型的前馈网络转为任务专属专家,同时保持多模态主干共享,每个样本只走一条任务路由。
DREAM(Developing Recommender Engine with Agentic Methods)是一种在现有推荐流水线上叠加可编排、可审计策略层的自主优化控制架构,包含三层 Intent Engine 与基于 MetaModel 的 Meta Engine。
开源框架 CyberFactory 将 CVE 等公开漏洞产物转化为可执行、可验证的任务实例,覆盖 PoC 生成、漏洞修补与 CyberQA,并用可复用的漏洞分析技能引导教师模型完成源码审查与证据验证。基于其合成的智能体轨迹训练出的 Aegis 模型在 CyberGym 上一小时预算下 Pass@1 达 52.4%,较 Qwen 3.5 基座提升 22.8 分,且推理时无需该技能。
LAWA 是一种世界动作模型(WAM)架构,用紧凑的潜在动作表示未来意图,在推理时无需生成未来观测即可完成未来想象。在 RoboCasa 上,LAWA 在少样本和全量数据设置下分别取得 65.6% 和 80.8% 的平均成功率,较匹配的 Fast-WAM 基线提升 9.6 和 4.5 个百分点,同时推理延迟比匹配的 Joint-WAM 变体低 42.9%。
研究团队提出 Game2World Engine(G2WEngine)全栈框架,可自动从真实游戏视频中提取可复用 UI 素材,并在干净画面上合成时序一致的 UI 叠加层,从而把带界面的野生游戏视频转化为世界模型训练数据。
研究者提出 OraRL,将标注作为 oracle rollout 直接纳入 on-policy 组,并用解耦优势估计器解决由此产生的 advantage inversion 问题。
一篇综述首次用统一框架系统研究智能眼镜,将其定义为连接人类感知、持久上下文与数字或物理动作的第一人称智能平台。文章提出 L0-L5 能力框架,覆盖采集、反应式感知、情境辅助、持久状态、受治理动作与具身耦合,并沿八项可验证硬件能力轴刻画设备。核心挑战不在模型能否单独识别、回答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且可治理的感知-状态-交互-动作闭环。
微信发布 WeMM-Embedding 通用多模态嵌入模型技术报告,支持文本、图像、视频、视觉文档和任意交错多模态输入,并可灵活设置输出维度。该系列包含 2B、4B、9B 三个规格,其中 2B 版本在 MMEB-v2 上已超过此前领先的 8B 开源基线,9B 版本取得 80.6 的总体最优成绩。
TorchMorph 是一个轻量级 PyTorch 扩展,用融合 CUDA kernel 直接在 (B, C, Spatial...) 张量上实现形态学变换,支持最多八个空间维度、共 22 个公开算子,涵盖二值形态学、灰度形态学、精确与近似距离变换以及熵正则最优传输。
LAION 公开 LAION-BVD 大规模开放视频数据集,从 CommonCrawl 收集 1.3B 条平台视频 URL,实际下载 80M 个视频、总时长 1000 万小时。
研究者提出 Entropy-Valley(EV),一种无需训练的长度选择器,通过全掩码前向传播的平均预测熵为候选目标画布打分,选出骨干模型最易填充的长度。相比基于训练语料长度统计的基线,EV 在 En→Zh、Zh→En、En→De 上分别恢复了参考目标长度所带来 COMET-22 增益的 64.9%、65.3% 和 33.0%。
研究提出 Best Practice Critic Optimization(BPCO),通过结合 DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化策略优势和长度自适应广义优势估计,解决 critic 训练不稳定的问题。
AutoSaddler 提出自动 harness 优化框架,把 harness 改进建模为离线学习问题,利用 mini-batch 的失败信号迭代更新 harness,并结合失败轨迹诊断、把 harness 当作代码的结构化补丁生成和基于验证的更新筛选。
研究者提出 OPDVR,将 on-policy 蒸馏(OPD)与可验证奖励强化学习(RLVR)无缝结合且不引入任何额外超参数。该方法先基于轨迹正确性重构采样 token OPD 的隐式奖励,再用 ReLU 门控让正确轨迹获得非负奖励、错误轨迹获得非正奖励,从而把采样 token OPD 变成标准 RLVR 方法,可直接搭配 GRPO 等策略梯度算法。
研究提出 Recuris,一种面向长程智能体框架的递归经验工作记忆架构,由工作记忆跟踪任务进度,并从经验记忆中引导技能选择,使技能调用贴合当前需求而非完整历史。
研究提出 DiffusionOPSD 同策略自蒸馏框架,将图像级奖励引导转化为去噪中间预测的显式监督目标,在 SD 3.5-M 和 Z-Image-Turbo 上于 20 个奖励匹配设置中的 19 个取得最佳最终留出分数,最高超越最强对比方法 44.0%。相比 DiffusionNFT,训练 GPU 时长在 SD 3.5-M 上减少 40%、在 Z-Image-Turbo 上减少 63%。
Meta^n 提出一种保持元操作 Ω 固定、对其自身产物递归的自我改进方法,深度由收敛而非预设决定,并用进化档案搜索层链。在两个骨干模型上,Meta^n 在全部八个基准系列上超越此前的自我改进智能体,在 ARC-AGI-2 上是唯一得分高于零的方法。消融实验显示递归收益主要来自各层传递给下一层的条件信息,且随深度涌现出未被提示词规定的层角色。
研究者提出 CAFE(Coupled Agent–Feedback Evolution)框架,让共享参数模型在搜索智能体与 critic 两种角色间交替,先基于基础智能体自身失败轨迹初始化反馈条件下的纠错,再耦合在线与离线优化。
研究者推出 LongRCA Bench,包含来自五个来源的 1,140 条完整失败轨迹,全部人工标注责任角色与最早决定性根因步骤,参考根因距任务完成中位数为 48 步,28.4% 的轨迹后续步骤超过 100 步。在 DeepSeek-V4-Flash 上,五个基线中最强者仅达 13.2% 根因步骤精确准确率;提出的免训练方法 RCTA 将这一指标提升至 24.1%,责任角色准确率达 51.1%。
研究提出一种前缀不变性审计方法,只需两次前向传播、无需训练或梯度,即可给出逐层分数定位因果性断裂位置。在八个 checkpoint 的 192 次注入故障试验中,掩码检查未检出任何一例,该审计将 192/192 全部定位到确切层。对 transformers 分块扫描代码的静态与动态分析还在 Zamba2 和 Nemotron-H 中发现同一跨块轴错误,并通过参考实现修复。
研究者用训练于数百万张星系图像的 Transformer 模型 AstroPT 作为校准测试平台,发现星系属性的涌现顺序固定且与已知难度一致:直接写入像素的波段星等训练早期即可解码,红移和比恒星形成率等推断量则出现更晚、位于更深层。该顺序不受测试的训练目标影响,随模型容量在幅度上扩展但顺序不变,线性探针方向还能恢复星系属性间已知的物理结构。
ClawProBench 是一个基于 OpenClaw 实时智能体运行时的轨迹感知基准,包含 102 场景完整版与 68 场景冻结留出集两条赛道,按正确性、过程质量与效率的安全门控公式从执行轨迹打分。
针对 RAG 证据利用率测量失真与上下文预算分配不佳两大瓶颈,研究者提出因果留一探针,揭示标准相关性代理在难负样本上的"诊断幻觉",并证明一味扩大上下文会因相关性衰减而受罚。
研究团队提出量化感知修复(QAH),将 4-bit 学生模型直接从原始未压缩模型蒸馏,替代默认的量化感知训练(QAT)。在 GPT-OSS 120B 到 60B 再到 MXFP4 的流水线上,QAH 学生模型在 9 项基准中的 7 项追平或超过其 bfloat16 源模型,权重内存约为原来的 1/4,参数量为教师模型的一半,并以 Hypernova-60B 开源发布。
研究者提出 EvoMap,将验证器确认的执行轨迹固化为结构化 Gene,并发布 LongWoF-Bench,包含代码生成、智能体环境合成、数学推理和规则遵循四类共 778 个机器可验证任务。
AutoResearch 是一个两阶段自主研究系统,将想法生成与想法执行打通:生成阶段融合新兴研究信号与领域知识,用多模型生成和交叉评审产出可验证的研究计划;执行阶段由智能体拆解实验并做独立证据评审。在 RSICD 基准上,其生成的想法将平均 Recall 从 32.84 提升至 34.69,审计确认的问题事件仅 5 起,其他自主研究系统为 11-27 起。
研究者构建了无脸呈现攻击数据集 TPO,用番茄、土豆和洋葱的活体、打印与重放录像替代人脸,基于基础模型的检测器在四个标准跨数据集人脸 PAD 基准上平均 AUC 达 92.70%,优于合成人脸训练并与真实人脸数据集训练相当。
EXPL-FR 通过轻量适配器将 VLM 图像编码器对齐到冻结的人脸识别(FR)空间,仅用人脸图像训练、不使用文本,同一适配器可直接作用于文本编码器,把 22 个类别共 978 条属性提示词转为 FR 空间锚点。
WorldToken 将每个时间步的观测编码为单个 world token,用因果 Transformer 处理历史并以扩散动作头生成动作块,仅 85M 参数就在 RoboCasa 上取得 59.4% 平均闭环成功率,接近 3.35B 参数的 π0.5。
研究对比了混合量子启发式 Kolmogorov-Arnold 网络(HQKAN)与 MLP 在联邦平均(FedAvg)下进行心电信号分类的效果。在 MIT-BIH 五分类任务上,HQKAN 可训练参数减少 37.35%、通信成本降低 24.89%;在 INCART 三分类任务上分别减少 44.81% 和 36.41%,同时多数聚合指标与少数类指标均有提升。
针对十亿级容量下原始用户行为数据扩展收益递减的问题,研究提出 User Behavioral Densing Law,刻画数据规模与最小充分 tokenization 容量之间的定量关系。