VLAct:面向视觉-语言-动作模型的表征中心持续预训练
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上持续预训练。
项目更新、模型与开源社区动态
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上持续预训练。
PonderPounce 复用预训练 MLLM 的原生因果上下文作为回合记忆,由 System 2 模型 PONDER 生成连续认知、System 1 动作模型 POUNCE 异步据此控制,两者端到端联合训练。
研究提出原子生成事实 f=(u,tau,omega,z;rho) 并编译为 Generation-Fact Graph(GFG),建立可递归的科学过程。基于 nanoGPT 的统一训练-学习动力学中,二阶预测器在留出运行的四类转换上达到 91.43% 准确率和 91.49% 宏平均召回率,并将推理确立为训练-学习动力学的冻结投影。
Luce 是一种将几何与 PBR 材质统一到体素化多模态高斯云中的 3D 表示,为 albedo、metallic-roughness 和表面法线分别设置专用高斯图元,并通过变分自编码器压缩为材质感知的隐空间。
CritICL 是一种推理时框架,将同族弱模型的失败模式转化为基于批判的上下文示例来提升强模型推理能力,包含动态预测输入相关失败模式并检索批判的 CritICL-dynamic 和使用全局失败模式画像的 CritICL-static 两个变体。实验显示其持续优于标准上下文学习,性能与测试时扩展方法相当或更优,同时生成次数和 token 成本显著更低。
Claude Code v2.1.251 新增 PreModelSwitch 和 PostModelSwitch 钩子事件,可拦截、确认或标注模型切换,SessionStart 恢复钩子现会收到会话陈旧度与预估重缓存成本。
研究团队提出 TacForcing,一个引入执行时触觉反馈的流式动作生成框架,用流式专家按块生成动作并保留未完成块的中间状态,执行后结合新触觉反馈继续生成。该方法还引入 Execution-Aware Tactile Attention(EATA),将每次触觉更新的直接访问限制在下一个待执行动作块。
研究冻结了一个大型评估集合,尝试重放其历史主张,发现多数评估单元因重放所需证据未被绑定而中止。在可重放的部分,不同主张在不同分辨率下保持稳定。作者将这一原本隐式的推理步骤显式化并可执行,论文共 36 页,源码归档中包含可移植的复现包。
EditaLive 是一个面向直播场景的实时角色视频编辑框架,基于预训练图像动画模型 Wan-Animate,通过 CharEdit-50K 数据集将其改造为指令式人物视频编辑模型。该框架把离线双向生成改为因果流式生成,并用对齐自 rollout 蒸馏压缩为两步采样器,配合固定 RoPE、align forcing 和首帧保留稀疏注意力,在保持面部表情一致的同时实现低延迟实时流式推理。
PILOT 是一个 supervisor-worker 架构的长时程智能体框架,通过实时转向和实时自我进化两项机制,在执行过程中重定向活跃 worker 并将经验蒸馏为可复用技能与记忆。
Procedura 是一个 3D 建模智能体框架,把物体写成由命名部件通过带类型、可机器校验的配合关系连接而成的参数化程序,从文本提示出发规划装配图并逐部件生成代码,只有通过编译、配合与连通性检查的部件才会被接纳。
研究者提出 RLHEV(Reinforcement Learning with Human-Engine Verification),一种结合游戏引擎密集信号与开发者隐式接受反馈的后训练范式,用于扩展世界模型。
GameWAM 是首个面向原生闭环游戏与 GUI 控制的世界动作模型(WAM),通过并行视觉与动作生成过程同时预测未来视觉观测和可执行的键盘鼠标轨迹。它按动作步预测游戏/GUI 模式,并用 block-cycle 控制协调预测、执行与上下文以支持长时程交互,实验中以更少的原生动作执行次数取得有竞争力的任务成功率。研究还发现低频动作源印记(LASI)这一生成控制的源敏感失效模式。
研究团队提出 MMLVE 任务与 MMLVE-Agent 框架,用 LLM 与 VLM 协同实现镜头级视频解耦和指令解析,解决长视频多指令编辑中的实体碎片化与编辑幻觉问题。团队同时构建了 MMLVE-Bench 数据集及三项评测指标,实验显示该框架优于 Seedance 2.0 等闭源 SOTA 方案,消除了编辑幻觉并保持跨镜头一致性与时空过渡。
研究者提出 Test-Time Policy Optimization(TTPO),一种非对称目标:对与伪标签一致的 rollout 用 OPSD 蒸馏,对不一致的 rollout 用 Grouped RL 惩罚,从而在无标签条件下实现测试时训练。
研究团队提出 Aphanta,一个面向 MLLM→图像编辑器→MLLM 流水线的自动化任务发现与闭环诊断框架,通过对比直接推理、编辑器生成中间结果和理想参考中间结果三种条件,区分视觉潜力与当前编辑器的实际效用。
Zero-WAM 是一个因果视频-动作模型,通过上下文人类视频引导执行训练中未见过的机器人操作任务,在 RoboTwin 2.0 仿真的七个未见任务上取得 47.0% 平均成功率,比最强视频-动作基线高 29.5 个百分点。
CaSKG 是一个反事实因果技能图框架,在检索前校准技能间的程序性关系,先构建高召回有向候选图,再用方向条件文本反事实探针与贝叶斯平滑发布状态过滤加权图,离线构建且不改变下游智能体策略。
研究者提出 CaRGo-T(Causal Reasoning Graph-of-Thought)推理框架,将多模态幽默背后的因果与上下文关系表示为轻量图结构,并由 VLM 生成代码化表示后再由同一或不同 VLM 解读,完成零样本或上下文学习预测。
研究提出 PAWBench 基准与 PAWEval 评估协议,将概率对齐形式化为世界模型的分布级判据,用重复生成视频的经验分布检验模型能否还原同一初始观测与动作下的行为概率分布。在 50 个场景、11 个现有系统上,没有模型能同时稳定匹配参考概率并覆盖有效行为范围。研究还测试了语言提示词、初始噪声采样与模型训练能否重塑模型的预测分布。
Self-OPD 提出一种无需教师模型的流匹配模型同策略蒸馏框架,将学生模型自身的探索转化为逐步监督信号。该方法在每个时间步将确定性下一状态预测分支为 K 个随机 SDE 候选,用 ODE 采样器展开并与确定性自参考基线比较奖励,得到归一化优势,再以全分支 pull-push 目标优化速度场。在单一与混合奖励基准上,Self-OPD 无需任务专用教师即优于此前的 RL 与 OPD 方法。
Magpie 是一个面向交互式游戏的实时生成式世界渲染系统,将玩法执行与视觉生成分离:游戏引擎负责解析玩家操作并维护世界状态,独立的 Render Server 则基于引擎输出的白盒帧生成画面。该方案保留了游戏的可设计性与可复现性,并降低早期游戏原型对完整视觉资产的依赖。
一篇 arXiv 论文提出用两级框架梳理 LLM 智能体的数据生成:把智能体数据表示为(环境、任务信号、交互实现、可选验证器)的因子化对象,并按主要锚点与依赖结构归类生成范式。作者进一步提出 Accuracy-Complexity-divErsity(ACE)视角,将生成视为受约束的分布设计,分别对应可行支撑、相对学习者的难度与覆盖冗余控制。
WikiSkill 是一个让 AI 智能体技能与持久知识库(wiki)协同演化的框架,它将原始执行经验、累积知识与可执行技能分离,并持续把经验整合进 wiki 供后续技能更新使用。
研究者提出 UrbanGround,一个基于香港全境 3D 地理空间数据构建的城市沙盒,让 MLLM 智能体通过第一人称观察和交互地图执行从局部问答到长程导航的任务。测试显示,智能体在视觉识别和短距离空间推理上具备可用的原子能力,但方向感和行人感知移动仍不可靠。核心失败出现在长时程探索中:局部能力无法组合成持续的目标导向行为,错误不断累积且缺乏有效纠正。
一项研究系统分析了 Evolution Strategies(ES)用于 LLM 推理后训练的优化机制,理论与实验均显示 ES 能带来比 GRPO 更广的推理覆盖,在提升 Pass@1 的同时取得更高 Pass@K,而 GRPO 会出现熵坍缩。
淘宝 Live 团队提出 Harness-Aware Training(HAT),通过 Harness-State Augmentation(HSA)对 Skill 标识与内容、工具 schema、提示词结构和 Hook 函数做任务保持变换,训练紧凑模型适应不断变化的 Harness。
Claude Code 发布 v2.1.250 版本,本次更新以修复 bug 和提升可靠性为主。该版本未公布新功能、性能数据或可用性变化。
Claude Code v2.1.248 新增 `--restricted`(或 `CLAUDE_CODE_RESTRICTED=1`)受限模式,移除执行命令与代码的内置工具及 `WebFetch`,将文件工具限制在工作目录内并拒绝 `bypassPermissions`。
inclusionAI 在 Hugging Face 发布 UI-Venus-2-9B,公开由其 Qwen3.5-9B 初始化的全参数权重,这是一个面向移动、网页与桌面的通用 GUI 智能体模型。
推荐理由:权重与逐项评测表格同时放出,可对照基座模型判断 9B GUI 智能体在同规模基准上的位置。
Claude Code v2.1.247 新增 SendFeedback 工具,会话出错时 Claude 可起草反馈报告,供用户从 /feedback 审阅并发送,可用 feedbackDrafts 设置关闭。
GigaBrain-0.7 是采用三系统架构统一理解、预测与动作的具身基础模型,预训练规模超 37,000 小时异构具身数据,并引入一阶段对齐训练联合优化视觉语言理解与多本体动作生成。
研究者提出 MoTE(Mixture of Task Experts)解码器架构,将大语言模型的前馈网络转为任务专属专家,同时保持多模态主干共享,每个样本只走一条任务路由。
DREAM(Developing Recommender Engine with Agentic Methods)是一种在现有推荐流水线上叠加可编排、可审计策略层的自主优化控制架构,包含三层 Intent Engine 与基于 MetaModel 的 Meta Engine。
开源框架 CyberFactory 将 CVE 等公开漏洞产物转化为可执行、可验证的任务实例,覆盖 PoC 生成、漏洞修补与 CyberQA,并用可复用的漏洞分析技能引导教师模型完成源码审查与证据验证。基于其合成的智能体轨迹训练出的 Aegis 模型在 CyberGym 上一小时预算下 Pass@1 达 52.4%,较 Qwen 3.5 基座提升 22.8 分,且推理时无需该技能。
LAWA 是一种世界动作模型(WAM)架构,用紧凑的潜在动作表示未来意图,在推理时无需生成未来观测即可完成未来想象。在 RoboCasa 上,LAWA 在少样本和全量数据设置下分别取得 65.6% 和 80.8% 的平均成功率,较匹配的 Fast-WAM 基线提升 9.6 和 4.5 个百分点,同时推理延迟比匹配的 Joint-WAM 变体低 42.9%。
研究团队提出 Game2World Engine(G2WEngine)全栈框架,可自动从真实游戏视频中提取可复用 UI 素材,并在干净画面上合成时序一致的 UI 叠加层,从而把带界面的野生游戏视频转化为世界模型训练数据。
研究者提出 OraRL,将标注作为 oracle rollout 直接纳入 on-policy 组,并用解耦优势估计器解决由此产生的 advantage inversion 问题。
一篇综述首次用统一框架系统研究智能眼镜,将其定义为连接人类感知、持久上下文与数字或物理动作的第一人称智能平台。文章提出 L0-L5 能力框架,覆盖采集、反应式感知、情境辅助、持久状态、受治理动作与具身耦合,并沿八项可验证硬件能力轴刻画设备。核心挑战不在模型能否单独识别、回答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且可治理的感知-状态-交互-动作闭环。
微信发布 WeMM-Embedding 通用多模态嵌入模型技术报告,支持文本、图像、视频、视觉文档和任意交错多模态输入,并可灵活设置输出维度。该系列包含 2B、4B、9B 三个规格,其中 2B 版本在 MMEB-v2 上已超过此前领先的 8B 开源基线,9B 版本取得 80.6 的总体最优成绩。