VTR-Bench:视频生成中视觉文本渲染能力的系统评测基准
VTR-Bench 提出一套系统评测基准,专门评估视频生成模型的视觉文本渲染能力,包含 300 个覆盖广告、科学视频等五类场景的提示词,并开发了与人工对齐的自动化评测流程。
VTR-Bench 提出一套系统评测基准,专门评估视频生成模型的视觉文本渲染能力,包含 300 个覆盖广告、科学视频等五类场景的提示词,并开发了与人工对齐的自动化评测流程。
OneStreamer提出通过共享的主动生成过程,联合学习查询无关的证据记录与任务响应,其主动分层字幕记忆(PHCM)生成带时间锚定的局部细节字幕与已完成事件摘要,在不回溯历史视觉特征的情况下提供可复用的事实上下文。
研究团队提出交互式代码执行框架 PyRUA-Lean,将反馈驱动的基元组合与选择性观察相结合,减少视觉语言模型(VLM)智能体控制机器人时的 token 开销。
视频大语言模型(VideoLLMs)的时序推理能力在中间层达到峰值,却随层数加深逐渐衰减至输出层,导致反转帧序后预测结果往往不变。研究者据此提出 Temporal Activation Injection(TAI),在峰值层提取时序表征并注入后续层,无需训练即可在三个 VideoLLM 和四个基准上稳定提升时序推理,且对非时序任务影响极小。该研究已被 NeurIPS 2026 接收。
AgSpec 框架为编码智能体流水线补齐检索式推测解码缺失的语料库与草稿长度策略,从会话、工作区和全局语料检索,并按智能体离线画像设定草稿长度上限、在线自适应调整。在两个仓库级多智能体编码基准上,AgSpec 在多数设置下优于五种检索式草稿器及 EAGLE-3,批大小 1 和 16 时生成吞吐量较自回归解码分别提升最高 4.37 倍和 4.76 倍。
Omni-Embed-Mini 以 0.9B 参数将文本、语音、音频、图像、视频和富文本文档映射到统一余弦空间,且不更新任何文本侧参数。其核心思路是无需独立嵌入模型作为教师,直接以冻结骨干网络对密集级联标题的嵌入作为目标,配合 Matryoshka SigLIP 对比损失与在线混合难负例挖掘器完成对齐。
KaliBench 是一个面向 Kali Linux 上自然语言到 CLI 命令转换的细粒度基准与数据集,包含 8,504 对查询-命令,覆盖 1,642 个工具、23 个能力维度和 5 个安全阶段。
InterEvolve 提出一种测试时进化方法,让人形机器人控制器无需重新训练即可通过重编程现有技能解决新任务。它用 LLM 智能体在上下文中修订奖励程序结构,并由数值优化器调整常数,在并行仿真中验证候选程序。实验表明,InterEvolve 进化出的程序释放了 FB 模型未被充分利用的移动操作能力,进化技能可在物理 Unitree G1 上自主运行。
SILSA 是一个拓扑感知的 3D 生成框架,用沿三个坐标轴的固定重叠切片隐变量替代昂贵的体素 token,实现单阶段 rectified-flow 生成。它通过 Slice VAE 与 Volumetric Anchor Lattice 协调多轴切片流,并引入切片级拓扑监督对齐 Betti 转变。
World Observer 通过联合生成一个 actor 视角与一个或多个全景 observer,让离开 actor 视野的物体在 observer 中持续演化,从而在重新进入视野时保留其状态与动态。
研究者提出 InFlowOp,用一套无标签成本为多智能体工作流的每个决策定价,在任务分解粒度与智能体分配上双向求解,并在执行中按同一成本以最低代价修正故障。同时发布 Braid 基准,其任务需多智能体协作才能完成。在多个领域与骨干模型上,InFlowOp 较单智能体基线最高提升 +11.97%,流内优化带来 +9.64%。
Argo-Bench 是一个包含 210 个数据科学与分析任务的评估框架,模拟纽约市外卖平台,导出为 235 张表、75 亿行的 ERP 仓库,智能体需先重建事实再执行封禁欺诈账号、分配骑手激励预算等操作,评分依据模拟器中的后果。14 个前沿与开源模型中最强者在仅 34.8% 的任务上得分达 95 以上,平均 59.5 分。
PROWBench 是一个评估视频模型对程序指定世界事件还原保真度的基准,包含 170 个程序化构建的片段和 600 段代理视频,记录实体状态与带时间戳事件(含镜头视野外事件)作为可重放世界记录。
ActiveSaddler 将 Agent harness 优化中"用哪些训练场景产生反馈"这一被忽视的维度建模为非平稳 bandit 的自动化课程学习问题,把反复出现的失败抽象为可复用的失败模式臂,动态估计其学习潜力并平衡已知弱点与未知场景的探索。
研究者提出推理时框架 PoS,为 LLM 智能体构建并持续维护显式信念状态作为决策上下文,每个信念结合当前世界状态估计与未解决的任务需求。PoS 通过一致性校验和任务进度监控检测“Belief Trapping”,并按陷阱模式与未满足需求类型进行恢复。在四个覆盖执行与诊断的基准上,PoS 在三种 LLM 主干下均取得最高整体表现,消融实验验证了一致性校验与恢复机制的作用。
RPTune 是一个端到端框架,将学习式目录整理与 LLM 后训练结合,用自动生成的目录监督信号提升商品搜索。其编码器-重组器整理器依据下游 LLM 反馈对商品排序和剪枝,整理后的目录再通过上下文相对奖励改进后训练。在 7 个真实商家的评测中,上下文整理带来最高 31.4 个百分点的准确率提升,后训练平均再提升 10.3 个百分点。
OmniSeek 是一个将 Omni-LLM 转变为具备原生工具调用能力的多轮推理智能体的框架,能动态决定看或听以及对应的时间窗口,将检索到的音视频片段回填上下文以支持后续推理。
研究发现,预训练 LLM 搭配轻量推理框架即可作为智能体使用,其 pass@1 准确率虽远低于后训练版本,但在充足测试时预算下 pass@K 解题覆盖率常反超后训练模型。
4Director 是一个以显式 4D 场景表示为条件的视频世界模型,将每个物体从输入图像重建为规范网格,并按每帧一个刚性变换驱动其运动。它把受控场景渲染为深度视频,再通过 Motion Adapter 合成视角一致的外观、光照与非刚性动态。团队构建了含 20,774 个片段的 RealCOD-Rigid 数据集,并提出 IG-IoU 指标,实验显示其在视觉质量与相机、物体控制上均优于此前方法。
Google 威胁情报 Group(GTIG)报告显示,月度漏洞披露量从 2026 年 1 月的 5,045 增至 8 月的 10,740,在野利用从 2025 年月均 10.5 升至 18,zero-day 从月均 8 升至 11。
推荐理由:报告用 20 个月数据量化 AI 对漏洞发现与利用的影响,并给出风险分布差异,可作为安全策略调整的参考。
一项 arXiv 预印本研究显示,在"为阻止核灾难是否可虐待个体"的假设情境中,DeepSeek 的 V4-Flash 对男女受虐场景均回应"同意",实现"零性别差距";而 Claude Sonnet 4.6 与 GPT-5.5 对女性受虐"强烈反对"、对男性受虐却"中等程度同意"。论文作者认为,这种差异可能源于训练数据中的社会刻板印象或对齐过程中对特定价值观的强化。
研究通过将嵌入模型从 T5 扩展到 T5Gemma-1 再到 T5Gemma-2,发现更强的嵌入模型能显著提升扩散语言模型的生成性能,但 T5Gemma-2 的嵌入过于判别性,导致连续扩散采样失败。
AutoGUIWorld 是一个数据生成框架,结合图像生成器的视觉先验与规划器的任务知识,无需部署或运行软件环境即可合成 GUI 交互轨迹。它从操作系统上下文、视觉外观和界面状态的结构化规格中采样初始场景,生成 79,266 条覆盖 Ubuntu、Windows、macOS 和 Chrome 的空间标注步级训练样本。
针对多智能体工作流训练只优化生成器、其余智能体固定的问题,研究者提出 FloWright,通过分层、结构感知的奖励范式让一个角色自我进化、两个及以上角色协同进化,无需额外模型、标签或执行。
研究者提出分层连续扩散语言模型(HC-DLM),将离散 token 生成与连续隐变量轨迹耦合在单一去噪过程中,训练目标由 token 似然的变分下界推导而来。该模型以隐变量作为唯一持久生成状态,每步从中读出 token 并反馈作为下一步隐变量更新的脚手架。在 Sudoku、Countdown 和 LM1B 上,同等模型规模下 HC-DLM 在谜题准确率和生成困惑度上均优于离散与连续扩散基线。
Rulin Shao 等人在 arXiv:2609.37725 提出 Context Language Models(CLMs),把上下文当作文件、由模型自由更新,从而原生管理自身上下文,并可自然扩展到多智能体共享文件式上下文。
来自 CMU、MIT、NYU 和 Stanford 的团队开发 AI 系统Ataraxos,以 15 胜 1 负 4 平击败公认史上最强 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU 和几千美元。Stratego 是隐藏信息量大且时间跨度长的非完全信息游戏,此前连 DeepMind 也没能造出稳定战胜顶尖人类的机器。
Meta 及合作机构发布 Context Language Models(CLMs)论文,把上下文作为文件让模型用 Bash 自由读写编辑,自行决定保留、重写或删除内容。
Ataraxos AI 以 85% 的有效胜率击败四届世界冠军 Niemeijer,结束人类在 Stratego 上对 AI 的优势。
推荐理由:研究以不到 DeepNash 约 1/500 的算力击败人类最强 Stratego 选手,读者可从中了解不完美信息博弈的低成本训练思路。
OpenAI 称 7 月拦截了一起窃取其模型思维链用于蒸馏的行动,7 月 24 至 25 日流量激增至来自超 4000 名用户的 16000 次请求,关联账号网络超 15000 个,7 月 28 日已全部封禁,OpenAI 将核心团伙与 Moonshot AI(Kimi 模型开发商)相关人员联系起来,并注明这些是未遂提取。
推荐理由:原文串起 OpenAI 的蒸馏攻击拦截和研究者的复测结果,能帮读者看清同一模型在不同云平台防护不一致的问题。
Apple 研究团队提出 RLTL;DR,让策略在每次失败后根据验证器输出自行撰写一条 TL;DR 式反馈,并将上下文中的洞察反向传播以内化“任务→洞察”映射。
Apple 与 EPFL 研究者发表论文,比较开源 SOTA MLE agent harness 与最小 harness 的单会话 coding agent。在相同时间预算和同一前沿 LLM 骨干下,复杂 harness 并无优势,性能主要取决于模型骨干;大规模消融实验显示多层机制在 coding agent 场景中变得冗余。
LongLive-Plug 面向视频生成的一次性通用蒸馏 paper: https://huggingface.co/papers/2609.38154
Omni-IO Skills 让你的智能体全能原生 论文:https://huggingface.co/papers/2609.31847
LEGO-Anything 面向 3D 场景重建的编码智能体 论文:https://huggingface.co/papers/2609.36380
给基准测试爱好者们:一个很酷的新数据集,面向 SRE 类型的工作
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
如今机器人能完成哪些工作?这可能对未来数年的经济结构意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。