inclusionAI 发布 LLaDA2.2-mini 轻量级智能体扩散语言模型
inclusionAI 发布 LLaDA2.2-mini,这是 LLaDA2 系列智能体扩散语言模型的轻量版本,总参数 16B,推理时仅激活 1.4B。它基于 LLaDA2.0-mini 架构,沿用 Levenshtein Editing(新增 DELETE 与 INSERT 控制 token),将上下文扩展到 128K,面向长上下文工具调用和多轮交互。
项目更新、模型与开源社区动态
inclusionAI 发布 LLaDA2.2-mini,这是 LLaDA2 系列智能体扩散语言模型的轻量版本,总参数 16B,推理时仅激活 1.4B。它基于 LLaDA2.0-mini 架构,沿用 Levenshtein Editing(新增 DELETE 与 INSERT 控制 token),将上下文扩展到 128K,面向长上下文工具调用和多轮交互。
RoboTok 是一个可扩展数据引擎,用查询人类操作视频从互联网视频中检索与操作相关的演示,用于训练灵巧机器人策略。它从 3D 手部轨迹学习潜在运动空间,可跨视角、场景外观和遮挡变化比较操作行为,并支持高效索引检索。真实机器人实验中,RoboTok 引导的策略相较最强基线平均成功率提升 42.2 个百分点。
研究者提出开放词汇互信息(OVMI),一种信息论指标,用于衡量语音脑机接口解码器相对于用户可能表达词汇参考分布所传达的信息量,使不同词汇表等条件下测得的能力可在统一通信尺度上比较。
VeriPhy 是一套可审计的物理验证系统,由纯文本规划器将提示词编译为带类型的物理义务和静态验证执行计划,再调用冻结的低层专家模型(分割跟踪、计数、11 类物理测量、深度、OCR、音频事件检测)生成带来源的证据记录,并映射为支持、矛盾或未知的三值判定。
Claude Code v2.1.261 发布,新增 `bashOutputMaxChars` 和 `taskOutputMaxChars` 设置,可将命令与后台任务内联输出上限提升至 128K 字符。
一篇论文定位了 RLVR 收窄解空间的位置,在对 Qwen2.5-3B 的 PPO 与 GRPO 训练中,解法覆盖率最多下降 67%。研究发现收缩集中在推理轨迹入口,首个算术操作前的每 token 似然偏移是后续推理的 11 到 16 倍,仅提供未被选中的入口前缀就能把低覆盖家族的完成率从 0.018 提升到 0.212。
DRACO 提出一种基于动态评分标准(rubric)的信用分配方法,用于无真值成功信号的长时程智能体训练:训练中动态生成 rubric 以跟踪策略能力变化,每条完整轨迹评分一次,再将判断以闭式解重新分配到各步骤,在 GRPO 中产生差异化的逐步优势,且不引入额外训练归因模块。
研究者推出 Last Translation Benchmark(LTB),收录经人工撰写与同行评审的文本、图像、音频、视频样本,专门用于击破领先机器翻译模型。每个样本附带手工编写的校验规则,描述该样本上的具体失败情形,从而支持可靠且可操作的评估。该基准为持续接收投稿的实时数据集,最新版本 LTBv1 收录 2026 年 9 月 1 日前接受的贡献。
QCell 是一种基于查询的显微镜重叠细胞实例分割模型,通过实例重组模块在潜空间分解并重组查询表示,并用对比查询对齐目标分离重叠细胞查询。在 ISBI2014 上,QCell 比 SOTA 方法提升 +2.2 AP 和 +2.7 AJI,同时提出新的 Organoid 重叠细胞分割基准。该工作已被 BMVC 2026 接收,代码、模型与数据集均已公开。
一项控制变量研究比较了长视频 MLLM 中视觉 token 的分配策略,发现帧选择是影响最大的环节:在 LongVideoBench 的小时级分桶上,8 帧查询选择比 16 帧均匀采样高 6.9 分,而数十年前的稀疏近似算法 Orthogonal Matching Pursuit 在三个基准上追平或接近所有专用选择器。
研究者提出 AutoTraceGT,首个将社会科学扎根理论自动化应用于智能体轨迹分析的多智能体流水线,通过开放式、轴心式与理论式编码迭代至饱和,为每个任务生成定制化行为分类体系。在六个轨迹语料库上,其生成的编码手册覆盖人工标注分类体系中 73%-91% 的失败模式,并发现后者遗漏的新模式。该编码手册作为演绎特征空间时,在下游失败预测任务上优于零样本和少样本 LLM 基线。
Scal3R 将在线 3D 重建重构为多参考相对位姿查询,用约占 1% 参数量的轻量可学习 token 经非对称注意力注入完全冻结的骨干网络,查询相对多个历史关键帧的位姿。
研究者提出"compile by training",将自然语言规格编译为可复用的神经函数:编译时由教师模型生成任务样本,训练一个紧凑解释器的小型适配器,成品无需教师模型即可运行,并可像普通软件一样存储、版本化和组合。
研究将随机梯度流(SGF)建模为渗流过程,发现嵌套架构对称性迫使子网络以离散块形式合并,而非单边连接,这种结构转变在宏观序参量上表现为方差尖峰。作者进一步给出 Adam 和 AdamW 在重尾梯度噪声下捕获论证成立的充分条件,并在训练好的 Transformer 上进行了测量。
研究者提出 CORD(Calibrator-Output Repair for Top-1 Decision Preservation),首个通过修复完整校准概率向量来强制保持 top-1 预测不变的事后校准适配器。
研究者提出 PACE 数据集,用于评估模型能否识别以自我中心知识或事件形式存在的潜在约束,从而判断看似合理的用户请求是否不当。PACE 将基于明确人设的用户请求与自我中心 KB 事实配对,要求模型整合上下文证据判断请求是否冲突。同时提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索关键证据,在 PACE 上的证据检索质量和冲突决策准确率均持续优于现有方法。
针对自主后训练中"过往更新经验在父模型变化后是否仍可复用"的问题,研究者提出 Boundary-Calibrated Intervention Transfer(BCIT),在改变权重的训练前先校验经验适用条件,对存在硬冲突的候选直接否决,必要时通过有界训练试验获取当前状态证据。
LatentStream 将流式视频理解的记忆机制从"存储-检索"转为"检索-内化",通过查询无关的分层流式记忆、分层潜在记忆演化和置信度引导的渐进优化三个组件,把历史证据内化为定长潜在记忆。该框架在现有在线与离线视频基准上取得新的 SOTA 结果。
Puffin-World 是一个统一多模态架构,无需外部离线模块即可整合物理理解、空间模拟与 3D 世界生成和重建,联合建模物理(重力场与纬度)、几何(深度)、外观(图像)三种原生世界状态,并引入统一 Omni-Camera 表示。团队构建了含 1500 万视觉-语言-相机三元组和 100 万条轨迹的 Puffin-16M 数据集,并已开源代码、模型与数据集。
论文提出 Random Attention,一种不计算任何分数、在每个注意力头内均匀随机淘汰 KV cache 的方法。在四个模型和六个推理任务上,它的任务表现持平最强基线,用 vLLM 部署时吞吐比该方法高 32-43%。
FlashRender 是一个少步生成式渲染框架,可在数秒内沿目标相机轨迹对源视频进行重拍。它提出 Representation Transformation and Alignment(RETA),将源视频隐表示与冻结视觉几何模型的目标视频特征对齐,实现采样步数一致的相机控制,再结合 MeanFlow 目标微调与 on-policy flow map 蒸馏。
WorldReward 是一个基于 VLM 的成对偏好奖励模型,统一评估相机条件世界模型的动作一致性与视觉质量,将成对视频拆解为动作对齐片段并投票聚合出视频级偏好。
针对联合音视频生成模型难以控制镜头切换与对白时间的问题,研究者提出 Temporal Context Routing(TCR),将脚本时间映射到视频与音频共享的时间轴上,并把提示词引导路由到对应位置。
研究发现,单条 query 的 one-shot OPD 训练可持续数百步提升,并恢复全量数据 OPD 的大部分收益。单条 query 的状态覆盖率达 71.5%,16 条语义不同的 query 可达 98.9% 并追平全量训练。OPD 因此是数据过饱和但算法受限,学生模型吸收监督的速度才是瓶颈。
针对 GPT-Image-2、Nano-Banana 等扩散模型只能输出扁平位图、文字易错且无法分层后编辑的问题,研究者提出 Editable Visual Design 新范式。
研究者提出 CORE,通过将交叉注意力重排序器的组合判断蒸馏进 MLLM 嵌入模型,来提升其组合检索能力。方法合成覆盖五个组合匹配层级的候选列表,并用 Rank-KL 目标训练嵌入模型复现重排序器的细粒度排序。
Principia 是一个通过配对物体间关系一致性来评测视频模型牛顿物理推理的基准,涵盖重力、弹性、摩擦、转动惯量、抛体、动量、单摆和弹簧振子八种现象,并使用与相机标定无关的一致性评分。在六个主流视频生成模型的数千次生成结果中,没有模型得分超过 0.42,而它们在同一批评测中 VBench 得分约 0.8。视觉语言模型检测关系物理违规的最佳准确率仅为 67%,多数接近随机水平。
研究者提出"环境演化"方法,通过离策略方式逐步提升环境难度并按代调度生成,为终端智能体训练持续提供学习信号。在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上经长程 RL 训练,二者在 Terminal-Bench 2.1 上分别提升 14.4 和 18.0 个百分点。
Terminal-Universe 框架可将终端智能体轨迹重建为可复用环境,并在此基础上合成新任务与持续交互,应用于公开轨迹后产出 37.3k 个任务充分的环境。用该语料对 Qwen3.5-27B 做监督微调,Terminal-Bench 2.1 单轮成绩提升 11.9 分,EvoCode-Bench v2 MT@4 多轮成绩提升 13.8 分。
LatentPress 将对话历史和长文档写入连续 memory tokens,由冻结解码器直接通过输入嵌入接口读取,推理时无需重建文本。
LLaDA-Image 是一个统一框架,将 6B DiT 从零训练与基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块配对。其生成管线包含 220M 样本,采用无参数 RMSNorm 与 Muon 优化器,蒸馏版 LLaDA-Image-Turbo 可在 2-4 步采样内完成推理。
inclusionAI 发布 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步 Base 版和 4 步蒸馏 Turbo 版,均为 6B 参数,并同步开放权重与 Diffusers 推理代码。
推荐理由:开源了 6B 参数统一图像生成与编辑模型,Base 与 4 步蒸馏 Turbo 两个版本都放出了权重和推理代码。
inclusionAI 发布 LLaDA-Image,一个 6B 参数的开源统一图像生成与编辑模型家族,包含 50 步的 Base 版和 4 步蒸馏的 Turbo 版。
推荐理由:官方放出 6B 统一生成与编辑模型的权重与推理代码,并公开了从纯图像预训练到联合训练的开源路线。
inclusionAI 开源 LLaDA-Image 图像生成与编辑模型家族,包含 50 步 Base 与 4 步 Turbo 两个 6B 参数版本,并发布检查点和基于 Diffusers 的推理代码。
推荐理由:开源模型同时提供 50 步 Base 与 4 步 Turbo 版本,读者可据此判断快速生成与高保真生成之间的取舍。
inclusionAI 发布并开源 LLaDA-Image 系列统一图像生成与编辑模型,包含 50 步的 Base 与 4 步蒸馏的 Turbo 两个变体,均为 6B 参数,同时提供 BF16 与 FP8 权重。
推荐理由:6B 参数单权重同时支持文生图与指令编辑,训练配方与推理代码一并开源,便于复现和二次开发。
研究团队构建 Minima,对 Qwen3.8-27B(48 层 GDN、16 层注意力)全部 496 个线性层(含 GDN)采用 NVFP4 W4A4 量化。
Claude Code 发布 v2.1.260,新增全屏模式下会话旁的 diff 面板,可用 /diff 查看未提交改动,并在 /cost 和状态栏 prompt_cache 字段中给出 prompt 缓存未命中的可能原因。
一项系统性实证研究探索了对话推荐系统(CRS)的零数据自举:无需任何领域内对话语料,仅从商品评论、元数据和用户-物品交互等非对话信号生成合成对话监督数据。
研究者提出 Sparse Readout Prism(SRP),仅用 unembedding 矩阵权重分解 readout,将任意 token logit 或 logit 差异表示为稀疏 readout 特征贡献之和,从而独立于拟合语料分析 lens 读数。
研究者提出 WHALE(Weight-Harness Alternating LEarning),交替进行模型权重更新与 harness 搜索,两阶段分别采用在线拒绝采样微调和 Meta-Harness。