inclusionAI 发布 ArmorOCR-GGUF:基于 Qwen3-VL-8B-Instruct 的对抗 OCR 量化版
inclusionAI 在 Hugging Face 发布 ArmorOCR-GGUF,这是基于 Qwen3-VL-8B-Instruct 的两阶段对抗 OCR 感知框架的 GGUF 量化版本,提供 Q8_0 与 Q4_K_M 两档量化,主模型与视觉投影器 mmproj 均覆盖,配合 llama.cpp 部署。
项目更新、模型与开源社区动态
inclusionAI 在 Hugging Face 发布 ArmorOCR-GGUF,这是基于 Qwen3-VL-8B-Instruct 的两阶段对抗 OCR 感知框架的 GGUF 量化版本,提供 Q8_0 与 Q4_K_M 两档量化,主模型与视觉投影器 mmproj 均覆盖,配合 llama.cpp 部署。
BLARM 是一种前馈方法,给定单目视频和静态物体网格即可预测时序连贯的动画网格,无需骨架、笼子、蒙皮权重或绑定标注。它用一组学习到的时变刚性运动分量和时不变顶点到分量的蒙皮权重表示动画,并通过分解式时空注意力将几何形变潜变量与视频特征结合。模型以轨迹重建、熵正则化和运动感知对比学习训练,可从单目视频中恢复紧凑可解释的运动结构。
研究检验了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力,发现从源语言提取的 FVs 无需推理时提供示例即可引导另一语言的任务行为,在干净与扰动零样本设置下均显著提升性能。每个 LLM 存在相对稳定的最优注意力头区间用于构建有效 FVs,且该模式跨语言一致。FVs 可部分复现标准少样本上下文学习的任务引导效果,同时避免处理多个示例的计算开销。
针对潜空间生成模型两阶段训练中重建优化潜空间不利于生成、端到端联合训练易发生潜空间坍缩的问题,研究者提出 GenFirst 策略:先以弱重建压力让生成目标塑造潜空间,再逐步加强重建以恢复视觉细节,实现首个无潜空间坍缩的直接端到端训练。
PaperGym 将每篇论文转化为完整训练环境,问题由研究目标与背景合成、评分标准取自方法与实验,标准泄漏率降至 3.7%(现有数据集为 11.90%–34.10%)。
研究团队提出 AutoSciRub,一个"先评估后执行"的框架,在科研执行前为任务自动生成可执行评分标准,用于指导实验、逐条验证与迭代修订。
CAST 是一个批判感知训练框架,可将稀疏的任务结果转化为动作级监督,用于批判学习与策略优化,并合成结构化理由来解释部分可观测条件下的动作有效性。在动态工具调用基准上微调 Qwen3 系列模型后,CAST 在 Retail 任务上 pass^4 超过 GPT-OSS-120B 逾 10%,在 Telehealth 的域外场景中再提升 9%。该工作已被 EMNLP 2026 主会接收。
研究者提出 MNIST-PRO,将 MNIST 数字识别改造为带 lookback 约束的序列化 glimpse 搜索任务,用以隔离考察 AI 智能体的感知状态构建能力。
NavMCP 是一个智能体脚手架框架,将 VLM 推理智能体与 NFM 执行器耦合,通过 intent、observation、memory 三条通道协作,无需重训练即可把孤立的导航 rollout 变成持续的具身交互。
一篇 72 页论文提出用 L0 到 L4 五级阶梯刻画大推理模型(LRM)学习过程中人类控制力的逐步退出,并沿奖励与经验两条轴线展开:奖励从逐例人工判断走向可复用验证器乃至无人类反馈的奖励,经验从人工策划任务走向自生成课程、自建环境与自主协同演化。论文同时指出奖励黑客、反馈漂移、课程崩塌和环境错误等风险,并从策略能力、反馈保真度、经验质量三方面给出评估框架,另维护 GitHub 仓库跟踪最新进展。
研究量化分析 On-Policy Distillation(OPD)训练中的教师监督,发现存在大量噪声且随教师规模增大而增多,但学生策略对噪声不敏感,去除噪声后性能相当。
CogEvol 是一组专为学习环境生成训练的模型,可将课程简介单次生成结构化 JSON 幻灯片或自包含交互式 HTML 页面,在 220k 生产请求中幻灯片中位耗时 17 秒、交互页面 59 秒。
inclusionAI 发布 Ling-3.0-flash-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio 等工具在本地运行。
Claude Code v2.1.252 修复了部分 Mac 上 Bash 命令报 "task output swap refused (tasks dir moved or linked)" 的问题,并解决了在尚无 .claude/settings.local.json 的项目中 "always allow" 无法保存的缺陷。
一项覆盖十种语言、11 个目标模型的审计发现,英语监督训练的抽取式提示词压缩器在非英语语言上大幅丢失上下文,且差距随压缩率升高而扩大。
研究者提出 Intention Distillation(INDI),将行为级意图蒸馏进 VLA 模型的动作解码器,训练时由冻结的教师 VLM 从当前观测、指令、粗动作摘要和执行视频中提取多模态意图表示,部署模型在解码器中间层恢复该表示来组织动作预测。
LoopArena 是一个评测模型能否引导独立编码智能体完成长时任务的基准,被评模型作为 Controller,在每轮编码后根据结构化摘要指示固定的 Worker 下一步做什么或验证什么,或决定是否停止。
研究者提出跨语言排序偏好优化框架 CRPO,利用英语偏好知识提升目标语言的偏好对齐,在目标语言与英语的平行偏好对上构建层次结构,联合优化语内与语间偏好。基于 LambdaLoss,CRPO 用多候选回答间的相对排序信号替代二元比较优化。在五种不同资源规模语言上的实验显示,CRPO 在指令遵循和知识利用上均持续优于标准方法,并显著提升奖励边际与理想回答的对数概率。代码已开源。
针对生成式视觉语言模型(VLM)在种族、性别等人口属性上的输出偏见,研究者提出 GGSS——一种保范数的推理时干预方法,在单位超球面上发现反事实偏见子空间,沿测地线弧引导视觉 token,并用自适应门控聚焦人口信号更强的 token。
一篇综述将"智能体式制品构建"定义为AI系统实质性构建或修改交付物、且中间观察结果能改变后续工作的有状态过程,并梳理了截至2026年8月20日的259项工作,其中230个系统符合该定义、29个为评测基准。文章比较六类制品,指出构建难点不仅取决于模态,还取决于决策耦合程度与失败是否在可修复时可见,并提出承诺与责任显式化、将反馈转为定向修复等原则。
DART-SD 提出一种面向多轮工具调用智能体自蒸馏的框架,将执行过程建模为收敛的 Interaction-State Transition Graph(ISTG),以捕捉成功与失败探索路径的钻石拓扑。
inclusionAI 发布 LLaDA-UI,一个 MoE 块状扩散视觉语言 GUI 智能体,端到端总参数约 16.7B,结合原生动态分辨率 ViT 与 LLaDA2.0-mini-base 扩散语言骨干,经多模态预训练和 GUI 智能体 SFT 两阶段训练。
inclusionAI 在 GitHub 开源 LLaDA-Image 模型家族,含 50 步 Base 版与经 Twin-DMD 蒸馏的 4 步 Turbo 版,支持文生图、VQ 条件生成、参考图编辑和中英文文字渲染。
研究者提出 Ring Forcing,一个自回归视频扩散框架,通过环状训练策略强制模型从久远历史中检索信息,以兼顾历史一致性与生成多样性。该方法结合压缩与时间步组合策略,在固定序列长度下将有效历史跨度扩展至分钟级,并引入稀疏 RoPE 机制实现可扩展的记忆适配。实验显示其在分钟级连贯性和物体恒存性上显著优于现有最优方法。
研究提出 Parallel Tube Decoding(PTD),将时空视频定位分解为一个时间块加多个时间条件空间块并行解码,把顺序解码深度固定为 1+1 轮,与 tube 长度无关。
研究提出在读写后自回归语义下推导快速权重记忆的归一化一阶更新,用于平方误差回归与负内积目标。该框架包含 Falcon-1(标量 NLMS 更新)、Falcon-2(逐列扩展)和 Falcon-3(滑动窗口小批量更新),以及对应的内积变体 Falcon-1A/2A/3A,并提供循环、掩码并行与分块并行形式及数值稳定的正衰减重归一化。代表性变体在语言建模中保持竞争力,并在变长数字加法上改善长度外推。
LayerRecall 是一种状态条件、按层选择的记忆路由器,将相关历史 K/V 状态仅注入骨干网络中记忆敏感的层,其余位置保留局部注意力。配套提出的 Cross-Horizon Prediction Matching(CHPM)用长上下文参考在预测空间监督有界记忆路由器,减少对高质量长视频和记忆分配标签的依赖。
研究团队发布开源预训练配方 Puro-2B,在消费级 RTX 5090 上以 FP8 精度从零训练最高 1.4 万亿 token,最佳模型算力成本低于 6.9K 美元,在自有评测协议下接近 Qwen2.5-1.5B 性能。
研究者提出 EASEL 基准,以参考图引导的逐步绘画作为灵巧视觉工具使用的主要代理任务,并包含区域标注、手写和路径规划等语义任务。评测 25 个模型显示,重建相似度普遍停留在 0.40-0.54 的低水平,轨迹诊断暴露闭环不稳定问题,模型通常早期饱和或达峰后退化。
StarHarness 提出一个在模型权重固定前提下演化环境专用智能体 harness 的框架,演化对象可包括提示词与任务框定、工具接口、技能、MCP 提供方、子智能体结构和智能体循环配置。
J-Zero 是一个统一的 Challenger–Solver–Judge 自进化框架,无需人工标注数据即可在可验证与不可验证领域同时自我提升。Challenger 与 Solver 通过对抗交互共同进化,Judge 则利用预先已知排序的偏好对进行协同适配。J-Zero 在可验证领域平均超越基线 4.2 分、不可验证领域 8.0 分,并可持续改进至少十轮,而基线两轮后即退化。
ABot-Recon 是一个流式 3D 重建模型,仅缓存前 11 帧的 KV 特征,预测当前相机坐标系下的点图和相邻帧相对位姿,再通过序列组合恢复全局位姿与几何。在 Oxford Spires 上,它取得 4.35 m 的 ATE 和 0.12° 的 RPE-R,两项误差较此前最佳结果均降低约 40%。
StepGuard 是一个步级护栏模型,可在智能体工具动作执行前进行审查,也能审计已完成的轨迹。其配套数据引擎 StepGen 生成同一上下文、仅风险步骤动作不同的安全与不安全轨迹,Balance-GRPO 则按观测准确率动态平衡两类动作的学习。
inclusionAI 发布 Ling-3.0-tiny-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio、Jan 等工具本地运行。
GeoNeXt 将预训练视频生成模型改造为统一的几何估计框架,把深度和表面法线估计重构为下一帧预测任务,实现图像与几何目标的联合建模。该方法在多个数据集上零样本单目深度和表面法线估计中超越此前的任务专用与统一生成模型,且训练数据量大幅减少。其性能可媲美使用 100 倍以上数据训练的判别式 SOTA 方法,并在若干 benchmark 上表现突出。
研究者提出 Rubric-to-Code Credit Assignment(RCCA)强化学习框架,将评分标准级功能反馈转化为代码上的局部优化信号,通过分层奖励区分格式、源码、运行时和功能失败。
研究者提出 LMSM,一个将 Linux Security Modules(LSM)的分离机制迁移到 LLM 服务的安全框架,由安全后端输出校准证据、版本化策略评估规则、独立 gate 授权缓冲输出释放。
ContextPilot 是一个面向长程智能体推理的主动上下文管理框架,通过加入规划、长期记忆和软上下文卸载工具扩展了原有工具集,并提出用上下文与熵变化定位关键编辑决策、从分支轨迹估计动作级优势的 RL 方法。在长上下文问答和深度搜索任务上,它以更紧凑的工作上下文持续超越现有基线,代码已开源,论文被 EMNLP 2026 主会接收。
研究者提出 ElephantBench,一个包含 1,094 道题目的闭卷知识探针,通过可审计的图流程从低曝光网络语料中挖掘自然分歧并转为多答案 QA 记录。在 32 个模型上,最强模型也仅在 52.4% 的题目上同时召回两种说法,其余题目几乎都只答出一种而遗漏另一种。扩大模型规模和增加推理时推理可提升召回,但无法消除这种不完整性。
研究者提出 Code-as-World,将物理世界的组成、动态演化与视觉外观表达为可执行代码,并通过受溯因推理启发的智能体循环完成假设的提出、执行、渲染、验证与迭代精化。基于该框架训练的 Code-as-World-VL 在 QuantiPhy 上取得 SOTA,超过多家领先闭源模型,验证了可执行世界表示作为可扩展物理智能基础的潜力。