inclusionAI Ling-3.0-flash-GGUF 发布,支持 llama.cpp / vLLM / Ollama 本地部署
inclusionAI 发布 Ling-3.0-flash-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio 等工具在本地运行。
项目更新、模型与开源社区动态
inclusionAI 发布 Ling-3.0-flash-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio 等工具在本地运行。
Claude Code v2.1.252 修复了部分 Mac 上 Bash 命令报 "task output swap refused (tasks dir moved or linked)" 的问题,并解决了在尚无 .claude/settings.local.json 的项目中 "always allow" 无法保存的缺陷。
一项覆盖十种语言、11 个目标模型的审计发现,英语监督训练的抽取式提示词压缩器在非英语语言上大幅丢失上下文,且差距随压缩率升高而扩大。
研究者提出 Intention Distillation(INDI),将行为级意图蒸馏进 VLA 模型的动作解码器,训练时由冻结的教师 VLM 从当前观测、指令、粗动作摘要和执行视频中提取多模态意图表示,部署模型在解码器中间层恢复该表示来组织动作预测。
LoopArena 是一个评测模型能否引导独立编码智能体完成长时任务的基准,被评模型作为 Controller,在每轮编码后根据结构化摘要指示固定的 Worker 下一步做什么或验证什么,或决定是否停止。
研究者提出跨语言排序偏好优化框架 CRPO,利用英语偏好知识提升目标语言的偏好对齐,在目标语言与英语的平行偏好对上构建层次结构,联合优化语内与语间偏好。基于 LambdaLoss,CRPO 用多候选回答间的相对排序信号替代二元比较优化。在五种不同资源规模语言上的实验显示,CRPO 在指令遵循和知识利用上均持续优于标准方法,并显著提升奖励边际与理想回答的对数概率。代码已开源。
针对生成式视觉语言模型(VLM)在种族、性别等人口属性上的输出偏见,研究者提出 GGSS——一种保范数的推理时干预方法,在单位超球面上发现反事实偏见子空间,沿测地线弧引导视觉 token,并用自适应门控聚焦人口信号更强的 token。
一篇综述将"智能体式制品构建"定义为AI系统实质性构建或修改交付物、且中间观察结果能改变后续工作的有状态过程,并梳理了截至2026年8月20日的259项工作,其中230个系统符合该定义、29个为评测基准。文章比较六类制品,指出构建难点不仅取决于模态,还取决于决策耦合程度与失败是否在可修复时可见,并提出承诺与责任显式化、将反馈转为定向修复等原则。
DART-SD 提出一种面向多轮工具调用智能体自蒸馏的框架,将执行过程建模为收敛的 Interaction-State Transition Graph(ISTG),以捕捉成功与失败探索路径的钻石拓扑。
inclusionAI 发布 LLaDA-UI,一个 MoE 块状扩散视觉语言 GUI 智能体,端到端总参数约 16.7B,结合原生动态分辨率 ViT 与 LLaDA2.0-mini-base 扩散语言骨干,经多模态预训练和 GUI 智能体 SFT 两阶段训练。
inclusionAI 在 GitHub 开源 LLaDA-Image 模型家族,含 50 步 Base 版与经 Twin-DMD 蒸馏的 4 步 Turbo 版,支持文生图、VQ 条件生成、参考图编辑和中英文文字渲染。
研究者提出 Ring Forcing,一个自回归视频扩散框架,通过环状训练策略强制模型从久远历史中检索信息,以兼顾历史一致性与生成多样性。该方法结合压缩与时间步组合策略,在固定序列长度下将有效历史跨度扩展至分钟级,并引入稀疏 RoPE 机制实现可扩展的记忆适配。实验显示其在分钟级连贯性和物体恒存性上显著优于现有最优方法。
研究提出 Parallel Tube Decoding(PTD),将时空视频定位分解为一个时间块加多个时间条件空间块并行解码,把顺序解码深度固定为 1+1 轮,与 tube 长度无关。
研究提出在读写后自回归语义下推导快速权重记忆的归一化一阶更新,用于平方误差回归与负内积目标。该框架包含 Falcon-1(标量 NLMS 更新)、Falcon-2(逐列扩展)和 Falcon-3(滑动窗口小批量更新),以及对应的内积变体 Falcon-1A/2A/3A,并提供循环、掩码并行与分块并行形式及数值稳定的正衰减重归一化。代表性变体在语言建模中保持竞争力,并在变长数字加法上改善长度外推。
LayerRecall 是一种状态条件、按层选择的记忆路由器,将相关历史 K/V 状态仅注入骨干网络中记忆敏感的层,其余位置保留局部注意力。配套提出的 Cross-Horizon Prediction Matching(CHPM)用长上下文参考在预测空间监督有界记忆路由器,减少对高质量长视频和记忆分配标签的依赖。
研究团队发布开源预训练配方 Puro-2B,在消费级 RTX 5090 上以 FP8 精度从零训练最高 1.4 万亿 token,最佳模型算力成本低于 6.9K 美元,在自有评测协议下接近 Qwen2.5-1.5B 性能。
研究者提出 EASEL 基准,以参考图引导的逐步绘画作为灵巧视觉工具使用的主要代理任务,并包含区域标注、手写和路径规划等语义任务。评测 25 个模型显示,重建相似度普遍停留在 0.40-0.54 的低水平,轨迹诊断暴露闭环不稳定问题,模型通常早期饱和或达峰后退化。
StarHarness 提出一个在模型权重固定前提下演化环境专用智能体 harness 的框架,演化对象可包括提示词与任务框定、工具接口、技能、MCP 提供方、子智能体结构和智能体循环配置。
J-Zero 是一个统一的 Challenger–Solver–Judge 自进化框架,无需人工标注数据即可在可验证与不可验证领域同时自我提升。Challenger 与 Solver 通过对抗交互共同进化,Judge 则利用预先已知排序的偏好对进行协同适配。J-Zero 在可验证领域平均超越基线 4.2 分、不可验证领域 8.0 分,并可持续改进至少十轮,而基线两轮后即退化。
ABot-Recon 是一个流式 3D 重建模型,仅缓存前 11 帧的 KV 特征,预测当前相机坐标系下的点图和相邻帧相对位姿,再通过序列组合恢复全局位姿与几何。在 Oxford Spires 上,它取得 4.35 m 的 ATE 和 0.12° 的 RPE-R,两项误差较此前最佳结果均降低约 40%。
StepGuard 是一个步级护栏模型,可在智能体工具动作执行前进行审查,也能审计已完成的轨迹。其配套数据引擎 StepGen 生成同一上下文、仅风险步骤动作不同的安全与不安全轨迹,Balance-GRPO 则按观测准确率动态平衡两类动作的学习。
inclusionAI 发布 Ling-3.0-tiny-GGUF 量化模型,提供 Q4_K_M 版本,可通过 llama.cpp、vLLM、Ollama、Docker Model Runner、LM Studio、Jan 等工具本地运行。
GeoNeXt 将预训练视频生成模型改造为统一的几何估计框架,把深度和表面法线估计重构为下一帧预测任务,实现图像与几何目标的联合建模。该方法在多个数据集上零样本单目深度和表面法线估计中超越此前的任务专用与统一生成模型,且训练数据量大幅减少。其性能可媲美使用 100 倍以上数据训练的判别式 SOTA 方法,并在若干 benchmark 上表现突出。
研究者提出 Rubric-to-Code Credit Assignment(RCCA)强化学习框架,将评分标准级功能反馈转化为代码上的局部优化信号,通过分层奖励区分格式、源码、运行时和功能失败。
研究者提出 LMSM,一个将 Linux Security Modules(LSM)的分离机制迁移到 LLM 服务的安全框架,由安全后端输出校准证据、版本化策略评估规则、独立 gate 授权缓冲输出释放。
ContextPilot 是一个面向长程智能体推理的主动上下文管理框架,通过加入规划、长期记忆和软上下文卸载工具扩展了原有工具集,并提出用上下文与熵变化定位关键编辑决策、从分支轨迹估计动作级优势的 RL 方法。在长上下文问答和深度搜索任务上,它以更紧凑的工作上下文持续超越现有基线,代码已开源,论文被 EMNLP 2026 主会接收。
研究者提出 ElephantBench,一个包含 1,094 道题目的闭卷知识探针,通过可审计的图流程从低曝光网络语料中挖掘自然分歧并转为多答案 QA 记录。在 32 个模型上,最强模型也仅在 52.4% 的题目上同时召回两种说法,其余题目几乎都只答出一种而遗漏另一种。扩大模型规模和增加推理时推理可提升召回,但无法消除这种不完整性。
研究者提出 Code-as-World,将物理世界的组成、动态演化与视觉外观表达为可执行代码,并通过受溯因推理启发的智能体循环完成假设的提出、执行、渲染、验证与迭代精化。基于该框架训练的 Code-as-World-VL 在 QuantiPhy 上取得 SOTA,超过多家领先闭源模型,验证了可执行世界表示作为可扩展物理智能基础的潜力。
研究团队提出 VLAct,一种面向 VLA 模型的 VLM 骨干,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨具身动作布局,在广泛异构多具身机器人数据上持续预训练。
PonderPounce 复用预训练 MLLM 的原生因果上下文作为回合记忆,由 System 2 模型 PONDER 生成连续认知、System 1 动作模型 POUNCE 异步据此控制,两者端到端联合训练。
研究提出原子生成事实 f=(u,tau,omega,z;rho) 并编译为 Generation-Fact Graph(GFG),建立可递归的科学过程。基于 nanoGPT 的统一训练-学习动力学中,二阶预测器在留出运行的四类转换上达到 91.43% 准确率和 91.49% 宏平均召回率,并将推理确立为训练-学习动力学的冻结投影。
Luce 是一种将几何与 PBR 材质统一到体素化多模态高斯云中的 3D 表示,为 albedo、metallic-roughness 和表面法线分别设置专用高斯图元,并通过变分自编码器压缩为材质感知的隐空间。
CritICL 是一种推理时框架,将同族弱模型的失败模式转化为基于批判的上下文示例来提升强模型推理能力,包含动态预测输入相关失败模式并检索批判的 CritICL-dynamic 和使用全局失败模式画像的 CritICL-static 两个变体。实验显示其持续优于标准上下文学习,性能与测试时扩展方法相当或更优,同时生成次数和 token 成本显著更低。
Claude Code v2.1.251 新增 PreModelSwitch 和 PostModelSwitch 钩子事件,可拦截、确认或标注模型切换,SessionStart 恢复钩子现会收到会话陈旧度与预估重缓存成本。
研究团队提出 TacForcing,一个引入执行时触觉反馈的流式动作生成框架,用流式专家按块生成动作并保留未完成块的中间状态,执行后结合新触觉反馈继续生成。该方法还引入 Execution-Aware Tactile Attention(EATA),将每次触觉更新的直接访问限制在下一个待执行动作块。
研究冻结了一个大型评估集合,尝试重放其历史主张,发现多数评估单元因重放所需证据未被绑定而中止。在可重放的部分,不同主张在不同分辨率下保持稳定。作者将这一原本隐式的推理步骤显式化并可执行,论文共 36 页,源码归档中包含可移植的复现包。
EditaLive 是一个面向直播场景的实时角色视频编辑框架,基于预训练图像动画模型 Wan-Animate,通过 CharEdit-50K 数据集将其改造为指令式人物视频编辑模型。该框架把离线双向生成改为因果流式生成,并用对齐自 rollout 蒸馏压缩为两步采样器,配合固定 RoPE、align forcing 和首帧保留稀疏注意力,在保持面部表情一致的同时实现低延迟实时流式推理。
PILOT 是一个 supervisor-worker 架构的长时程智能体框架,通过实时转向和实时自我进化两项机制,在执行过程中重定向活跃 worker 并将经验蒸馏为可复用技能与记忆。
Procedura 是一个 3D 建模智能体框架,把物体写成由命名部件通过带类型、可机器校验的配合关系连接而成的参数化程序,从文本提示出发规划装配图并逐部件生成代码,只有通过编译、配合与连通性检查的部件才会被接纳。
研究者提出 RLHEV(Reinforcement Learning with Human-Engine Verification),一种结合游戏引擎密集信号与开发者隐式接受反馈的后训练范式,用于扩展世界模型。