CASTER:无需梯度的测试时自适应,用仿射统计传输适配冻结模型
CASTER 是一种无需梯度的测试时自适应方法,将源类统计量存入判别子空间,由目标批次矩估计类共享仿射变换并解析传输源类分布,无需反向传播、优化器状态或源特征库。
项目更新、模型与开源社区动态
CASTER 是一种无需梯度的测试时自适应方法,将源类统计量存入判别子空间,由目标批次矩估计类共享仿射变换并解析传输源类分布,无需反向传播、优化器状态或源特征库。
研究提出可信用分配推理(credit-addressable reasoning),并实例化为 Code-CoT 与 CE-GRPO:前者将视觉关系表示为可按行寻址的可执行代码,并把推理组织为带类型事件;后者用结构先验与类型归一化熵选取事件边界,从共享前缀采样完整续写,将结果差异转为局部优势。
一项研究提出递归再生数 R_AI,用于判断 AI 研发反馈是否会在开发周期中自我放大:R_AI>1 时改进效果跨周期累积,R_AI<1 时则逐周期衰减。该转变取决于 AI 研发反馈回路的结构,而非某个特定的模型能力水平,因此系统可能在加速显现之前就已进入自我放大状态。模型还显示,跨机构共享的改进可使整个研发生态具备自我放大性,即便单个参与者并非如此。
inclusionAI 在 GitHub 开源 Choruz,这是一个本地优先的 Slack 式协作应用,每个 Agent 在独立工作区运行真实 CLI,并通过消息、线程、任务和文件把工作交给人类或其他 Agent。
研究者提出以感知为中心的持久智能体架构 Pera,将语言智能体从解决用户指定的有限任务,转向在长期场景中提供持续服务。Pera 围绕感知与控制组件,持续捕捉任务执行、内部上下文和环境变化中的服务相关信号,并据此构建生命周期任务,驱动服务流程持续运行与自适应。该工作用 Pera 回溯梳理近期研究、开展案例研究,并提出构建更强持久智能体的前瞻性见解。
DiagEvo 通过诊断器从自我博弈的失败历史中提取反复出现的错误原因,存入错误原因记忆并按技能节点追踪 Active 或 Mastered 状态,无需外部任务资源即可引导出题。
Safin-1 是一系列基础模型,基于 Memory-Anchor Routing across Context History(MARCH)架构,通过内容条件路由维护结构化记忆状态并选择性检索历史信息,实现"内在安全"。
研究提出 SMELT(Sparse MoE Transformer, middle layers Loop Twice),将 MoE Transformer 中间一半层循环两次,在每 token FLOPs、非嵌入参数量和 KV cache 三项预算与未循环基线匹配的前提下扩展至 54B 非嵌入参数。
阿里发布 Qwen-Drive-1.0,一个面向自动驾驶的视觉语言基础模型,在统一框架内整合 3D 感知、视觉问答与运动规划。模型保留预训练 VLM 架构,通过外部 BEV 感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割,并由规划专家生成未来自车轨迹。实验显示其在保持通用视觉语言能力的同时具备较强 3D 感知与驾驶场景理解,开环、伪闭环和闭环评测中运动规划表现具竞争力。
UI-Venus-2 是一个通用基础 GUI 智能体,通过统一的闭环推理动作框架在移动、网页和桌面环境运行。为贴近实际部署,论文从环境、任务和验证三个维度扩展:环境覆盖 170 多个多语言移动应用与原生桌面操作系统,任务侧用深度研究流程生成基于功能的指令,验证侧采用 trace-level 与 sample-level 评估器,结合视觉关键点和多模型投票提供可靠 RL 信号。
论文提出 Harness-of-Harness(HoH)框架,让基于 LLM 的编码智能体在自主开发中按规划、编码、测试循环持续改进软件。
ZimaBlue 提出从大规模视频学习可泛化世界动作模型(WAM)的三段式训练框架,先在人类与机器人第一视角视频上做因果具身视频预训练,再通过统一动作表示在异构机器人轨迹上做视频-动作中期训练,最后针对目标机器人专门化。
H3-World 将 33B MiniMax-H3 视频生成器改造为交互式世界模型,把自然语言指令转化为精确的、时间对齐的角色与镜头控制,且不引入专门的动作模块。它通过时间注意力路由限制每条指令的作用区间以减少控制泄漏,仅用 8,000 个游戏样本、10,000 步 LoRA 优化和 0.199% 可训练参数即实现有效控制,并保持生成质量、可泛化到未见场景。
研究团队提出 E-Commerce Bench,一个把多轮供应商谈判与动态事件整合进为期一年电商经营的开源基准,LLM 智能体需在 365 天内同时运营多家网店,完成市场调研、进货谈判、销售策略、订单履约、退货处理与现金流管理,以最大化年末总资产。
针对多智能体 LLM 系统中提示词同时承担内容生成与执行协议两种角色、优化时易破坏路由与格式协议的问题,研究者提出 control-data flow separation,将执行关键的控制逻辑表示为带类型、可验证的程序对象,任务相关语言则保留为可优化的数据流。在合成推理、协作评审生成和保险评级三类工作流中,该框架实现 100% 最终协议有效性,并持续提升任务表现。
研究者提出 DroneCATS-Agent 架构与 DroneCATS 基准,将 MLLM 直接放入无人机控制回路,动作空间仅由提示词声明,无需微调或函数调用。评测覆盖接近可见目标、跟踪移动目标、搜索视野外目标及多无人机编队指挥四项能力,模型规模下探至 2B 参数。结果显示小型开源模型常比前沿模型更可靠地进入成功半径,却因过早或未声明到达而失败,多机指挥中还会盲目复制单一坐标。
研究在无预训练视觉先验的原生统一多模态模型中发现,理解与生成在表征层面可互相提供有用信号,但强制走同一计算路径会导致一方主导。任务解耦架构在保留语义交互的同时专门化冲突的视觉计算,可避免这种不对称退化。系统层面,端到端统一多模态模型在同时需要图像理解与生成的复杂任务上优于匹配的规划器-执行器流水线。
StudentSim 是一个将稀疏的单个学生数据转化为个性化模拟器的训练框架,采用先池化训练、再按学生特化的方式,使模拟器既能复现学生自身回答,也能在导师指导下更新。
EM^2Mem 是一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,使每个事件索引记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实与来源信息。
Hi-Q 是一个证据条件化的分层查询细化框架,通过 resolution 算子判断当前查询单元是否已被检索证据支持,未解决节点再由保持依赖关系的二元算子展开并经语义覆盖验证器检查,从而生成由语料支持信号决定拓扑的查询树。
研究团队提出 InternReviewer 和 InternAdvocate 两个学术智能体,用于生成同行评审与反驳内容,并构建了大规模高质量学术数据集与高效 arXiv 检索工具支持主动取证。
ReFlowSET 是一种条件潜空间流匹配框架,通过联合 SAR-EO 重建审计来选择编解码器,并在选定潜空间中从零训练更小的条件 DiT,配合双流 SAR 条件与联合特征精炼。训练时用冻结视觉基础模型提取的干净 EO 表征对齐中间噪声 EO 特征,不增加推理成本。在 QXS-SAROPT 和 SAR2Opt 上取得 SOTA,代码与预训练权重已公开。
研究者推出 GUI-CC 基准,用于评测 GUI 世界模型作为智能体环境时的上下文一致性,而非单步下一屏预测。该基准包含离线参考动作与在线智能体循环两条赛道,基于 GUIOdyssey 构建 500 个离线轨迹任务,并在 30 个移动应用中构建 200 个经模拟器验证的在线任务,评测转换保真度、转换合理性、上下文一致性与任务进度。
一项 arXiv 研究指出,当前 LLM 服务的安全防护多以拒答率、攻击成功率和违规率来评估,但这些指标只反映防护在测试请求上的局部表现,无法回答部署后攻击者持续适配或另寻入口时系统仍会提供多少有害帮助。研究认为,证明有害帮助仍存在只需一次成功攻击,而要证明其已很少则必须补充防护之外整个系统的证据,这类证据在深度编码的论断中仅占少数。因此局部分数提升本身不等于部署更安全。
Claude Code 发布 v2.1.258,修复了 2.1.255 引入的 macOS 12(Monterey)无法启动的回归问题。该版本还修复了远程和定时会话在重新发送权限审批无法应用后,报错 "user messages must have non-empty content" 的问题。
RECAP-Forcing 提出按"外观新颖度"而非时间远近组织记忆,在内容首次出现时保留其对应 KV cache,让记忆规模随新增内容量而非视频长度增长。该方法统一了注意力汇与基于光流的新颖度库两种机制,作为无需训练、不增加可学习参数的推理方法,在多个强基线上持续提升视觉质量与语义保真度,并优于现有记忆方法。
研究者发布 CoVA-SFT,一个包含 51.9K 样本、超 222K 多模态推理步骤的视觉抽象链数据集,覆盖 5 种布局家族和 17 项复杂任务,并配套 1,700 条测试样本的 CoVA-Bench 基准。在该数据集上微调的模型在 CoVA-Bench 上平均超过所有交错 CoT 基线 2 倍以上,但仍落后于强纯文本 CoT 基线。该数据集已被 EMNLP 2026 Findings 接收。
Claude Code v2.1.257 新增 Claude Fable 5.1(claude-fable-5-1)并设为默认 Fable 模型,支持 1M 上下文,定价 $10/$50 per Mtok、缓存读取 $0.25/Mtok。
研究者构建了来自 Twitter/X 七种语言的大规模真实虚假信息数据集,并提出多模态虚假信息分类体系,通过 VLM 自动化多步标注流程完成分类落地并经人工验证。分析发现,AI 生成内容在科技领域尤为普遍,而疫苗虚假信息则大量借用新闻媒体图片以增强可信度。该方法和发现为针对性检测多模态虚假信息提供指引,并建议缓解措施应策略性地差异化应用而非统一实施。
SpanCalib-VLM 提出一种双系统混合方案,用于视觉语言模型的幻觉片段检测:将 XLM-RoBERTa-Large 与 SigLIP 视觉编码器经交叉注意力融合的多模态序列标注器,与微调生成式 VLM(Qwen3.5-4B-SHROOM-SFT)结合,通过 Union-Calibrated Fusion 策略用标注器的校准概率对生成模型的候选片段重新打分。
研究者提出 ContextBias 受控评估框架与 ContextBench 基准,覆盖 92 种职业、1,656 条语义受控提示词,用于隔离上下文变化对职业相关视觉表征的影响。
inclusionAI 推出 Ling-3.0-tiny-singprobe,一个基于 Ling-3.0-tiny 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
inclusionAI 发布 Ling-3.0-flash-singprobe,这是一个基于 Ling-3.0-flash 隐藏状态的流式安全探针,仅 5.18M 参数,在生成每个 token 时对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
研究者推出 EvoGenUI-Bench,用于评估 LLM 在多轮生成式 UI 任务中维护可执行界面的能力,包含 150 个五轮任务、共 750 轮,覆盖信息呈现、可执行交互和工具接地外部状态三类场景。
研究提出 FACE-Eval,用 5,100 条样本评测来自 8 个模型族、参数量 4B 至 1.60T 的 15 个开源模型,改变偏好线索的位置(用户消息或工具返回)与呈现方式(直接摘要或原始文件)。
Aardvark Weather 通过为观测编码器加入输入相关噪声、在处理器中引入 Monte Carlo dropout,被改造为概率模型,并用全方差定律将预报离散度分解到观测与模型两个来源。
研究者提出 PRISK 动态评估框架,用于系统检测 LLM 个性化的副作用,覆盖无关个性化、偏好窄化和谄媚偏见三类风险。在 13 个 LLM 上的实验显示,用户画像与检索记忆会持续加剧这些偏见,三项指标平均分别下降 45.9%、41.7% 和 61.7%。
研究者提出 Super Library Agent 问题:让 LLM 编码智能体在顺序生成 N 个相关应用的同时,维护一个可复用的跨应用共享 Super Library。
研究者提出 Hash-Atlas 网络与对话式 3D 场景编辑方法 CE3D++,将 3D 场景编辑重构为对 2D atlas 图像的操作,实现 2D 编辑与 3D 重建流程解耦。
SafeAtlas-VL 发布 150 万条训练实例的多模态安全数据集,将图像、请求、回复三个层级的判断统一到五级有序量表,覆盖 15 个危害类别和 55 个细分子类。