OmniScientist 提出全模态跨学科 AI 科学家系统
论文提出 OmniScientist,一个端到端全模态 AI 科学家系统,可直接从异构原始证据开展多学科研究。系统由感知层和构思、实验、撰写三个自主智能体组成,运行在确定性流水线中,并通过代码执行新颖性筛查、统计有效性、执行溯源和数值可追溯性检查。
项目更新、模型与开源社区动态
论文提出 OmniScientist,一个端到端全模态 AI 科学家系统,可直接从异构原始证据开展多学科研究。系统由感知层和构思、实验、撰写三个自主智能体组成,运行在确定性流水线中,并通过代码执行新颖性筛查、统计有效性、执行溯源和数值可追溯性检查。
研究提出 Plan-Real Spearman 与 CEM-stage Spearman 两项指标,用于衡量 JEPA 式潜在世界模型中欧氏距离代价能否按真实任务进度对候选动作排序,即"决策-度量对齐"。
研究者提出语义任务完成视频生成任务,并构建覆盖六个领域的评估数据集 SemComp-Data 与评估协议 SemComp-Bench,后者用 VLM 回答结构化二值问题,分别报告 Outcome Achievement 的 OA Score 和 Generation Reliability 的 GR Score。
研究者发布 SoftVTBench 视触觉数据集与闭环基准,包含 4,000 条专家演示和 50 多个资产,以 20 Hz 同步多视角 RGB、双指触觉 RGB 与标记运动、本体感知、语言及夹爪动作,并附仅评测端可见的有限元(FEM)状态。
研究者提出 Top-K prompting 训练与推理范式,并构建约 4560 万条已验证反应的 CREED-CCV-2+USPTO-XL 数据集,训练出化学约束一致性语言模型 C3LM。该模型结合微调与基于 ChemCensor 及新颖性导向的奖励,在 OOD URSA-expert-2026 基准上取得 SOTA。反应唯一性分析显示 LLM 与传统模型探索互补的反应空间,支持集成式逆合成系统。
研究者提出一种无需数据的白盒血缘验证方法,仅凭权重即可判断两个兼容模型检查点是否同源。该方法在 residual-MLP 和 GPT-2 基准上以 AUROC=1.0 区分微调、LoRA 合并、剪枝、量化后代与独立及蒸馏模型,在 GPT-2 上比最接近的鲁棒基线快 76 倍。案例研究正确识别出 3 个相关和 7 个无关的 LLaMA-2 公开检查点。
SemaPLC 是一个项目级、验证门控的智能体框架,只有在外部检查确认规格、编译与实时运行行为后才判定任务完成。在 117 个独立 POU 任务上,它在全部七个模型上取得最高严格验证通过率,平均 72.6%;在 65 个需在真实项目中编译运行的任务上,其动态行为得分 52.2,明显高于基线的 22.4 至 31.4。该框架已开源。
SPADE 是一个自博弈强化学习框架,让单个 LLM 同时扮演环境设计者和推理智能体,环境设计者以可执行代码形式编写带 reset()/step() 接口的长时程训练环境。扩展到 30B 参数模型时,SPADE 在八个数学、科学、代码与推理基准上平均超过最强固定环境基线 +5.3,BFCL-v4 多轮提升 +5.7,ACEBench-Agent 提升 +13.9。
研究在 API-Bank、BFCL 和 NESTful 上评测原生与改造后的循环语言模型,发现循环计算在组合式、依赖感知的工具调用上普遍有增益,而在孤立 API 调用上提升较小且更依赖具体模型。多步工具调用准确率通常随循环深度增加而上升,自适应推理则通过按需分配算力实现更优的算力-性能权衡。
研究团队发布 FM-Bench(Football Management Benchmark),让 LLM 智能体在 20 年游戏时长内通过 26 个工具、约 340 到 400 个决策点经营一家足球俱乐部,由确定性引擎累计最终得分,不使用 LLM 裁判或人工评分。
SkillForge 是一个自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目专属问题,并将解决过程中获得的知识蒸馏为与仓库实体绑定的可复用技能,用于后续真实问题修复。在开源和闭源模型上的实验显示,该方法持续优于强基线,且无需依赖历史问题修复记录或为每个问题付出高昂的测试时探索成本。
FACET 是一个终端任务合成框架,通过将相关智能体技能重构为信息丰富的场景,并先构建和修复执行环境再生成任务产物,让容器状态成为指令、参考解与验证器的共享基础。它生成带密集可执行检查的复杂终端任务,用其成功轨迹微调多个规模的模型,在 Terminal-Bench 2.1 上性能持续提升。
Claude Code v2.1.237 修复了使用 LLM 网关或自定义 base URL 的会话中的提示词缓存问题。该版本新增内置 Concise 输出风格,Claude 会直接给出结果、跳过开场白和过程叙述,同时保持同样的工作完成度,可在 /config 的 Output style 中选择。
研究提出 FAR(Find、Attempt、Recommend)文献到复审的级联流程,把研究者输入从单个问题改为研究方向。在组合数学试点中,流水线从 5,245 篇论文提取 6,453 条候选猜想或公开问题,筛出 4,717 条表述清晰且仍未解决的问题,经推理与自动分诊得到 598 项潜在解答,最终选出 77 项交由作者团队复审。
Claude Code 发布 v2.1.236,新增 ANTHROPIC_DEFAULT_MODEL 环境变量,用于设定新会话的默认模型,且 `/model` 选择仍可覆盖并跨重启保留。
LEGO-RL 是一个让编码智能体在不改动原生 harness 控制流的前提下进行策略梯度训练的强化学习框架,通过进程内 LLM 代理、沙箱编排与可观测训练插件解决环境崩溃、reward hacking 和训推不一致问题。
研究者推出 PTXBench,用于评估和适配 LLM 使用架构特定 PTX 进行 GPU 内核优化,覆盖 H100 和 B200 上的 GEMM 与 attention 负载,衡量功能正确性、目标指令是否在运行时执行及相对前沿库的加速比。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列,并放出预训练、中间训练与 WSM 合并三个阶段的 checkpoint,其中 Ling-3.0-tiny-base 总参数 7.9B、每 token 激活 1.3B,采用 MoE 与 KDA 结合 Gated MLA 的混合线性注意力架构。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并放出训练过程中的多组 checkpoints,涵盖预训练、中训以及完成 WSM 合并但未做后训练的版本。
inclusionAI 开源 Ling-3.0 语言基础模型系列,并按预训练、中训、WSM 合并三个阶段放出检查点,覆盖 Ling-3.0-tiny 与 Ling-3.0-flash 两条规模。
inclusionAI 开源 Ling-3.0 系列基础模型,并放出 pretrained、mid-trained 与 WSM 合并三个训练阶段的 checkpoint,供继续预训练、微调和蒸馏研究使用。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并按预训练、中训和 WSM 融合三个阶段放出多个检查点,供继续预训练、微调与蒸馏研究使用。
推荐理由:Ling-3.0 系列按预训练、中训、融合三个阶段放出中间检查点,便于研究者做继续预训练与蒸馏对比。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列基础模型检查点,包含 tiny 与 flash 两条线,分别提供预训练、中期训练和 WSM 合并三个阶段共 8 个 checkpoint。
CardioState-JEPA 是一个基于生理感知联合嵌入预测架构的心脏基础模型,可跨 ECG、PPG、PCG 三种模态学习单一共享表征,并通过学习到的延迟对齐器处理电、机械与血流动力学事件间的时序偏移。
V-RAE 是一种视频表示自编码器,在冻结的视觉基础模型表示之上构建紧凑的生成式潜在空间,通过轻量时序池化模块去除时序冗余并保留语义结构。它在 K600 上取得 2.13 rFVD,优于所有评测的大规模预训练视频 VAE;在 UCF101 和 K600 上 gFVD 分别为 117.86 和 19.16,收敛速度最高提升 6 倍。
DiSCO 是一种零样本、严格黑盒的文生图防御方法,完全在提示词层面工作,无需重训练、微调或访问模型内部。它通过 beam search 做分布引导的后缀扩展,并用目标模型自身生成的安全与不安全图像池进行对比打分,迭代反馈直至产出安全内容。在 I2P 基准的多种红队攻击下,DiSCO 将无防御与已有防御模型的 ASR 分别降低 37.7% 和 25.13%,同时保持语义保真度并提升图像连贯性。
研究团队提出 MoE-ViE 混合专家视觉编码器,系统探索 CLIP 风格视觉编码器的 MoE 设计,发现细粒度 MoE 拓扑显著优于稠密和标准 MoE 方案,并引入无辅助损失均衡变体与专用 MoE kernel 降低推理延迟。
该 arXiv 论文通过受控实验与配对轨迹分析,考察 LLM 智能体技能(Skills)在什么条件下有效、为何有效以及会在哪里失效。
PixRestore 是一个无需 VAE 的像素空间 Diffusion Transformer,用于统一图像修复,扩散主干完全从零训练、不依赖 T2I 预训练,直接在 patch 化像素上做 flow matching。
研究通过跨模型冻结记忆迁移发现,在源模型上训练的 Engram 式哈希记忆冻结后接到不同目标模型时,记忆内容与正确寻址都重要,但只有配上对齐目标模型的 reader 才能发挥作用。
EditBridge 是一个扩散桥框架,将低分辨率编辑结果到高分辨率对应图像的细化建模为结构化数据到数据翻译,并以原始高分辨率图像为条件保留真实细节。它引入先验引导的分块稀疏注意力机制,将跨图像交互限制在空间对齐区域,从而降低计算开销。实验显示其可在最高 4K 分辨率下实现高保真编辑,2K 下提速 3.6–8.4 倍,4K 编辑仅需 61 秒。
研究团队发布 CoinVE-200K,一个面向组合式指令引导视频编辑的大规模高质量数据集,包含 1080p 视频编辑对、最长 201 帧,每个样本涉及 2 至 5 个原子编辑操作。
Agent Lightning v1.0 发布,这是一个约 3500 行代码的轻量框架,用于 harnessed agentic RL,支持任意 agent harness。
MathForm 是一个通过 Mathlib 知识检索与验证引导迭代精修来构建可验证训练数据的自动形式化框架,并据此构建了约 367K 条 Lean 4 验证样本的 FormalVerse 数据集。
HarnessRisk 是一个面向智能体 harness 安全的全生命周期基准,把安全问题划分为 harness 配置、能力扩展、运行时操作、状态持久化、动作控制和事件恢复六个运行阶段,共含 128 个沙箱用例。
研究者提出一个"通用层方程",用更新域、通道集、传播库、逐通道消息映射、通道融合算子、ego/残差映射和更新映射七个组件统一描述图神经网络架构,核心分解将信息移动位置(传播库)与移动内容(消息映射)分离。该框架覆盖局部消息传递、注意力、谱滤波、全局通信等七类非互斥架构家族,可组织超过 200 种架构,并关联过平滑、过挤压、异质性和表达能力等议题。
研究者提出"个性化自动科研"问题,主张 AI 联合科学家应将研究者的既有工作、方法储备与合作网络纳入检索、假设搜索、实验、写作和评审的每个环节。该框架包含图结构的研究者表征、全流程个性化与基于个体的评估三部分,并指出当前系统存在"一刀切"失效模式:不同研究者提出同一目标会得到几乎相同的研究结果。
一项受控评测系统比较了稠密与稀疏索引、文本记录、结构化存储、分层存储、精炼式记忆、参数化更新和激活兼容上下文机制等多类记忆基底,覆盖 3 个基座模型与 4 个基准套件,在统一框架下测量 26 项性能与效率指标。
FreeToken 是一个边缘原生 MoE 推理系统,围绕模型布局与加载、专家驻留、CPU 与 GPU 执行、智能体状态复用和运行时内存管理做全栈协同设计,并按设备实际可用资源动态映射计算与模型状态。
研究者提出统一具身导航框架 TAMP-Nav,通过 Pixel-to-3D 动作公式让 VLM 只选 2D 像素再投影为 3D 坐标交由 SLAM 控制器执行,并引入选择性推理与 Anchor-Trajectory 记忆机制及基于 GRPO 的两级对齐范式。该框架在 R2R-CE 上达到 66.2% SR 的 SOTA 表现,仅需 90k 训练轨迹,兼具运行时与样本效率。