SkillForge:用自蒸馏智能体解决项目专属代码问题
SkillForge 是一个自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目专属问题,并将解决过程中获得的知识蒸馏为与仓库实体绑定的可复用技能,用于后续真实问题修复。在开源和闭源模型上的实验显示,该方法持续优于强基线,且无需依赖历史问题修复记录或为每个问题付出高昂的测试时探索成本。
项目更新、模型与开源社区动态
SkillForge 是一个自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目专属问题,并将解决过程中获得的知识蒸馏为与仓库实体绑定的可复用技能,用于后续真实问题修复。在开源和闭源模型上的实验显示,该方法持续优于强基线,且无需依赖历史问题修复记录或为每个问题付出高昂的测试时探索成本。
FACET 是一个终端任务合成框架,通过将相关智能体技能重构为信息丰富的场景,并先构建和修复执行环境再生成任务产物,让容器状态成为指令、参考解与验证器的共享基础。它生成带密集可执行检查的复杂终端任务,用其成功轨迹微调多个规模的模型,在 Terminal-Bench 2.1 上性能持续提升。
Claude Code v2.1.237 修复了使用 LLM 网关或自定义 base URL 的会话中的提示词缓存问题。该版本新增内置 Concise 输出风格,Claude 会直接给出结果、跳过开场白和过程叙述,同时保持同样的工作完成度,可在 /config 的 Output style 中选择。
研究提出 FAR(Find、Attempt、Recommend)文献到复审的级联流程,把研究者输入从单个问题改为研究方向。在组合数学试点中,流水线从 5,245 篇论文提取 6,453 条候选猜想或公开问题,筛出 4,717 条表述清晰且仍未解决的问题,经推理与自动分诊得到 598 项潜在解答,最终选出 77 项交由作者团队复审。
Claude Code 发布 v2.1.236,新增 ANTHROPIC_DEFAULT_MODEL 环境变量,用于设定新会话的默认模型,且 `/model` 选择仍可覆盖并跨重启保留。
LEGO-RL 是一个让编码智能体在不改动原生 harness 控制流的前提下进行策略梯度训练的强化学习框架,通过进程内 LLM 代理、沙箱编排与可观测训练插件解决环境崩溃、reward hacking 和训推不一致问题。
研究者推出 PTXBench,用于评估和适配 LLM 使用架构特定 PTX 进行 GPU 内核优化,覆盖 H100 和 B200 上的 GEMM 与 attention 负载,衡量功能正确性、目标指令是否在运行时执行及相对前沿库的加速比。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列,并放出预训练、中间训练与 WSM 合并三个阶段的 checkpoint,其中 Ling-3.0-tiny-base 总参数 7.9B、每 token 激活 1.3B,采用 MoE 与 KDA 结合 Gated MLA 的混合线性注意力架构。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并放出训练过程中的多组 checkpoints,涵盖预训练、中训以及完成 WSM 合并但未做后训练的版本。
inclusionAI 开源 Ling-3.0 语言基础模型系列,并按预训练、中训、WSM 合并三个阶段放出检查点,覆盖 Ling-3.0-tiny 与 Ling-3.0-flash 两条规模。
inclusionAI 开源 Ling-3.0 系列基础模型,并放出 pretrained、mid-trained 与 WSM 合并三个训练阶段的 checkpoint,供继续预训练、微调和蒸馏研究使用。
inclusionAI 开源 Ling-3.0 系列语言基础模型,并按预训练、中训和 WSM 融合三个阶段放出多个检查点,供继续预训练、微调与蒸馏研究使用。
推荐理由:Ling-3.0 系列按预训练、中训、融合三个阶段放出中间检查点,便于研究者做继续预训练与蒸馏对比。
inclusionAI 在 Hugging Face 开源 Ling-3.0 系列基础模型检查点,包含 tiny 与 flash 两条线,分别提供预训练、中期训练和 WSM 合并三个阶段共 8 个 checkpoint。
CardioState-JEPA 是一个基于生理感知联合嵌入预测架构的心脏基础模型,可跨 ECG、PPG、PCG 三种模态学习单一共享表征,并通过学习到的延迟对齐器处理电、机械与血流动力学事件间的时序偏移。
V-RAE 是一种视频表示自编码器,在冻结的视觉基础模型表示之上构建紧凑的生成式潜在空间,通过轻量时序池化模块去除时序冗余并保留语义结构。它在 K600 上取得 2.13 rFVD,优于所有评测的大规模预训练视频 VAE;在 UCF101 和 K600 上 gFVD 分别为 117.86 和 19.16,收敛速度最高提升 6 倍。
DiSCO 是一种零样本、严格黑盒的文生图防御方法,完全在提示词层面工作,无需重训练、微调或访问模型内部。它通过 beam search 做分布引导的后缀扩展,并用目标模型自身生成的安全与不安全图像池进行对比打分,迭代反馈直至产出安全内容。在 I2P 基准的多种红队攻击下,DiSCO 将无防御与已有防御模型的 ASR 分别降低 37.7% 和 25.13%,同时保持语义保真度并提升图像连贯性。
研究团队提出 MoE-ViE 混合专家视觉编码器,系统探索 CLIP 风格视觉编码器的 MoE 设计,发现细粒度 MoE 拓扑显著优于稠密和标准 MoE 方案,并引入无辅助损失均衡变体与专用 MoE kernel 降低推理延迟。
该 arXiv 论文通过受控实验与配对轨迹分析,考察 LLM 智能体技能(Skills)在什么条件下有效、为何有效以及会在哪里失效。
PixRestore 是一个无需 VAE 的像素空间 Diffusion Transformer,用于统一图像修复,扩散主干完全从零训练、不依赖 T2I 预训练,直接在 patch 化像素上做 flow matching。
研究通过跨模型冻结记忆迁移发现,在源模型上训练的 Engram 式哈希记忆冻结后接到不同目标模型时,记忆内容与正确寻址都重要,但只有配上对齐目标模型的 reader 才能发挥作用。
EditBridge 是一个扩散桥框架,将低分辨率编辑结果到高分辨率对应图像的细化建模为结构化数据到数据翻译,并以原始高分辨率图像为条件保留真实细节。它引入先验引导的分块稀疏注意力机制,将跨图像交互限制在空间对齐区域,从而降低计算开销。实验显示其可在最高 4K 分辨率下实现高保真编辑,2K 下提速 3.6–8.4 倍,4K 编辑仅需 61 秒。
研究团队发布 CoinVE-200K,一个面向组合式指令引导视频编辑的大规模高质量数据集,包含 1080p 视频编辑对、最长 201 帧,每个样本涉及 2 至 5 个原子编辑操作。
Agent Lightning v1.0 发布,这是一个约 3500 行代码的轻量框架,用于 harnessed agentic RL,支持任意 agent harness。
MathForm 是一个通过 Mathlib 知识检索与验证引导迭代精修来构建可验证训练数据的自动形式化框架,并据此构建了约 367K 条 Lean 4 验证样本的 FormalVerse 数据集。
HarnessRisk 是一个面向智能体 harness 安全的全生命周期基准,把安全问题划分为 harness 配置、能力扩展、运行时操作、状态持久化、动作控制和事件恢复六个运行阶段,共含 128 个沙箱用例。
研究者提出一个"通用层方程",用更新域、通道集、传播库、逐通道消息映射、通道融合算子、ego/残差映射和更新映射七个组件统一描述图神经网络架构,核心分解将信息移动位置(传播库)与移动内容(消息映射)分离。该框架覆盖局部消息传递、注意力、谱滤波、全局通信等七类非互斥架构家族,可组织超过 200 种架构,并关联过平滑、过挤压、异质性和表达能力等议题。
研究者提出"个性化自动科研"问题,主张 AI 联合科学家应将研究者的既有工作、方法储备与合作网络纳入检索、假设搜索、实验、写作和评审的每个环节。该框架包含图结构的研究者表征、全流程个性化与基于个体的评估三部分,并指出当前系统存在"一刀切"失效模式:不同研究者提出同一目标会得到几乎相同的研究结果。
一项受控评测系统比较了稠密与稀疏索引、文本记录、结构化存储、分层存储、精炼式记忆、参数化更新和激活兼容上下文机制等多类记忆基底,覆盖 3 个基座模型与 4 个基准套件,在统一框架下测量 26 项性能与效率指标。
FreeToken 是一个边缘原生 MoE 推理系统,围绕模型布局与加载、专家驻留、CPU 与 GPU 执行、智能体状态复用和运行时内存管理做全栈协同设计,并按设备实际可用资源动态映射计算与模型状态。
研究者提出统一具身导航框架 TAMP-Nav,通过 Pixel-to-3D 动作公式让 VLM 只选 2D 像素再投影为 3D 坐标交由 SLAM 控制器执行,并引入选择性推理与 Anchor-Trajectory 记忆机制及基于 GRPO 的两级对齐范式。该框架在 R2R-CE 上达到 66.2% SR 的 SOTA 表现,仅需 90k 训练轨迹,兼具运行时与样本效率。
研究者提出 Energy-Guided Flow Matching(EG-FM),用热核滤波后的动态端点替代 flow matching 的固定干净图像端点,通过图像特定的能量引导调度逐步释放高频信号,无需改动骨干网络和训练数据。
研究者提出一套能力驱动的数据基础设施,将能力专属监督构建与能力对齐的课程调度耦合,通过三个可互操作的数据引擎分别构建文本-图像 grounding、图像间变换和图像-知识关联监督。该框架构建了 440M 图像的 T2I 语料、120M 编辑对和超 27M 图像-实体对,并从头训练了 3B 和 6B 两种规模的多模态扩散模型,在 CPI-Bench 上完成定量评估。
研究使用 AI-Infra-Guard(A.I.G)对 DeepSeek Harness(DSH)开展间接提示注入评估,在 16 个间接内容通道上完成 14560 次受控执行,覆盖文本与文件载体模式、35 个载荷目标和 12 种攻击方法。
GS-Voxel 是一种无拟合结构化潜变量框架,可将预优化 3DGS 重建确定性转换为稀疏活跃体素,无需逐场景额外优化,并保留所选图元的亚体素位置与渲染属性。其 GS 专用因子化 VAE 分别编码体素几何与局部高斯属性,潜变量规模随占用体素数增长,而非受固定场景图元总数限制。研究还通过重叠感知分块推理,将基于卫星视图图像的条件生成扩展到单次训练裁剪之外的大面积航拍 3DGS 场景。
研究团队提出 Agentic Video Auto-Encoder(AVA-Encoder),一种由智能体自进化驱动的自编码框架,可将视频转换为 Film Knowledge Graph(KG)表征并重建回视频。
ASI-Bench 是面向通用科研领域的基准,包含覆盖 11 个科学领域的 60 项项目级研究任务,用于联合评估 AI 的创新探索与自主科研执行能力。该基准在同一研究项目中逐步撤去人类方法指引,测试 AI 能独立推进到何种程度;在 18 种智能体与模型配置上,平均分从完整方法指引下的 50.91 降至仅指定方法的 29.10,需自行确定方法时进一步降至 26.62。
研究者用 Abra 这一受控的 flow-matching Transformer 家族,在 10^19 到 10^22 FLOPs 共三个数量级的算力上系统研究了文本到图像扩散模型的缩放律。
研究者推出 StartupBench,一个基于市场验证 AI 创业产品构建的端到端智能体基准,将真实产品工作流转化为面向交付物的任务并用细粒度评分标准评估。在统一 agent harness 下,最强模型也仅能完成约 30% 的任务,复杂指令遵循与领域专业知识是主要失败原因。结果表明许多已被市场验证的工作流仍超出当前通用智能体的可靠能力范围。
研究者提出 aDSL,一种以智能体为中心的领域特定语言,并配套角色分工的多智能体系统,通过 Plan-Execute-Critic 循环分解请求、生成代码并利用执行反馈迭代修复错误。
研究者提出 RUPA(Relational Uncertainty Propagation for Agents),一个面向 LLM 智能体的轨迹级不确定性量化框架,将执行历史建模为有向轨迹图,在推理状态、工具交互与环境反馈节点间传播不确定性。