FlowEvo:工作流与可执行技能共同演化的免训练智能体框架
FlowEvo 是一个免训练框架,让工作流与可执行技能在推理时共同演化,把成功的工作流编译成可调用技能存入持久技能库,并追踪各技能的下游效用、抑制造成负迁移的技能。
项目更新、模型与开源社区动态
FlowEvo 是一个免训练框架,让工作流与可执行技能在推理时共同演化,把成功的工作流编译成可调用技能存入持久技能库,并追踪各技能的下游效用、抑制造成负迁移的技能。
TinyCast 是一个无注意力机制的零样本预测器,仅 146,505 个参数即可输出预测分布,其核心思路是用零参数频谱检测器计算上下文的主周期,再按相位折叠后由膨胀卷积编码器和块自回归分位数解码器建模其余部分。
Claude Code v2.1.239 发布,成本估算(/cost、状态栏、--max-budget-usd)现对数据驻留工作区计入 1.1× 美国境内推理溢价。
论文在 37 项任务上对比 10 个 LLM 与 26 个嵌入模型(118M 至 14B 参数),结果显示两种方案总体性能基本持平。
分层机器人基础模型 τ_0-VLA 将高层子任务生成建模为可扩展计算的推理问题,通过世界模型引导的测试时计算,在每步推理中借助执行记忆生成子任务,必要时搜索备选方案后再输出。该模型基于 40,115 小时异构真实世界数据和多模态协同训练,在域内与分布偏移场景下增加测试时计算均显著提升下一子任务预测准确率,并转化为长程机器人操作任务更高的闭环成功率。
QuoteBench 用 56 个一次性任务、14 个事故衍生家族,在生成契约与执行传输之间加入一个故意未转义的解析器,测量命令生成错误与生成后故障的边界。八个同窗口配置中,同一回复经该解析器重放后成功率下降 55.4 至 73.2 个百分点,披露边界可为六个配置挽回 30.4 至 60.7 个百分点。
研究者提出分层自我改进(HSI)框架,让冻结的 LLM 在任务 harness、改写 harness 的 evolver 和改写 evolver 策略的 meta-evolver 三个层级上运作,harness 可随迭代热切换并依据环境反馈重写。
研究人员提出 GOAG,一种学习特定夹爪接触面分布隐表示的深度生成模型,无需物体专属训练数据即可采样有效抓取配置,仅在推理时引入物体特征。在 MultiDex 数据集上,该方法平均成功率达 86.93%,生成大量抓取时速度显著更快,性能与专门针对该数据集训练的领先方法相当。
CoToGrasp 是一种严格以特定接触拓扑为条件生成多样稳定抓取的生成式框架,采用与物体无关的训练方式,通过基于特征的规范工作空间将局部物体特征投影到统一的以夹爪为中心的域中,实现对未见物体的零样本泛化。在 DexGraspNet 数据集上,CoToGrasp 取得 SOTA 性能,超越现有分类法引导的规划器,并在实体机器人平台上验证了所合成接触拓扑的物理可行性与运动学可行性。
研究将三个前沿 MoE 模型(阿里、OpenAI、NVIDIA,各 3.6-4.0B 激活参数)微调为用低资源语言推理,发现准确率基准几乎无变化,仅改随机种子就能让分数波动 7.7 分。
研究者推出 NARU 基准,用于评估日语长视频中的叙事演变与文化理解推理,包含 1,481 道问题、155 个视频共 146.8 小时,覆盖四个叙事与五个文化维度。该基准通过分层记忆标注流程构建,并经 68 名母语者两阶段验证。对八种模型配置的评测显示,模型在长程叙事整合与文化根基推理上均存在明显不足。
研究者提出自监督框架 NAPE(Next-Audio-Patch-Embedding prediction),用因果 Transformer 从 log-mel 频谱图的先前 patch 嵌入预测下一个 patch 嵌入,仅靠因果掩码和 stop-gradient 作为训练信号,不使用重建解码器、声学 tokenizer、师生结构或辅助正则损失。
论文提出 SWE-bench Science,这是一个仓库级科学软件工程基准,包含来自 98 个 GitHub 仓库、覆盖 20 个科学领域的 119 个任务,并分为 Issue-driven、Expert-exploratory、Engineering-integration 三种范式。
研究提出一套量化 ASR 模型基准优化的方法,聚焦音频无法确定参考转写文本的情形,通过参考分歧、掩码数字恢复和拼写切换三类行为探针发现,得分最高的开源模型在音频矛盾、被掩码或含糊时仍逐字输出基准参考文本片段。机制探针显示模型会依据狭窄声学线索覆盖对音频的忠实表征,转而采用基准优化策略,且该行为可通过低秩线性引导或简单在片段末尾追加音频被因果操控。
研究提出 Chain-of-Experience(CoE),让 LLM 在测试时通过自我反馈或环境信号(如正确性、公开代码测试通过率)迭代积累经验,形成持续改进循环。在数学、编程和知识任务上测试 8 个 LLM(含 GPT-5、Gemini-2.5 Pro、Claude-4.5 Sonnet),整体提升 5.6%,API 成本降低 19%,且每 token 准确率高于现有测试时策略。
FlashPrefill V2 将块稀疏 Prefill 注意力从算法原型推进到可部署的长上下文 LLM 服务方案,新增均值修正项抑制近似误差,并重写稀疏注意力算子以对齐 FlashAttention-3/4、支持 FP8 推理。
SkillEvo 提出用多轮用户模拟生成反馈梯度、并用独立治理层约束进化方向,解决现有 Agent Skills 进化在首轮修补后梯度衰减、多轮缺陷不可见而停滞的问题。在 6 类云服务、9 个生产 Skills 和 98 个 skill-reference 文件上,SkillEvo 比基于自我反思的进化高 23.0 分,比单轮 QA 驱动的进化高 15.4 分。
inclusionAI 发布 Ling-3.0-flash 的 DSpark 推测解码草稿模型,1.36B 参数、BF16 精度、5 层全注意力,用 SpecForge 训练并支持 SGLang 与 llama.cpp 部署。该草稿模型采用 8 个 draft token 的块大小(验证宽度 9),在 GSM8K、HumanEval 等九项负载上的接受长度宏均为 5.29。
Repo0 是一个面向零到全代码生成的持续结构演化框架,用需求级 DAG、组件级 DAG 及对齐关系构成的 Dual-DAG 显式维护架构状态,通过模块化指标引导结构动作迭代演化组件边界,收敛后再驱动测试驱动开发生成代码。
研究者提出 IAR(Inject、Align、Recover)三阶段后训练框架,将固定语料转化为参数化知识,实现无检索文档问答。
4DAnyone 提出一套框架,可从未经标定的单目视频重建 4D 人体,做法是先生成达到重建级多视角一致性的视频,再提升为 4D Gaussian Splatting(4DGS)。
ForgeWM 提出渐进式框架,通过域适应、教师强制因果训练、因果一致性蒸馏和基于双向教师的 on-policy 分布匹配,将双向动作条件视频生成器转为少步世界模型,学生模型稳态去噪预算为 1、2、4 步。
研究提出 MemTrapBench,用于评测 LLM 记忆使用中由记忆引发的认知陷阱,涵盖 Reasoning Fixation 和 Belief Distortion 两类。
WithEveryone 是一个可生成最多十个参考身份群体图像的统一框架,通过将每个身份注入为带地址的 token、预测结构化身份—布局方案并渲染为视觉条件来实现身份保持。
EXIMO 是一种面向 VLA 策略的高效微调算法,分探索、模仿、优化三阶段:探索阶段由 VLM 充当规划器,把长时程任务拆解为短任务,并与 VLA 协同采集数据集;模仿阶段用该数据微调 VLA;优化阶段再用残差 off-policy RL 进一步微调。实验显示其在样本效率和最终性能上显著优于现有方法。
谷歌提出 Environment Harness(EnvHarness),一种可编程插件层,能在不修改底层逻辑的前提下重塑静态环境行为,并保留原有验证器。配套的 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹合成针对缺陷的 EnvHarness 组件。
PolicyGuide 将领域政策编译为工作流图,并在用户轮次边界调用主动验证器,从持久化图状态中核对未决请求并给出符合政策的步骤级补救指引。
针对现有奖励指标分开评估音频、视觉与同步性、易被 reward hacking 的问题,研究者构建了 VAPref-10K 人类偏好数据集(9K 提示词、10.3K 细粒度成对比较)与 VA-Judger-Bench 基准,并提出链式思维全模态奖励模型 VA-Judger。
Claude Code v2.1.238 新增 `keybindingFlavor` 设置,设为 `"readline"` 后 Ctrl+W 可按 Bash 方式删除至前一个空白符,默认 `"classic"` 不变。
研究者提出首个音乐上下文保持(MuseCP)评估框架 MuseCPEval,覆盖四类音乐属性并配有细粒度指标,用于衡量音乐编辑中本应保持不变的音乐特征。客观验证与人类研究证实了这些指标的有效性,对多种音乐编辑系统的案例研究显示其可作为测试平台与诊断工具。该工作已被 ISMIR 2026 接收。
RapidLiDAR 将 LiDAR 场景补全的初始化本身变为可学习的数据驱动模块,通过自适应初始化预测每个输入点的空间变化位移,无需手动调噪声。该方法在 SemanticKITTI 和 KITTI-360 上达到与 SOTA 相当的补全性能,0.1 秒完成整场景,比此前最快方法快 2.3 倍,匹配车载 LiDAR 10 Hz 采集率。论文已被 ECCVW 2026 接收,代码已开源。
研究团队提出数据生成框架 HOTFIXR,通过探测学生模型的多语言薄弱点并生成定向合成训练数据来缓解语言特定能力差异。在三个分布内任务、三个分布外任务和四种分布外语言上,HOTFIXR 平均将分布内性能提升 6.2%,并将微调导致的分布外任务灾难性遗忘降低 3.7%、分布外语言性能降低 7.1%。代码将在论文被接收后发布。
研究者提出 Structured Prior Knowledge(SPK)框架,从预训练目标检测器中显式提取与 OoD 相关的先验知识,用于识别分布外物体引发的过度自信幻觉。
论文提出 Bounded Agents 委派安全框架,用 Agentic Principal Chain(APC)在模型之外对多智能体请求执行六项授权检查并限制委派范围与预算。
inclusionAI 发布 ArmorOCR,一个基于 Qwen3-VL-8B-Instruct 的两阶段对抗性 OCR 感知框架,可在原图上单次推理,无需推理时的视觉变换或工具辅助。
inclusionAI 在 GitHub 发布 LLaDA-Research,一个面向 LLaDA 2.x 模型家族的英文优先研究索引站,用 MDX 发布模型、论文与技术博客并部署为 GitHub Pages 静态站点。
SkillGate 通过将 token 支持划分为两条互不重叠的信用通道——结果信用只到达执行 token,动作局部优势只到达技能命名 token——解决了长程智能体技能选择中的"选择器信用饥饿"问题。在 16 个候选技能的设定下,五个智能体基准测试中,SkillGate 将 9B 策略的试验成功率从 40.8% 提升至 53.2%,同时将误导性候选的暴露减少三分之二,并读取更少的技能。
AdaPop 是一种按事实流行度自适应调整梯度压力的 LLM 遗忘方法,结合局部 token 置信度与来自 Wikidata sitelinks、LLM-as-Judge 等外部代理的流行度指数,并用双上升控制器逐 epoch 自动调节保留惩罚。在三个模型家族和两个基准上,AdaPop 在改写查询下泄漏的遗忘内容比对比方法少约 5 倍,在对抗性改写下少约 1.6 倍。
一种基于序列标注的 token 级幻觉检测方法,融合文本统计、NLI 蕴含与语言模型 surprisal 构成 33 维特征流,用 BiGRU 在 RAGTruth 上达到 0.840 AUC,比独立逻辑回归基线提升 11 个点(p = 0.002)。
研究者提出属性引导的体裁扩展框架,将主题广度与体裁形式控制分离,用人工撰写的故事提示词作创意种子、人工整理的体裁属性约束结构风格,构建出覆盖故事、说唱、歌词、剧本、游戏设计等 13 种体裁的 5 万条 Multi-Genre Collection 语料。