Debias-SparseGPT:面向大语言模型的偏差感知剪枝方法
Debias-SparseGPT 是一种训练后剪枝方法,通过基于人口统计学对比输入定义的二阶项引入表征去偏,在 25%、50% 和结构化 2:4 稀疏度下均比 SparseGPT 减少剪枝引入的偏差,同时保持模型困惑度和零样本准确率。在最严格的 2:4 结构化稀疏下,用长上下文、内容丰富的样本增强校准集可进一步提升下游性能与公平性。该工作已被 EMNLP 2026 接收。
项目更新、模型与开源社区动态
Debias-SparseGPT 是一种训练后剪枝方法,通过基于人口统计学对比输入定义的二阶项引入表征去偏,在 25%、50% 和结构化 2:4 稀疏度下均比 SparseGPT 减少剪枝引入的偏差,同时保持模型困惑度和零样本准确率。在最严格的 2:4 结构化稀疏下,用长上下文、内容丰富的样本增强校准集可进一步提升下游性能与公平性。该工作已被 EMNLP 2026 接收。
研究用语言模型表示从企业信息环境中推断企业间互动结构:每家企业表示为新闻文章嵌入向量的分布,通过目标锚定的 Wasserstein barycentric 重构为每家企业选出能重建其信息足迹的加权企业组合。
研究提出用企业级分布特征替代跨资产收益协方差,为投资组合风险提供单边上界证明,加权成对松弛在可检验条件下凸且只需边际波动率尺度。在2018-2022年52家公司面板上,基于Qwen3-Embedding-8B新闻表征构建的配置在四个预设上限组合群体中处于样本内方差第0.69至1.33百分位,等风险加权则处于第21.1至28.6百分位。
FoldingAgent 是一个智能体框架,能直接从折纸演示视频中推断出显式的参数化折叠程序。它基于预训练 VLM,配备模拟几何变换、验证物理合理性、检索比对视觉内容及自评估预测的工具,并定义了几何与参数化折叠动作构成的参数空间,可顺序操作并重新规划动作以缓解多步折叠的累积误差。
NeoMME 是一族 260M 和 800M 参数的多模态多语言双向编码器,用单个双向 Transformer 编码器直接处理多语言文本和原始图像 patch,支持 16,384 token 上下文,可编码最多两张标准 4K UHD 图像。
研究者提出一种知识门控任务构建协议,将任务指令与包含私有约定、参考表和工具算子的紧凑 artefact 分离,通过构建溯源、字节一致指令、泄漏审计和可执行见证让任务对 artefact 的依赖可测试。
研究者提出 LLAMIA-Bench,包含六项协作国际象棋任务,用于检验 LLM 与非语言智能体协作时"语言化"是否构成瓶颈。他们提出潜在状态内化方法,将子智能体的连续表示直接投影为 LLM 的 state token。
研究者提出 KBMR,首个专为知识型视觉问答(KB-VQA)设计的基于 MLLM 的嵌入检索器,将图像映射到更能保留概念身份的语义空间。针对 Wikipedia 规模检索中的噪声监督,KBMR 引入基于 MLLM 的语义判别器生成连续实体一致性权重,并据此设计连续语义蒸馏目标。
研究者提出 Autoregressive Mosaics(AM-Bench)基准,用翻译任务和布局任务区分纯文本 LLM 是真正具备 2D 空间布局内部表征,还是仅能把空间描述转成代码。
ZipTok3D 是一种面向极短 token 序列高保真重建的 3D 分词器,通过嵌套 dropout 训练让每个保留前缀都能重建完整物体,并用参数共享的 Transformer 块迭代解码。
腾讯元宝团队提出 SnapBench,首个针对 snap-and-ask 多模态检索的成对鲁棒性基准,包含 1,145 条查询、9,085 个图库条目和 53 种受控损坏条件,并评测了 16 个多模态检索器。
VibeVoice-ASR-Streaming 技术报告提出一种基于 LLM 的端到端流式说话人归属 ASR 方法,将固定大小音频块、少量前瞻音频与历史文本交错输入,无需独立说话人分离阶段即可在语音到达时输出谁说了什么。7B 模型在五个评测集上取得最低平均 WER/CER,说话人归属在 13 项评测设置中有 12 项最佳或并列最佳。团队同时开源 1.5B 与 7B 模型权重及推理代码。
CRISP 是一种面向长上下文 LLM 推理的输入自适应稀疏预填充方法,用结构代理 C_struct 替代 JSD 路由,并基于噪声底设置 sink-aware 阈值以消除选择阶段的 O(n) 背景噪声。
SimLoss 是一种无参考的嵌入空间目标函数,用于单次推理的细粒度图像描述,通过 InfoNCE 对比损失将视觉语言模型投影的隐藏状态与冻结图像嵌入对齐,无需人工细粒度描述或多阶段伪描述。其全微分微调版本 SimLoss FFT 精度最高,F1 接近多阶段方法,且推理速度约为多阶段流程的 20 倍;基于奖励的 SimLoss GRPO 召回率最强。
研究团队与波士顿公共图书馆联合发布 Institutional Newspapers Pipeline,从 1,473,635 份 1795 至 1930 年的公有领域报纸扫描件中提取出 83.1 million 个文本切片,OCR 输出达 16.3 billion 个 o200k_base token。
研究者提出 DisCo 技能驱动研究智能体,可将 GitHub 仓库蒸馏为可复用技能。其任务无关蒸馏产出 AREX-Skill Library,从 1,000 个常用 ML 仓库提炼出 5,000+ 个已验证技能,覆盖 20 个领域、178 个能力族。
研究者提出交互式基准 S3Gym,用 Self-Testing、Self-Judging、Self-Improvement 三项耦合能力评估 LLM 的自我改进,并在七款带可执行环境验证器的文本游戏中区分宽松探索与严格留出评测。
研究者提出 HarnessDev 基准,将评估对象从任务输出转向可运行基础设施,包含 Creation 与 Evolution 两个阶段。Creation 覆盖 6 个创建者 LLM、4 个领域和 5 个下游基准共 2,207 个实例,生成 harness 在代码与搜索研究上落后于人工参考,在写作与机器学习实验上持平或超越,执行成本差异较大。
EarlyEval 是一个轻量框架,通过训练一对 LightGBM 成功与失败分类器,在 Agent 执行过程中提前预测最终结果并终止运行,从而降低评估成本。
研究团队提出 ASPIRE 基准,考察模型能否仅凭一句自然语言能力目标完成自我进化,下游评测任务对智能体保持隐藏。智能体需自行选择数据与更新方法、构建训练和验证信号并决定何时评测,基准同时支持模型权重与 agent-harness 两条进化路径,并在覆盖六个目标的 520 条隐藏专家题目上评测。
研究者提出 Declarative Attention(DA)协议,让模型在思维链中主动声明需要关注的上下文区域,推理引擎像解析工具调用一样跳过大部分 KV cache 读取。
论文提出一套端到端后训练流水线,结合 22,000 道题的数据筛选、合成推理轨迹、SFT 与 RL,训练出 Nemotron-3-Nano-CC(30B-A3B)和 Nemotron-3-Ultra-CC(550B-A55B)。
研究团队提出 Kirin 框架,可从野外动物视频重建 3D 动作、大规模学习动作先验并生成可直接用于动画资产的真实动作。团队基于大量野外视频构建了 AiM3D,这是首个面向四足动物、提供对齐视频-文本-动作三元组的大规模数据集。其视觉引导动作生成模型以文本和图像为条件,结合现成图像到 3D 模型自动绑定并驱动 3D 网格,生成可直接渲染的动画动物。
研究通过系统性消融实验确定鲁棒视觉文本表示学习的四个关键要素:可变图像分辨率与渲染字号、自然图文对、布局感知渲染、两阶段多语言课程。据此训练的 Pixel Linguist II 采用原生分辨率与实时渲染,在 2.8 亿训练样本上完成多语言课程训练,在英文、跨语言及多语言 Visual STS 与 ViDoRe 上取得新的 SOTA,并在 80% 视觉 token 压缩下保持稳健。
论文提出 ExecRetrieval 代码检索基准,包含 939 个 Python 任务,每个任务配有一个经执行验证的规范实现和最多四个执行验证的缺陷干扰项。在评测 23 种稠密嵌入配置与 BM25 后,检索池含近似克隆反事实时头部托管系统的 exec@10 达到 1.00,但 exec@1 仅 0.331。
针对 RLVR 依赖粗粒度结果奖励、对中间推理过程指导不足的问题,研究者提出奖励塑形策略 Cliff,用现成 LLM 作为教师识别每条 rollout 中的第一个错误,将轨迹拆分为正确前缀与错误后缀,并转化为 token 级优势。在 12 个场景的实验中,Cliff 持续提升推理表现,分别超过 on-policy distillation 15%、标准 GRPO 7%,即使教师模型能力一般也有效。
PaperCompiler 将论文证据编译为显式的仓库级实现规格,保留来源溯源并区分论文支持、推断、外部委托和未解决信息,规格中编码非退化要求、归属分配、跨文件依赖和文件级约束。在 Paper2CodeBench 上,其基于参考的忠实度相对提升 13.8%(从 3.64 到 4.15),高严重度评估批评从 13.2% 降至 6.1%。
论文提出 SolarWM,一个完全开放的视频世界模型基础,覆盖从数据准备到长时程推理的全流程。其数据引擎把 10 个数据集的 143 万条片段统一为帧对齐格式,并在共享接口下基于 Wan2.2、LTX-2.5 和 MiniMax-H3 实例化四个 5B 至 33B 模型。模型仅用 5 秒序列训练即可支持分钟到小时的实时交互 rollout,数据、流程、配方、权重与框架均已开放。
针对采样 token 在线策略蒸馏(OPD)中 pass@1 提升但 pass@k 停滞的多样性蒸馏失败问题,研究者提出一阶局部熵影响(First-Order Local Entropy Influence),将每次更新的熵效应拆解为师生对数概率差与学生局部概率结构。
研究者推出 Multi³IR 基准,包含 104.9K 条 Stack Exchange 查询,每条都标注了捕捉查询隐含视角的视角描述,用于评估检索器在跨领域、跨模态下覆盖开放式查询多面视角的能力。
CoGR 是一个让 LLM 在查询侧和物品侧直接生成关键词表示的检索框架,关键词通过倒排索引匹配,兼容现有检索基础设施。它采用两阶段训练:先监督微调建立对齐的关键词空间,再用 GRPO 交替优化两侧生成器,物品侧使用反事实边际奖励。在内部 APP Marketplace 数据集和公开 WANDS 基准上,CoGR 的 F1 分别比最强基线提升 10.9% 和 36.1%。
研究提出"内生授权洗白"概念:LLM 智能体的持久记忆若错误记录权限变更,可在无外部攻击下凭虚假授权执行未授权操作。新基准 EAL-Bench 测试显示,增量记忆更新下写入方为最高 50.2% 的未授权请求创建虚假权限,执行方在 98.6% 的试验中照此行动。要求权限有有效源事件背书、用有界事件溯源追踪权限变更可大幅降低洗白,但也会拒绝更多合法操作,形成安全与效用的权衡。
RealSWE 提出由 SWE-bench Verified 与 Pro 衍生的 381 个多变量任务族,用于评测真实用户请求风格下的编码智能体。对真实提示词与基准问题的对比显示,只含问题陈述的请求占真实提示词的 88%,在基准问题中仅占 7%;87% 的真实提示词为随意书写,而 94% 的基准问题为正式书写。
基于 logit 的知识蒸馏在中训练阶段会拖慢事实记忆的习得,但推理能力仍持续提升,原因是教师模型对程序性数据更有信心、而学生模型更早掌握低熵事实知识。为此提出的 Switch Distillation 以教师预测熵为路由信号,仅在教师有信心的 token 上蒸馏,其余回退到交叉熵。
研究对比了脚本专家与 ACT 策略在 ParcelStow 接触密集型任务中不同执行速度下的表现:两者在标称速度下均达 100% 成功率,但在最大演示速度下专家成功率为 84%,ACT 仅为 53%。
Claude Code v2.1.259 新增 `managedMcpServers` 托管设置,组织可为每位用户下发 HTTP/SSE MCP 服务器;同时加入 `--permission-prompts none`,供无人值守的 headless 主机自动拒绝所有弹窗请求。
研究者提出 agentic data cracking,让智能体在推理过程中顺带将非结构化数据自适应、推测性地结构化,从而减少重复打开文档的开销。在 FanOutQA 上每道测试题仅扩展一个相关问题,该方法在保持准确率的同时将成本降低 53%;而理想预结构化存储的推理成本可低 28 倍。
论文提出 AgentJudgeBench,称其为首个系统研究 LLM-as-a-judge 在智能体工具调用工作流 DAG 上可靠性的基准,包含 3,808 个实例、六种 DAG 拓扑和三个难度层级,用五个生成模型与六个裁判模型在有无真值条件下配对评测。
研究团队通过生产错误分析定位指令遵循、函数调用和内部任务分布三方面差距,为每个维度单独训练 GRPO 专家并用两阶段 SLERP 合并,将 200 多个内部应用的流量整合到单一自托管模型上。
腾讯混元联合北京电影学院、北京大学等发布 DramaChain Bench,这是首个覆盖剧本、分镜、关键帧、镜头级视频到成片全链路的短剧生成评测基准。该基准基于 DramaChain Dimensions 的 5 个评估轴、63 个叶子维度构建,由 3 位专业标注员对 5,785 个条目独立打分,产出 17,488 条有效评分和 255,925 条可追溯归因记录。