HyQuant:面向 LLM 注意力机制的混合精度量化框架
HyQuant 是一种面向 LLM 注意力机制的混合精度量化框架,将大部分注意力状态量化为低比特,仅保留少量竖线 token 和局部窗口状态为高精度,并以轻量级竖线感知注意力模式信号筛选这些精度关键区域。
项目更新、模型与开源社区动态
HyQuant 是一种面向 LLM 注意力机制的混合精度量化框架,将大部分注意力状态量化为低比特,仅保留少量竖线 token 和局部窗口状态为高精度,并以轻量级竖线感知注意力模式信号筛选这些精度关键区域。
Intern-NCP 团队发布 NCP-ArchPreview 技术报告,该隐空间语言模型在标准 token 级自回归生成之外,通过下一概念预测(NCP)学习跨多个 token 的离散概念,并用隐状态构建乘积量化的概念词表。
研究团队提出 CARDEA,一个用于冠脉造影(CAG)端到端解读的大型视觉语言模型,可从原始多视角视频经关键帧筛选输出研究级诊断,并展示结论背后的可审计空间证据。
SenseNova-U1.5 发布,这是一个 8B-MoT 原生统一多模态模型,在无编码器、无 VAE 架构下实现视觉内容的理解、推理与生成。模型支持最高 4K 原生分辨率,并通过多专家 on-policy 蒸馏优化视觉美学、双语文字渲染、信息图生成与图像编辑等能力。官方将开源训练代码,涵盖监督微调、强化学习与 on-policy 蒸馏。
针对 AutoResearch 智能体 RL 训练中环境执行成为瓶颈的问题,研究者提出 World Model RL(WMRL),用世界模型替代环境执行,并配合 Online Debiasing 与 Inverse-Variance Denoising 分别抵消偏差、抑制噪声,理论上证明两者严格改善收敛保证。
研究团队推出 T1,一个 122B 总参数的 Mixture-of-Experts 模型,通过强化学习在云沙箱中操作真实 shell,单任务支持 300+ 轮工具调用,并以任务自带 verifier 执行结果作为奖励。
Claude Code v2.1.268 发布,在 gateway.yaml 中设置 pricing 后,已登录客户端可通过托管设置获得相同费率,使 /cost 与遥测数据同支出计量保持一致。
PARSER 将长文档读取与推理解耦:一组轻量子智能体各自绑定单个 chunk 并行读取全文,主智能体通过迭代 scatter-gather 轮次广播查询、聚合证据并生成更深层追问,仅主智能体用强化学习优化,子智能体保持冻结。
开源答案引擎 OreoLook 提出三层缓存架构,在单台 8-vCPU Intel Cascade Lake 服务器上实现 89.3% 的 Redis 键空间命中率、0.1 ms 读取延迟和仅 1.38 MB 内存开销。
论文提出 SCHEMEARENA,一个 400 场景的基准,通过因子化场景合成框架对 LLM 智能体中的图谋行为做可扩展压力测试,覆盖多种安全相关工具域、工具性目标、管控条件和施压机制。
蚂蚁集团推出 Ling 家族首个金融增强模型 Ling-3.0-flash-Fin,总参数 124B、激活参数 5.1B,支持 256K 上下文窗口。该模型基于 Ling-3.0-flash 用高质量金融数据继续训练,覆盖端到端金融研究、多文档推理与估值建模,并同步开源 FinFIRST 评测集。当前以 BF16 发布,兼容 SGLang 与 vLLM,默认开启思考模式。
蚂蚁 inclusionAI 发布 Ling-3.0-flash-Fin,这是蚂蚁 Ling 家族首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,具备 124B 总参数、5.1B 激活参数和 256K 上下文窗口,并同步开源评测集 FinFIRST。
蚂蚁集团 Ling 家族发布首个金融增强模型 Ling-3.0-flash-Fin,总参数量 124B、激活参数 5.1B、上下文窗口 256K,基于 Ling-3.0-flash 在高质量金融数据上继续训练。
研究针对稀疏二元信号在噪声线性测量下的支撑集恢复问题,给出稀疏高斯测量矩阵在高信噪比区间 $ds/p \to \infty$ 时最大似然恢复所需最小样本量的充分条件,并结合已知下界得到阶为 $s\log(p/s)/\log(ds/p)$ 的信息论阈值。
研究者推出 StochBench,一个包含 450 道研究生级随机过程问题的 Lean 4 基准,每题配有自然语言题面,覆盖 Markov 链、鞅、布朗运动、随机微积分等 Mathlib 中较少涉及的领域。
研究提出 influence-guided response rewriting,用影响函数(IF)定位干预目标,在保持指令不变的前提下将样本回答替换为行为对齐或行为相反的监督信号。
研究者提出 Brain2Semantics2Text,通过中间语义嵌入空间重建文本,将句子级 MEG 响应映射到语义流形后再反演为自然语言,无需词级对齐即可恢复高层语义。该方法针对非侵入式神经记录信噪比低、难以细粒度重建音素或单词的问题,与既有非侵入式 Brain2Text 方法相比在句子级结果上取得提升。
AgentGrad 是一个面向 LLM 多智能体系统的提示词优化框架,通过顺序干预逐个修改智能体行为以定位导致失败的目标智能体,并用其输出作为智能体级监督提取细粒度文本梯度。该方法还通过语义文本梯度抽象对相似梯度聚类,避免混合无关失败模式。在五个 MAS 基准上,AgentGrad 达到 SOTA,优化耗时降低 2.5 倍,优化成本平均降低 21.8%。
OracleZoom 是一个受在线策略蒸馏启发、带参考约束的递归图像超分辨率框架,通过在训练轨迹上保留最后一次真实标注证据来监督更深层预测。它在七个数据集上取得 SOTA 超分质量,平均 CLIPIQA 达 0.713,深层放大尺度收益更大,并显著减少模型幻觉。代码、数据与模型均已开放。
一篇综述系统梳理了 VideoLLM 的推理效率机制,覆盖帧采样、模态编码、连接器层 token 压缩以及 LLM 预填充与解码各阶段的瓶颈。研究按方法作用的流水线阶段进行归类,涵盖 2022 年底以来的 VideoLLM 及更早的帧采样与视觉编码器机制,并汇总了共享宿主模型与输入协议下的精度—成本对比,指出音视频效率与标准化评测仍存空白。
HybridAL 是一种自适应训练调度方法,通过监测在线稳定信号,在模型轨迹持续稳定后从重新训练切换为微调。在三种编码器骨干和六个文本分类任务上,HybridAL 的端点 macro-F1 与重新训练和微调相比不劣于 0.010 的差距,最多节省 49% 的重新训练时间,并恢复了重新训练在 NLL 校准上的大部分优势。相比固定轮次切换,它在中度额外成本下获得更低的 NLL。
论文发布 SWE-Bench Pro Verified,针对 SWE-Bench Pro 的两类可靠性问题做修正,形成更可信的软件工程智能体评测基准。原基准的问题一是奖励攻击,源自定义解法或隐藏评测信息泄漏;二是任务质量,包括问题陈述误导与测试范围不当,这些都会抬高分数。
SyncWorld 是一种动作条件世界模型,借助视觉校准片段(成对帧与动作)在上下文中指定具体环境的 Action-Visual Mapping,无需额外训练即可跨未见环境充当零样本模拟器。实验显示,SyncWorld 能在先前未见场景中准确模拟动作结果,并支持测试时策略改进而无需训练。
研究团队提出 DF26 基准,用于检测由近期文本到视频和图像到视频模型生成的合成视频,视频为单人公开演讲场景,包含 271 条真实视频与 2,420 条合成视频,合成视频由七个现代视频模型生成。基于 DF26 的研究显示,人类识别 AI 生成视频的表现以及当前最先进的 deepfake 检测器都接近随机水平。研究指出当前评测协议存在局限,需要能明确衡量对现代生成模型分布偏移鲁棒性的基准。
研究者推出 WearableQA 基准,包含 4,084 道 10 选项多选题,数据来自 200 名真实用户的可穿戴时间序列、血液生物标志物与人口统计信息,每人最多 500 天日常测量。
研究者提出 SAEScientist-Bench,用于评估 AI 智能体能否像科学家一样使用 SAE 工具自主完成机制可解释性发现。任务要求智能体在 Gemma-2-9B-IT 的 Gemma Scope 词典中检索 131K+ 特征,并与 Neuronpedia 上的专家参考特征对比激活排名、对比文本上的概念选择性和因果引导效果。
针对 agent harness 与模型权重共同决定行为的问题,研究在七项企业 agent 任务上先为较弱模型演化 harness,再用更强专家监督。但让弱模型模仿专家完整轨迹会导致 Qwen3-Coder 和 Gemma 4 在全部七项任务上回退 4 至 30 分,原因是模仿破坏了模型与 harness 的匹配。
研究在共享 Flutter/Dart 数据集上训练 Rainbow-Pony-100M 和微调 Qwen2.5-Coder-0.5B 两种代码模型,对比直接生成整文件与迭代 diff 编辑两种输出方式,在约 1,790 个任务上评估。
DianShi-RxnDB 是一个通过全自动抽取与归一化流程构建的大规模细粒度有机反应数据平台,整合专利文本、图像与反应式,覆盖 USPTO 和 EPO 1976 至 2025 年的有机合成专利,产出约 2400 万条反应实例,其中约 1480 万条(61.7%)通过自动质检。
针对 AI 研究智能体的成果声明,Discovery Certification Protocol(DCP)将其转为在注册模型、信息边界和预算下的可执行审计,Gate 1 验证有效改进,Gate 2 用匹配智能体测试可复现性,Core 要求零复现且给出有限样本复现上界。
研究者构建了 RESCUE 基准,用于评估 LLM 能否捕捉并利用多人关系中不断变化的动态来提供情感支持。该基准取自真实情侣与家庭访谈对话,包含 191 个样本、7,079 个标注轮次和 1,064.8 分钟视频,定义了关系理解与关系敏感支持两类能力下的六项任务。对十款 LLM 的实验显示,模型在依赖局部情绪线索的任务上表现尚可,但在关系模式预测、观点预测和支持策略预测等关系密集型任务上表现不佳。
研究团队提出 AgenticGen,一个奖励引导的智能体框架,将广告视频生成拆解为策略选择与草稿生成两个可训练推理阶段,并从在线反馈中学习性能奖励、结合人工质量标准的评分奖励来监督策略优化。
Puppeteer 是一个姿态感知、物体锚定的共语手势扩散模型,在因果潜空间中运行,将长手势分解为结构化基元并编码为时序有序的潜 token,再以语音、运动历史、初始姿态参考和物体几何为条件进行扩散生成。
Show-Harness 是一种 Embodied Harness,通过离散语义动作单元接口让 VLM 直接控制机器人,无需额外模型容量或昂贵的本体专用预训练。
研究者提出 Φ-Bench,用于系统评估 LLM 工程化 LLM 基础设施栈的能力,覆盖从局部 kernel 级函数补全到长周期实现与端到端系统优化等不同复杂度任务。该基准源自前沿研究中的优化问题并基于真实代码仓库构建,弥补了现有基准仅关注孤立 kernel、预定义算子或预设优化目标的不足。对前沿 LLM 的实验揭示了其在工程化复杂 LLM 基础设施上的现有能力与局限。
研究发现,LLM 后训练(如 SFT)中完整推理轨迹带来的收益有限,而部分轨迹即使被大幅截断仍然有效。基于注意力的分析和受控 token 移除实验表明,中间 token 对最终推理质量贡献极小,模型可依据已知轨迹端点从内部知识推断缺失步骤。仅用端点训练还能改变推理行为,并提升基于强化学习或 on-policy 蒸馏的后训练方法效果。
Programmable World Model 提出一种可编程世界模型框架,把世界状态演化与视觉观测生成解耦,由智能体将自然语言指令翻译为可执行程序,以指定实体状态和状态转移规则。
研究者提出 StudyBench,一个受控物理基准,直接衡量自进化方法将训练材料转化为能力的效率,测试集分为评估吸收能力的 Application Set(难题)与评估迁移能力的 Transfer Set(奥赛级题)。
研究者提出 Graph Machine(GM)架构,维护 O(n) 大小的状态并通过稀疏动态路由访问,用类似指针追逐的 referral 机制以可微分方式更新边。
研究者提出 EvoHarnessBench,一个在可控 harness 演进下评测 LLM 智能体的基准,覆盖工具、技能和智能体三个维度,包含 802 个任务、520 个工具、42 个技能和 62 个智能体。