论文审计 37 个 LLM 作为合成问卷受访者的心理测量效度,结论是看似合理但无效
研究以立陶宛 263 名员工的组织心理学问卷(68 个题项、12 个分量表)为基准,审计 37 个 LLM 充当合成问卷受访者的表现,结论是 LLM 样本不能直接替代真人问卷数据。
项目更新、模型与开源社区动态
研究以立陶宛 263 名员工的组织心理学问卷(68 个题项、12 个分量表)为基准,审计 37 个 LLM 充当合成问卷受访者的表现,结论是 LLM 样本不能直接替代真人问卷数据。
论文团队仅用二手部件从零搭建 128 张 GPU 的 DumpsterCluster 并运行一年,通过流水线并行优化,使其基于 V100 的集群达到有竞争力的 LLaMA-70B 吞吐。
PACE-Bench 是一个基于模拟器的基准,包含六个物理领域的 144 个源到目标适应对,用于测试智能体在环境条件改变后能否通过代码迭代恢复。评测显示 Reflexion + Qwen3-14B 仅解决 35.9% 的完整基准对,GPT-5.5 在完整预算下解决 Statics 子集的 66.7%。结果表明基于模拟器的反思比未经验证的自我修正更可靠,而机制重设计而非参数推断才是核心瓶颈。
针对 RAG 投毒攻击,研究者提出轻量检测框架 D-SCAN(Document-level Signal Collapse Analysis),通过监测生成器注意力动态识别被攻击的生成结果。
ENTLORE 是一个图基企业问答基准构建框架,包含来自三类来源的 2,341 篇文档和 907 道问题,覆盖显式查找、跨源组合与隐性组织推理三类任务,并在 56 种模型与访问配置上评测。即使提供 gold documents,仍有 30.4% 的隐性组织推理问题无法回答,而显式与组合类问题分别仅为 12.6% 和 6.2%。该基准、数据与代码已公开。
TeleOCR 是一个统一文档解析框架,通过形变感知学习将几何感知引入 VLM,并提出自适应采样机制处理复杂版面,同时用内容-结构解耦学习显式建模公式语法与表格结构。
研究者提出"agentic transaction"概念与 ACID 合规的智能体系统框架,将经典 ACID 属性重新解释为语义原子性、语义一致性、语义隔离和语义持久性四项保证。基于该框架构建的数据智能体在常用基准上比包括 Claude Code 在内的 SOTA 智能体提升 10.6%。
Nanbeige4.2-3B 是一个基于 Looped Transformer 的 3B 参数智能体模型,在 Apple Silicon(MPS)上存在五个独立 bug 导致无法通过 Hugging Face transformers 直接运行。
发表于 COLM 2026 的研究在 15 个模型、6 个基准上标注 15,282 条推理轨迹,提出 Behavioral Lift 指标衡量某行为出现与否时正确率的变化。研究发现思维模型显著放大自我纠错、假设检验和不确定性承认,而提升正确率最高的行为是置信度校准、知识对齐和自我意识。置信度校准是最强的正向正确率信号之一却几乎未被放大,不确定性承认被放大 3 至 7 倍却与正确率弱相关或负相关。
研究团队提出 ParliamentRAG,一个面向意大利众议院议事记录的 RAG 系统,核心是随查询变化的话题相关权威模型,综合职业、教育背景和既往发言等可解释因素为发言人赋权。
Apodex Discovery 框架发布,通过“重型求解器”系统支持长时、有状态、可验证的探究,并调研 561 个行业、汇集 423 个高价值现实问题,首批选取 20 个。
一项覆盖语言、形式推理、社会推理、物理推理四大认知域共 46 项任务的电路分析发现,大语言模型自发形成了与人脑相似的模块化架构:在人类大脑中依赖同一网络的任务,在 LLM 中会调用重叠的神经元,而依赖不同网络的任务则调用不同神经元。研究者认为,模块化可能是智能系统的基本属性,而非生物大脑独有的进化偶然。
一项被 ICML 2026 AI for Law 研讨会接收的研究用真实法律引用做受控扰动,测试了 14 种模型配置的引用支持验证能力。模型能识别 93-100% 的错判例引用,但只发现 37-61% 的法院判决书错页码引用和 52-83% 的法律文书错页码引用。GPT-5.4 高推理强度仍漏掉法院判决书中 40%、法律文书中 18% 的页码不匹配,模型往往依据主题相关而非页面级支持就接受引用。
DFM 发布 Mimir v1,一个基于 Hierarchical Reasoning Model(HRM)架构、从零训练的 1B 参数语言模型,仅使用合规后训练数据,在 161 个数据集上训练。
一项研究在六个公开数据集、七个队列上测试临床决策多智能体委员会能否被捷径刷分,发现线索单独出现时 Gemini 委员会翻转率仅 5-16%,但两名同伴同时给出同一错误答案时,被测试智能体有 38% 的案例采纳。
Claude Code 发布 v2.1.234,新增 GitLab merge request 徽章,仓库配置 GitLab remote 且 glab CLI 已认证时在页脚和状态栏显示 MR !
研究者提出 Self-Supervised Visual On-Policy Distillation(S²VOPD),通过从学生侧"减去"信息而非给教师添加特权信息来构造不对称学习信号,无需真值标注、奖励或独立更强教师模型。
ALD/E-ImageMiner 基准与 ICDAR 2026 原子层沉积/刻蚀科学图表信息抽取竞赛提供来自 205 篇出版物的 1,951 张图表,由专家标注用于分类、数据表格抽取、摘要和视觉问答。作者提出以"从图像中获取科学概念理解"作为长期基准目标,未来方向涵盖更广领域与图表类型、跨文档综合、假设评估、溯源、不确定性、反事实 grounding 及开放式多模态研究。
研究者提出 SimpleOPD,一种 Tokenizer 无关的在线策略蒸馏(OPD)方法,将长上下文推理模型 SU-01 的证明推理能力迁移到短上下文学生模型。
UNMASK 是一套全自动流程,无需人工标注即可发现、因果验证并缓解文本分类器中的虚假相关性。在 MNLI 上训练的 BERT 和 RoBERTa 中,它分别验证了 10 个特征中的 9 个和 6 个。
研究者发布 LITTLECURRICULUM——一个 88B token 的预训练语料,仅覆盖美国小学教材内容,明确排除五年级以上才教授的概念、事实与词汇。基于该语料从零训练的 5B 参数模型 LITTLELEARNER 具备开放式评测所需的语言能力,同时拥有与可解释课程大纲对应的清晰知识与能力边界。
UniProbe 是一款轻量可学习的 Token 级幻觉检测器,对冻结的 LVLM 单次前向传播的计算轨迹建模,通过 GNN、ViT、GRU 交替处理图像 patch、查询 token 与生成 token 构成的注意力有向图。它在多种 LVLM 骨干上取得 SOTA 的 Token 级与物体幻觉检测效果,解码时可将物体幻觉降低最多 55%,延迟仅为标准生成的 1.06 倍。
inclusionAI 在 GitHub 发布 ConceptEdit,提供从指令生成、FLUX 编辑到 VQA 评估的三阶段流水线,用于生成基于分类体系的大规模图像编辑数据集。支持单概念和多概念(2–5 个并行编辑)两种变体,每步幂等可断点续跑,并附带 ConceptBench 评测代码,采用 MIT License。
Second Thought 是一个免训练推理框架,在 ReAct 智能体每个 Thought 阶段结束时fork 出四条辅助分支,与主循环并行解码,待环境观察返回后再合并生成的思考。
PRM-as-a-Judge 1.5 发布,这是一个将机器人 rollout 视频转化为密集进度曲线并派生多项细粒度指标的机器人过程评估工具包。它在 1.0 版本基础上新增三项指标,分别刻画失败侧进度、回撤后恢复与成功侧执行质量,并推出 RoboPulse++ 用于评估过程奖励模型(PRM)的可靠性。团队同时开源了包含 benchmark、指标实现与可视化工具的评估套件,支持可复现的操控过程评估。
在预测 1000 只美股小时级收益时,时间序列基础模型(TSFM)出现预测近乎平坦、横截面相关性差的"预测坍缩"现象,而同一设定下预测成交量时该现象基本消失。研究覆盖 TSFM、12 个深度学习预测模型和 97 个公开基准配置,发现其与目标可预测性密切相关,并揭示校准与排序之间的权衡:优化平方误差导致预测平坦,直接优化横截面相关性可提升排序但会使预测幅度膨胀逾一个数量级。
一篇 arXiv 论文提出新的评估框架,对七个前沿模型在 36 项长周期任务上的表现做系统评测,用规则化指标从方案构建、执行与反馈控制刻画单次运行行为,并通过受控对比考察任务内与跨任务的经验复用。
GAS 是一个生成引导的训练框架,将视觉生成重新定义为表征学习的辅助监督,采用解耦的 Mixture-of-Transformers(MoT)架构适配 Next Embedding Prediction(NEP)作为跨模态生成范式。
Marionette 是一种交互游戏世界模型,用两阶段自回归动力学模型预测 276 维显式 3D 世界状态,再由零参数图形桥计算世界空间几何与遮挡,最后用控制条件视频扩散模型合成 RGB 画面。
Intern-S2-Mobius 是一个将知识与推理解耦的基础模型,架构由全局共享的 Memory(FFN)存储知识向量、多个 Reasoner(Self-Attn)迭代完成组合推理,两者以隐藏状态作为缓存和载体反复交互。
研究者提出多模态模型差分框架 MMDiff,通过训练多模态 SAE 并对比基础 LM 与多模态适配版本的 SAE,识别多模态训练改变的特征,实现特征隔离、任务特定特征检测与特征级控制。
研究者提出 Latent On-Policy Self-Distillation(LOPD),将自教师的特权上下文本身变为可端到端学习的连续 latent token,而非依赖人工指定的答案、反馈或技能。
研究发现,在固定 tokens-per-parameter(TPP)比例下,领域数据的最优重复次数随模型规模增大而轻微上升;不同领域中,最优重复次数与该领域最终验证损失呈强负相关,验证损失越低的领域越能从更多重复中获益,而唯一领域数据量与最优重复次数的关系较弱。这表明用相同 TPP 的小型代理模型调出的重复次数,可为更大模型提供实用估计。
Dion3 是 Muon 优化器的改进版本,通过 Gram Newton-Schulz 算法、CuteDSL 内核和 megabatching 策略,在保持或改善 Muon 损失表现的同时将优化器步时最高降低 6 倍。该版本还修改了更新规则,每步仅对动量矩阵的部分行做正交化,速度和性能均优于此前的压缩版 Dion。Dion3 已通过 dion 包发布,可作为 Muon 的直接替代品使用。
研究者提出图像编辑基准 CPI-Bench,包含 CPI-General-Bench、CPI-Practical-Bench 和 CPI-Intelligent-Bench 三个子集,分别覆盖多图编辑、真实用户高频场景与高难度推理编辑。
SPARGen 是一个统一多模态框架,将 3D 重建、稠密对应和空间推理统一建模为指令条件下的生成任务,通过将结构化与语言输出序列化为 token 序列、并以图像对齐形式生成稠密几何场,让空间监督共同塑造原生多模态生成模型内的共享表示。在 3D 重建、对应和空间推理的多项基准上,SPARGen 在单一原生多模态生成框架内对异构空间任务取得了有竞争力的表现。
研究发现,带可验证奖励的在线策略强化学习(RLVR)会在提升当前目标的同时,让后续目标所需的成功行为变得难以采样。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升 6.5 个百分点,而 best@32 下降 9.8 个百分点,且该分化在两个模型家族和多个 IF 基准上均出现。这类变化集中在回答最前面的几个 token,RLVR 主要是在重排基座策略已有的开头方式。
HumanTracker 是一个面向人形动作追踪的评测基准,包含约 153 小时、由多位专业表演者采集的光学动作轨迹,按四类动作家族组织并配有文本标签用于细粒度诊断。团队同时提出偏好对齐指标 HumanScore,基于 12K 动作对(含 24K 段动作)训练,能比运动学指标更好地预测人类偏好,并暴露脚滑、触地时机错误等接触与稳定性问题。该工作已被 ECCV 2026 接收。
研究者推出 MobileMem,一个面向端侧长期记忆的基准与框架,基于一年期移动端体验数据构建。它通过知识驱动的合成流程,从用户-App 会话中生成连贯且时间一致的长期轨迹,提供文本与多模态两种设置,覆盖多跳与时序推理、知识更新和隐式偏好推断。MobileMem 让智能体记住过去、理解当下并适应未来,将记忆从信息检索推进到体验智能。
研究者提出免训练框架 CLR(Claim-Level Reliability Assessment),将测试时算力从额外采样转向针对性验证,通过把推理轨迹压缩为决策关键声明并寻找反驳证据来抑制错误共识。