微软研究院用机器学习预测电网空间天气风险,覆盖美国 66,935 座变电站
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google DeepMind 发表研究,提出 SynthIDBio 蛋白质水印技术,可在 ProteinMPNN 逐个选择氨基酸的过程中嵌入水印,且不影响蛋白功能,实验中水标记蛋白仍能结合目标。




面壁智能联合清华 THUNLP 提出 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种合理判断。
SpatialClaw 重新思考智能体空间推理的动作接口 论文:https://huggingface.co/papers/2606.13673
研究者提出多模态唇形同步评判模型 Align Then Reason(ATR),先在帧级唇部表征与候选台词的音素单元间建立单调对齐,再基于对齐结果推理内容与时间是否匹配。
研究者提出首个基于用户历史的个性化图像生成统一基准,包含个性化场景生成与个性化创意生成两项任务,以及覆盖目标保真度、视觉质量、用户可区分性、语义对齐和任务效用的多轴评估协议。同时提出 PEARL,将多模态推理器与冻结的图像生成器耦合为交错的“推理-反思”循环,并用差分数据奖励优化,在两项任务上平均提升 15% 的个性化指标。
研究发现非侵入式脑信号解码单词的主要性能提升可在无脑数据时复现,固定长度窗口重叠隐式泄露词间时长信息,合成无脑信号达 22.0% balanced accuracy,接近真实脑记录的 22.3%。作者改为独立处理各窗口以消除该捷径,提出的 SimpleB2T 在感知语音基准上达到 36.6% 词错率(每词五次观测)。
小型自回归 Transformer 仅用受限参数区间的轨迹训练,就能在训练分布之外的闭环评估中复现倍周期分岔、混沌动力学和吸引子结构。在 logistic 映射上,模型复现了直至周期 128 的连续倍周期分岔,得到有限阶标度比 4.6687,与 Feigenbaum 常数误差在 5×10⁻⁴ 以内。研究还通过因果干预揭示了控制参数信息经注意力机制影响状态预测与闭环动力学的路径。
研究者提出"修辞鲁棒性"概念,并发布 RobustReview 基准,包含 1,260 个稿件版本,评测了 30 种审稿配置,发现低改写敏感度可能与跨论文评分崩塌并存的"虚假鲁棒性"。为此提出双分支审稿模型 SciCore,将全文判断与结构化科学核心判断取平均,在 GPT-5.5 对比中取得领先的稳定性-区分度表现,同时保持有竞争力的人类对齐度。
零样本机器人抓取系统 BeyondSCe 可依据目标在过往事件中扮演的角色而非名称或外观来定位并抓取,目标被遮挡时结合事件先验与当前场景几何主动选择视角。在单腕部 RGB-D 相机真机实验中,初始可见与遮挡目标抓取成功率分别为 76% 和 77%,最强基线为 40% 和 55%;在四个重度遮挡场景中成功率从 75% 提升至 95%,平均视角数从 3.35 降至 2.20。
研究提出 Speaker Identified cpWER(SI-cpWER)指标,在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪两种形式)及 CHiME-6。
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
DexPolicy 将强化学习的探索尺度设为训练步数的显式函数,从宽到窄退火,在 ViViDex 等轨迹引导的灵巧操作任务中提升确定性 Target 成功率。在五个 YCB 物体、三个随机种子上,FPO 的平均成功率从 49.4% 升至 68.1%,GRPO 从 14.1% 升至 45.4%,PPO 从 32.0% 升至 35.7%。
LEAP 通过将录音切分为固定时长块、用轻量定位阶段为每块候选窗口打分,再把高分窗口汇聚后单次有界重编码作答,使答案输入与峰值上下文不随录音时长增长。在多个 AVQA 基准上,LEAP 较 Qwen3-Omni-30B-A3B 基线提升 4.5-16.8%,迁移到 MiniCPM-o 4.5 后超出其已发表结果 3.1-13.0%。
PixelDense 提出用稠密预测模型替代纯语义编码器作为像素扩散的表征对齐目标,将 DINOv2 与 SAM2 归入语义投影流、Depth Anything v2 与 Metric3D v2 归入几何投影流,并加入权重空间正交惩罚使两流处于不相交子空间。
研究者提出 ATLAS 训练目标,通过将编码器表示中的归一化成对结构迁移到规划潜在空间,并用 Wasserstein 嵌入匹配(WEMReg)校准其边缘分布,从而在变换中保留规划相关的关系几何。
针对 LVLM 用 CoT 做空间推理时每步必须锁定单个 token、易造成过早离散化并传播错误的问题,研究者提出 Soft Spatial Reasoning 后训练框架,通过混合 token 嵌入形成连续软状态,让多个候选延续共同影响下一步推理。
Multimodal Flow 提出一种全连续的多模态生成模型,将文本块与图像组织为有序连续 hyperchunks,通过共享 chunk-causal flow backbone 和 Flow Matching 学习统一向量场。
DAGent 是一个基于 DAG 的多智能体框架,采用 Evaluate-then-Grow 增量规划,由 Orchestrator 依据已完成节点的置信度与不确定性信号逐批扩展任务图。
研究者提出 EvolvingNav,通过时间索引的 3D 物体历史构建持久-迁移结构化信念,并用事件驱动滤波器在目标未被观测移动时预测其状态、结合 RGB-D 证据修正位置假设,配合冻结的零样本视觉语言控制器完成动作选择与重规划。
SpatialCORE 是一个后训练框架,将模型对生成式 grounding 的自身置信度转化为空间推理的学习信号,通过自调节空间奖励按坐标 token 置信度加权每个预测边界框的匹配质量,并用答案门控将 grounding 优化与最终答案正确性绑定。该框架在多个基准上取得开源及专用空间推理模型中的 SOTA 结果,并可零样本迁移到未见数据分布,源代码已公开。
针对 RL 后训练中已解出问题回复变得冗长的"长度扩展税"(LST),研究者提出 Length Self-Distillation(LSD),将已解出的提示词路由到 on-policy 蒸馏,未解出的仍保留原 RL 目标,并以在线策略的指数移动平均作为教师,无需外部模型。
MemLife 是一个多模态记忆系统,通过构建实体锚定的第一人称文本片段,并用时间索引的智能体读取器进行检索,在无需训练、查询时不访问原始视频的情况下,于四个长时程基准上比最强免训练基线提升 4.6–12.0%。配套的 MemOpt 强化学习框架优化记忆写入器,使 MemLife 再提升 2.7–5.0%,且增益可跨写入器与读取器骨干及不同记忆系统泛化。
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由该图派生,使每条标准都锚定到验证所需的文件。
一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。
该论文研究预训练数据中“野生”AI 生成网页文本的影响,用 Pangram 标注发现 FineWeb 过滤后 2026 年 6 月网页 token 中 27.5% 为 AI 生成,8 月升至 31.1%。
研究提出位置选择性自蒸馏方法,利用自然语言反馈训练 LLM 评判模型。该方法基于教师与学生模型间的逐位置熵偏移进行位置掩码,保留熵偏移分布的低尾部分,从而提升分布外泛化能力。实验显示,自蒸馏评判模型在主观任务子类别上比 GRPO 等结果监督强化学习训练的评判模型高出 2-9 个百分点,在客观任务上保持竞争力。
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
Apple 研究团队系统考察了 LLM 条件控制方法在概念注入与移除场景下的表现,发现高效激活引导方法往往以流畅性大幅下降为代价。研究还发现激活引导在指令微调模型上的效果远不如基座模型,而提示词与监督微调适合概念注入却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。
EgoTools 发布,成为首个面向第一视角工具使用理解的综合套件,包含 100 小时带同步音频、密集标注与 3D 信息的 EgoTools-Data 语料库,以及覆盖感知、几何、流程与因果推理四条轨道的 1,000 对 QA 基准 EgoTools-Bench。
研究显示,多智能体系统的潜空间通信即使良性训练链接也会提高有害顺从度,而智能体本身的安全对齐未被改动。攻击者可通过在有害查询-响应对上优化链接、投毒训练数据或强化学习攻击放大该效应,在三种通信拓扑和四个安全基准上将平均有害顺从分从 27.9 提至 76.9;把奖励调整为更安全行为可修复被攻陷的链接,无需更新智能体。
AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。
DyRAD 用静态背景反射体与运动跟踪的动态点反射体建模动态驾驶场景,渲染完整的距离-方位-多普勒(RAD)张量,并通过源自雷达信号处理链的固定解析点扩散函数(PSF)渲染反射体,避免传感器扩散被写入场景表示。
研究团队构建了 95 小时城市步行游览视频数据集 WT++,用于严格按时间顺序、滑动窗口批次的流式自监督预训练。结果显示对比学习和蒸馏方法在此设定下表现不佳,MAE 较稳健但仍不及标准 i.i.d. 预训练,主要瓶颈是批内帧高度相似。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 个任务上评估多个模型,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。早期的 Claude Opus 4.6 和 GLM-5.2 则无一成功,文章称这一阈值已被越过。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。在 Stable Diffusion v1.4 上以 HPS-v2 评测,其完全解锁版本对基线模型取得 90% 胜率,并支持在无法访问内部权重的闭源模型上实现定制控制。
Anthropic 发布研究,用 Claude 基于环境结构化程度对约 19,000 个工作任务评分构建机器人暴露指数,发现机器人能完成美国 74% 的物理任务,占全部工作时间的 34%,但仅对 0.3% 的任务具有成本竞争力,按每年约 3% 的价格下降速度需 40 年才达 10%。
推荐理由:报告用 Claude 对近万个任务评估机器人暴露度,给出成本竞争力仅 0.3% 等量化结论,读者可借此理解物理自动化的现实门槛。
Hugging Face 发布 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实真实但被归因到错误来源的问题。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中取得最高分。