#数据/训练
#数据/训练
今日 3 条
Rohan Paul@rohanpaul_aiAI 评分4747
Hugging Face Daily PapersAI 评分3535 通过扩展与蒸馏文本嵌入提升扩散语言模型的可扩散性
研究通过将嵌入模型从 T5 扩展到 T5Gemma-1 再到 T5Gemma-2,发现更强的嵌入模型能显著提升扩散语言模型的生成性能,但 T5Gemma-2 的嵌入过于判别性,导致连续扩散采样失败。
TechCrunch · AIAI 评分5757 Graphite 研究发现 Claude Opus 5.5 与 OpenAI Astra 各有 1.3 万个 AI 写作特征词
Graphite 发布新研究,用 1 万篇 ChatGPT 发布前的文章作人类对照,让各家模型重写后对比用词,找出 1.3 万个在 AI 文本中出现频率至少两倍的写作特征。
Hugging Face Daily PapersAI 评分3535 邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
Hugging Face Daily PapersAI 评分4545 GraphForge:用图锚定工作区合成训练工作型智能体
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由该图派生,使每条标准都锚定到验证所需的文件。
Hugging Face Daily PapersAI 评分4646 合成预预训练在规模扩展下依然有效,但并非语法先验
一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。
Hugging Face Daily PapersAI 评分6060 研究提出 WildAI 缩放律:衡量 AI 生成网页文本对预训练的价值
该论文研究预训练数据中“野生”AI 生成网页文本的影响,用 Pangram 标注发现 FineWeb 过滤后 2026 年 6 月网页 token 中 27.5% 为 AI 生成,8 月升至 31.1%。
Apple Machine Learning ResearchAI 评分5353 Apple 发布 SCLATE:持续学习智能体训练与评测的执行基底
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
Hugging Face Daily PapersAI 评分3636 DARA:面向多奖励强化学习的密度感知奖励聚合方法
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
Hugging Face Daily PapersAI 评分3737 AutoDataBench:面向加速自动研究的数据中心测试平台
AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。
OpenBMB@OpenBMBAI 评分4949清华NLP(OpenBMB成员)联合中科院大学、东北大学、UIUC和约翰霍普金斯大学提出One-Shot OPD,将训练集缩减到一条查询,发现OPD是"数据过喂但算法饥饿"。

Hugging Face Daily PapersAI 评分4444 SkillGym:用自动可验证环境生成训练技能使用智能体
SkillGym 是一套自动流水线,可从互联网抓取技能、筛选可离线复现的工作流,并通过 builder-reviewer 流程构建难度可控的任务,最终生成 6.8k 个环境和 19k 条已验证成功轨迹用于监督微调。
Apple Machine Learning ResearchAI 评分3737 Apple 研究提出 LIPPAX 算法,改进联邦变分不等式的收敛速率
Apple 研究团队针对联邦随机变分不等式(VI)优化,证明经典 Local Extra SGD 在更精细分析下可获得更紧的收敛保证,并指出其存在客户端漂移过大的固有缺陷。
凡人小北@frxiaobeiAI 评分5656HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
Tencent Hy@TencentHunyuanAI 评分3535
Sakana AI BlogAI 评分5050 Sakana AI 提出 PC-ALM:无需反向传播训练 1000 层网络
Sakana AI 提出 PC-ALM,一种仅靠局部动力学、无需反向传播即可训练 1000 层神经网络的局部学习替代方案。该方法将预测编码推广为使用增广拉格朗日,引入对偶神经元(拉格朗日乘子)参与层内动力学,使每层成为 PI 反馈控制系统以最小化局部预测误差。PC-ALM 能将信号传播到近乎任意深度,在标准预测编码难以学习的深层窄网络中尤其有效,并可能为神经形态硬件上的深度学习提供参考。
Google ResearchAI 评分4949 Google Research 提出 ToolGrad:用文本“梯度”高效生成工具调用数据集
Google Research 提出 ToolGrad,一种“答案优先”的工具调用数据集生成范式:先生成真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Dwarkesh PatelAI 评分5959 Dwarkesh 实验分析:2019-2025 预训练进展主要来自数据改进
Dwarkesh Patel 发布研究,在最高 1e19 FLOPs 规模下组合 2019-2025 各年度代表模型配方与公开数据语料训练,发现数据改进带来 12.0x 计算效率增益、模型改进为 3.7x,数据贡献约为模型的 3.24 倍。两者收益基本独立,88% 的 OLMES 分数方差可由模型与数据的加性效应解释;作者提醒小模型更受益于数据精选,而大模型的关键作用在于让大规模计算可用。
Google ResearchAI 评分5555 Google 与 NASA JPL 发布 MAPL-EMIT 深度学习框架,从太空绘制全球甲烷排放
Google 与 NASA JPL 在 PNAS 发表 MAPL-EMIT,一个基于 Swin-S vision transformer 的深度学习框架,用于从 EMIT 高光谱卫星数据中自动检测甲烷羽流并定位排放源。
Hugging Face BlogAI 评分4343 Hugging Face 提出 Quantization-Aware Healing:4-bit GPT-OSS 120B 压缩模型在 9 项基准中 7 项超越全精度版本
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩至 60B 参数并量化为 MXFP4 后,在 9 项基准中的 7 项超过其 bfloat16 全精度版本。
Import AIAI 评分4747 Import AI 470:机器不应享有权利;SPADE 自动化环境生成;Hawkeye 构建更优 GPU kernel
METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。
Google Research精选AI 评分6262 Google Research 提出知识剖析框架:召回而非编码是前沿 LLM 事实性的瓶颈
Google Research 发表研究,提出知识剖析(knowledge profiling)行为框架与 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),用于区分 LLM 事实错误的编码失败与召回失败。
推荐理由:研究把事实错误拆分为编码失败与召回失败,指出前沿模型瓶颈在召回而非存储,并量化了 thinking 的恢复作用。
Meta EngineeringAI 评分5050 Meta 发布 LLaTTE 论文:多阶段序列建模为广告排序带来 LLM 式 scaling law
Meta 工程博客介绍其广告排序的多阶段序列建模架构与论文 LLaTTE:离线用户模型异步处理数千长度序列并缓存嵌入,在线排序模型结合实时信号完成打分。
Google ResearchAI 评分5757 Google Research 在 Nature 发表强化学习控制量子纠错研究,让量子计算机从错误中学习
Google Research 与 Google DeepMind 在 Nature 发表研究,用强化学习智能体根据量子纠错检测事件持续调整控制参数,在计算过程中对抗漂移,无需中断计算。
Google ResearchAI 评分4242 Google Research 揭示扩散模型创造力来源:分数平滑如何带来泛化
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源:神经网络训练中的正则化会让学到的分数函数被"平滑",使去噪过程在训练数据点之间插值,从而生成新样本而非简单记忆。
Google Research精选AI 评分6161 Google Research 发布可穿戴健康基础模型 SensorFM,基于超一万亿分钟传感器数据预训练
Google Research 推出 SensorFM,从500万同意参与者采集的超一万亿分钟多模态可穿戴传感器数据中自监督预训练,覆盖 PPG、加速度、EDA、皮肤温度和测高五类模态。
推荐理由:原文给出SensorFM的训练规模、跨35项健康任务的泛化结果和Agent集成实验,读者可据此评估可穿戴健康基础模型的实际能力。
Import AIAI 评分5252 Import AI 460:社会性 reward hacking 基准 SocioHack、Anthropic 递归自我改进迹象与 RL 无人机竞速超人类水平
Import AI 460 期汇总多篇研究。KCL、复旦与 Alan Turing Institute 发布 SocioHack 基准,含 72 个沙盒社会环境,RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的制度漏洞。
LMSYS BlogAI 评分4040 Miles 如何用 Token-In-Token-Out 消除智能体 RL 的训练-推理不匹配
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求第 n 轮 prompt 的 token 序列必须与第 n-1 轮 prompt+response 逐位一致,以消除智能体 RL 中训练与推理的 token 序列不匹配。
Google DeepMindAI 评分5252 Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)训练架构,将训练拆分为异步的算力孤岛,硬件故障被隔离后其余部分可继续学习。
Google ResearchAI 评分4646 Google Research 推出 TurboQuant:用极致压缩重新定义 AI 效率
Google Research 发布压缩算法 TurboQuant,可在零精度损失下大幅压缩模型,兼顾 KV cache 压缩与向量搜索,将亮相 ICLR 2026。