#数据/训练
#数据/训练
今日 8 条
Rohan Paul@rohanpaul_aiAI 评分4747
Thomas Wolf@Thom_WolfAI 评分5353
引用Rohan Paul@rohanpaul_aiBen Affleck (Hollywood star & Artists Equity CEO) talks about how he fine-tunes open video models by unfreezing weights and trained only the last cinematic layer so a film crew can hit real production standards. for context, Ben Affleck founded InterPositive in 2022, a 16-person AI shop for film post and Netflix bought it in March 2026 for $587 mn in cash. He needed that model because public video models were trained on his peers' films, and he did not think that was a real business. So InterPositive raised money, shot its own dataset for 8 months on a controlled stage, and used it only as late-stage training. Each new film then trains a private model on its own dailies, so the production keeps the footage and the learning. That is the product Netflix paid $587 million for. ---- From "Bloomberg Live" YouTube channel, (link in comment)
IT HomeAI 评分5757 东芝投资约 600 亿日元扩建菲律宾工厂,2027 财年将 AI 数据中心 HDD 产能翻倍
东芝计划在 2027 财年内将用于 AI 数据中心的机械硬盘 HDD 产能翻倍,投资约 600 亿日元(约合 25.53 亿元人民币)扩建菲律宾生产基地,这是其近五年来首次 HDD 重大投资。
Hugging Face BlogAI 评分4343 AutoSynthData:为 Enterprise Agents 生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。
The DecoderAI 评分7474 Meta 将 AI 数据中心归为实验性项目以申请研发税收抵免,2025 年节税 39 亿美元
Meta 将 AI 数据中心分类为试点模型、将 Nvidia 芯片归为实验材料以申请研发税收抵免,2025 年节省 39 亿美元,此前 2024 年为 20 亿美元、2023 年为 7 亿美元,是上市公司中最大受益者。
Hugging Face Daily PapersAI 评分3535 通过扩展与蒸馏文本嵌入提升扩散语言模型的可扩散性
研究通过将嵌入模型从 T5 扩展到 T5Gemma-1 再到 T5Gemma-2,发现更强的嵌入模型能显著提升扩散语言模型的生成性能,但 T5Gemma-2 的嵌入过于判别性,导致连续扩散采样失败。
Databricks BlogAI 评分3535 Apache Iceberg REST Catalog 新增读限制与目录标签,统一跨引擎与跨目录治理
Apache Iceberg 社区为 Iceberg REST Catalog 推进两项新规范:read restrictions 与 catalog labels。
TechCrunch · AIAI 评分5757 Graphite 研究发现 Claude Opus 5.5 与 OpenAI Astra 各有 1.3 万个 AI 写作特征词
Graphite 发布新研究,用 1 万篇 ChatGPT 发布前的文章作人类对照,让各家模型重写后对比用词,找出 1.3 万个在 AI 文本中出现频率至少两倍的写作特征。
Hugging Face BlogAI 评分5454 Ai2 发布 Olmo-core 3 开源 MoE 训练框架,支持扩展至万亿参数
Ai2 发布 Olmo-core 3,为 Olmo 框架带来重新设计的开源 MoE 训练系统,可扩展到万亿参数规模并保持计算效率。新实现从 FSDP 切换到基于 DDP 的方案,47B 参数 MoE 在 8 张 NVIDIA B300 上达到每 GPU 每秒 52,000 tokens,约为旧实现的 2.7 倍;启用 MXFP8 后吞吐比 BF16 高约 21%。
Google Cloud: DatabasesAI 评分4343 Google Cloud Managed Lustre 推出 6 美分/GB*月 Dynamic Tier,降低高性能并行文件系统门槛
Google Cloud Managed Lustre 新增 Dynamic Tier,以 6 美分/GB*月提供热数据亚毫秒延迟,容量可线性扩展至 80 PB,且不单独收取介质、数据移动和元数据 IOPS 费用。该层支持多轮训练、写入密集检查点、快速检查点恢复和交互式开发,平均读延迟约 300µs,比替代分布式文件系统响应快至 4 倍。
Perplexity@perplexity_aiAI 评分4646
elsewhere articlesAI 评分3434 心资本韩彦 SuperReturn Asia 演讲:2026至2028年中国硬科技早期投资窗口在哪
心资本创始合伙人韩彦在 SuperReturn Asia 2026 演讲中判断,2026至2028年是中国硬科技早期投资窗口:IPO市场回暖、退出路径变清晰,但愿意支持早期企业的资本尚未充分回流。他援引数据称,2026年上半年香港85宗上市募资约2,100亿港元、同比增长92%,中国VC/PE投资金额4,310亿元人民币、同比增长173%,其中44.7%投向AI。
X.PIN@thexpinAI 评分6060
elsewhere articles精选AI 评分6767 数据公司估值飙升背后:给模型做练习题的生意逻辑
作者观察到一批成立不满一年的数据公司估值快速增长,如 UniPat 达 25 亿美金,认为数据成为模厂竞争的核心原料。文章把数商业务概括为给模型制作练习题,即采集专家解题轨迹或搭建 RL environment,并分析其同时是信任市场、信息市场和油水很足的市场,还提及水下蒸馏与爬取数据的灰色操作,以及字节、阿里、腾讯等买方梯队。
推荐理由:作者以一手行业观察拆解数据公司高估值背后的生意本质,包括信任、信息和关系三个维度,读来能理解这条赛道的运转逻辑。
SemiAnalysis@SemiAnalysis_AI 评分5252
Hugging Face Daily PapersAI 评分3535 邻近监督更优:Neighborhood OPSD 自蒸馏方法提升数学推理模型性能
Neighborhood OPSD(N-OPSD)通过局部参数扰动构建冻结专家池,将参考对齐修正转化为学生可用的监督信号,在 AIME 2024、AIME 2025 和 HMMT February 2025 三项基准上,将 Average@12 较标准 OPSD 分别提升 2.75、1.67 和 1.94 分(对应 Qwen3-1.7B、4B、8B)。推理时仅使用蒸馏后的学生模型。
Hugging Face Daily PapersAI 评分4545 GraphForge:用图锚定工作区合成训练工作型智能体
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由该图派生,使每条标准都锚定到验证所需的文件。
Hugging Face Daily PapersAI 评分4646 合成预预训练在规模扩展下依然有效,但并非语法先验
一项覆盖 500M 至 7B 参数、PT 预算最高 100B token 的研究显示,合成数据预预训练(PPT)的 token 效率增益在规模扩展后依然存在,3B 规模下可节省至少 21B PT token。但研究未发现一致证据表明这些增益来自语法先验,下游表现与语法可接受性在各模型规模上并不一致。增益实际来自提升长程检索能力的 PPT 任务,且对 PT 数据混合方式稳健,仅在缺少网页文本时减弱。
Hugging Face Daily PapersAI 评分6060 研究提出 WildAI 缩放律:衡量 AI 生成网页文本对预训练的价值
该论文研究预训练数据中“野生”AI 生成网页文本的影响,用 Pangram 标注发现 FineWeb 过滤后 2026 年 6 月网页 token 中 27.5% 为 AI 生成,8 月升至 31.1%。
Apple Machine Learning ResearchAI 评分5353 Apple 发布 SCLATE:持续学习智能体训练与评测的执行基底
Apple 发布 SCLATE,一个持续学习智能体训练与评测的执行基底,基准和未修改的智能体通过适配器把事件加入同一开放事件调度器,混合模拟时钟可把一个月长的场景压缩到数小时。
Hugging Face Daily PapersAI 评分3636 DARA:面向多奖励强化学习的密度感知奖励聚合方法
针对多奖励强化学习中各目标学习进度不均的问题,研究者提出密度感知奖励聚合方法 DARA,通过逆平方根密度校正,为激活频率较低的奖励信号赋予更高权重。在工具调用任务上,DARA 最多减少 26% 训练步数达到高格式合规率;在数学推理任务上,最多减少 65% 步数接近长度合规饱和,最终性能与 GDPO 相当。
Hugging Face Daily PapersAI 评分3737 AutoDataBench:面向加速自动研究的数据中心测试平台
AutoDataBench 是一个隔离数据因素、系统评估 LLM「数据智能」的受控测试平台,覆盖数据诊断、组织与构建三类优化任务,在固定非数据因素下考察前沿 LLM 通过迭代实验改进训练数据的能力。研究还对比训练前预测与实际结果,检验 LLM 是否具备数据效应推理能力,并发现复用 AutoDataBench 轨迹进行 mid-training 可提升下游编码性能。
OpenBMB@OpenBMBAI 评分4949清华NLP(OpenBMB成员)联合中科院大学、东北大学、UIUC和约翰霍普金斯大学提出One-Shot OPD,将训练集缩减到一条查询,发现OPD是"数据过喂但算法饥饿"。

Thomas Wolf@Thom_WolfAI 评分5656引用Larry Dial@classiclarrydNew historic NanoGPT record at 39.9s (-27.7s) from @DevenPzak , obliterating the prior record of 67.6s! This record introduces a new paradigm of thinking to NanoGPT: instead of optimizing matmuls or adding more expressive operations, optimize at the individual flop level with incredibly clever engineering and ML judgement. If a flop is low value on a particular step, skip it. Specifically: -(~8s) Sampled softmax. If a token doesn’t appear in a batch, skip its lm_head fwd/bwd some fraction of the time. -Sparse values. Only run an optimizer step for ngram embeddings that occurred in the batch. Set beta1 to zero to enable this. Beta2 is applied retroactively when the row is later used. -Sparse updates. Only update ngram and value embeddings once every 4 steps instead of once every 2. -Sparse communication. Shard the n-gram table across GPUs, and only pass the rows receiving updates on each step. -Sparse optimizer states. For the n-gram table, reduce from 2 floats in Adam optimizer per param, to 1 float per 768 params. -Hand-rolled flash attention for 64 dim heads. There are several additions that add accuracy too: -(~4s) EMA during last 300 steps, combined with lifting final_lr to 0.3 instead of 0.15. -(~1s) A new optimizer, Anvil2, which expands muon via a second tracked momentum buffer, improves the ortho coefficients, and modifies the cautious weight decay application. -A couple additional dynamic skip connections in the network. The most striking consequence of the ‘flop aware paradigm’ is you can grow parameters arbitrarily large, only limited by the available memory, since you can selectively choose how to expend flops on those parameters on each step. NanoGPT has kept active parameters below 124M, but total is unbounded, and has grown to 640M through embedding sparsity over the last year. This PR takes that to its logical conclusion on the 8xH100, scaling up to 65B sparse embedding parameters, which accounts for 25% of the PR’s gains. At frontier scale, where one is not bounded by an 8xH100, one could imagine where this paradigm could lead. https://github.com/KellerJordan/modded-nanogpt/pull/360 As this was a very notable PR, I spoke with Deven for an hour to learn how he did it. Here’s his story on the changes: https://hyperstition.cc/training-nanogpt-in-39-9-seconds
Hugging Face Daily PapersAI 评分4444 SkillGym:用自动可验证环境生成训练技能使用智能体
SkillGym 是一套自动流水线,可从互联网抓取技能、筛选可离线复现的工作流,并通过 builder-reviewer 流程构建难度可控的任务,最终生成 6.8k 个环境和 19k 条已验证成功轨迹用于监督微调。
Apple Machine Learning ResearchAI 评分3737 Apple 研究提出 LIPPAX 算法,改进联邦变分不等式的收敛速率
Apple 研究团队针对联邦随机变分不等式(VI)优化,证明经典 Local Extra SGD 在更精细分析下可获得更紧的收敛保证,并指出其存在客户端漂移过大的固有缺陷。
凡人小北@frxiaobeiAI 评分5656HuggingFace 上开源了一个用 Claude Opus 5.5 生成的模拟医患对话数据集,覆盖 2194 种疾病,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
clem 🤗@ClementDelangueAI 评分4343开源 RL 环境就是赢。当然是在 Hugging Face 上!
引用Harveen Singh Chadha@HarveenChadhawas looking for a quiet weekend but xiaomi dropped their rl envs repo last night to put in perspective, if you have to buy some tasks like this its usually hundred to thousand dollars per task so this repo is literally worth millions https://huggingface.co/datasets/XiaomiMiMo/MiMo-V2.6-RL-oss
Latent SpaceAI 评分6262 Endura 创始人谈 Foundries 与 Navigators:AI 如何降低科学研究的成本
Endura Therapeutics CEO Adrian Sanborn 提出 AI 变革科学研究的两种路径:Foundries 用新技术把实验数据生成速度提高一个数量级,Navigators 用语言模型消化思考盈余、改进运营决策。
inclusionAI Hugging Face models精选AI 评分6060 inclusionAI 开源 Ling-mini-2.0:16B 总参数 MoE 模型,激活仅 1.4B
inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。
推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。
inclusionAI Hugging Face models精选AI 评分6060 inclusionAI 发布万亿参数推理模型 Ring-2.6-1T
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
Tencent Hy@TencentHunyuanAI 评分3535Google Developers BlogAI 评分5050 Google 用 MaxText 在 TPU 上复现 Ai2 的 Olmo 3 7B 预训练与中期训练
Google 团队在 MaxText/JAX 和 Google Cloud TPU 上从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练(约5.93T token)和 stage-2 中期训练 anneal,held-out C4 loss 与 8 项下游任务均与 Ai2 参考持平。
ByteByteGoAI 评分4040 如何定制模型让它学会新技能:从提示词、RAG 到 LoRA 与 QLoRA 微调
当提示词和 RAG 无法消除模型在特定任务上的反复偏差时,就需要通过微调把期望行为固化进模型参数。文章梳理了定制模型的路径:先用 few-shot prompting 和检索增强生成(RAG)补充信息,再用监督微调(SFT)训练模型,而 LoRA 和 QLoRA 通过减少需要调整的参数和显存占用,让微调现有模型更易落地。
Latent SpaceAI 评分5959 Latent Space 访谈 John Platt:Google ERA 用 AI 自动求解可评分科学问题
Latent Space 发布对 John Platt 的访谈,介绍其团队在 Google 开发的 Empirical Research Assistance(ERA)。
Anthropic Newsroom精选AI 评分7676 Anthropic:Claude 发现类似 CRISPR 的新型酶系统 ART
Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。
karminski-牙医@karminski3AI 评分3939Qwen4 家族首次曝光,包含 Qwen4-Max、Qwen4-Flash & Qwen4-Plus 以及 Qwen4-27B,未来 Qwen 会训 5-10T 的模型。卧槽5-10T???
引用Max For AI@MaxForAI🚨Qwen4家族首次曝光!! 刚刚,在2026年云栖大会的开幕式上,新任@Alibaba_Qwen LLM负责人刘大一恒官宣了即将到来的Qwen4家族! 包含Qwen4-Max Qwen4-Flash&Qwen4-Plus 还有Qwen4-27B!!! 未来Qwen会训5-10T的模型
Latent Space精选AI 评分8585 Xiaomi MiMo-V2.6-Pro 1T-A42B 发布,以约 300 万美元训练成本登顶开源权重模型
Latent Space 期 AINews 汇总,Xiaomi 发布 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 原生全模态开源模型(MIT 许可)。
推荐理由:原文汇总了 MiMo-V2.6-Pro 登顶开源权重榜的评测数据和 RL 训练成本细节,读者可以借此评估后训练路线的实际性价比。
MIT Technology Review · AIAI 评分5959 MIT Technology Review 发布美国边境虚拟围墙死亡调查的方法论解析
MIT Technology Review 公布其历时 15 个月的美墨边境监视塔与移民死亡调查的方法论,分析近 4,000 起可确认地点的死亡案例和约 600 至 800 座监视塔,覆盖 2015 年以来的数据。
elsewhere articlesAI 评分2626 百曜科技联合《麻省理工科技评论》发布 AIVC 深度研究报告
百曜科技联合《麻省理工科技评论》中国团队发布《AI 虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》,将 AIVC 定义为 AI 时代生命科学的新型基础设施。报告指出产业竞争正从模型规模转向"数据—模型—实验"干湿闭环,并梳理了泛化能力、私有数据与干湿闭环三大趋势。百曜科技今年 6 月已发布基于 LLM-JEPA 架构的 AI 虚拟细胞世界模型 AURA CellOS。