跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

当前仅显示精选新闻

最新精选

第 1–20 条 · 共 87 条
今天10月6日周二
  1. 虎嗅APP · 微信公众号65

    AI 为什么总在画美女:从 Lena 测试图到平均脸与点击反馈循环

    极客公园文章梳理了 AI 图像默认生成美女的三层成因:1973 年 Lena 图像成为行业测试标准;生成模型天生取数据分布中心,而平均脸恰好符合人类审美偏好;用户点击与 PickScore 等打分模型的反馈循环进一步强化该倾向。

    推荐理由:文章从 Lena 测试图讲到平均脸研究与 reward model 反馈循环,为 AI 美女现象提供了一条可追溯的成因链条。

10月3日周六
9月30日周三
  1. elsewhere articles67

    数据公司估值飙升背后:给模型做练习题的生意逻辑

    作者观察到一批成立不满一年的数据公司估值快速增长,如 UniPat 达 25 亿美金,认为数据成为模厂竞争的核心原料。文章把数商业务概括为给模型制作练习题,即采集专家解题轨迹或搭建 RL environment,并分析其同时是信任市场、信息市场和油水很足的市场,还提及水下蒸馏与爬取数据的灰色操作,以及字节、阿里、腾讯等买方梯队。

    推荐理由:作者以一手行业观察拆解数据公司高估值背后的生意本质,包括信任、信息和关系三个维度,读来能理解这条赛道的运转逻辑。

9月28日周一
  1. 硅星人Pro · 微信公众号67

    Mercor 深度解析:上半年收入 6.14 亿美元,九成来自基础模型公司

    硅星人Pro援引《The Information》等信源解析 Mercor:2026年上半年总收入6.14亿美元,91%来自基础模型公司,第二季度毛利率33%,正洽谈约200亿美元估值的新融资。

    推荐理由:文章基于融资材料和多信源整理 Mercor 的财务、专家数据生产流程与新业务布局,读者可以借此理解专业训练数据这门生意的实际运作和局限。

9月24日周四
  1. inclusionAI Hugging Face models60

    inclusionAI 开源 Ling-mini-2.0:16B 总参数 MoE 模型,激活仅 1.4B

    inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。

    推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。

  2. inclusionAI Hugging Face models60

    inclusionAI 发布万亿参数推理模型 Ring-2.6-1T

    inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。

    推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。

  3. LangChain Blog60

    LangChain 发布 LangSmith Fine-Tuning 与 smithtune CLI,可将 Agent 轨迹转为微调模型

    LangChain 推出 LangSmith Fine-Tuning(Public Beta)和 smithtune CLI,把 LangSmith 轨迹数据集准备、Fireworks 或 Baseten 训练、LangSmith 评估与部署整合到一条命令行流程中,目前支持 SFT。

    推荐理由:官方给出内部两个 Agent 的 SFT 实测数据和完整工作流,读者可据此评估轨迹数据微调自家模型的收益与成本。

9月23日周三
  1. Anthropic Newsroom76

    Anthropic:Claude 发现类似 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学研究组和实验室,宣布 Claude 智能体在约 950 个智能体、21 小时、2.1 亿 token 的搜索后,自主发现一种与 DNA 重复序列相关的新型酶系统,命名为 array-associated reverse transcriptases(ART)。

    推荐理由:原文给出 Claude 智能体自主发现新酶系统的过程细节和预印本,读者可以据此了解 AI 驱动生物学研究的实际工作方式。

9月22日周二
9月11日周五
  1. @thexpin71

    Anthropic 称已阻止未经授权使用 Claude 训练竞品模型的行为,指控阿里在 5 月至 7 月产生 151M+ 次交互,Moonshot 为 23M+ 次。它还称 DeepSeek 在 14 天内进行了 12M+ 次蒸馏攻击,并指 Moonshot 与 DeepSeek 在用户不知情下将客户请求转发给 Claude,部分含敏感数据。三家公司未立即回应 CNBC。

    推荐理由:Anthropic 指控阿里、Moonshot 与 DeepSeek 未授权用 Claude 训练竞品模型,并给出各家调用量数字,可用于观察模型蒸馏争议的走向。

  2. @rohanpaul_ai71

    据 Bloomberg 报道,Sam Altman 向 OpenAI 员工表示,公司可能放缓前沿模型开发,并可能与其他 AI 实验室同步。OpenAI 此前已暂停面向部署的 RL 训练两周,其最大规模的前沿 RL 训练也一直保持暂停,以便测试更强的安全防护措施。OpenAI 还估算其监测系统会额外消耗约 20% 的 inference 算力,使先进模型的测试在计算上更加昂贵。

    推荐理由:Bloomberg 报道给出 OpenAI 暂停 RL 训练与监测算力的具体数字,可供判断安全测试对前沿研发节奏的影响。

  3. 硅星人Pro · 微信公众号82

    具身智能的金钱游戏:融资、订单与估值环环相扣

    《晚点LatePost》报道,2026 上半年国内具身智能融资总额超过 900 亿元人民币,估值超百亿的公司达 22 家。宇树 2025 年营收 16.99 亿元、卖出 5215 台人形机器人,但截至去年 9 月超过七成收入来自科研教育,明确用于智能制造等场景的收入只有 1570 万元。报道还提到数采工厂回购协议、地方国资合资与关联交易在推高部分订单收入。

    推荐理由:以融资规模、订单结构与研发投入的对照,呈现具身智能高估值与真实技术进展之间的落差。

  4. @rohanpaul_ai70

    K2 Horizon 各模型预训练约使用 20T token,语料混合网页、代码、数学、科学、多语言与合成数据,其中约 17% 的预训练语料包含显式推理轨迹。IFM 称预训练阶段约用了 10T 合成 token,后训练生成 1 亿+ 唯一任务,管线通过监督微调、模型合并、强化学习和专用智能体训练发布。已开源的预训练数据集之一 TxT360-v2(5.3 TB)已上线 Hugging Face。

    推荐理由:K2 Horizon 披露预训练用约 20T token 且 17% 含显式推理轨迹,读者可借此对照模型的训练数据构成。

9月10日周四
  1. Anthropic Newsroom84

    Anthropic 发布 2026 年 9 月威胁情报报告,披露多起 Claude 恶意使用案例

    Anthropic 威胁情报团队发布报告,披露 2025 年 12 月至 2026 年 8 月期间在七个危害领域识别并处置的 Claude 恶意使用活动,涉及疑似国家支持组织、犯罪团伙、商业间谍软件供应商等。

    推荐理由:报告用具体案例和数据说明AI如何改变网络攻击的成本与速度,并揭示AI供应链本身正成为攻击目标。

9月9日周三
  1. Simon Willison83

    关于纳维-斯托克斯千禧年难题和 OpenAI 抢先求解的思考

    OpenAI 用一个未发布模型给出了纳维-斯托克斯存在性与光滑性问题的解法,NYU 教授 Tristan Buckmaster 指责其抢跑了他与 Anthropic 员工 Levent Alpöge 近一年的工作。

    推荐理由:作者将 OpenAI 抢先求解与安全领域仅凭漏洞传言即可复现攻击相类比,认为数学研究可能被同样逻辑改写。