#数据/训练
#数据/训练
今日 0 条
SemiAnalysis@SemiAnalysis_AI 评分5252
Latent SpaceAI 评分6262 Endura 创始人谈 Foundries 与 Navigators:AI 如何降低科学研究的成本
Endura Therapeutics CEO Adrian Sanborn 提出 AI 变革科学研究的两种路径:Foundries 用新技术把实验数据生成速度提高一个数量级,Navigators 用语言模型消化思考盈余、改进运营决策。
Latent SpaceAI 评分5959 Latent Space 访谈 John Platt:Google ERA 用 AI 自动求解可评分科学问题
Latent Space 发布对 John Platt 的访谈,介绍其团队在 Google 开发的 Empirical Research Assistance(ERA)。
Dwarkesh PatelAI 评分5656 Dwarkesh 对谈 John Schulman、Beren Millidge 与 Charlie O'Neill:递归自我改进还有多远
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 长篇对谈,逐段讨论递归自我改进(RSI)最可能失败的技术原因、中国实验室的追赶路径、自动化 AI 研究者的训练方式以及长时程 RL 能否带来 AGI。
elsewhere articlesAI 评分4646 对谈 Pyromind 创始人 Kevin Ding:AI 下半场不会只剩一个超级模型,AutoRL 与 PyroDash 如何让 Agent 在生产环境持续进化
Pyromind 创始人兼 CEO Kevin Ding 在播客中提出,RL as a Service 只解决一半问题,真正让 Agent 在生产环境持续改进需要把训练、奖励、反馈、部署和数据回流串成自动循环管道,即公司押注的 AutoRL。
Andrew Ng@AndrewYNgAI 评分5050在捍卫 AI 开放性的斗争中,Marin 项目是模型训练开放性的一份珍贵示范——开放代码、数据、配方,甚至实验结果。公开分享 AI 研究曾是常态;我很感激 @percyliang 的开放实验室做法。
引用Percy Liang@percyliang🚢 Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + midtraining (20%) on 18.75T tokens on 11 x GB200 NVL72 for ~3 months (2.7e24 FLOPs). Post-training will follow. Before kicking off the run, we trained a 4-rung scaling ladder from 1.6B-A61M (48B tokens) to 27.7B-A1.2B (926B tokens) to debug issues, and to make a forecast of our hero run. This is by far our biggest run, so definitely expecting the unexpected.
jietang@jietangAI 评分4444引用Liam Fedus@LiamFedusAn excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!
Nathan Lambert: InterconnectsAI 评分5151 Nathan Lambert 分析开源 AI 的经济学与 Nvidia 的芯片需求策略
Nathan Lambert 撰文分析开源 AI 的经济结构,区分附带完整训练配方的开源语言模型与仅含权重和使用代码的开放权重模型,指出 Nvidia 投入 260 亿美元打造近开源 Nemotron 模型意在让更多人自建模型、扩大其芯片需求。
Nathan Lambert: InterconnectsAI 评分6161 Nathan Lambert 写完 AI 教科书后谈 LLM 长篇非虚构写作的停滞
Nathan Lambert 完成后训练教科书《Reinforcement Learning from Human Feedback》后撰文指出,LLM 在长篇非虚构写作上进展停滞,能校对 200-300 页书稿的细微错误、辅助编辑和同步 Markdown 与 LaTeX 版本,但组织整章内容时仍混乱并累积概念错误。
Dwarkesh PatelAI 评分5858 Dwarkesh Patel 提出持续学习时代的 8 项 AI 预测
Dwarkesh Patel 提出持续学习到来后的 8 项预测,认为模型仅在会话间写 Markdown 无法积累执行整份工作所需的经验,经验必须沉淀进权重。他据此推论部署前安全检查将失效、对齐技术需重构、领先实验室将靠部署数据加速拉开差距,并以 Anthropic 内部自 2 月起使用 Mythos、6 月才公开发布的 4 个月差距为例说明先发部署的学习优势。
Berkeley AI ResearchAI 评分5454 UC Berkeley 提出 Agent 时代数据系统的 For、Of、By 三大研究议程
UC Berkeley 的 Aditya G. Parameswaran 等人发表观点文章,认为近零推理成本时代将重塑数据系统研究。
Dwarkesh Patel精选AI 评分6565 Dwarkesh Patel:下一个突破是 AI 在工作中学习
Dwarkesh Patel 撰文认为,实验室押注的 RLVR 训练未必能泛化到无法在数据中心内复现的现实领域,因为训练样本效率低且缺少可重放模拟器。
推荐理由:作者论证 RLVR 难以泛化到不可复现的现实领域,并梳理 OPSD 与模拟训练等让模型在工作中持续学习的可能路径。
Dwarkesh PatelAI 评分5959 Dwarkesh:AI 进步的核心是数据黑洞而非样本效率提升
Dwarkesh Patel 撰文认为,近几年 AI 进步主要来自更宽更好的数据分布和 RL 合成数据,而非样本效率提升。他估算人类从出生到成年只接触约 2 亿 token,前沿模型却训练于数十至数百万亿 token,差距近百万倍;按 Chinchilla 常数,即使无限增加参数也只能将所需数据降低约 10 倍,说明人类处于不同的 scaling 曲线。
Import AIAI 评分5353 Import AI 459:AI经济难以测量、自动化对齐更难、GPIC数据集与Biohub发布ESMFold2
Import AI 第459期:一篇论文估算美国AI经济2025年名义规模约2500亿美元、质量调整产出年增约2600%,但常规GDP统计难以体现;UK AI Security Institute论文说明自动化对齐研究的错误比人类基线更难识别,并给出测量与红队等干预建议。
Import AIAI 评分4848 Import AI 457:AI 版 Stuxnet、有缺陷的 Muon 优化器与正向对齐
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏科研与工程计算。
AI as Normal TechnologyAI 评分6060 Sayash Kapoor 撰文分析 AI 为何可能拖慢而非加速科学进步
Sayash Kapoor 在 AI as Normal Technology 框架下撰文指出,科学论文产出指数级增长但实际进步停滞甚至放缓,AI 很可能加剧这一生产-进步悖论。