Sayash Kapoor 撰文分析 AI 为何可能拖慢而非加速科学进步
Sayash Kapoor 在 AI as Normal Technology 框架下撰文指出,科学论文产出指数级增长但实际进步停滞甚至放缓,AI 很可能加剧这一生产-进步悖论。
媒体报道、公司博客与研究文章
Sayash Kapoor 在 AI as Normal Technology 框架下撰文指出,科学论文产出指数级增长但实际进步停滞甚至放缓,AI 很可能加剧这一生产-进步悖论。
金融科技公司 Mercury 的 staff 工程师 Matt Russell 在访谈中复盘其团队六个月使用 AI 智能体的经验。团队从 3 月内部黑客松起步,通过 Linear for Agents 把 issue 分派给第三方智能体并回收 PR,还用 Linear Asks 模板让 ops 团队自助提交工单、由智能体建 UI 并提交 PR,几乎无差错。
Mistral AI 发布语音理解模型 Voxtral,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。
推荐理由:官方给出完整基准对比和定价细节,开源语音模型在准确率与成本上的位置可以直接对比判断。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并推出 Devstral Small 1.1 升级版。
推荐理由:官方给出 SWE-Bench Verified 分数和 API 定价,可比较两款新模型在成本与代码智能体性能上的定位。
Suno 宣布 Paul Sinclair 加入公司担任首席音乐官,负责领导面向行业与艺人的相关工作。Paul 曾任 Atlantic Records 总经理,与 Bruno Mars、Coldplay、Janelle Monae、Missy Elliot 等艺人合作,并曾是音频硬件公司 Audeze 的长期董事会成员。
Mistral AI 推出 AI for Citizens 协作计划,帮助各国政府和公共机构战略性地运用 AI 改造公共服务、推动创新并保障竞争力。该计划提供开放模型与产品组合、自托管或 SaaS 部署选择、数据主权保障及定制化研发,已与法国、卢森堡、新加坡、荷兰、英国、瑞士等国政府及公共部门合作。
Factory 发布 Agent-Native Development 指南,讲解如何让智能体运行完整的开发内循环:收集上下文、规划、实现、验证并提交可审查的变更。
推荐理由:Factory 提出 Agent-Native Development 方法论,给出精确规格、环境配置和任务失败时的恢复策略,可直接迁移到日常智能体编码工作流。
Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。
推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。
Suno 宣布收购全浏览器运行的 AI 加速数字音频工作站 WavTool,其编辑技术与核心团队加入 Suno 并担任产品与工程领导职务。WavTool 是首个结合 VST 插件支持、采样级编辑、现场录音与 stem 分离、AI 生成 MIDI、应用内聊天机器人等原生 AI 能力的浏览器 DAW。此前 Suno 本月刚发布包括高级歌曲编辑器、stem 分离和增强音频上传的新编辑界面。
Mistral AI 发布 AI 基础设施服务 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成技术栈,涵盖 GPU、编排、API、产品和服务。
Sam Altman 撰文认为人类已越过奇点事件视界,技术起飞已经开始,2025 年出现能做真实认知工作的 Agent,2026 年可能出现能提出新洞见的系统,2027 年可能出现能在现实世界执行任务的机器人。他称科学家反馈 AI 使生产力提升两到三倍,并主张先解决对齐问题,再让超级智能变得便宜、普及且不集中于少数人手中。
Linear 宣布完成 Series C 融资,称公司已盈利、增长强劲,超过 15,000 家公司(包括 OpenAI、CashApp、Ramp、Scale AI 和 Boom)在使用其产品。下一步规划两个方向:Linear for Agents 让第三方或自建智能体在产品工作流中被部署和协调;Linear AI 则把 AI 功能直接嵌入建 issue、自动分类路由和反馈总结等现有工作流中。
Mistral AI 发布首个推理模型 Magistral,含 24B 参数开源版 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:官方给出两个版本的基准分数、开源许可和语言能力细节,读者可据此评估它在推理模型中的定位。
Mistral 发布企业级 AI 编码助手 Mistral Code,基于开源项目 Continue,面向 JetBrains IDE 和 VSCode 开放私测,GA 计划近期推出。
Suno 发布一组创作控制功能:升级版 Song Editor 可在波形上逐段重排、改写和重制曲目,并可将曲目拆分为 12 条干净 stems(人声、鼓、贝斯等)预览和下载。音频上传扩展至最长 8 分钟,可从自己的完整曲目或吉他 riff 开始创作,另新增三个创意滑杆控制生成风格,支持导出后在 DAW 中继续编辑。
推荐理由:原文列出了 Song Editor、stems 分离和上传上限等具体能力,读者可以对照自己现有的创作流程判断是否用得上。
Mistral AI 发布代码专用嵌入模型 Codestral Embed,称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 大型嵌入模型。
Factory 宣布 Droids 软件开发智能体正式开放(GA),覆盖从工单到生产代码的整个软件开发生命周期。
推荐理由:Factory 宣布 Droids 正式开放,覆盖从编码到 on-call、工单管理的整个软件开发生命周期,价格和集成方式对团队选型有参考价值。
Linear 创始人发文分析为何质量稀缺,认为每次技术进步都会把行业拉离手艺,而 AI 正试图把制作者的判断和品味也从创作中分离出去。他主张质量本身就是商业策略:Linear 第二年实现盈利,第四年拥有超过 10000 个付费客户且几乎没有营销支出,并分享了以质量为北极星、3-5 人小团队、MVP 仅限内部使用、issue 7 天内修复等实践。
DeepSeek 官方宣布 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力增强,AIME 2025 Pass@1 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,Aider 从 57.0 升至 71.6。
推荐理由:官方更新日志列出各基准的具体分数变化,读者可以直接对比新旧 R1 在推理和幻觉上的差异。
Mistral 发布新的 Agents API,将模型与代码执行、网络搜索、图像生成、Document Library 及 MCP 工具等内置连接器结合,并作为 Chat Completion API 的补充简化 Agent 场景开发。
推荐理由:官方原文给出内置连接器、有状态对话与多智能体编排等核心能力,还附 SimpleQA 数字,读者可据此评估其对企业级 Agent 开发的适用性。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:官方发布给出 SWE-Bench Verified 成绩、开源许可和部署门槛,读者可据此判断它在本地或企业编码场景中的位置。
Mistral AI 发布 Mistral Medium 3,定位为兼顾 SOTA 性能、成本低约 8 倍和更易部署的新级别模型。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准数字和 $0.4/$2 定价,读者可以据此评估它在企业部署中的性价比。
Mistral AI 推出企业级 AI 助手 Le Chat Enterprise,由全新 Mistral Medium 3 模型驱动,提供企业搜索、Agent 构建器、数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
Sayash Kapoor 撰文提出 AGI 不是里程碑,公司宣布实现 AGI 不是可操作事件,对商业、政策或安全都没有直接含义。文章以核武器为反类比,认为 AI 的经济影响依赖以十年计的扩散过程,并批评基于影响、内部机制和基准行为的三类 AGI 定义各有缺陷,建议企业和政策制定者关注安全扩散而非 AGI 宣言。
推荐理由:作者区分能力与权力、以扩散视角解释 AGI 为何不是可操作事件,为评估各方 AGI 宣言提供了一个可用的分析框架。
Suno 发布最新音乐生成模型 v4.5,曲风选项大幅扩充且更贴合描述,人声情感与音域增强,歌曲最长可达 8 分钟。新增提示词增强助手,Covers 与 Personas 可组合使用,生成速度与音频质量也有明显提升。
推荐理由:官方公告列出了 v4.5 在曲风、人声、音质和生成速度上的具体改进,音乐创作工作流的变化可以直接对照查看。
Arvind Narayanan 发布超过 1.5 万字的新论文,提出将 AI 视为“常态技术”的世界观,认为其影响类似电力和互联网等通用技术,变革性经济与社会影响将以数十年为时间尺度缓慢展开。
推荐理由:作者提出 AI 是像电力一样的常态技术,经济影响将以数十年计缓慢扩散,并给出风险与政策的替代框架。
Mistral AI 发布教程,介绍用 LLM As A Judge 评估 RAG 系统的方法。文章讲解 TruLens 提出的 RAG Triad 框架,从上下文相关性。
Linear 发文探讨 AI 时代界面设计,认为 ChatGPT 带火的聊天界面只是通用容器,提示词难以精确控制结果,无法适配具体工作流。文章主张以传统 UI 构建功能型应用、再用 AI 能力补充,并把 Linear 这类软件比作“工作台”,为 AI 智能体提供结构、上下文与审核环境,人类保持在回路中。
DeepSeek 官方宣布 deepseek-chat 模型升级为 DeepSeek-V3-0324。基准测试提升明显,MMLU-Pro 75.9 → 81.2,GPQA 59.1 → 68.4,AIME 39.6 → 59.4,LiveCodeBench 39.2 → 49.2。
推荐理由:原文给出各基准测试的具体提升数字和功能变化,读者可据此评估升级对现有应用的影响。
Mistral AI 发布 Mistral Small 3.1,相比 Mistral Small 3 提升文本性能,新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,官方称超越 Gemma 3 和 GPT-4o Mini 等同级模型。
推荐理由:官方给出了与 Gemma 3 和 GPT-4o Mini 的对比数据、部署门槛和开放下载渠道,可据此评估端侧与低成本部署选择。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),以图像和 PDF 为输入,输出交错的文本与图片,已作为 Le Chat 默认文档理解模型。
推荐理由:官方公布了自评基准对比、定价和部署选项,读者可以据此评估它在文档理解与 RAG 场景中的位置。
Linear 发布 Customer Requests 功能,可将来自支持工单、Slack 消息和通话的客户反馈直接带入 Linear,供产品与工程团队识别需求模式并辅助决策。该功能支持按营收、客户层级等业务指标筛选客户以排定优先级,并替代分散的反馈记录方式、免去工具间手动同步。Linear 表示正在开发 Salesforce 和 HubSpot 集成,并计划用 AI 从大量反馈中提取有效信号。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并转化为结构化开发工单,自动在 Linear / Jira 中创建。
Sam Altman 发文《Three Observations》,提出 AI 经济学三点观察:模型智能约等于训练与运行资源投入的对数,同等智能水平的使用成本每 12 个月下降约 10 倍(GPT-4 到 GPT-4o 每 token 价格下降约 150 倍),线性增长的智能带来超指数级的社会经济价值。
DeepSeek 在 API 中上线 deepseek-reasoner,即新模型 DeepSeek-R1,通过指定 model=deepseek-reasoner 调用。详细更新见 DeepSeek-R1 正式发布说明,调用指南见推理模型文档。
推荐理由:原文说明 deepseek-reasoner 即 DeepSeek-R1,给出了调用方式,方便开发者在 API 中直接使用新推理模型。
Sam Altman 在 ChatGPT 两周年之际发文回顾 OpenAI 近九年历程,称已进入能完成复杂推理的新模型范式,周活跃用户从约 1 亿增长到超过 3 亿。他复盘一年前被董事会解雇事件,认为那是善意的治理失败,也谈到治理与信任的教训。他表示有信心按传统理解构建 AGI,预计 2025 年首批 AI 智能体加入劳动力并实质改变公司产出,下一目标是真正意义的超级智能。
deepseek-chat 模型已升级为 DeepSeek-V3,接口不变,仍可通过指定 model=deepseek-chat 调用。详细更新可参考官方 DeepSeek-V3 正式发布说明。
推荐理由:API 接口保持不变,现有用户可无迁移成本地用上 DeepSeek-V3,原文还指向了详细更新说明。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。
Sayash Kapoor 分析 WIRED AI Elections Project 收录的 78 个 2024 年选举 AI 使用案例,发现其中 39 个无欺骗意图,而 39 个欺骗性内容不用 AI 也能以几百美元内的成本复制。文章提出误信息的关键在需求侧而非供给侧,治理信息环境依赖结构性、制度性改变,而非限制 AI 生成内容。
推荐理由:作者基于 WIRED 数据库 78 个案例给出一手分析,指出政治误信息更多是需求侧的结构性问题,值得从供需视角重新审视。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench(08.01-12.01)准确率从 29.2% 提升至 34.38%。中文写作与推理能力在内部测试集中也有提升,同时优化了文件上传和网页总结功能的用户体验。