Kimi K3 的成功藏在 4 个月前杨植麟的 GTC 演讲里
月之暗面 CEO 杨植麟 3 月 21 日在英伟达 GTC 大会演讲中,披露了 Kimi K2.5 背后的三大扩展方向:可替换 Adam 的开源优化器 Muon Clip、线性注意力架构 Kimi Linear,以及智能体蜂群训练范式。K2.5 在英伟达 H800 集群上完成超 15 万亿 token 训练,是首个原生实现视觉与文本联合训练的开源模型。
微信公众号
月之暗面 CEO 杨植麟 3 月 21 日在英伟达 GTC 大会演讲中,披露了 Kimi K2.5 背后的三大扩展方向:可替换 Adam 的开源优化器 Muon Clip、线性注意力架构 Kimi Linear,以及智能体蜂群训练范式。K2.5 在英伟达 H800 集群上完成超 15 万亿 token 训练,是首个原生实现视觉与文本联合训练的开源模型。
Kimi K3 正式发布,上下文窗口 1M、总参数 2.8T,官方在基准测试中于 14 项里的 11 项击败 GPT-5.6 Sol,全部 14 项击败 Opus 4.8,并在 Frontend Code Arena 以 1679 分位列第一,超越 Claude Fable 5。
推荐理由:官方跑分与第三方评测同时给出对比数据,读者可据此判断 K3 在前端能力和成本上相对同级模型的位置。
Kimi K3 发布并已在网页端上线,参数量达2.8万亿,是目前公开的开源模型中规模最大的一个。它基于Kimi Delta Attention(KDA)混合线性注意力机制,并引入Attention Residuals结构,原生支持视觉理解,上下文窗口达100万token。
推荐理由:原文列出Kimi K3的参数规模、KDA与AttnRes架构改动及多项榜单跑分,可据此判断当前开源模型的能力位置。
Claude Code 创造者 Boris Cherny 发长文称,自动化正从工程师的加分项变成团队能否用好 AI 智能体的分水岭。他认为自动化能让智能体大军整体提速、把重复问题变成 lint 规则或 CI 步骤永久解决,并让新人及产品经理、设计师也能参与代码库。他建议每个团队动手写 CLAUDE.md、REVIEW.md 和技能文件,把领域知识转化为基础设施。
OpenAI 发布新一代语音模型 GPT-Live,采用全双工架构可同时听和说,遇到联网搜索或深度推理任务时会在后台调用 GPT-5.5 处理。该模型已在客户端和网页端向全球用户推送,付费用户默认使用 GPT-Live-1,免费用户使用 GPT-Live-1 mini,首发版暂不支持视频和屏幕共享。
SpaceXAI 发布大模型 Grok 4.5,已向用户开放,可在 Grok Build、Cursor 编译器和 SpaceXAI 控制台 API 调用。
Lilian Weng 在博客中提出,递归自我改进(RSI)在近期很难靠模型直接重写自身权重实现,更可行的路径是优化环绕基础模型的 Harness 系统,即负责协调执行、规划、调用工具、管理上下文和评估结果的系统层。
Anthropic 研究团队用基于雅可比矩阵的可解释性技术在 Claude 内部发现名为 J 空间的机制,其作用类似神经科学中的全局工作空间,可让模型不写文字就默默推理。
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出图像生成模型 Muse Image,并同步预览了 Muse Video。
Anthropic 的 Claude Code 团队给出循环(loop)的定义,即 Agent 重复执行工作周期直到满足特定的停止条件,并按其触发方式、停止条件、底层工具和适用任务分成四大类。
腾讯混元Hy3正式版发布,已在WorkBuddy首发上线并提供两周限时免费体验。官方披露其尺寸为300B,称在软件开发、办公生产等领域追平甚至在前端、数据分析等细分领域优于700多B的GLM 5.1,部分能力接近DeepSeek V4 pro。
德适科技推出医疗影像数据合规协同平台 iMedLoop,由基座大模型 iMedImage、标注工具 iMedStudio 和训练发布出口 iMedMaaS 三部分组成,将专病模型所需标注数据量降至原来的 1/200,开发周期压缩至 1/12,资金与算力投入降 90%。平台已积累 2895 万条影像数据、100 余款 AI 模型,超 3000 名标注人员入驻。
Claude Code 团队成员 Thariq 发布《A Field Guide to Fable: Finding Your Unknowns》指南,认为驾驭 Fable 5 的关键技能是发现自己的未知数。
Anthropic 的 Boris Cherny 与 Cat Wu 在对谈中梳理了从 Claude Code 到 Claude Tag 的演进,Claude Fable 5 现已接入 Claude Tag。
Palantir CEO Alex Karp 在电视采访中抨击 OpenAI 和 Anthropic 的商业模式,称企业客户花钱买的 token 并未创造匹配价值,反而把工作流程、客户数据等核心机密喂给模型,最终被卖给竞争对手。他认为按 token 计费本身说明产品无法大规模稳定创造价值,真正值钱的技术应直接谈利润分成而非收算力费。
Anthropic 在出口管制正式解除后,于北美时间 7 月 1 日面向全球重新上线 Fable 5。可用平台包括 Claude Platform(API)、Claude.ai、Claude Code 和 Claude Cowork,AWS、Google Cloud、Microsoft Foundry 上的访问会尽快恢复但暂未同步。
Anthropic 发布 Claude Sonnet 5,Agent 能力接近 Opus 4.8,即日起在免费版、Pro、Max、Team 和 Enterprise 套餐开放,API 代号 claude-sonnet-5,上线初期输入每百万 token 2 美元、输出 10 美元,优惠持续到 8 月 31 日。
推荐理由:Sonnet 5 把此前多在 Opus 系列出现的 Agent 能力下放到更低价位,读者可据此权衡模型选型与成本。
Meta 发布 Brain2Qwerty v2,基于非侵入式脑部记录实现实时句子级解码,整体单词准确率达 61%,远高于此前其他非侵入式方法的 8%,并开源了 v1 和 v2 的完整训练代码。
Agnes AI 推出 PC 端 Agent Native 创作平台 Pavo,将 Agent、图片生成、视频生成、剧情短片四个模块整合进同一工作台。官方数据显示,其全模态模型 API 免费后单周调用量达 4.66T Token,其中文本模型 2.80T、多模态模型 1.86T。
OpenRouter 梳理了截至 2026 年 6 月最值得关注的四款开源模型,认为开源与闭源的差距稳定在 3 到 6 个月。
DeepSeek 开源推理优化方法 DSpark,并配套发布论文、草稿模型以及训练框架 DeepSpec。在 DeepSeek V4 生产环境中,V4 Flash 和 V4 Pro 的用户生成速度提升最高达 85%,吞吐量和延迟提高约 50%。DeepSpec 支持 DSpark、DFlash 和 Eagle3 三种算法,模型权重与代码库均已在 GitHub 开放。
OpenAI 正式开启下一代大模型 GPT 5.6 系列的限量预览,采用全新命名体系,旗舰模型为 Sol、主打日常平衡的 Terra 和快速亲民的 Luna,分别对应不同能力层级。
无影云电脑提出为 AI 工具准备一张云端「第二桌面」,让 Cursor 等 AI 编程工具和 OpenClaw 这类 AI Agent 在云上 7×24 运行,不再与用户本机抢内存、CPU 和屏幕。该云电脑支持算力弹性伸缩、镜像标准化交付、分钟级批量开出上百台一致环境,并可通过快照回滚实现秒级恢复,笔记本、平板、手机等设备均可实时查看 AI 操作画面。
DeepSeek发布官方招聘海报,宣布将所有部门规模至少扩大一倍,岗位覆盖超算集群研发、高性能算子与编译器、大规模训练/推理框架、数据策略产品经理、Agent Harness 与 Agent Infra、Frontier 研究员等方向,工作地点为北京和杭州。文章称此次扩张与DeepSeek近期完成首轮外部融资、募资总额超过500亿元有关,并提到新增 AGI 核心业务管培生、所有岗位均接受实习。
IBM 宣布推出全球首款亚1纳米节点芯片,采用 0.7 纳米(即 7 埃)制程,单芯片集成晶体管数量接近 1000 亿。相较其 2021 年发布的 2 纳米芯片,新芯片可实现最高 50% 的性能提升或 70% 的能效提升,晶体管密度约为两倍。其纳米叠层(Nanostack)三维架构在 VLSI 2026 上展示了 SRAM 40% 的面积缩减,IBM 预计该技术最早将在未来五年内进入量产阶段。
2026中国AI智能体大会(AgenticAICon 2026)将于7月2-3日在杭州举办,由智东西旗下智猩猩主办,主题为“范式跃迁 重塑世界”。
OpenAI与博通联合发布自研AI推理芯片Jalapeño,这是OpenAI第一颗自研智能处理器,从最初设计到制造流片用时九个月。工程样品已在实验室以量产目标频率和功耗稳定运行ML工作负载,其中包括GPT-5.3-Codex-Spark,早期测试显示其每瓦性能将大幅优于当前最先进水平。Jalapeño计划于2026年底开始初步部署,并与微软等合作伙伴共同推进吉瓦级数据中心。
推荐理由:原文交代了OpenAI自研推理芯片的架构取向、合作分工与部署节奏,读者可据此理解其全栈基础设施布局。
AI 研究者 Nathan Lambert 撰文认为,GLM-5.2 是首个在编程框架中作为通用智能体使用时手感极佳的开放权重模型,官方于 6 月 16 日以 MIT 协议开放权重。
推荐理由:Nathan Lambert 结合实测与多个基准讨论 GLM-5.2 在编程智能体中的表现,读者可据此观察开源与闭源模型的能力时差。
Anthropic 发布新产品 Claude Tag,让 Claude 以团队成员身份加入 Slack,用户 @ 它一个任务后由它自行拆解步骤、逐步执行并在线程里回复结果。
字节在 2026 火山引擎 FORCE 原动力大会上发布 Seedance 2.5,将于七月初上线,同时 Seedance 2.0 升级支持原生 4K 直出和 10-bit 位深。
华盛顿大学计算机博士 Alisa Liu 在入职 OpenAI 前公开了自己的《行业求职笔记》,记录她面 11 家公司、经历 57 场正式面试的完整过程。她把面试分成 ML 编程、通用算法、研究讨论、行为面试、数学和工作演讲几类,并给出备考方式与用纸笔手写实现 transformer 等建议。
DeepSWE 编程基准更新到 v1.1,共 113 个任务,来自 91 个活跃开源仓库,GLM-5.2 位列开源第一,kimi-2.7-code 开源第二,两者均高于 Opus-4.6 max。
作者用千问电脑端语音输入法完成了一场"AI工具2026年中盘点"线上发布会的全部筹备,全程不碰键盘,4项任务总耗时约36分钟,传统方式预估需300分钟。语音指令可直接生成策划方案、1000字演讲稿和10页PPT,其中PPT生成从2小时降至几十秒,但首版页数不足需补指令,且测试中遇到过一次文案被删除的bug。千问语音输入及内置AI工具完全免费,支持Windows和Mac。
开源工具 Understand Anything 是一款 Claude Code 插件,用多智能体流水线扫描项目,提取文件、函数、类和依赖关系并生成可交互的代码知识图谱面板。
2024 年诺贝尔化学奖得主、AlphaFold 项目负责人 John Jumper 宣布,在谷歌 DeepMind 工作近 9 年后离职,短暂休整后加入 Anthropic。
智谱开源其内部使用的强化学习训练框架 slime,GLM-5.2 的 OPD 后训练在该平台上约用 2 天完成。slime 通过连接 Megatron 与 SGLang 做高性能训练,并提供自定义数据生成接口,官方称其是 GLM-5.2、GLM-5.1、GLM-5、GLM-4.7 等模型背后的 RL 训练框架。
英伟达 GEAR 实验室发布 ENPIRE 系统,让 8 个 Codex 智能体接管一支机器人舰队,自主完成重置场景、检索论文、写代码、训练模型、部署验证到分析失败再改代码的完整研究闭环,全程无人类介入。
金山办公在苏州一场30多位企业CIO参与的闭门会上,提出企业级AI需从"个人提效"走向"组织增智",并给出四个落地判断:只做高价值高难度的"双高"场景、答案在数据而非聊天框、把老员工经验蒸馏进AI、最终考核财务指标。
智谱发布 GLM-5.2,以 MIT 协议完全开源,参数 753B,支持 1M token 上下文窗口,主打长程任务能力。文中称在相近 token 消耗下其能力介于 Opus 4.7 与 Opus 4.8 之间;FrontierSWE 得分 74.4,落后 Opus 4.8 约 1%,超过 GPT-5.5 的 72.6。
推荐理由:文中给出 GLM-5.2 在长程编程基准上与 Opus 4.8 的分数对比,可看到开源模型在长任务上的位置。
马斯克旗下 SpaceX 以换股方式、按 600 亿美金估值正式收购 Cursor,Cursor 团队将加入 SpaceX 共同研发前沿 AI 技术。双方此前已联合训练一个 AI 模型,并将在 Cursor 和 Grok Build 上发布。