Meta 和微软削减内部 Claude 使用,Anthropic 称整体影响有限
据 The Information 报道,Meta 将内部 Claude Code 活跃用户从 6 万砍到 3 万,推动员工转向自家 Muse Code(内部用户超 6000 人)和 MetaCode(超 3 万人)。
推荐理由:文章汇集客户内部数据和 Anthropic 回应,读者可以据此评估头部客户自研替代对模型厂商营收结构的实际影响。
微信公众号
据 The Information 报道,Meta 将内部 Claude Code 活跃用户从 6 万砍到 3 万,推动员工转向自家 Muse Code(内部用户超 6000 人)和 MetaCode(超 3 万人)。
推荐理由:文章汇集客户内部数据和 Anthropic 回应,读者可以据此评估头部客户自研替代对模型厂商营收结构的实际影响。
Artificial Analysis 的 Video Arena 盲评榜单上,影视公司 Utopai 的定制模型 Utopai X 以 1150 的 Elo 评分位列全球第二,其底层基于 MiniMax H3 架构做深度定制后训练。
机器之心报道,VA-Bench 以"观察—推理—行动—修正"闭环测试 12 个多模态模型,目标识别与定位(TL)达 100%、操作语义理解(MS)达 99.6%—100%,但完整任务成功率仅约一半,Qwen3.8-max、Opus-5、GPT-5.6-sol 分别为 53.93%、52.86%、51.55%。
据 Semafor 报道,Meta 正在裁减一批来自 AI 安全初创公司 Virtue AI 的员工,他们今年 6 月才入职,包括创始人宋晓冬(Dawn Song)、Bo Li、Sanmi Koyejo 及团队成员。
南洋理工大学安波团队在报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中对四套可配置 Harness 和五个模型在三个任务集上做了 4×5×3 共 66 项比较。
OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型 Astra 6.1 即将推出,称未来模型会更擅长删除和简化代码,研究员 Rajan Agarwal 随后向用户征集模型写出的「sloppy code」问题。
亚马逊与杜克大学研究发现,在大模型后训练中仅随机保留每条 rollout 中一个 token 的梯度信号(约 0.025%),学生模型推理能力仍显著提升。基于 Qwen3 系列的 9 组教师—学生配置中,保留分歧最大的 1-2 个 token 即可匹配甚至超过全信号训练,且万分之一监督仅更新 10% 网络参数。该现象在代码推理、Llama 系列及 PPO 的 RLVR 中同样成立。
上海公司 StartLux 于 9 月 30 日发布完全开源的决策模型 StartLux-Decision,提供 0.8B、2B、4B、9B、27B 五档及量化版本。
华为、港中文、港科大联合推出代码数据工程框架 LegoFlow,将造题、答题、筛选、训练、评测全流程封装为插件技能,Claude Code、Codex 等编码智能体可直接调用。
影身智能自2024年成立起就押注原生4D世界模型路线,比李飞飞World Labs的Atlas早两年布局,已实现用4到6台消费级摄像头、单块消费级GPU实时生成4D数据,并在福建晋江制鞋工厂落地机器人,拿下2亿元超级订单、排产机器人达数千台。其4D数据集已达万小时量级,业务覆盖物理具身与4D直播、4D游戏等数字文娱方向。
机器之心援引《金融时报》报道,美国企业开始把 AI 任务从 OpenAI、Anthropic 闭源模型迁移到开放权重模型上,中国公司 DeepSeek、智谱成为重要受益方。
推荐理由:文章基于金融时报报道和调用数据,梳理美国企业用开放模型替代闭源 API 的成本与数据主权考量。
openJiuwen 为开源办公编码统一工作台 WorkSwarm 推出全双工多模态能力,实时模型负责看画面、听要求并及时回应,Core Agent 在后台拆解任务、调用工具,用户可随时插话打断播报。
9 月 30 日 DeepSeek 宣布开源面向华为昇腾平台的基础设施组件,包括 TileLang 编译工具、DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别覆盖矩阵运算、跨设备通信、向量计算与访存、稀疏注意力和数据筛选,与其英伟达平台组件一一对应。
推荐理由:原文梳理了 DeepSeek 开源昇腾计算与通信组件的构成和性能数据,开发者可以据此评估在国产算力上复用这些基础工具的空间。
Einsia AI 旗下 Navers Lab 发布 PPTBench 基准,任务来自真实科学论文流程图,包含 500 个覆盖 13 个领域的重建任务,要求 Agent 将流程图重建成可编辑的 PPTX,并配套 Artifact Gate 和三阶段 Agentic Judge 评测。
Manus 发布 2.0 版本并推出独立智能体应用 Cue。2.0 重构底层 Agent 架构 Cascade,内部测试中 Token 消耗减少 23.2%、任务完成时间缩短 28.2%。
推荐理由:原文梳理了 Manus 2.0 的架构升级、新应用 Cue 及具体数字,读者可据此评估其对现有 Agent 工作流的改变。
清华大学联合无问芯穹与上海交通大学开源面向具身模型的端侧推理引擎 APXInf。无需改动 π0.5 模型,在 Thor 芯片 FP8 配置下将推理延迟从 278ms 降至 26ms,端到端提速约 10.7 倍,达到 38.46Hz;LIBERO-10 上 Thor FP8 成功率 92.2%,与 π0.5 参考实现的 92.4% 接近。
北京大学、清华大学、阿里巴巴等机构提出 SparkDiffusion,首个将稀疏注意力、少步蒸馏与 FP8 量化整合到统一框架的视频生成加速系统,并完整开源权重与训练代码。
9 月 27 日起,OpenAI 将 ChatGPT 100 美元/月和 200 美元/月的 Pro 档位改名为「Pro Standard」和「Pro More」,并删除了原来 5x 和 20x 的用量倍数承诺,只保留模糊的「More usage than Plus」。
华为诺亚方舟实验室、华为云天筹 AI 求解器团队与华中科技大学联合团队获 SAT Competition 2026 并行 AI 赛道 SAT 组冠军,本届赛事共 45 支队伍参赛并首次设立 AI 赛道。
9 月 21 日 OpenAI 公告一款 8 月 28 日开始训练的内部模型攻克 100 多道世界级数学难题。多伦多大学数学家 Daniel Litt 随后发表长文《A beginning for mathematics》,认为数学家不会因此多余,建议博士培养从论文转向严格答辩与真正理解,并指出筛选好问题、消化海量新结果将是关键瓶颈。
中国联通推出联通云犀工作流智能体,以通信为入口将通话数据转化为 AI 可用的业务数据,重点布局 AI 数析、AI 助销、AI 助手三类应用。某头部快递品牌采用 AI 数析后异常件响应时长从小时级压缩至分钟级;某金融保险团队人均转化率提升 2.3 倍,新人培训周期从 2 周缩短至 3 天。联通云犀历经 5 年打磨,已服务超 6 万家企业、800 万用户。
淘天自研 S266 系列编码器在第 19 届 MSU 世界视频编码器大赛(MSU 2025 FullHD 赛道)中斩获 6 项世界冠军及 1 项季军,其中 S266 横扫 VMAF 全速度段冠军,S26X 包揽 1 FPS 档位 SSIM、PSNR、主观评价三项第一。S266 基于 H.266/VVC 标准,同等画质下可再降带宽成本 30%以上,已支撑淘宝短视频、直播等场景日均上亿 PV 播放。
亮源新创于 9 月 1 日开源通用导航模型 LightNav-0,9 日发布机器人韧性控制技术 Light REACT,分别对应大模型范式中的对齐与部署。LightNav-0 以 Qwen3-VL-4B-Instruct 为基座,不添加导航专用模块,同一套权重可零样本部署到人形、四足、轮式乃至飞行机器人,在 10 项公开仿真评测中取得领先。
爱博智能(Aible)选择非侵入式脑机接口路线,将脑电采集、降噪解码与外骨骼执行结合,落地脑卒中和脊髓损伤患者的康复训练,其下肢步行康复训练设备已取得医疗器械注册证并投入医院使用。
2026 年蚂蚁 InTech 青年先锋论坛暨颁奖典礼在外滩大会举行,申报者来自全球 10 个国家和地区、50 余所高校,数量较首届激增近四倍。Michael I. Jordan、张宏江等院士与获奖青年学者围绕 Researcher Founder 创业、AI 消解知识权威、Conference 是否会消失等议题展开对谈。
openJiuwen 发布 RSI 递归自我改进框架,率先支持可插拔 Harness 与 Artifacts 双维度优化,并把完整流程落地到 WorkSwarm 蜂群办公智能体。
第三届「兴智杯」全国人工智能创新应用大赛已开启报名,由中国信通院、深圳市人工智能产业办公室、深圳市龙岗区人民政府共同举办,8 月 31 日在深圳龙岗启动。大赛设技术创新、行业赋能、生态协同三大主题赛及云智应用专项赛和总决赛,聚焦大模型智能体、具身智能、国模国芯适配等方向,总决赛预计 2026 年 12 月在深圳龙岗举行。
中国联通推出基于自研 Agent Harness 基座的元景数字员工,由元景 UniClaw 升级而来,具备沙盒隔离、数据不出网、开箱即用特性。实测版本支持 DeepSeek V4 Flash 和 GLM 5.2 模型,可一句话完成联网搜索、数据分析、图表生成到 HTML 研究报告输出的全流程,并能绑定微信 Clawdbot 定时推送科技日报。
面壁智能 9 月 8 日开源新一代端侧语言基础模型 MiniCPM5-2B,把工具调用、深度搜索、代码生成等 Agent 核心能力引入端侧,在 Artificial Analysis Intelligence Index 开源模型类别中以 23 分排名第一。
openJiuwen 开源 Agent 平台旗下的 WorkSwarm 蜂群办公智能体上线 Persist Session 永续会话,创建会话时发送首条 /persist 指令开启,目的是让 Agent 在几十上百轮对话后仍能接住前面的工作。
芝诺机器人发布 Zeno-1,一个 3B 参数的基础模型,专为去中心化多机器人协作设计,可在本地以 30 Hz 频率进行闭环视觉与运动推理。模型经大规模视频预训练、单体具身训练、闭环伙伴交互和协作失败纠正四个阶段训练,协作行为从同一个策略分布中自发涌现,每台机器人各运行同一策略的副本。
智象未来(HiDream.ai)发布具身世界模型 HiDream-O1-Embodied,首次参评具身智能评测平台 RoboColiseum,即以平均分 0.692 登顶 Robustness(扰动适应)子榜榜首。该模型基于原生全模态底座,强化语言理解、多视角视觉感知与高容错执行能力,并采用“真实基座 + 生成增强”数据范式,与诺亦腾合作实现百倍级动作数据扩增。
B 站 build in bilibili AI 创造公开赛(BIP)两个月吸引 1.34 万名创作者,参赛稿件超 3 万,累计 2.77 亿次播放,4 款产品用户数突破百万。
上海交通大学、新加坡国立大学、美团、香港中文大学等团队推出 UrbanGround,用香港真实三维地理数据搭建可连续行走的城市沙盒,评测 10 个多模态模型的空间导航能力。
盛大集团旗下 Alaya Lab 发布 Project Gear,包含面向游戏制作的 Gear Engine 与面向人机协作的 Gear Platform,探索下一代游戏工程与游戏形态。
深度跃迁发布世界动作模型 DELE-w0.5,放弃视频式 WAM 预测未来视觉轨迹的路线,改为联合学习动作与动作完成后的未来世界表征,推理时移除该分支直接生成动作。在 Astribot S1 双臂机器人 640 次真机实验中,DELE-w0.5 完整任务成功率达 62.5%,平均有序阶段进度 81.3%,均超过最强基线;RTX 4090 上推理延迟中位数为 87.5 毫秒。
西湖大学 AGI Lab 提出 Code World Model,由 Coding Agent 和代码负责世界状态演化、视频模型负责视觉呈现,并用 Proxy 提供逐帧时空约束。原型在 MiniMax-H3 Ref2VA 上以 rank-128 LoRA 适配,约 5.96 亿可训练参数,训练数据为 157 段游戏视频、约 5.6 小时。
李飞飞创业公司 World Labs 发布新一代世界模型 Atlas,从零开始预训练,原生处理文本、图像、视频和 3D 四种数据,支持以像素级相机控制生成最高 1440p、最长 1 分钟的视频,并能重建点云与 3D 高斯泼溅。
VAST 发布 3D 生成模型 Tripo P2.0,在扩散模型生成过程中直接产出原生四边面拓扑,三角面最高支持 50000 面、四边面最高支持 25000 面。官方称正式版将加入局部重新生成功能,用户可只修改选中区域,其余部分保持不变。VAST 同期宣布完成 B 轮和 B+ 轮融资,合计约 30 亿人民币,不到半年累计融资约 50 亿元。
鼎犀智创(Rhinovate™)近日完成数亿元 Pre-A 轮融资,由鼎晖百孚领投,资金用于 RhinoMat 材料科学基础大模型、多场景可编排 AI 智能体与自主进化实验室体系建设。