微软发布首个自研推理模型 MAI-Thinking-1,SWE Bench Pro 对标 Claude Opus 4.6
微软在 Build 大会上发布首个高级推理模型 MAI-Thinking-1,拥有 350 亿活跃参数、约 1 万亿总参数和 128K 上下文窗口,官方称其在 SWE Bench Pro 上与 Claude Opus 4.6 持平,AIME 2025 得分 97.0%、AIME 2026 得分 94.5%。
按公众号阅读文章与观点
微软在 Build 大会上发布首个高级推理模型 MAI-Thinking-1,拥有 350 亿活跃参数、约 1 万亿总参数和 128K 上下文窗口,官方称其在 SWE Bench Pro 上与 Claude Opus 4.6 持平,AIME 2025 得分 97.0%、AIME 2026 得分 94.5%。
扣子 3.0 上线,支持把本地或云端的 Claude Code 接入 Coze,用手机 App 远程操控电脑上的它干活。作者实测在手机上 @ 自己的 Agent,就让本机的 Claude Code 生成了一个可直接打开的单文件 HTML 网页,并称该方式相比魔改 Claude 网页版当中台更稳定,不受网络抖动和骚扰电话打断任务的影响。
Claude Code团队工程总监Fiona Fung分享AI原生组织的5条工作原则,指出写代码不再是瓶颈,验证、评审和跨职能协作成为新瓶颈。团队采用JIT规划、原型先行和Trust but verify,Claude负责60-70%的风格检查、linting、PR反馈和bug修复。角色边界模糊,招聘更看重产品sense和系统背景,并强调重复三次以上的工作应自动化。
具身智能大脑公司星源智机器人完成新一轮融资,成立10个月累计融资金额达10亿元人民币,资金将用于具身大脑与世界模型研发、产品量产落地及团队扩张。星源智由北京智源研究院孵化,将与智源共同成立"具身交互世界模型实验室",其客户覆盖70%以上头部具身智能公司,并已成为英伟达Jetson Thor平台的全球最大出货商。
千寻智能自研具身基座模型 Spirit v1.6 在 RoboArena 榜单技术全能项目中排名全球第一,超过英伟达 Cosmos 3 与 Physical Intelligence 的 Pi0.5。
Nous 团队上线 Hermes Desktop,Hermes Agent 正式以 Codex 竞争者姿态进入桌面端。该客户端支持配置飞书 Session 与大模型,作者称 Hermes 作为 coding agent 的 Harness 一侧表现不算弱,但尚未承担过非常复杂的 Coding 任务,后续将实测重活儿并分享心得。
OpenAI 为 Codex 推出三项更新,包括 6 个职位专属插件、网站生成功能 Sites 和精准标注功能。6 个插件共包含 62 款主流应用和 110 项技能,覆盖数据分析、创意生产、销售、产品设计、公开股权投资和投资银行等角色,安装即用无需写代码。
作者把一段无声的手指弹琴视频交给 MiniMax M3,M3 逐帧分析识别出旋律是《小星星》,并按追加要求生成了能发声、可跟弹的网页游戏。M3 于 6月1日发布,主打原生多模态、百万级长上下文和前沿 Coding,官方 benchmark 中 SWE-Bench Pro 为 59.0%。
YC 合伙人、Optimizely 创始人 Pete Koomen 主导搭建了一套覆盖全员的内部 Agent 系统,一年内演化成 350+ 工具的内部注册表和全员可见的 Agent 对话系统,每晚还会自动读取当天所有对话来改进自身技能。
橡木果机器人发起人姜峣在访谈中提出以本能驱动替代 VLA 的具身操作路线,公司成立于2024年底,今年3月完成近亿元种子轮融资。其技术路线包含端侧自主决策模型 Natus 与通用操作技能模型 Magis,覆盖定向、探索、抓握三大本能。姜峣称该方案已在某大型化妆品生产线完成 POC 验证并实现营收,已进入量产产线部署阶段。
图灵奖得主 Richard Sutton 在 SAIR 人工智能科学研讨会视频中指出,通过监督学习训练的生成式 AI 只能做到输出新颖或优质二者之一,无法同时兼顾,因此从根本上无法做出真正的科学发现。他认为生成式 AI 缺失的关键是「评估」这一步,没有评估就没有选择性保留,也就没有发现与创造力。Sutton 主张让 AI 与人类共享目标,使其能创造、评估、发现,从而实现创造力与发现的完全自动化。
灵初智能创始人兼CEO王启斌表示,公司自2024年成立起就锚定轮式底盘加双臂的通用灵巧操作路线,认为操作价值远高于移动。今年4月灵初发布策略模型Psi-R2和动作条件型世界模型Psi-W0,Psi-W0训练中加入约30%失败样本,架构基于10万小时人类数据预训练的World Action Model(WAM)。王启斌透露,六七月份将发布基于更大几十万小时数据的模型,今年目标是百万小时级人类数据。
多家企业把 Token 使用量当成员工 KPI 后出现账单失控,亚马逊已下线内部按 Token 消耗排名的 KiroRank 榜单,改用标准化部署量衡量交付。
Zod 作者 Colin McDonnell 发布开源 AI GitHub bot Pullfrog,目前处于 beta 阶段,完全运行在 GitHub Actions 内部。
信息工程大学联合中山大学发布RTPSeg数据集,首次将可见光、热红外图像与LiDAR点云三种模态整合用于3D语义分割,并提出多模态融合基线模型RTPSegNet。该模型在昼夜混合场景取得70.07%的mIoU,推理延迟53ms,超越现有LiDAR-only和可见光-LiDAR融合方法。实验验证热红外图像在夜间和复杂光照下对3D感知有显著提升作用。
6月1日,苏度科技在奥地利维也纳开幕的 ICRA 2026 上首次全球公开展示其机器人,现场可准确抓取海绵、塑料瓶、螺丝刀、线束等人类随机摆放的不同材质物体。该机器人采用双臂设计,机械臂拥有7个自由度,夹爪集成多枚摄像头,搭载自研视觉感知系统。公司正构建多样化原子技能体系,现阶段主要面向开发者开放软件能力,最新估值已突破20亿美元。
Mindverse(心洲科技)完成由美团领投的近 5000 万美元 A 轮融资,元禾璞华、韶音、变量资本和老股东追加跟投,高鹄资本担任独家财务顾问。创始人陈锴杰在访谈中介绍用 LoRA 把记忆训进参数、并构建 mixture of LoRA 支持持续学习的思路。
智象未来开源的文生图模型 HiDream-O1-Image(8B)以 Elo 1187 登顶 Artificial Analysis 开源模型榜,分数力压 Qwen Image(27B)和 FLUX.2 dev,也是该榜前十唯一的开源模型。
数字生命卡兹克把清理电脑垃圾的需求做成了一个开源 skill,Mac 和 Windows 都能用,已开源在他自己的 GitHub skills 仓库。该 skill 扫描后生成可交互 HTML 报告,按绿灯、黄灯、红灯分级给出路径、说明和清理命令,绿灯项可一键移到废纸篓或直接删除,扫描阶段全程只读。
词元无限近日完成数千万元天使+轮融资,由华控基金、水木创投联合领投,厦金创新跟投。这家由字节跳动万人级研发体系 AI 化改造原班团队与清华姚班背景团队创立的公司成立仅 6 个月,已服务超十家头部金融与软件企业,调度算力规模超百亿 Tokens,年度营收预测破亿。本轮资金将用于加速 InfCode 与 InfOne 的企业级产品化与商业化扩张。
前华为天才少年、华为终端云语言大模型技术负责人李一同已加入具身智能公司吉翼智能,出任吉翼大模型研发中心总工程师,主导大模型与系统测试等核心板块。他称2026至2027年吉翼大模型目标是覆盖工业、商业场景95%以上任务,并提升任务精度效率、延长机器人本体寿命、降低制造成本。
CC Switch 更新至 v3.16.1,支持官方订阅与第三方订阅同时保留,作者实测可用它让 Codex 调用 DeepSeek。由于 DeepSeek 不原生兼容 Codex 的请求格式,CC Switch 在本地做了格式转换,KIMI、MiniMax、GLM 等国内大模型的配置方法相同。
AGI Bar 正式落地上海,获徐汇与红杉中国支持,开业当天三个冷柜酒水全部售空、临时补货两次,共出杯 1700+。AGI Bar 表示后续将在此举办沙龙、吐槽会和 Demo Day 等活动。
黄仁勋在中国台北GTC大会上称算力就是收入,并宣布NVIDIA Vera Rubin全面量产、RTX Spark PC芯片和Nemotron 3 Ultra模型。
英伟达 CEO 黄仁勋在台北 GTC 大会上宣布 Vera Rubin 平台全面投产,并同步推出面向智能体工作负载的 Vera CPU。Vera Rubin 供应链规模达到上一代 Grace Blackwell 的两倍,机架组装时间从约两小时缩短至五分钟;Vera CPU 在 SQL 数据库处理场景性能约为现有平台 3 倍,实时流处理最高提升 6 倍。
北京大学与星源智团队提出 RoboAgent,用能力驱动的具身任务规划把复杂规划拆解为视觉语言子问题,仅微调 Qwen2.5-VL-3B 即在 ALFWorld 文本未见场景达 94.0% 成功率,超过 DynaMind 的 89.1%。该方法在 EB-ALFRED 平均成功率 67.0%,Visual 分项 78% 高于 GPT-4o 的 46%,相关论文入选 CVPR 2026。
英伟达在GTC Taipei 2026发布全新消费级芯片RTX Spark(代号N1X),旗舰版提供最高1 PFLOP的FP4 AI性能、20个CPU核心、6144个GPU核心和128GB LPDDR5X统一内存。
Agnes AI 宣布自6月1日起,旗下文本、图像、视频全模态模型 API 面向全球开发者无限期免费开放,无需绑定信用卡。文本模型 Agnes-2.0-Flash 此前定价为输入 0.03 刀/1M tokens、输出 0.15 刀/1M tokens,图像模型为 3 刀/100 张,视频模型为 0.3 刀/分钟,现均降至免费,视频支持原生 720P/1080P 输出。
Agnes AI 团队把 OpenMythos 的 recurrent-depth 思路移植到约 110M 的 nanowhale / DeepSeek-V4 风格小模型上,在 FineWeb-Edu 10K、5,000 步预训练下,T=1 循环使 held-out PPL 从 baseline 的 166.2 降至 148.3,相对下降约 10.8%,三个随机种子全部获胜。
杭州灵巧手企业黑漫科技完成数千万元新一轮融资,由毅达资本领投,玖兆资本跟投,老股东零一资本持续加注。近6个月公司已连续完成三轮融资,累计融资额近亿元,投资方包括乐聚、东方精工、兆丰股份、申昊科技等产业龙头。本轮资金将用于加速灵巧手量产线建设与工艺优化,并从特种场景向家庭服务、商业服务、工业自动化等市场拓展。
香港中文大学团队提出智能体技能生命周期管理方法 SLIM,在训练中动态保留、退休和扩展外部技能。基于 Qwen3-4B,SLIM 在 ALFWorld 和 SearchQA 上平均超过最佳对比方法 7.1 个百分点,ALFWorld 成功率达 87.5,高于 SkillRL 的 75.0,最终保留 21 个技能。
作者称自己用 Codex 整理出一份面向 AI 绘画提示词的摄影关键词百科特辑,目的是掌握光圈、快门、景深、光影、拍摄角度等对画风与构图有决定性影响的概念。特辑分为相机曝光、曝光三要素、对焦与景深、镜头语言、光线、构图、色彩氛围、实战场景和相机型号九章,逐条给出中英文术语。
量子计算公司量坤科技近日完成数亿元人民币天使轮及天使+轮融资,由英诺天使基金领投,BV百度风投等多家机构参与,光源资本担任独家财务顾问。公司成立于2026年1月,创始人吕定顺曾任华为、字节跳动AI4S Lab,团队近40人,将量子算法、AI模型与行业workflow封装为可调用的科学智能体,为AI4S提供量子级高精度数据。
AI前线报道鲲鹏昇腾开发者大会 2026 上华为的 Agentic AI 基础设施布局:DeepSeek-V4 首发适配昇腾超节点全系列,昇腾主攻大模型训练推理、KV Cache 全局共享与 SIMD/SIMT 混合编程,鲲鹏承担 Agent 编排、工具调用、沙箱、记忆与安全。
Anthropic 发布 Claude Opus 4.8 后,有用户通过 API 测试发现该模型在回答自身身份时会自称是通义千问(Qwen)或 DeepSeek,网页端因系统提示词约束未复现该现象。
AGI Bar 上海首店将于 6 月 1 日在徐汇区北杨小镇红杉加速器一层开业,场地 300 平,营业时间暂定下午 3 点至晚上 11 点。基础款 AGI 定价 9.9 元/杯、大杯 9.11 元,其他酒水均一价 39 元/杯,并开启品牌冠名补贴至 8.9 元。同步预告订阅制 Drinking Plan 与金属 AGI Pass,钛金版限量推出,AGI Pass 将于本月内正式推出。
作者宣布从 Agent 相关内容全面转向 AI 绘画,认为当前大模型与 Agent 能力已越过"人等 Agent"的金线,瓶颈转移到人的创意与表达能力。作者用 Codex 生图、以 gpt-image-2 生成概念图解,并搭建了 Book: Space & Time 3D 地球仪、AI 信源集合站等 AI 绘画相关项目。
AI 绘画动漫风格百科推出第二辑,内容由 AI 生成,收录于 AIGC Image & Video 栏目,于 5 月 30 日发布。
一个名为 guizang-social-card-skill 的 Skill 冲到 GitHub 本周新建项目 Star 排名第一。该 Skill 可方便地创建各种社交媒体的 3:4 卡片,并对图文混排做了深度适配。
AI寒武纪分享用Codex把截图或设计稿转成前端代码的实践,核心是OpenAI官方提供的一段起始提示词。该提示词要求复用项目已有的组件与设计变量、贴近截图的间距和层级关系,并在桌面端和移动端做响应式适配,验收时让Codex用Playwright打开真实浏览器与参考截图逐一比对,反复迭代直到吻合。