微软 Skala 1.1 发布:训练数据增 2.5 倍,并集成进 CP2K 等主流 DFT 软件
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据比上一版多 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Microsoft 发布首个 cyber 模型 MAI-Cyber-1-Flash,为源自 MAI-Thinking-1 的紧凑代码安全模型,可处理约 90% 的任务,让 MDASH 把 GPT-5.4 留给最难的 10% 任务,相比现有最佳组合节省 50% 成本。
Microsoft AI 发布推理模型 MAI-Thinking-1,为 35B 激活、约 1T 总参数的稀疏 MoE 模型。官方称其在 SWE-Bench Pro 上与 Claude Opus 4.6 相当,AIME 2025 达 97.0%、AIME 2026 达 94.5%,盲测中人类偏好高于 Sonnet 4.6。
推荐理由:官方公布了模型规格与基准成绩,并说明不蒸馏、自建训练栈的路线,读者可据此评估中型推理模型的部署价值。
微软研究院发布 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前专有与开源模型在静态识别上表现明显优于交互式规划,且均远低于人类水平,失败多出现在规划阶段而非感知阶段。图像与视频生成工具仅在单帧内保留结构关系时有用,跨多步操作仍不可靠。
Microsoft 发布 MAI-Code-1.1-Flash,代码质量更高、token 效率提升 25%,价格仅为 6 月在 Microsoft Build 发布的 1.0 的四分之一,并已在 GitHub Copilot 投入生产。
Microsoft Research 发布研究模型 CARE-X,统一支持胸部 X 光报告生成、疾病分类、定位和校准诊断预测,基于 SigLIP2-so400M 与 Phi-4-mini-instruct (3.8B),采用三阶段 SFT 加 DAPO 强化学习训练。
Microsoft 发布 MAI-Image-2.6,在 Arena 文生图排行榜上排名第二,领先 Meta、Google 和 xAI 的模型。该模型总体 Elo 比 MAI-Image-2.5 提升 +79,文本渲染单项提升 +91 Elo,各评测类别均有进步。目前可在 Arena 上试用,本周晚些时候上线 MAI Playground,并将很快登陆 Microsoft Foundry 等产品。
Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
微软宣布 MAI 模型落地 GitHub Copilot 和 Excel,通过 hill-climbing 方法从 MAI-Code-1-Flash 出发训练出更高效的专用模型。
推荐理由:微软用自家产品数据展示小模型在 Copilot 和 Excel 的效率与成本对比,读者可据此评估专用小模型替代大模型的路径。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
微软 AI 与诗歌推广人 William Sieghart、创意工作室 Gravity Road 合作推出数字诗歌体验 Ode Poetry,基于 MAI 音频模型实现实时对话与诗歌推荐。
Microsoft 发布文本转语音模型 MAI-Voice-2,在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升。支持语言从英语扩展到 15 种,提供情感标签细粒度控制,可用 5-60 秒参考音频零样本创建自定义声音,且生产环境仅允许授权声音合成。
推荐理由:官方发布给出语言扩展、零样本克隆与偏好测试数据,读者可据此评估该语音模型在生产场景中的可用性。
Microsoft MAI 团队发布图像模型 MAI-Image-2.5 及更快更便宜的 MAI-Image-2.5-Flash,MAI-Image-2.5 在 Arena 图像编辑榜排名第 2(超过 Nano Banana 2),文生图榜排名第 3,较 MAI-Image-2 总分提升 75 分。
推荐理由:官方公布了 Arena 图像编辑第 2 的排名、与 Flash 双版本定价和 Foundry 入口,读者可据此评估生产图像工作流的选型。
Microsoft AI 发文阐述其在医疗领域的产品与研究方向,称旗下消费产品每天处理数千万条健康问题,对 50 万条 Copilot 对话的分析显示用户依赖 AI 做症状解读、检查结果解释和就医导航。
推荐理由:微软官方阐述其在医疗领域的价值落地,读者可以据此了解 MAI DxO、Mayo Clinic 合作与 Copilot Health 的进展全貌。
Microsoft MAI 在 Build 2026 主题演讲中发布七款新模型,覆盖图像、语音、转录、推理和编码。
推荐理由:作者以当事方身份逐一公布七个新模型的定位、基准数字和开放渠道,读者可以对照竞品评估各自适用场景。
微软推出转录模型 MAI-Transcribe-1.5,新增关键词偏置功能,可让用户提供领域特定关键词列表来引导预测,模型会结合上下文判断是否应用偏置而非盲目强制匹配。在 FLEURS 多语言基准上,启用关键词偏置后词错误率(WER)降低 30%,在提升专业词汇识别的同时保持通用语音的准确率。
Microsoft AI 发布七款新 MAI 模型,将上线 Foundry、OpenRouter、Fireworks 和 Baseten,并首次允许开发者自行微调模型权重。
推荐理由:官方完整说明了模型开放方式、Frontier Tuning 效率数据和医疗合作安排,读者可以据此评估其模型路线与可调性。
Microsoft 发布面向开发者的编码模型 MAI-Code-1-Flash,训练直接使用 GitHub Copilot 生产 harness,以适配真实智能体编码工作流。
微软发布 MAI-Image-2-Efficient 图像模型,定位量产场景,成本比旗舰低 41%,适用于产品图、营销素材、UI 原型和批量管线,支持短文本和实时交互工作流。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft 发布语音识别模型 MAI-Transcribe-1,定价 $0.36 每小时音频,称其在大规模云厂商中具备最优性价比。模型正在 Copilot Voice 模式和 Microsoft Teams 中分阶段部署,并已在 Microsoft Foundry 公开预览,同时可在新上线的 Microsoft AI Playground 体验。
Microsoft AI 团队发布图像生成模型 MAI-Image-2,称其使 MAI 进入 Arena.ai 榜单前三的文生图实验室行列。
推荐理由:原文给出榜单排名、可用入口和面向创意工作的三大能力重点,读者可据此判断是否试用或接入。
Microsoft 推出 Copilot Health,这是 Copilot 内的独立安全空间,可整合健康记录、可穿戴设备数据与健康历史并生成个性化健康洞察。
推荐理由:官方宣布 Copilot Health 上线并给出数据整合规模、隐私隔离措施和分阶段开放方式,读者可以了解其功能边界与使用入口。
Microsoft AI 分析 2026 年 1 月超过 50 万条 Copilot 健康与 wellbeing 相关对话,发现近 1/5 对话涉及用户描述自身症状、解读检查结果或管理病情,约 40% 的问题聚焦症状、疾病和治疗信息。
Microsoft AI 发布《Copilot 使用报告 2025》,基于 3750 万次对话的脱敏摘要数据分析了用户的真实使用模式。健康类话题在移动端全年居首,2 月情人节前后关系类对话明显激增,编程与游戏话题在 8 月出现交叉——工作日偏编程、周末偏游戏。报告还发现凌晨时段宗教与哲学类对话排名上升,且用户寻求个人建议的对话占比持续增长。
Microsoft AI 发布长文,提出 Humanist Superintelligence(HSI)理念,即面向具体领域、受控服务于人类的超智能,并宣布组建由作者领导的 MAI Superintelligence Team。
推荐理由:Microsoft AI 提出以人类为中心、领域受限的超智能路线,文中给出医疗诊断等具体方向和 containment 难题的判断。
Microsoft AI 于 2025 年 10 月 13 日宣布 MAI-Image 1,这是其首个完全在内部开发的图像生成模型,首日进入 LMArena 文生图模型前十。
推荐理由:微软首次完全自研的图像生成模型,官方说明了训练重点、擅长场景和后续落地产品,可了解其定位与可用入口。
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Microsoft AI 发布 MAI-DxO 诊断编排器与 SD Bench 基准,将 304 个 NEJM 病例转化为逐步诊断挑战,MAI-DxO 正确诊断最高达 85%,是同一组有经验医生的四倍以上,且以更低检查成本得出正确诊断。
推荐理由:原文同时给出诊断准确率、成本对比和研究局限,并说明 SD Bench 尚未公开,读者可据此理解结果边界。
微软 AI 发布 Copilot 应用,其 discover feed 体验整合了学习、探索与放松功能。微软 AI CEO Mustafa Suleyman 表示,Copilot 能理解用户生活语境,同时保护隐私、数据与安全,并记住最有帮助的细节。它还能提供知识获取,简化日常信息轰炸,并在用户需要时给予支持与鼓励。
Microsoft AI CEO Mustafa Suleyman 在 TED 演讲中提出,即便最接近 AI 开发的人也难以准确描述其走向,他用"新数字物种"这一隐喻来聚焦当下这一非凡时刻。演讲后他与 TED 负责人 Chris Anderson 进行了问答。