Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。
推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。
Airwallex 空中云汇首席营收官吴恺在播客中回顾公司 11 年从 0 到 110 亿美金估值的历程,并称 AI 正把全球金融推向关键拐点。Airwallex 目前服务 Kimi、MiniMax、智谱、DeepSeek 等大模型公司,已推出 AI 助手 Kai、AgentOS、T:0、Airi 等金融产品,并收购 Leapfin、OpenPay。
Jack Clark 在 Import AI 465 期汇总多条 AI 动态。英国 AISI 首次公开分析显示,GLM-5.2 和 DeepSeek-V4-Pro 在窄域网络安全任务上已接近领先其 4 到 7 个月发布的闭源模型。
Every 作者 Katie 复盘自己放弃和留下的多个 AI 工作流,结论是关键在于工作流回报的速度与是否匹配真实工作习惯。她为 CEO 的 Tend 需求搭建的 Attention Desk 因问题不存在而弃用,管理日程的 Margot 因维护成本过高被搁置,而即时给到回报的 compound writing 插件成为日常核心。
Thinking Machines 的开源多模态模型 Inkling 上线 Hugging Face,总参数 975B(激活 41B),原生接收图像、文本和音频输入,支持 1M 上下文和 1M token 训练语料中的 45 万亿 token 多模态训练,同日推出 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:官方详细拆解了 Inkling 的 MoE、相对注意力等架构设计,并给出从 2TB BF16 到 1-bit GGUF 的多档部署路径,方便按硬件选型。
Arvind Narayanan 与 Akash Kapur 撰文认为模型推理在均衡状态下将陷入 Bertrand 悖论式竞争,价格趋向生成 token 的边际成本,模型层难以维持利润。
推荐理由:文章用历史案例和经济理论论证模型推理难逃商品化陷阱,实验室将靠上移价值栈构建护城河,但代价是企业锁定。
OpenRouter 在 MMMU-Pro Vision(1,730 题)上基准测试 OpenAI 和 Google 五款模型的图像 detail 设置,发现 gpt-5.5 用 low 比 auto 低 13.8 分(65.2% vs 79.0%)且每题更贵(5.1¢ vs 4.5¢),原因是模型为看清热压缩图像多花 1.6x 推理 token。
推荐理由:基于 MMMU-Pro Vision 实测五款模型,给出推理模型保持 auto 细节、改调 reasoning effort 省钱的可操作结论。
Jack Clark 在 Import AI 464 期中汇总多项进展:Fable 在 KernelBench-Mega 上提交了首个也是最快的 megakernel。
Dwarkesh Patel 的 AI 大问题征文赛收到超过 600 篇 essays,并公布三名获奖者及全文。
OpenRouter 基于 2026 年 1 月 1 日至 6 月 14 日超 450 万亿 token 的日志分析,DeepSeek V4 于 4 月 24 日发布后,DeepSeek token 份额从年初约 9% 升至 6 月初近 20%,并自 5 月中旬起成为 OpenRouter 上用量第一的模型,智能体工作负载贡献了主要增量。
推荐理由:基于 OpenRouter 450 万亿 token 日志分析 V4 上线后的份额变化,并区分智能体与人类流量,数据口径和价格对比都有可参考价值。
OpenRouter 认为 2026 年 6 月最值得关注的四款开放权重模型是 DeepSeek V4 Flash、GLM 5.2、MiniMax M3 和 NVIDIA Nemotron 3 Ultra,并指出开放权重模型与美国前沿实验室的能力差距已连续 18 个月保持在 3-6 个月且未在扩大。
推荐理由:OpenRouter 用自家价格与吞吐数据逐一点评四款开放权重模型的适用场景,读者可以按成本、质量和模态对号入座选型。
Nathan Lambert 撰文认为 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可开源的 GLM-5.2,是首个在编码智能体场景中真正好用的开源权重模型,社区评测显示其在 Arena 智能体榜单上是唯一能与 OpenAI 和 Anthropic 最新模型抗衡的开源模型。
推荐理由:作者以亲测和社区评测为依据,把 GLM-5.2 与 DeepSeek R1 时刻类比,并展开开源与闭源差距及监管风险的独特分析。
本期Import AI汇总:牛津、UK AISI、斯坦福等机构研究显示AI在4项实验、6923人、18978段对话中说服力稳定超过专家人类,对Save the Children的真实募款效果约为专业劝募员的近3倍。
针对华盛顿近期签署 AI 模型审查行政令、国会立法提案及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来若监管甚至禁止开源 AI 将是严重错误。
Mistral 将 Emmi AI 并入后推出物理 AI,用模型从几何与边界条件直接预测物理场,单次前向传播在单块 GPU 上以秒级完成,替代传统 CFD/FEM 每轮设计动辄数小时至数周的求解流程。该能力面向 ASML、Airbus、Safran、Siemens Energy 等合作伙伴,覆盖产品设计、工装工艺与实时数字孪生三类场景,传统求解器保留用于验证与边缘工况。
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏科研与工程计算。
Sierra 发布 𝜏-knowledge,扩展其 𝜏-bench 对话基准,新增 𝜏-Banking 域,包含 698 篇文档、21 个产品类别(约 195K tokens),任务平均需查阅 18.6 篇文档和 9.5 次工具调用。
Jack Clark 在 Import AI 455 中判断,到 2028 年底出现无人类参与的 AI 研发(模型自主训练出后继版本)的概率超过 60%,2027 年约为 30%。
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 与 𝜏-Voice 两个评测域,并合入社区对原有 airline、retail、telecom 任务的修复。
Sayash Kapoor、Arvind Narayanan 与 Stephan Rabanser 等人发布 66 页论文《Towards a Science of AI Agent Reliability》,将智能体可靠性拆解为一致性、鲁棒性、可预测性、安全性四维共 12 项指标。
推荐理由:论文把智能体可靠性拆成12个维度并实测14个模型,显示18个月内准确率大涨而可靠性仅小幅提升。
Mistral AI 宣布完成 1.7B€ C 轮融资,投后估值 11.7B€,由 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 参投。
推荐理由:官方原文给出融资金额、估值和 ASML 领投的战略合作细节,可了解这笔资金将投向工业级定制 AI 方案。
Microsoft AI(MAI)发布两款自研模型:语音生成模型 MAI-Voice-1 已用于 Copilot Daily 和 Podcasts,并上线 Copilot Labs 体验。
推荐理由:Microsoft AI 官方公布两款自研模型的训练规模、使用入口与后续路线,读者可了解其自研模型布局。
Sayash Kapoor 撰文提出 AGI 不是里程碑,公司宣布实现 AGI 不是可操作事件,对商业、政策或安全都没有直接含义。文章以核武器为反类比,认为 AI 的经济影响依赖以十年计的扩散过程,并批评基于影响、内部机制和基准行为的三类 AGI 定义各有缺陷,建议企业和政策制定者关注安全扩散而非 AGI 宣言。
推荐理由:作者区分能力与权力、以扩散视角解释 AGI 为何不是可操作事件,为评估各方 AGI 宣言提供了一个可用的分析框架。
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic 和 Google Gemini 下一代模型遇阻后的叙事翻转,认为宣布模型扩展已死为时尚早,行业领袖的预测并不可靠。
推荐理由:作者用可核查的证据指出业内叙事反复翻转的成因,并区分能力提升与实际社会影响的薄弱关联。