GLM-5.2如何在Design Arena中击败了Fable 5
GLM-5.2 在 Design Arena 的单轮 HTML 网页设计(Non-Agentic)评测中总分第一,比上一代 GLM-5.1 高 5 个名次,击败长期霸榜的 Claude Fable 5、Opus 4.6 和 Opus 4.7,成为首款登顶的开源模型,MIT 授权。
按公众号阅读文章与观点
GLM-5.2 在 Design Arena 的单轮 HTML 网页设计(Non-Agentic)评测中总分第一,比上一代 GLM-5.1 高 5 个名次,击败长期霸榜的 Claude Fable 5、Opus 4.6 和 Opus 4.7,成为首款登顶的开源模型,MIT 授权。
Redis 之父 Salvatore Sanfilippo(antirez)于 6 月 15 日在 X 发文,反驳中国模型靠 API 蒸馏美国模型的说法,认为 API 只返回最终文本、拿不到完整 logits,蒸馏在数学上不成立,并指出 DeepSeek 已公开预训练、SFT 和 RL 管线且部分结果被复现。
百川智能创始人王小川在《硅基立场》访谈中表示,公司以医学增强模型 M4 和 AI 家庭医生百小医切入医疗,目标是为医疗体系补充供给,百小医底层是 Agent Harness 架构、上层封装成 AI 家庭医生。
滑铁卢大学助理教授陈文虎是 MMLU-Pro、MMMU 和 MMMU-Pro 等主流 AI 基准评测的幕后出题人。他 2024 年推出的 MMLU-Pro 含 12032 道题、覆盖 14 个领域,选项从 4 个扩展到 10 个,使模型准确率较原版 MMLU 下降 16% 到 33%。他现已加入 Meta 超级智能实验室,继续从事多模态预训练数据与评估工作。
Meta CTO Andrew Bosworth在内部备忘录中承认,公司这轮AI重组的愿景沟通与员工支持做得糟糕透顶,并称重组动摇了员工对自身专长、成长和工作影响力的三重信任。
陶哲轩12年前预言数学家将用计算机可理解的形式化语言取代LaTeX撰写论文,如今他通过Lean4和AI协作将其变为现实。他发起的Equational Theories项目针对约2200万个代数等式,依靠AI写证明、Lean自动核验、全球志愿者协作,48小时内完成大规模筛选,前9天进度达99.866%,第57天主项目基本完工,仅剩162个蕴含关系待收尾。
无问芯穹Agentic MaaS平台Token调用量从2025年底到今年5月增速超20倍,其中95%以上来自智能体场景。这家2023年成立的公司不研发通用大模型、不做芯片,而是坐在芯片和模型之间做算力调度与优化,在万亿参数模型场景下实现5到10倍的性价比提升,并以Token计费形成商业化飞轮。
Pinecone 在 Microsoft Build 2026 上发布 Nexus 知识引擎与 Microsoft OneLake 的集成,让 AI 智能体通过预构建的结构化知识工件查询 OneLake 中的企业数据,而非传统检索管道。
快手资深服务端架构师闫文亮在 QCon 全球软件开发大会 2026 北京站分享了用 AI 治理 Feature Flag 技术债的实践,通过大模型生成加 AST 引擎校验的双引擎架构实现开关自动下线。
昆仑万维旗下 Skywork 发布 3.1 版本,上线 Skywork Design 与 Dynamic Workflows 两项能力。Skywork Design 将 AI 设计从对话框延展至可视化画布,支持多页面 UI 项目持续迭代;Dynamic Workflows 通过多 Agent 并行调度拆解复杂任务,并支持验证与断点续跑。
InfoQ 编译 The Pragmatic Engineer 的文章,梳理 Meta 近几周强制部分工程师转岗做数据标注、记录键盘鼠标操作、将词元用量纳入绩效等举措,认为其工程文化已被降为成本中心。
Google DeepMind 的诺奖得主、AlphaFold 之父 John Jumper 宣布离职并加入 Anthropic,两天前 Transformer 核心作者 Noam Shazeer 也离开 DeepMind 加入 OpenAI。
推荐理由:48小时内DeepMind连失两位核心人物,可见Anthropic与OpenAI在生命科学和AI编程上的吸引力。
香港大学李弘扬团队联合华为、上海创智学院及清华大学李升波教授团队发表论文 World Engine,提出面向端到端自动驾驶的后训练框架。该框架由 SimEngine、Behaviour World Model 和 Reinforcement Post-training 三部分组成,把真实驾驶日志中的长尾失败重建为可闭环交互的仿真环境,再用带行为约束的强化学习后训练策略。
2024 年诺贝尔化学奖得主、AlphaFold 项目负责人 John Jumper 宣布,在谷歌 DeepMind 工作近 9 年后离职,短暂休整后加入 Anthropic。
智谱开源其内部使用的强化学习训练框架 slime,GLM-5.2 的 OPD 后训练在该平台上约用 2 天完成。slime 通过连接 Megatron 与 SGLang 做高性能训练,并提供自定义数据生成接口,官方称其是 GLM-5.2、GLM-5.1、GLM-5、GLM-4.7 等模型背后的 RL 训练框架。
追觅科技6月18日宣布完成新一轮核心战略调整,将业务体系重组为追觅品牌、MOVA、NAVEE和机器人四大事业群,手机与汽车业务未作为独立事业群出现,被放入产业研究院体系。公司同时披露2026年1至5月主营业务同比增长80%,截至6月全球门店突破1万家、覆盖120多个国家和地区。多位员工透露裁员已开始,部分重合业务被裁撤,调整大部分尚未真正落地。
作者端午回县城老家,发现街头冒出大量挂 AI 招牌的智能美肤中心、智习室和共享棋牌室,实际业务多是旧模式换名。文中提到,全国 AI 智习室从 2023 年的 1320 家增至 2025 年的 5 万家,而作者体验的九块九测肤、刷题和棋牌室自动算分,与当下讨论的大模型并非一回事。文章还追溯了招商公司把普通软硬件套上 AI 外壳、向三四线城市推广加盟的流程,以及加盟商交钱后总部承诺不兑现的情况。
深圳眼镜展上,传统眼镜店老板直接找AI眼镜ODM厂商问价拿货,不带摄像头的AI音频眼镜成本已做到7美元、带摄像头约100-200元。Rokid Glasses搭载高通AR1、32GB存储,硬件成本约2000元,售价2800元,头部品牌硬件毛利仅30%左右。IDC数据显示2026年第一季度全球智能眼镜出货356.6万台,同比增长130.1%,行业共识是AI眼镜首先得是一副戴着舒服的眼镜。
虎嗅采访三位靠外贸起家的00后创业者,他们把销冠经验做成可调用的skill、让Agent跑上品和数据周报等重复工作,并先设定目标人群再让Accio Work反推选品方向。
Claude Code 上线 Artifacts 功能,能在每次开发对话中生成实时、可分享、可交互的网页,把 PR 走查、系统架构说明、调试时间线、发布 checklist 等完整工作进展发布成同一链接下的可视化页面。
Claude Code 上线 Artifacts 功能,能在开发对话进行过程中生成实时、可分享、可交互的网页页面,把一次开发 session 的完整进展沉淀为团队可见的工作台。
清华系 AI Infra 公司清程极智推出赤兔推理引擎、八卦炉和 AI Ping 三款产品,分别覆盖训练、推理部署与 Token 服务智能路由。赤兔通过软件层映射 FP4、FP8 低位宽计算,让不原生支持这些格式的国产芯片高效运行大模型,部署 DeepSeek-V3 满血版从 4 台 8 卡服务器压缩至 1 台。
光象科技发布首个工业级自进化具身智能机器人 Phi-Bot X1,并已拿到头部车企订单进入真实汽车产线。X1 在 2026 ATC 蔚来汽车焊接上下料场景连续作业约 21.5 小时,实现零失误、零中断和 100% 成功率,具备 10mm 定位精度与 0.05mm 末端重复定位能力,部署周期约一周。
演语科技(Evoken)完成近3亿美元B+轮融资,投后估值超过20亿美元,由Granite Asia、腾讯、顺为资本联合领投,高榕资本、蚂蚁集团、红杉中国等现有股东继续加码。
智谱 GLM-5.2 发布后热度大涨,最新榜单显示它与 GPT-5.5、Gemini-3.1 同列前三,马斯克也回应了中国追赶 Fable 的时间。Hugging Face 表示为所有 GLM-5.2 模型的开销买单,但未提前通知智谱,智谱随后预告未来 5 小时免费。
银河通用机器人发布 AstraBrain-WBC 0.5,定位面向人形机器人全身实时运控的小脑基础模型,基于约2万小时、约20亿帧人类动作数据训练,参数规模8040万。
OpenAI 与 Molecule.one 联合发布新成果,GPT-5.4 在近乎自主条件下改进了药物合成中常用的 Chan–Lam 偶联反应。
Google 工程副总裁、Gemini 模型联合负责人 Noam Shazeer 在 X 上宣布离开 Google,加入 OpenAI,并将担任 OpenAI 新的架构研究负责人。
虎嗅分析指出,部分通用推理Token价格三年内最高降幅达99%,但企业AI运营总支出并未缩减。原因在于企业正从简单问答转向Agent协作、代码生成等复杂工作流,Token消耗量可达简单问答的十倍甚至百倍。文章据此梳理从芯片、HBM、光模块到云平台、模型厂商和应用端的利润分配,认为掌握稀缺资源与高粘性场景的环节更能在用量爆发中持续收费。
X(推特)在4月底5月初替换升级原有 Google 翻译,将全平台帖子自动翻译成用户的系统语言,让任何语言的帖子都能获得全球曝光。作者据此观察全球网友在同一评论区互相围观的现象,从日常吐槽、地狱笑话到性别与阶级话题,指出语言隔阂消除后共享同一处境的人反而更显亲近。
Founder Park 摘取 Sensor Tower《State of AI 2026》报告,指出购物与软件类品牌占 ChatGPT 广告总量近一半,OpenAI 将更多广告预算转向 YouTube 和 LinkedIn。
6 月 17 日,据韩联社报道,SK 海力士取消招聘中「四年制本科及以上学位」的硬性规定,研发、芯片设计、器件工程等岗位向高中生和大专生开放,本科生和硕士生也能投递生产线岗位。
火山引擎 6 月 15 日上线 Seedance 2.0 mini,价格更低、速度更快,剪映、即梦和小云雀几乎同时宣称首发该模型。mini 版图生视频定价 0.023 元/千 tokens,720P 折算单秒成本约 0.5 元,比 Seedance 2.0 低约一半,应用侧则把单秒价格压到 0.15 至 0.25 元。
前 OpenAI Go-to-Market 负责人 Zack Kass 在清华大学演讲提出,AI 的决定性变化是推理成本快速下降,智能将像电力、互联网一样成为低成本基础设施。他认为 AI 带来认知外包、数字成瘾等新风险,对工作的冲击不只是岗位替代,更是当"我是谁"不再由工作定义时的身份重构。AI 能否成为真正进步,取决于能否降低住房、医疗、教育等核心生活成本。
Ramp 发布最新 AI Index,显示 AI 采用程度前 1% 的公司每位员工每月在 AI 工具和算力上支出达 7500 美元,仅过去一个月人均支出就增长 14.1%。
智谱创始人兼首席科学家唐杰在 X 上回应马斯克关于中美模型差距的判断,称赶超 Claude Fable 5 级别"不会那么久",暗示有望今年内实现。此前马斯克认为中国达到该水平可能在 2027 年 Q1。智谱随即推出 GLM-5.2,以 51 分登顶所有开源权重模型,领先 MiniMax-M3、DeepSeek V4 Pro 和 Kimi K2.6,并采用 MIT 协议全量开源。
银河通用联合团队在 CVPR 2026 发布人形机器人通用小脑模型 AstraBrain-WBC 0.5,用 20 亿帧人类动作数据和因果 Transformer 做运控基座。
智谱创始人唐杰隔空对话马斯克,称赶超 Claude Fable 5 不用等到 2027 年。该表态针对马斯克此前关于追赶时间的判断,双方就前沿模型能力差距与追赶节奏展开交锋。
一篇端午节祝福内容给出了 GPT-Image-2 的提示词示例:比例 3:4,主体为像素化端午节庆典海报,日期 2026.06.19,色盘以绿色为基调、莫兰迪色调并配少许撞色。作者同时标注内容由 AI 生成。
DeepSeek完成首轮外部融资超500亿元人民币,估值突破500亿美元,成为中国AI行业迄今最大规模单轮融资。梁文锋自掏200亿元成为本轮最大出资方,外部投资者资金进入其管理的有限合伙企业,无投票权且五年锁定期。文章对比互联网泡沫等历史案例,并指出DeepSeek约7亿美元的年收入预期与500亿美元估值之间的倍数压力。
推荐理由:文章梳理梁文锋的融资条款设计,并以历史泡沫案例和估值收入倍数提供冷静的判断视角。