Output isn't design:AI 生成界面不等于设计
针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。
媒体报道、公司博客与研究文章
针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。
Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。
推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。
Google 提出推理优先的合成数据框架 Simula,将数据集生成重构为机制设计问题,通过全局多样化、局部多样化、复杂化和双批评者质量检查四个步骤,从第一性原理构建数据集,无需种子数据。
Google Research 提出 MoGen 神经元形态生成模型,用合成神经元形状增强 PATHFINDER 重建模型的训练数据,在预留小鼠轴突上把重建误差降低 4.4%,主要来自合并错误的减少。该结果相当于在完整小鼠脑规模下节省 157 人年的手动校对工作,是生成式 AI 首次用于改进连接组重建的当前最优方法。MoGen 已开源,相关论文将在 ICLR 2026 展示。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,改进可控性、表现力和质量,在 Artificial Analysis TTS 排行榜获得 1,211 Elo 分。
推荐理由:官方介绍新增 audio tags 和多说话人对话能力,还给出 AI Studio 导演式控制与 API 导出的具体用法,便于开发者评估接入。
Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。
推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。
Qwen 团队在 Qwen3.6-Plus 之后开源 Qwen3.6-35B-A3B,一个总参数 35B、激活参数仅 3B 的稀疏 MoE 模型。官方称其智能体编码性能大幅超越前代 Qwen3.5-35B-A3B,并可媲美更大的稠密模型。
推荐理由:千问官方开源了只用 3B 激活参数的 MoE 模型,重点在智能体编码能力,效率与性能的取舍值得对比参考。
Together AI 提出稳定循环架构 Parcae,通过将激活多次传入同一批层来提升算力,验证困惑度较此前大规模循环模型最多降低 6.3%。其 770M 版本在相同数据上达到 1.3B 参数 Transformer 的质量,参数约减半;团队还首次建立循环架构的缩放定律,发现算力最优训练需同步增加循环次数与数据量。
Sierra 为旗下检索与重排模型 Linnaeus 和 Darwin 搭建了一套每日评估系统,从客户前一天的对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出"golden articles"作为基准,再以 recall、precision、nDCG 等指标对比智能体实际检索结果。
Google 于 4 月 15 日在 Gemini API 更新日志中宣布推出 Gemini 3.1 Flash TTS Preview,定位为低成本、富有表现力且可引导的文本转语音模型。用户可查阅 Text-to-Speech 文档了解更多。
微软发布 MAI-Image-2-Efficient 图像模型,定位量产场景,成本比旗舰低 41%,适用于产品图、营销素材、UI 原型和批量管线,支持短文本和实时交互工作流。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建多人对话,评估高中与大学生的问题解决、协作等未来技能,现已上线 Google Labs 并开放英文注册。
Gemini 发布机器人模型 gemini-robotics-er-1.6-preview,新增仪表读数能力,并提升了空间与物理推理能力。旧版 gemini-robotics-er-1.5-preview 将于 2026 年 4 月 30 日上午 9 点(PST)关停。
Anthropic 宣布弃用 Claude Sonnet 4(claude-sonnet-4-20250514)和 Claude Opus 4(claude-opus-4-20250514),Claude API 上的退役时间定于 2026 年 6 月 15 日。官方建议分别迁移至 Claude Sonnet 4.6 和 Claude Opus 4.8。
Google DeepMind 发布 Gemini Robotics-ER 1.6,提升机器人在空间推理、多视角理解、任务规划和成功检测方面的能力,并新增仪表读数功能。
推荐理由:官方给出了与上一代的具体能力对比和仪表读数新用例,读者可据此评估其是否适配现有机器人方案。
Together AI 发布 EinsteinArena,一个供智能体在开放数学问题上互动、讨论和竞争的平台,含实时验证与公开排行榜,已完全开源。智能体通过多轮协作将 11 维 kissing number 下界从 AlphaEvolve 的 593 推至 604,截至 2026 年 4 月 11 日已产生 11 项新 SOTA 结果,覆盖 Erdős 最小重叠问题、第二自相关不等式等。
推荐理由:原文给出多智能体协作在开放数学问题上刷新界值的实例和开放接口,读者可以了解智能体协作搜索的实际运作方式。
Sam Altman 称凌晨 3:45 有人向其住宅投掷燃烧瓶,无人受伤,他发文希望劝阻下一个袭击者。文中他阐述了对 AI 的信念,包括 AI 需要民主化、权力不能过度集中、安全不只是模型对齐还需全社会应对,并反思了自己与 OpenAI 董事会冲突中的错误,认为行业乱象源于"想控制 AGI"的心态,出路是广泛分享技术且无人独占。
推荐理由:Sam Altman 在自家中弹燃烧瓶事件后亲述个人信念与反思,是理解其 AI 治理立场与行业判断的一手材料。
Linear 团队在 Linear Agent 正式发布前就已将其用于 Slack、Linear 和代码库,并总结出三条内部工作流:客户邮件经 Intercom 转为 Linear issue,Slack 讨论转为 pull request,PM 提交 issue 并直接修复。
Runway 扩大与 NYU Tisch 艺术学院的合作,向 ITP、IMA 两个项目以及 NYU 全校性的 Hyper Cinema Lab 开放其全套 AI 工具。这些项目的学生将在课程作业和个人项目中使用 Runway 工具,探索新工作流。Runway CEO Cristóbal Valenzuela 表示,ITP 是他与联合创始人的重要教育经历,Runway 正是在那里诞生。
LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。
ElevenLabs 新增 On-Premise 和 On-Device 两种本地部署方式,前者运行在自有数据中心的 Confidential Computing GPU 基础设施上,后者面向车载、可穿戴等离线推理场景。
Google Research 推出 ConvApparel,一个包含 4000 多段人机多轮对话(近 15000 轮)的服饰购物领域数据集,用于量化 LLM 用户模拟器与真实人类的真实感差距。
Google 发布两款面向学术工作流的 AI 智能体:PaperVizAgent 负责生成论文配图,ScholarPeer 负责自动同行评审。
Manus 发布品牌摄影 AI 图像提示词指南,提出提示词需包含主体与服装、环境场景、相机与胶片类型、光线四层指令,并给出广角、三分之四、侧面、特写、背面、双人六类镜头的可复制提示词示例。指南建议用相同身体描述配合角色参考或种子锁定保持模特一致,并锁定 Kodak Portra 400 等相机与胶片描述维持美学统一。
Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。
Together AI 提出"AI Native Cloud"概念,指为 AI 原生公司专门构建的云,需覆盖从预训练、微调到高规模推理的完整生命周期。其关键特征包括软硬件垂直整合的全栈(NVLink、RDMA 级互联)、研究到生产的快速通路,以及能按天交付大规模 GPU 集群的生态协作能力。
Linear 官方发布事故复盘,3 月 24 日 12:07 至 1:10(UTC)部署的代码变更导致同一 workspace 内私有团队数据可能对包括 guest 在内的其他成员可见。
推荐理由:官方复盘给出完整时间线、变量遮蔽根因和权限测试缺口,可作权限层事故响应的参考样本。
Manus 官方宣布推出一整套在 Slack 中使用 Manus 的方式,可在对话发生处直接委派任务。提供三种集成:Manus Agent 通过 DM 私聊执行任务并具备持久记忆;Slack 集成支持在任意频道话题中标记 @manus,读取话题上下文和文件后在原地交付结果,但无持久记忆;Slack 连接器(MCP)可代用户阅读和发送消息,例如定时汇总频道并以用户名义发布周报。
Manus 博客盘点了 2026 年五款最佳桌面 AI Agent:Manus My Computer、Claude Cowork、ChatGPT Agent、Genspark 和 Perplexity Computer。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排),用于其客服 AI 智能体,解决率最高提升 16 个百分点。Linnaeus 直接处理完整对话,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责精准筛选,使搜索成本与 P90 延迟均下降超 75%。
Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。
研究团队提出 DBPlanBench,将 Apache DataFusion 的物理算子图经序列化压缩约 10 倍后交给 LLM 推理,让模型以 JSON Patch(RFC 6902)对现有物理计划做局部改写而非重新生成。
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,现已在 Microsoft Foundry 和 MAI Playground 开放。
推荐理由:官方公布三款 MAI 模型的 Foundry 定价与基准对比,开发者可直接据此评估接入成本和可用性。
Microsoft 发布语音识别模型 MAI-Transcribe-1,定价 $0.36 每小时音频,称其在大规模云厂商中具备最优性价比。模型正在 Copilot Voice 模式和 Microsoft Teams 中分阶段部署,并已在 Microsoft Foundry 公开预览,同时可在新上线的 Microsoft AI Playground 体验。
Eric Eyken-Sluyters 加入 Sierra 担任现场运营总裁,负责全球销售、销售工程与合作伙伴团队。Sierra 上线两年已成为客户体验 AI 智能体领域的领先平台,服务 Fortune 50 中 40% 的企业,客户包括 ADT、Chime、Cigna、Nordstrom、Nubank、Rivian、Wayfair 等。Eric 拥有超过三十年构建和扩展高增长企业软件业务的经验。
Qwen 团队继 2 月发布 Qwen3.5 系列后,宣布 Qwen3.6-Plus 正式发布,现已可通过 API 使用。官方称该版本相比前代有大幅能力提升,尤其显著增强了智能体编码能力,覆盖从前端网页开发到复杂仓库级问题求解的场景。
推荐理由:官方宣布新一代模型上线 API,重点提升智能体编码能力,关注代码开发的读者可以对比前代评估升级幅度。
Google 发布 Gemma 4,包含 gemma-4-26b-a4b-it 和 gemma-4-31b-it 两款模型。两款模型已在 AI Studio 上线,并可通过 Gemini API 使用。
推荐理由:官方更新日志明确了 Gemma 4 两款模型的名称与获取渠道,可据此确认 Gemini API 的可用变化。
Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。
Manus Blog 发布 OpenClaw 与 Manus Desktop 的对比评测,通过开发者网站监控和营销人员竞品情报两个用例说明二者差异。
Together AI 内核团队起源于 2022 年 Memorial Day 周末发布的 FlashAttention,该工作将数据库系统的数据局部性与内存层级原理应用于 attention,实现 2–3x 加速。