跳到正文

全部动态

今日 26 条
5月4日周一
  1. Runway News41

    Runway 如何用 GPU 点对点广播将模型冷启动提速 60 倍

    Runway 构建了 NCCLBack 系统,让新 GPU worker 直接从已加载权重的对等节点通过 GPU 互联接收权重,而非从云存储重复下载,将模型冷启动时间从数分钟缩短到数秒,冷启动时间不再随集群规模线性增长。该系统基于 NCCL broadcast 原语,配合 Redis 队列做节点发现,并包含传输与完整性校验层。

5月2日周六
  1. Sierra Blog64

    Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent

    Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。

    推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。

4月30日周四
4月29日周三
4月27日周一
4月25日周六
  1. LMSYS Blog73

    SGLang 与 Miles 实现 DeepSeek-V4 (1.6T Pro, 284B Flash) Day-0 推理与 RL 训练支持

    SGLang 与 Miles 团队宣布在发布当天为 DeepSeek-V4 (1.6T Pro, 284B Flash) 提供推理与 RL 训练的开源支持,针对其混合稀疏注意力、mHC 和 FP4 专家权重架构做了专项适配。

    推荐理由:原文给出 ShadowRadix、HiSparse 等具体优化机制和基准数字,读者可以了解混合稀疏注意力架构对推理与 RL 训练系统的实际工程要求。

4月24日周五
  1. DeepSeek API updates76

    DeepSeek API 上线 DeepSeek-V4-Pro 与 V4-Flash

    DeepSeek API 已支持 V4-Pro 与 V4-Flash,兼容 OpenAI ChatCompletions 接口与 Anthropic 接口,base_url 不变,model 参数改为 deepseek-v4-pro 或 deepseek-v4-flash。

    推荐理由:官方说明了新模型接入方式与旧模型名停用时间,开发者可以据此安排迁移。

4月23日周四
  1. Sierra Blog39

    Sierra 收购巴黎 AI 初创公司 Fragment

    Sierra 宣布收购总部位于巴黎的 Fragment,后者利用 AI 帮助企业扩展运营、让员工专注于更高价值工作。Fragment 联合创始人 Olivier Moindrot 和 Guillaume Genthial 将加入 Sierra,增强其在法国的智能体开发能力。

  2. Claude Blog66

    Claude Managed Agents 内置记忆功能开启公开测试

    Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。

    推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。

4月22日周三
  1. Sierra Blog61

    Sierra 重构工程师面试流程,用 AI 原生 onsite 取代编码与算法面试

    Sierra 取消编码和算法面试,改为 AI 原生 onsite,候选人先与面试官共同定义产品,再用 2 小时自由使用 AI 工具构建,最后演示并复盘代码与产品取舍。公司同时用系统设计面试取代编码电话筛,并试点调试面试考察 1 到 N 的改进能力;作者称新流程信号更丰富,候选人反馈更投入,但开放式设计带来标准化难题,需配套评估标准和双人面试来校准。

    推荐理由:Sierra 作者亲历重构招聘流程,给出了可迁移的 AI 原生面试设计与权衡细节。

4月21日周二
  1. Google DeepMind32

    Google DeepMind 与埃森哲、贝恩、BCG、德勤、麦肯锡合作加速企业 AI 转型

    Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助全球企业规模化采用前沿 AI。合作方将获得包括 Gemini 系列在内的前沿模型早期访问权,并可直接对接 Google DeepMind 技术团队,聚焦金融、制造、零售、媒体娱乐等行业的智能体转型。目前仅 25% 的组织成功将 AI 规模化投入生产。

4月20日周一
  1. Berkeley AI Research46

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。

4月17日周五
  1. Linear Now34

    Output isn't design:AI 生成界面不等于设计

    针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。

4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

4月14日周二
4月13日周一
4月10日周五
  1. LMSYS Blog43

    HiSparse:用分层内存为稀疏注意力提速,长上下文吞吐最高提升 5 倍

    LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。

4月8日周三
  1. Sierra Blog55

    Sierra 推出首个 Level 1 PCI 合规的 AI 智能体支付能力

    Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。

4月4日周六
4月3日周五
  1. Google Research40

    Google Research 发布 LLM 行为倾向对齐评估框架,测试 25 个模型

    Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。

4月2日周四
  1. Sierra Blog33

    Eric Eyken-Sluyters 加入 Sierra 出任现场运营总裁

    Eric Eyken-Sluyters 加入 Sierra 担任现场运营总裁,负责全球销售、销售工程与合作伙伴团队。Sierra 上线两年已成为客户体验 AI 智能体领域的领先平台,服务 Fortune 50 中 40% 的企业,客户包括 ADT、Chime、Cigna、Nordstrom、Nubank、Rivian、Wayfair 等。Eric 拥有超过三十年构建和扩展高增长企业软件业务的经验。

  2. Sierra Blog35

    Sierra 推出 Explorer:与 Ghostwriter 配合的智能体优化智能体

    Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。

4月1日周三
3月31日周二
  1. Runway News43

    Runway 推出 Runway Fund,初期承诺投入最高 1000 万美元

    Runway 正式推出 Runway Fund,专注投资 AI、媒体与世界模拟领域的早期公司,初期承诺投入最高 1000 万美元,单笔投资一般不超过 50 万美元,面向 pre-seed 和种子轮。该基金已低调运作数年,此前投资了 Cartesia、LanceDB 和 Tamarind Bio,重点关注 AI 研究、新应用以及新媒体与内容三大方向。

  2. Mistral AI57

    Mistral AI 发布 Spaces CLI,面向人类与 Agent 双重用户

    Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。