跳到正文

全部动态

今日 293 条
4月20日周一
  1. Berkeley AI Research46

    GRASP:面向世界模型的梯度规划器,让长时程规划更稳健

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度。该方法针对长时程规划中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维隐空间失效模式等问题,使基于梯度的长时程规划更稳健。

4月17日周五
  1. Linear Now34

    Output isn't design:AI 生成界面不等于设计

    针对 AI 工具宣称能快速生成界面、把文字直接变成产品甚至代码,文章指出设计的难点从来不是生成形式,而是理解问题本身。作者引用 Christopher Alexander《Notes on the Synthesis of Form》中"形式与语境良好契合"的定义,认为 AI 能快速产出看似精致的方案,却无助于理解底层问题,反而容易让人跳过对真实约束的梳理。

  2. AI as Normal Technology74

    Sayash Kapoor 等人提出开放世界评测并发布 CRUX 项目,AI 智能体成功上架 iOS 应用

    Sayash Kapoor 与 Arvind Narayanan 等 17 位研究者发布 8000 字论文,定义开放世界评测这一新兴评测类型,并介绍定期开展此类评测的 CRUX 项目。

    推荐理由:文章界定了开放世界评测这一新兴评测类型,并以 CRUX 首个实验给出智能体发布 iOS 应用的具体过程与成本细节。

4月16日周四
  1. Claude Platform release notes84

    Anthropic 发布 Claude Opus 4.7,维持 $5/$25 定价并引入 task budgets 与高分辨率图像输入

    Anthropic 发布 Claude Opus 4.7,定位复杂推理与智能体编码,定价维持 $5/$25 per MTok,与 Opus 4.6 相比存在 API 破坏性变更并需参考迁移指南。

    推荐理由:原文列出定价、API 破坏性变更、task budgets 与高分辨率图像等具体变化,升级前可据此排查迁移成本。

4月14日周二
4月13日周一
4月10日周五
  1. LMSYS Blog43

    HiSparse:用分层内存为稀疏注意力提速,长上下文吞吐最高提升 5 倍

    LMSYS 提出分层内存系统 HiSparse,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,长上下文场景吞吐最高提升 5 倍,256 并发请求时吞吐超过基线 3 倍。该功能已作为实验特性集成进 SGLang,目前支持 DeepSeek-V3.2 和 GLM-5.1 等采用 DSA 的模型。

4月8日周三
  1. Sierra Blog55

    Sierra 推出首个 Level 1 PCI 合规的 AI 智能体支付能力

    Sierra 推出 Level 1 PCI 合规支付能力,称其为首个达到该标准的对话式 AI 平台,支持聊天和语音场景中直接完成卡片和 ACH 支付。支付时智能体切换到安全交易流程,持卡数据经专用 PCI 认证基础设施直达商户现有支付处理器,LLM 不接触敏感信息;该能力已由 Visa 全球服务提供商注册处验证,SiriusXM 等客户每日处理数千笔支付。

4月4日周六
4月3日周五
  1. Google Research40

    Google Research 发布 LLM 行为倾向对齐评估框架,测试 25 个模型

    Google Research 提出一套基于情境判断测试(SJT)的框架,评估 LLM 在真实用户-助手场景中的行为倾向与人类共识的对齐程度。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类标注完全一致的场景中,小于 120B 的模型与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。

4月2日周四
  1. Sierra Blog33

    Eric Eyken-Sluyters 加入 Sierra 出任现场运营总裁

    Eric Eyken-Sluyters 加入 Sierra 担任现场运营总裁,负责全球销售、销售工程与合作伙伴团队。Sierra 上线两年已成为客户体验 AI 智能体领域的领先平台,服务 Fortune 50 中 40% 的企业,客户包括 ADT、Chime、Cigna、Nordstrom、Nubank、Rivian、Wayfair 等。Eric 拥有超过三十年构建和扩展高增长企业软件业务的经验。

  2. Sierra Blog35

    Sierra 推出 Explorer:与 Ghostwriter 配合的智能体优化智能体

    Sierra 发布 Explorer,一款与建智能体的 Ghostwriter 配合、主动指出智能体需修复或改进之处的智能体优化工具,可视为针对客户对话而非互联网的 ChatGPT deep research。它持续扫描每段客户对话并每周推送变化简报,支持一键经 Ghostwriter 落地建议;ADT、DIRECTV 等数百家企业每周使用,ADT 称其让此前不可见的表现维度变得可分析。

4月1日周三
3月31日周二
  1. Runway News43

    Runway 推出 Runway Fund,初期承诺投入最高 1000 万美元

    Runway 正式推出 Runway Fund,专注投资 AI、媒体与世界模拟领域的早期公司,初期承诺投入最高 1000 万美元,单笔投资一般不超过 50 万美元,面向 pre-seed 和种子轮。该基金已低调运作数年,此前投资了 Cartesia、LanceDB 和 Tamarind Bio,重点关注 AI 研究、新应用以及新媒体与内容三大方向。

  2. Mistral AI57

    Mistral AI 发布 Spaces CLI,面向人类与 Agent 双重用户

    Mistral AI 发布面向人类开发者和编码 Agent 的 CLI 工具 Spaces。核心设计包括每个交互式输入都提供等价 flag 和 -y 无头模式、生成 context. 与 AGENTS.md 供 Agent 读取项目上下文、插件化的模块注册表,并将状态显式化以避免 CWD 等隐式假设;文中 Agent 从单个提示词到完成部署耗时不到 10 分钟。

3月28日周六
  1. Sierra Blog43

    Sierra 收购日本企业 AI 初创公司 Opera Tech

    Sierra 宣布收购东京企业 AI 初创公司 Opera Tech,其联合创始人 Keita Morikawa 与 Kiyohito Kunii 将一同加入。Sierra 称此举旨在拓展日本市场,并援引 Singtel 10 周上线、解决率超 70%,以及 Rocket Mortgage 月贷款规模达 $1B 等客户案例。

3月26日周四
  1. Suno Blog66

    Suno 发布 v5.5 模型,推出 Voices、Custom models 和 My Taste 个性化功能

    Suno 发布 v5.5 模型,同时推出三项个性化功能。Voices 让用户采集自己的声音来创作音乐,包含验证流程且默认私密,面向 Pro 和 Premier 订阅者;Custom models 可基于自有曲目调出个性化模型,最多可建三个;My Taste 根据用户偏好学习风格,面向所有用户。官方称这些能力为今年晚些时候与音乐行业合作推出的新一代音乐模型打基础。

    推荐理由:原文交代了新功能的具体机制与订阅限制,读者可据此判断如何用自己的声音和风格来创作音乐。

3月25日周三
3月24日周二
  1. Sierra Blog33

    Sierra 在澳大利亚悉尼开设办公室

    Sierra 宣布在澳大利亚悉尼开设办公室,此前已扩展至新加坡、东京、马德里、巴黎和伦敦。其平台上的 AI 智能体支持 30 多种语言、全天候无等待服务,覆盖产品发现、注册登录、故障排查和流失管理。Rocket Mortgage 每月贷款量达 $1BN,使用其智能体的购房者完成流程的可能性高出四倍。

  2. Mistral AI66

    Mistral AI 发布首个语音合成模型 Voxtral TTS

    Mistral AI 发布 4B 参数的文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,API 定价 $0.016 per 1k characters。

    推荐理由:官方给出了与 ElevenLabs 对比的人类评测数据和低延迟指标,读者可据此评估其在语音 Agent 场景的可用性。

3月20日周五
3月19日周四
3月18日周三
  1. Google Research77

    Google Research 发表两篇 Nature Cancer 研究,评估 AI 辅助英国 NHS 乳腺癌筛查流程

    Google Research 与 NHS 合作开展 AIMS 研究,在 Nature Cancer 发表两篇论文评估 AI 乳腺癌检测系统。回溯评估覆盖约 115,973 名女性的乳房 X 光检查,AI 灵敏度显著高于原第一人类读者,癌症检出率从每千人 7.54 升至 9.33,并检出原双重读片漏掉的 25% 间期癌。

    推荐理由:研究给出了AI作为乳腺癌筛查第二读者的端到端验证数据,包括检出率和人力节省的具体结果与仲裁误判风险。

  2. Mistral AI47

    Mistral AI 推出 Forge:面向企业构建前沿级定制模型

    Mistral AI 推出 Forge,一套让企业基于自有专有知识训练前沿级 AI 模型的系统,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可处理多模态输入,模型可在企业自有基础设施内训练与治理。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数并生成合成数据。

3月17日周二
  1. Mistral AI57

    Mistral AI 成为 NVIDIA Nemotron Coalition 创始成员并将共同开发开源前沿模型

    Mistral AI 宣布加入 NVIDIA Nemotron Coalition 并担任创始成员,双方计划结合各自架构与算力共同开发前沿开源模型。联盟首个项目是在 NVIDIA DGX Cloud 上训练的基础模型,将支撑即将推出的 NVIDIA Nemotron 4 系列并开源;Mistral AI 同日发布 Mistral Small 4,此前双方曾合作开发 Mistral Nemo。

  2. Google Research49

    Google 用高温超导研究问题测试 LLM:NotebookLM 与自建 RAG 系统表现最佳

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位国际专家盲评打分。NotebookLM 在多数维度表现突出,自建 RAG 系统紧随其后,两者与 Gemini 在观点平衡性和答案全面性上排名前三。

3月13日周五
  1. Berkeley AI Research45

    伯克利 AI 研究提出 SPEX 与 ProxySPEX:为 LLM 大规模识别关键交互

    伯克利 AI 研究提出 SPEX 与 ProxySPEX 算法,用于在大规模 LLM 中识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,而 LIME、Banzhaf 等边际方法忠实度明显更低。

最多提供 50 页,更早的内容请使用搜索或主题页。