跳到正文

全部动态

今日 26 条
8月4日周二
  1. Runway News48

    EA 如何将生成式 AI 带入可生活的可玩世界

    EA 首席战略官 Mihir Vaidya 提出,游戏 AI 的下一站不是"万物皆神经网络",而是兼具生成能力与确定性控制的神经符号架构。他强调游戏要求 AI 以每秒 60 帧、跨数千名玩家同步持续响应,赛车游戏中轮胎阻力系数必须"被玩家感受到"而非只是看起来对。他将 AI 影响分为效率、扩展与变革三个层面,并以累计超 5 亿玩家的《模拟人生》为例说明扩展空间。

  2. Microsoft Research69

    Microsoft Research 发布开源智能体框架 Orchard

    Microsoft Research 发布开源智能体框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:原文给出框架设计、训练配方和多项基准数字,读者可以据此评估开放环境层对降低 Agent 研究成本的作用。

8月3日周一
  1. Sierra Blog39

    Plaid 与 Sierra 合作,让 AI 智能体从对话走向业务成果

    Plaid 与 Sierra 达成合作,客户可在 Sierra 的 AI 智能体内直接安全连接银行账户,无需离开对话即可完成支付或财务验证。Sierra 上月推出的 Horizon 平台支持智能体跨数天、数周甚至数月主动推进再融资、催收逾期款项或保险理赔等长周期任务。该集成以消费者明确授权为前提,并配备合规监控与人工介入机制。

  2. OpenRouter Announcements68

    OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型

    OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。

    推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。

8月1日周六
7月31日周五
  1. Runway News42

    Skyscanner 如何用 Runway 消除广告拍摄前的猜测

    Skyscanner 品牌团队在美加品牌广告拍摄中引入 Runway,用于锁定构图、布光和演员走位,并在片场实时验证拍摄效果。团队用 Runway 生成酒吧、水疗、海滩和酒店阳台等场景环境,还借助 AI 生成临时背景检查服装与道具,使预可视化与实际成片的差距很小。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。

    推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。

  2. Cursor Blog66

    Cursor 团队讲解如何搭建云端智能体开发环境

    Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。

  3. Microsoft AI News61

    Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果

    Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。

    推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。

7月29日周三
7月28日周二
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。

    推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。

7月27日周一
  1. LMSYS Blog78

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

    SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。

    推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。

7月26日周日
  1. Berkeley AI Research44

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月25日周六
7月24日周五
  1. Runway News58

    Runway 发布 Media Router,为视频、图像和音频生成模型自动选型

    Runway 推出 Runway Media Router,称其为首个面向生成式媒体模型的路由功能,已在 Runway Dev 上线,支持视频、图像和音频模型。用户设定成本、质量、延迟偏好及价格上限、允许和拒绝列表等约束后,只调用一个端点,路由器会筛选并评分选出最优模型,返回结果及所用模型的元数据;无模型满足约束时报明确错误,生产前可用 dry-run 验证选型且不产生费用。

7月23日周四