跳到正文

全部动态

今日 313 条
8月3日周一
  1. OpenRouter Announcements68

    OpenRouter 发布 Ori Eval,帮你在自己的代码库里选模型

    OpenRouter 发布 Ori Eval,在其 500 多个可选模型中为具体应用找出最合适的模型。工具会扫描代码库中所有模型调用点,通过问答确定你关心的成本、速度或准确率,生成 *.eval.ts 评测文件,用 bun test 断言智能体调用的工具并用 LLM judge 评开放性回答;运行期间固定 harness 与模型使结果可归因于模型变化。

    推荐理由:原文说明评测如何固定环境、覆盖代码中模型调用点并接入 CI,读者可据此判断选型流程能否落地到自己的项目。

  2. elsewhere articles30

    对谈汪天凡:AI 智能在通胀,智慧才稀缺,2026 该投什么?

    BAI Capital 高级合伙人汪天凡在「十字路口」公路播客中判断,基础模型趋同后 AI 智能正在通胀,真正稀缺的是智慧,AI 应用的新机会藏在 Context 和交互里。他认为 AI 硬件真正难被「华强北 80 块平替」抄走的是产品定义与「注入人性的光辉」,并称 2026 年泡沫期更该投有愿景的创始人和让人更快乐的产品。

8月2日周日
8月1日周六
7月31日周五
  1. Runway News42

    Skyscanner 如何用 Runway 消除广告拍摄前的猜测

    Skyscanner 品牌团队在美加品牌广告拍摄中引入 Runway,用于锁定构图、布光和演员走位,并在片场实时验证拍摄效果。团队用 Runway 生成酒吧、水疗、海滩和酒店阳台等场景环境,还借助 AI 生成临时背景检查服装与道具,使预可视化与实际成片的差距很小。

7月30日周四
  1. Google DeepMind67

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,新增视频理解与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。

    推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。

  2. Cursor Blog66

    Cursor 团队讲解如何搭建云端智能体开发环境

    Cursor 团队分享如何为云端智能体搭建开发环境,让智能体能在其单体仓库中运行和测试代码。做法包括用 Dockerfile 统一 Ubuntu VM 环境、构建 anydev CLI 简化智能体操作、通过 Cursor Cloud MCP 和 Cloud Doctor 实现环境自愈与持续优化。云端智能体编写 PR 的占比从去年 12 月的约十分之一升至今日的超过一半。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建细节,含 anydev CLI 和 Cloud Doctor 等可借鉴做法。

  3. Microsoft AI News61

    Microsoft 阐述按 token 效率优化前沿性能曲线的策略并盘点 MAI Flash 模型成果

    Microsoft 提出行业下一个焦点是 token 效率,主张通过联合优化模型、harness 和 RL 环境为具体产品调校模型,而非所有任务都用前沿通用模型。

    推荐理由:Microsoft 官方阐述 token 效率策略,用多款 MAI Flash 模型的实际成本数据说明如何按任务匹配模型规模。

7月29日周三
7月28日周二
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。

    推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。

7月27日周一
  1. LMSYS Blog78

    SGLang 与 Miles 为 Kimi K3 提供 Day-0 支持

    SGLang 和 Miles 发布对 Kimi K3 的 Day-0 支持,分别覆盖推理与 RL 训练。K3 为 2.8T 参数的 3 万亿参数级首个开源模型,采用 69 层 KDA 线性注意力与 24 层 MLA 的混合架构和 1M token 上下文窗口。

    推荐理由:原文由 SGLang 团队自述 Day-0 支持的实现细节,给出内存管理、投机解码与并行策略的具体方案和实测数字,可迁移到异构注意力架构的部署。

7月26日周日
  1. Berkeley AI Research44

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要转化为自然语言"信念状态",并通过信念评分监督其信息内容。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

7月25日周六
7月24日周五
  1. Runway News58

    Runway 发布 Media Router,为视频、图像和音频生成模型自动选型

    Runway 推出 Runway Media Router,称其为首个面向生成式媒体模型的路由功能,已在 Runway Dev 上线,支持视频、图像和音频模型。用户设定成本、质量、延迟偏好及价格上限、允许和拒绝列表等约束后,只调用一个端点,路由器会筛选并评分选出最优模型,返回结果及所用模型的元数据;无模型满足约束时报明确错误,生产前可用 dry-run 验证选型且不产生费用。

7月23日周四
  1. Google Research67

    Google Research 发布 SymptomAI 研究论文,用 Gemini Flash 2.0 Agent 做日常症状评估

    Google Research 发表 SymptomAI 论文,通过 n=13,917 的全国规模随机研究测试基于 Gemini Flash 2.0 的实验性对话 Agent 做症状问诊与鉴别诊断(DDx)。

    推荐理由:原文给出 n=13,917 随机研究的主要结果,临床专家在超五成案例更偏好 SymptomAI 的鉴别诊断,可据此理解对话式问诊 Agent 的真实表现。

7月22日周三
  1. Nathan Lambert: Interconnects63

    Interconnects 播客复盘开源模型:Kimi K3 体验、Qwen 大模型计划与蒸馏争论

    Nathan Lambert 与 Florian Brand 做季度开源模型复盘,讨论 Kimi K3 发布后的使用体验、GLM 5.2 的作用以及中国模型为何能追近闭源前沿。二人反驳 Ben Thompson 关于蒸馏在 RL 阶段更有影响的说法,认为 SFT 蒸馏收益有限,并讨论了限制中国开放权重模型可能带来的网络安全防御风险。