跳到正文

全部动态

今日 26 条
9月8日周二
  1. OpenRouter Announcements73

    OpenRouter 推出 Shell 工具、容器与 Files API

    OpenRouter 发布 openrouter:shell 服务端工具、openrouter:bash 工具和 Files API,让平台上任意支持工具调用的模型都能在托管 Linux 容器中执行命令,目前以 beta 提供。

    推荐理由:原文给出了定价、容器网络与文件管理等具体配置细节,可帮助读者评估在现有 Agent 工作流中如何复用这套服务端沙箱。

9月5日周六
  1. Runway News48

    Runway 推出 Team 团队协作套餐

    Runway 发布 Team 套餐,面向协作创作团队,提供最多 100 个共享项目、Brand Kits 和 1TB 存储,每个席位每月向统一共享余额贡献 6,900 credits,未用完的 credits 可结转一个月。该套餐今日上线网页端,每席位每月 69 美元,按年付费为 55 美元(8 折),支持 2 至 9 人团队;Standard、Pro 和 Max 转为个人套餐。

  2. GitHub Blog · AI & ML67

    GitHub 推出 Project HydraFusion 多模型编排研究预览

    GitHub 发布 Project HydraFusion 研究预览,通过运行时多模型编排提供前沿级编码质量,所有 GitHub Copilot 计划用户可在 Copilot CLI 通过 /experimental 使用。

    推荐理由:原文给出三种执行模式和三项基准的质量与成本数据,读者可以据此评估多模型编排对现有编码工作流的适用性。

9月4日周五
  1. Google Research44

    Google Research 研究跨人群基因组预测的迁移学习策略

    Google Research 利用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床性状上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;而遗传相关性高的性状可继续受益于欧洲数据直至目标样本达 25-40k+。

  2. GitHub Blog · AI & ML60

    GitHub Copilot app 新手教程:如何同时运行多个 agent 会话

    GitHub 官方博客发布面向新手的教程,介绍如何在 GitHub Copilot app 中同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上互不干扰,各自保留上下文,用户通过 sessions 视图追踪进度,教程以 tailspin-toys 仓库演示了并行添加功能、无障碍审查和运行测试的做法。

    推荐理由:官方教程讲清了并行 agent 会话如何借助 Git worktree 隔离运行,读者可以照着示例直接上手尝试。

  3. Anthropic Research80

    Anthropic:Claude 用 11 天完成费马大定理首个完整机器验证证明

    Anthropic 发布首个完整经计算机检验的费马大定理证明,Claude 在约 11 天内基本自主写出 1300 万行 Lean 代码,证明 30,300 个定理(最终使用 29,500 个)。

    推荐理由:原文详述了多智能体协作与 Prove2Me 平台的具体做法,对想复现大规模形式化工作的读者有可迁移的方法参考。

  4. Google Research64

    Google Research 联合 HHMI Janelia 发布完整雄性果蝇大脑连接组

    Google Research 与 HHMI Janelia、MRC 分子生物学实验室及剑桥大学等合作,在 Cell 发表雄性果蝇大脑和中央神经系统的完整连接组,包含超 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:由参与方介绍完整雄性果蝇连接组,读者可了解其规模、AI 重建方法及对后续脑映射研究的用途。

9月3日周四
  1. Google DeepMind72

    Google DeepMind 发布 WeatherNext 3 全球 AI 天气模型

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为最先进准确的全球 AI 天气模型。模型直接学习实时卫星数据和气象站观测,逐小时产出最高 5 公里分辨率预报,精度约为 WeatherNext 2 的五倍;中期降水预报 CRPS 相对 IMERG 提升最高 60%。

    推荐理由:官方介绍了新模型的分辨率、逐小时更新和降水精度提升,并说明其在 Google 各产品中的落地方式,读者可评估对天气相关业务的应用价值。

  2. Hugging Face Blog65

    用 TRL 和 GRPO 微调 LFM2.5-350M,100 步提升 IFStruct 结构化输出成绩

    Hugging Face 发布一份完整教程,用 TRL 库的 GRPO 微调 LiquidAI/LFM2.5-350M 提升结构化输出合规性,在 IFStruct benchmark 上从 22.6% 提升到 29.7%。

    推荐理由:原文给出完整可复现的 GRPO 微调流程和前后对比数据,读者可以照着用免费 GPU 把小模型的结构化输出提升约 7 个百分点。

  3. Hugging Face Blog69

    Hugging Face 发布开源工具 funes,为编码 Agent 提供本地自有记忆层

    Hugging Face 发布开源工具 funes,把机器上已有的 Agent 会话记录变成可检索的记忆层,一条 funes add 命令即可接入 Claude Code、Codex、pi 和 Hermes。

    推荐理由:原文给出 funes 的本地检索管线、跨机器同步与 token 成本对比数据,读者可以据此判断它能否改善多机多 Agent 的工作流。

9月2日周三
  1. Google Blog: AI53

    Google 推出 Fairwind Program,向政府和企业开放 Gemini 3.8 Flash Cyber 网络防御能力

    Google 发布 Fairwind Program,为政府和可信合作伙伴提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具,用于自主发现并修复漏洞,可在组织安全云环境内数分钟生成经验证的补丁。该计划初期面向政府、关键基础设施运营方和核心技术平台开放,已有超过 650 个合作伙伴参与;同时 Google.org 将全球网络安全资金累计提升至超过 1 亿美元。

  2. Runway News46

    Runway 推出 Runway Dev MCP 托管服务器,让编码智能体接管集成全流程

    Runway 发布 Runway Dev MCP,一个将 Runway Dev 账户接入 Claude、ChatGPT、Codex、Cursor 等编码工具的托管 MCP 服务器。智能体可自主查询模型价格与能力、拉取请求 schema、配置 Model Router 并按成本、延迟或质量优化,还能创建 Characters、排查生成失败原因,token 效率更高。添加为自定义连接器即可使用。

  3. Meta Engineering50

    Meta 构建从专家学习的组织级第二大脑 AI 智能体

    Meta 工程团队构建了一个作为组织第二大脑的 AI 智能体,通过结构化知识体系、可组合 recipes 推理层和自动自我改进循环,把专家反馈编译为无需模型重训练的验证更新。系统将 200+ 知识文件按密度与使用频率划分、以 YAML 依赖图组织,六周内把单项评估时间从数天降到数分钟,每轮次 token 消耗减少约 80%,改进周期零回归。

  4. Google Developers Blog62

    Google 复盘 AI Agents Challenge 最强提交背后的 4 种工程模式

    Google for Startups AI Agents Challenge 评选结束后,官方从高分提交中总结出四种工程模式:双向 MCP、事件驱动并发、同标准降级(Gemini 3.1 Pro 503 时回退 Gemini 3.6 Flash 并共用同一校验函数)、以及模型调用前的分层路由。

    推荐理由:文章从真实参赛代码中提炼四个可复用的工程模式,覆盖工具暴露、并发、降级校验和分层路由,可直接迁移到自己的智能体项目。

  5. Hugging Face Blog52

    Allen AI 发布 BenchMIRT:在题目层面审计 LLM 基准实际测量的能力

    Allen AI 发布 BenchMIRT,一种基于多维 IRT 的方法,用于在单个题目层面审计 LLM 基准实际测量的能力。方法基于 100 个 LLM 在 16 个基准、超 34K 题目上的结果训练,未事先告知标签即独立恢复出安全与通用推理两个维度;分析发现 BBQ 和 WMDP 与通用推理的关联强于安全,HarmBench 的版权题也更接近推理。

  6. Runway News35

    Miro 如何用 Runway 为四地市场制作 Canvas26 主题演讲视频

    Miro 品牌团队完全用 Runway 生成 Canvas26 年度活动开场视频,并针对 4 个城市分别制作本地化版本,所有城市景观、人群和入场镜头均由 Runway 生成,再叠加动效与品牌元素。团队用场馆照片作为 Runway 参考图生成对应地点的电影感入场镜头,并借助 Runway 原生生成非标准宽高比画面,避免 4K 素材裁切损失分辨率。

  7. Google DeepMind68

    Google DeepMind 为 Gemini 推出 agentic video understanding 视频分析功能

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出 agentic video understanding,动态检索视频片段以替代固定帧率处理,token 消耗最多降 88%,成本最多降 66%,准确率最多提升 7%。

    推荐理由:官方给出 token、成本与准确率的具体降幅和开启方式,长视频处理场景下可评估是否切换处理模式。

9月1日周二
  1. Runway News68

    Runway 发布 Interface World Model 首个模型 Solaris,实时生成可交互界面

    Runway 发布 Solaris,定位为 Interface World Model 系列的首个模型,基于 Gen-4.5 改造,逐帧实时生成应用和网站界面,无需代码等中间表示。用户研究显示 250 名参与者约 7500 次成对评判中,61% 偏好其遵循指令(对比编码界面的 24%),71% 认为交互更自然;文本渲染、长会话一致性和无障碍集成仍是待解难题,现已开放早期访问申请。

    推荐理由:官方详细说明了实时生成的原理、与 Claude Opus 5 的对比数据和遗留短板,读者可以据此判断这类界面生成模型的实际边界。

  2. Sierra Blog32

    Julia Brau Donnelly 加入 Sierra 出任首席财务官

    Sierra 宣布 Julia Brau Donnelly 加入公司担任首席财务官,她此前曾任 Pinterest CFO,并拥有投行、私募及 Wayfair 运营经验。Sierra 上线仅两年半,已成为面向客户的对话式 AI 平台,七个季度实现 100M 美元 ARR,九个季度达到 200M 美元,客户覆盖超 40% 的 Fortune 50。

  3. Google Research56

    Google 发布 TimesFM-3 时间序列基础模型,支持零样本多变量预测

    Google 发布 TimesFM-3,一个 330M 参数、在超过 1 万亿时间点上预训练的时间序列基础模型,原生支持零样本多变量预测。模型可在单次前向传播中生成整个预测区间,支持多目标、过去协变量和过去-未来协变量,并在 Gift-Eval、FEV-Bench 和 Time 三个基准上于点预测和概率预测指标中均排名第一。

  4. Claude Platform release notes71

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,默认 1M token 上下文并下调缓存读取价格

    Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时运行的智能体编码、知识工作和研究,并向 Project Glasswing 参与者提供 Claude Mythos 5.1。

    推荐理由:官方发布说明列出了定价、上下文窗口和多项 API 变更,方便现有使用方评估迁移和缓存成本影响。