跳到正文

#部署/工程

今日 19 条
今天10月2日周五
  1. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  2. Hacker News popular via buzzing.cc51

    turbopuffer v3 弃用矢量主索引,重构存储架构

    turbopuffer 宣布 v3 将弃用以 ANN 矢量索引为主键的存储架构,把 ANN 降为二级索引。官方称现有架构已支持单索引 100B+ 向量、200ms p99 读、1k+ QPS,但存在存储放大、写放大和向量化受限三大问题;v3 已通过 100% CI,后续将公开基准测试并逐步上线生产。

  3. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

  4. OpenRouter Announcements58

    OpenRouter 支持机器人模型路由教程:cheap-first 处理 FAQ

    OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。

  5. AWS Machine Learning Blog49

    亚马逊支付如何用 Amazon SageMaker AI 上的上下文 bandit 提升获客漏斗转化

    Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。

10月1日周四
  1. OpenRouter Announcements67

    OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由

    OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。

    推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。

  2. The Verge · AI73

    Google 发布 Gemini 4 Argon,初期仅限受信任的网络防御者使用

    Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御方面具有前沿性能。初期仅向一组受信任的网络防御者开放,Google 正参与美国政府预发布模型访问的自愿流程并逐步扩大访问。模型已用于 Google 内部工作流,如大规模代码库迁移;Google 将在更广泛发布前加强防范滥用和提示词注入攻击、监测错位等安全措施。

  3. Ars Technica · AI65

    Google 发布 Gemini 4 Argon 模型,暂未开放使用

    Google 发布 Gemini 4 Argon,称其在编码、知识工作和网络安全方面性能领先,但模型仍处有限测试,普通用户暂无法使用。DeepSWE v1.1 达 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5;API 定价为每百万输入 token $2、输出 $10,输出上限提升至 100 万 token(此前为 64,000)。

  4. Databricks Blog34

    Lakebase Postgres 成本优化实用指南

    Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。

  5. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

9月30日周三
  1. OpenRouter Announcements70

    OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试

    OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。

    推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。