#部署/工程
#部署/工程
今日 19 条
dex@dexhorthyAI 评分2020Hacker News popular via buzzing.ccAI 评分5050 开源项目 Bez 发布:根据规范和测试自动生成浏览器引擎
开源项目 Bez 尝试不再手工编写浏览器引擎,而是从规范文本生成代码,用 Chromium、Firefox、WebKit 三浏览器一致性投票和 WPT 作为测试判据,通过后以普通 Rust 提交。
AWS Machine Learning Blog精选AI 评分6060 AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
Hacker News popular via buzzing.ccAI 评分3838 2026年9月 Rust 编译器性能进展:平均编译时间缩短 4.57%
Rust 编译器在 2026-07-29 至 2026-09-28 期间平均编译时间缩短 4.57%,629 项基准测试中 555 项改善、仅 74 项退步。Clippy 启用 PGO 后最佳提升 18%,升级至 LLVM 23 带来平均 1.2% 的提速。新借用检查器 Polonius Alpha 和新 trait solver 已在 Nightly 启用,但少数场景仍有性能回退。
Hacker News popular via buzzing.ccAI 评分6767 Cloudflare 发布开源决策模型 Clef 与 Clef-flash,并推出 RL 微调服务
Cloudflare 发布两个自研决策模型 Clef 和 Clef-flash,托管在 Workers AI 并以 Apache 2.0 许可开源到 Hugging Face,与 Jev-API 完全兼容。
Hacker News popular via buzzing.ccAI 评分5151 turbopuffer v3 弃用矢量主索引,重构存储架构
turbopuffer 宣布 v3 将弃用以 ANN 矢量索引为主键的存储架构,把 ANN 降为二级索引。官方称现有架构已支持单索引 100B+ 向量、200ms p99 读、1k+ QPS,但存在存储放大、写放大和向量化受限三大问题;v3 已通过 100% CI,后续将公开基准测试并逐步上线生产。
IT HomeAI 评分6060 谷歌首次将先进芯片送入太空,白皮书估算星舰需发射 1800 次才能支撑在轨数据中心
谷歌的在轨计算原型卫星 10 月 1 日搭乘 SpaceX 火箭升空,启动“太阳捕手”项目,验证 Tensor 处理器能否在太空运行,这是谷歌首次把先进芯片送入轨道。
TechCrunch · AIAI 评分5555 Satlyt 完成 800 万美元种子轮融资,为卫星提供在轨 AI 运行软件
由前 Google 和 SpaceX 产品经理 Rama Afullo 联合创办的 Satlyt 完成 800 万美元种子轮融资,由 Non Sibi Ventures 领投,为多公司卫星提供运行 AI 模型的软件,对标 VMware 和 Snowflake 的平台模式。
OpenRouter Announcements精选AI 评分6464 OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式
OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。
推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。
OpenRouter AnnouncementsAI 评分5959 OpenRouter 比较 LangChain 与 CrewAI 编排及其原生路由的分工
OpenRouter 发文将多模型编排拆为三层:工作流编排(LangGraph、CrewAI 负责)、模型路由和提供商路由(OpenRouter 负责)。
OpenRouter AnnouncementsAI 评分5858 OpenRouter 支持机器人模型路由教程:cheap-first 处理 FAQ
OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。
NVIDIA Blog精选AI 评分6767 OpenAI 推出 GPT-6 Astra Ultrafast,基于 NVIDIA Blackwell GPU 将 token 生成速度提升至 8 倍
OpenAI 发布 GPT-6 Astra Ultrafast,运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用。
推荐理由:原文给出 Ultrafast 模式相对 Astra Standard 的加速幅度和适用场景,开发者可据此评估 coding agent 工作流的收益。
SemiAnalysis@SemiAnalysis_AI 评分3535
Claude Code GitHub ReleasesAI 评分5555 Claude Code v2.1.287 发布:新增 Claude Mods 与多项修复
Claude Code 发布 v2.1.287,新增 Claude Mods 插件机制和内置 mod "You should know",Opus 4.7+ 与 Fable 在 Bedrock、Vertex、Foundry 等默认使用 1M 上下文窗口。另修复大量问题,包括 rm 危险命令保护、屏幕阅读器模式和 VSCode 扩展的多项缺陷,并改进 Bash 速度与 MCP 权限提示展示。
Databricks BlogAI 评分4646 Lakebase Postgres 推出基于分支的恢复,100 TB 数据库秒级还原
Databricks 的 Lakebase Postgres 推出基于分支的恢复机制,将恢复时间从数小时降至秒级,即使数据库规模达 100 TB。该架构将计算与存储解耦,数据库历史以可即时引用的形式存放在对象存储中,恢复只需在指定时间戳创建一个分支,属于元数据操作而非数据拷贝与 WAL 重放。
AWS Machine Learning BlogAI 评分5252 AWS 博客演示如何用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆
AWS 博客发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT 1.6)的自定义记忆后端,并部署在 Amazon EKS 上。
AWS Machine Learning BlogAI 评分4949 亚马逊支付如何用 Amazon SageMaker AI 上的上下文 bandit 提升获客漏斗转化
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。
AWS Machine Learning BlogAI 评分5151 AWS 用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流
AWS 发布基于 Amazon Bedrock AgentCore 的环境智能体(ambient agent)参考实现,用 S3 上传等事件自动触发 agent 任务,替代等待用户输入的聊天模式。
Google Cloud: DatabasesAI 评分2222 PayPal 如何用 Managed Service for Apache Spark 加速数据分析
PayPal 将分析负载从本地 Hadoop 迁移到 Google 的 Managed Service for Apache Spark,核心分析任务处理时间缩短 25%,SLA 达标率提升 30%。该服务支持分钟级集群部署与弹性扩缩容,并原生对接 GCS 和 BigQuery,帮助 PayPal 整合分散的批处理流程、降低运维成本。
OpenRouter@OpenRouterAI 评分4545AWS Machine Learning BlogAI 评分3636 uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署上线
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其适配自身零售审核策略。
Hugging Face BlogAI 评分5454 Ai2 发布 Olmo-core 3 开源 MoE 训练框架,支持扩展至万亿参数
Ai2 发布 Olmo-core 3,为 Olmo 框架带来重新设计的开源 MoE 训练系统,可扩展到万亿参数规模并保持计算效率。新实现从 FSDP 切换到基于 DDP 的方案,47B 参数 MoE 在 8 张 NVIDIA B300 上达到每 GPU 每秒 52,000 tokens,约为旧实现的 2.7 倍;启用 MXFP8 后吞吐比 BF16 高约 21%。
NVIDIA BlogAI 评分3636 NVIDIA AI 工厂如何实现高产出、长寿命与通用性以最大化投资回报
NVIDIA 提出 AI 工厂投资回报由三大要素决定:每兆瓦产出能力、硬件使用寿命和 token 需求。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本低至 45 分之一。
SemiAnalysis@SemiAnalysis_AI 评分2727
OpenRouter Announcements精选AI 评分7474 OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter Announcements精选AI 评分6868 OpenRouter 发布 Agent 模型成本与质量权衡的三步选型框架
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
OpenRouter Announcements精选AI 评分6767 OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由
OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。
推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。
Latent SpaceAI 评分7474 Latent Space DevDay 访谈:Ari Weinstein 谈 Computer Use 进展,Nikunj Handa 解析 OpenAI 新 API 栈
Latent Space 在 OpenAI DevDay 当天发布访谈,Computer Use 负责人 Ari Weinstein 表示 Computer Use 已与数月前 180 度不同。
The Verge · AIAI 评分7373 Google 发布 Gemini 4 Argon,初期仅限受信任的网络防御者使用
Google 发布新一代前沿模型 Gemini 4 Argon,称其在软件工程、法律金融等企业知识工作和网络安全防御方面具有前沿性能。初期仅向一组受信任的网络防御者开放,Google 正参与美国政府预发布模型访问的自愿流程并逐步扩大访问。模型已用于 Google 内部工作流,如大规模代码库迁移;Google 将在更广泛发布前加强防范滥用和提示词注入攻击、监测错位等安全措施。
Ars Technica · AIAI 评分6565 Google 发布 Gemini 4 Argon 模型,暂未开放使用
Google 发布 Gemini 4 Argon,称其在编码、知识工作和网络安全方面性能领先,但模型仍处有限测试,普通用户暂无法使用。DeepSWE v1.1 达 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5;API 定价为每百万输入 token $2、输出 $10,输出上限提升至 100 万 token(此前为 64,000)。
Runway News精选AI 评分6363 Runway 发布 Runway Ads,端到端自动化投放广告创意
Runway 发布新产品 Runway Ads,连接广告账户和品牌套件后可生成视频与图像广告创意,直接发布到 Meta、Google 和 TikTok,并读取平台表现数据迭代下一轮创意。
推荐理由:Runway 官方发布并给出自身投放数据,读者可以据此评估端到端生成式投放工具对营销工作流的实际改变。
Nathan Lambert@natolambertAI 评分5151
Databricks BlogAI 评分3434 Lakebase Postgres 成本优化实用指南
Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。
SemiAnalysis@SemiAnalysis_AI 评分4949AMD 首次公开 Helios 机架的 TH6 scale up 交换机设计,可见 Broadcom 以太网 retimer 紧邻飞线电缆接入交换机 ASIC。
引用AMD@AMDPOV: You’re an engineer building AMD Helios. Next up: putting it to the test. Episode 2 drops today 👀
LangChain Blog精选AI 评分7070 LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
Google Cloud: DatabasesAI 评分4141 Google Cloud 9 月 AI 基础设施与编排更新:GKE Agent Substrate、M4N 与 Z4D 等
Google Cloud 9 月为应对智能体规模化需求更新 AI 基础设施与编排能力,推出开源 GKE Agent Substrate,可运行数百万个沙箱,密度达标准容器运行时 10 倍,支持每秒超 500 次挂起/恢复且恢复低于 500ms。
ByteByteGoAI 评分5454 DoorDash 如何为 AI Agent 构建统一的 Agent Gateway 工具接入平台
DoorDash 工程团队构建了共享的 Agent Gateway,统一控制 AI Agent 对工具的发现与调用,覆盖认证授权、凭证注入、工具目录筛选和监控审计。
X.PIN@thexpinAI 评分6060
Google Developers BlogAI 评分4242 在 TPU 上加速视频扩散模型的时空注意力
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
OpenRouter Announcements精选AI 评分7070 OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试
OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。
推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。