用 Amazon Quick 和 Amazon Bedrock AgentCore 构建 AI 合同智能平台
基于 Amazon Bedrock AgentCore 的合同智能平台用 AI 智能体从合同 PDF 中提取八个关键字段,由 Claude Sonnet 系列模型负责抽取、Claude Haiku 独立复核,签名识别分歧时交由 Amazon Textract 用计算机视觉做确定性裁决。
基于 Amazon Bedrock AgentCore 的合同智能平台用 AI 智能体从合同 PDF 中提取八个关键字段,由 Claude Sonnet 系列模型负责抽取、Claude Haiku 独立复核,签名识别分歧时交由 Amazon Textract 用计算机视觉做确定性裁决。
Anthropic 销售团队基于 Claude Managed Agents (beta) 构建了购买智能体,每天处理数千次对话,引导客户从咨询到完成购买,升级给销售的线索转化率是旧表单的两倍多,成交快约五天。底层只有一个提示词、少量工具和 Claude,一名工程师几周就完成初版;经验包括给目标而非规则、提示词从简、把升级给销售的每一次当作改进反馈,需要人工介入的对话占比已降约一半。
Google Cloud 团队发文详解 Agent Development Kit(ADK)的 Workflow 图编排能力,通过一个退款流程示例演示 fan-out/fan-in、确定性路由与 agent 路由、RequestInput 人工审核暂停、parallel_worker 批量处理以及 ctx.run_node 动态编排等模式。
LLM 的幻觉是指生成内容与事实不符、凭空编造或与给定材料相矛盾,例如把公司 14 天退款政策说成 30 天并虚构 5 个工作日到账承诺。文章将错误分为事实性幻觉、忠实性幻觉和编造三类,并解释逐 token 预测文本的机制为何会产出虚构事实。
作者分享花费 10+ 小时摸索出的用 Opus 5.5 做视频生成的工作流:建议搭配 Claude Code 使用,用 OpenRouter API 一个密钥调用图像。
glad to see my lifetime project of randomly DMing this image to product designers is starting to pay off
OpenRouter 比较了自家平台四条图生视频模型线的分辨率、时长、帧控制、音频和价格,覆盖 Veo 3.1、Seedance 2.5 与 2.0 系列、Kling v3.0 和 Grok Imagine Video 1.5,价格数据核查于 2026 年 9 月 11 日。
推荐理由:指南覆盖模型选型、迁移调参和 Claude Code 使用三方面,开发者可直接对照迁移工作流。
Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。
推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。
Suno Studio 发布 EQ 使用技巧,建议混音时以耳朵为准而非只看曲线,并遵循"先衰减后提升"原则,例如用 80Hz 高通滤除人声低频、在 400Hz 处先减 6dB 去除浑浊。
Stripe 与 Tempo 联合发起的 Machine Payments Protocol(MPP)于 2026 年 3 月上线并提交 IETF,通过 HTTP 402 加 WWW-Authenticate: Payment、Authorization: Payment 和 Payment-Receipt 三个头部,让 AI Agent 无需注册账号即可按请求付费。
从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
Simon Willison 为 WeAreDevelopers 大会闭幕演讲用 Claude Opus 5.5 生成一个含至少 20 只鸮鹦鹉的 HTML5 canvas 像素艺术派对动画页面。
TypeSafe AI 的首个 System One Model Jev 比前沿 LLM 快 100 倍、成本低 100 倍,适合承担 LLM 周边的决策类任务。文章列出 9 个替代场景:模型路由、护栏检测、工具调用权限分类、收件箱分类、重排序、LLM 评测打分、批量打标、实时决策和置信度门控。核心思路是让 LLM 负责生成,Jev 负责围绕生成的决策。
推荐理由:作者用具体数字拆解了 Opus 5.5 降价对 Claude Code 单任务成本的实际影响,并给出可复用的成本计算器入口。
GitHub Copilot app 提供 canvas 功能,运行 /create-canvas 技能并用自然语言描述工作流、界面操作和 agent 职责三要素,即可生成看板、清单等自定义界面并保存为可共享的 extension。
推荐理由:官方教程给出从描述到生成可复用 canvas 界面的具体步骤和三个提问框架,读者可以直接照做迁移到自己的工作流。
ByteByteGo Live 推出「用 AI 重建 YouTube」课程,由前 YouTube 工程师授课,9 月 26 日(周六)开课,报名 24 小时后截止。
GitHub Copilot 博客作者提出聊天(chat)很多时候是错误的 AI 交互界面,介绍 GitHub Copilot app 中的 canvas,它是在应用内运行、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信。
推荐理由:作者作为 Copilot 团队成员提出用 canvas 自定义界面替代聊天框,并结合工作流自动化等实例说明何时值得让智能体先造工具。
GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。
推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。
SGLang 的 /v1/score 接口让调用方通过 label_token_ids 显式声明所需标签分数,避免依赖生成响应 top-k logprobs 中是否出现该标签。
Google 团队在 MaxText/JAX 和 Google Cloud TPU 上从零复现了 Ai2 的 Olmo 3 7B,覆盖 stage-1 预训练(约5.93T token)和 stage-2 中期训练 anneal,held-out C4 loss 与 8 项下游任务均与 Ai2 参考持平。
如果你注意到 https://claude.ai 和桌面应用在过去几周变得有多快,这就是我们做到的方法。 博客文章里有很多干货学习和技巧,适合正在为自己的应用提速的工程师。
We made claude.ai 3x faster in two weeks. Here’s how we use Claude to measure, debug and improve performance. Prompts and methods included. https://claude.dev/blog/how-we-made-claude-ai-faster/
GitHub Copilot app 重建了 Pull Request 视图,可流畅打开含 2,200 个文件、超过一百万行变更和 400 多条内联评论的超大 PR。核心做法是把高度拆成确定性的代码几何与动态评论块两套独立体系,配合基于身份锚定的滚动校正、先流式返回结构的 pipeline,以及用生产探针和自动巡航跑 change → measure → improve 循环来定位 bug。
一篇用可交互示例讲解 shadow roots 的教程,演示样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以受控方式与页面 DOM 交互。该示例由 Fable 5.1 Medium 根据提示词生成。
当提示词和 RAG 无法消除模型在特定任务上的反复偏差时,就需要通过微调把期望行为固化进模型参数。文章梳理了定制模型的路径:先用 few-shot prompting 和检索增强生成(RAG)补充信息,再用监督微调(SFT)训练模型,而 LoRA 和 QLoRA 通过减少需要调整的参数和显存占用,让微调现有模型更易落地。
Cursor 官方博客介绍其智能体 harness 的多项 token 效率优化,整体将用户 token 成本降低 7% 且质量未下降。
推荐理由:Cursor 自述其 harness 层的多项 token 优化手段与量化收益,读者可以借鉴这些方法来降低长时智能体运行成本。
OpenRouter 发布 2026 年嵌入模型选购指南,通过对 19 个模型发起 28 项 API 实测,按用例给出推荐:英文 RAG 首选 openai/text-embedding-3-small。
推荐理由:OpenRouter 用自家端点实测 19 个嵌入模型并按用例给出推荐表,读者可直接按输入类型和价格约束对号入座。
OpenRouter 发布 TypeScript 教程,讲解如何通过 Decisions API(模型 ID typesafe/jev-1.13,端点 POST https://openrouter.ai/api/alpha/decisions)用 TypeSafe 的 Jev 决策模型审核二手市场商品列表。
肝不动了....GPT的几个和后端/Agent性能测试明天再说吧.....
@karminski3 效率也太高了!你不睡觉的吗😳
Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。
推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。
OpenAI 于 2026 年 7 月发布全双工语音模型 GPT-Live-1,可同时听和说,无需轮次检测器。
OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。
推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。
LangChain 博客介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准评估器和自动化发布门禁。