跳到正文

#教程/实践

今日 18 条
9月30日周三
  1. Claude Blog55

    Anthropic 销售团队如何用 Claude Managed Agents 重建 inbound 销售

    Anthropic 销售团队基于 Claude Managed Agents (beta) 构建了购买智能体,每天处理数千次对话,引导客户从咨询到完成购买,升级给销售的线索转化率是旧表单的两倍多,成交快约五天。底层只有一个提示词、少量工具和 Claude,一名工程师几周就完成初版;经验包括给目标而非规则、提示词从简、把升级给销售的每一次当作改进反馈,需要人工介入的对话占比已降约一半。

9月29日周二
  1. ByteByteGo45

    为什么 LLM 会说谎?

    LLM 的幻觉是指生成内容与事实不符、凭空编造或与给定材料相矛盾,例如把公司 14 天退款政策说成 30 天并虚构 5 个工作日到账承诺。文章将错误分为事实性幻觉、忠实性幻觉和编造三类,并解释逐 token 预测文本的机制为何会产出虚构事实。

  2. Databricks Blog65

    Databricks 如何让 12,000 名员工在模型发布首日即可用新模型

    Databricks 介绍其通过 Unity Gateway 让全体员工在 Opus 5.5、GPT-6 Sol 和 GPT-Luna 发布首日即获得实验性访问的完整流程:先用实验标签和按用户预算(月度上限、每日 runaway 限额、质量前沿预算、实验预算四类)控制风险,再依据内部基准、用户反馈和 OpenTelemetry 成本追踪评估。

    推荐理由:原文给出企业内部让全体员工 Day 1 用上新模型的完整流程和成本数据,方法可迁移到类似的模型接入评估场景。

9月28日周一
  1. Tianyi Cui43

    有人提名了三个 DSH 插件导航站:dshfind.com、dshmarket.com 和 awesome-dsh-plugin.com,其中 dshmarket 可直接作为 DSH 插件安装到设置页。据 DeepSeek 官方 API 统计,约 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件,团队称将持续支持插件生态并推动插件 API 趋于稳定、减少破坏性更新。

    引用Tianyi Cui@tianyi

    从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)

9月27日周日
9月26日周六
  1. ByteByteGo29

    Jev 最值得替代 LLM 的 9 个场景

    TypeSafe AI 的首个 System One Model Jev 比前沿 LLM 快 100 倍、成本低 100 倍,适合承担 LLM 周边的决策类任务。文章列出 9 个替代场景:模型路由、护栏检测、工具调用权限分类、收件箱分类、重排序、LLM 评测打分、批量打标、实时决策和置信度门控。核心思路是让 LLM 负责生成,Jev 负责围绕生成的决策。

  2. ClaudeDevs70

    Opus 5.5 的输入和输出 token 比 Opus 5 便宜 20%,cache reads 便宜 60%。作者据此测算了在 Claude Code 中完成一个任务的实际成本变化,并发布了博客和计算器,读者可从 /usage 运行自己的数据:https://claude.dev/blog/what-a-task-costs-on-opus-5-5/

    推荐理由:作者用具体数字拆解了 Opus 5.5 降价对 Claude Code 单任务成本的实际影响,并给出可复用的成本计算器入口。

  3. GitHub Blog · AI & ML60

    GitHub Copilot app 新手教程:如何用 canvases 构建自定义工作流

    GitHub Copilot app 提供 canvas 功能,运行 /create-canvas 技能并用自然语言描述工作流、界面操作和 agent 职责三要素,即可生成看板、清单等自定义界面并保存为可共享的 extension。

    推荐理由:官方教程给出从描述到生成可复用 canvas 界面的具体步骤和三个提问框架,读者可以直接照做迁移到自己的工作流。

9月25日周五
  1. GitHub Blog · AI & ML61

    GitHub Copilot 博客:为什么聊天界面往往不是正确的 UI,用 canvas 试试

    GitHub Copilot 博客作者提出聊天(chat)很多时候是错误的 AI 交互界面,介绍 GitHub Copilot app 中的 canvas,它是在应用内运行、无浏览器外壳的全栈小应用,可与 Copilot agent 双向通信。

    推荐理由:作者作为 Copilot 团队成员提出用 canvas 自定义界面替代聊天框,并结合工作流自动化等实例说明何时值得让智能体先造工具。

  2. GitHub Blog · AI & ML63

    GitHub Security Lab 发布 Fuzzing Taskflow:用 LLM 智能体自动化 C/C++ 模糊测试

    GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。

    推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。

9月24日周四
  1. Boris Cherny48

    如果你注意到 https://claude.ai 和桌面应用在过去几周变得有多快,这就是我们做到的方法。 博客文章里有很多干货学习和技巧,适合正在为自己的应用提速的工程师。

    引用ClaudeDevs@ClaudeDevs

    We made claude​.ai 3x faster in two weeks. Here’s how we use Claude to measure, debug and improve performance. Prompts and methods included. https://claude.dev/blog/how-we-made-claude-ai-faster/

  2. GitHub Blog · AI & ML56

    GitHub Copilot app 如何渲染超大 Pull Request

    GitHub Copilot app 重建了 Pull Request 视图,可流畅打开含 2,200 个文件、超过一百万行变更和 400 多条内联评论的超大 PR。核心做法是把高度拆成确定性的代码几何与动态评论块两套独立体系,配合基于身份锚定的滚动校正、先流式返回结构的 pipeline,以及用生产探针和自动巡航跑 change → measure → improve 循环来定位 bug。

  3. Simon Willison25

    用可交互示例讲解 Shadow DOM 的 shadow roots

    一篇用可交互示例讲解 shadow roots 的教程,演示样式封装、继承、slots、parts 以及 JavaScript 访问方式,展示 shadow root 如何创建带私有样式表和元素的隔离 DOM 树,并以受控方式与页面 DOM 交互。该示例由 Fable 5.1 Medium 根据提示词生成。

9月23日周三
  1. ByteByteGo40

    如何定制模型让它学会新技能:从提示词、RAG 到 LoRA 与 QLoRA 微调

    当提示词和 RAG 无法消除模型在特定任务上的反复偏差时,就需要通过微调把期望行为固化进模型参数。文章梳理了定制模型的路径:先用 few-shot prompting 和检索增强生成(RAG)补充信息,再用监督微调(SFT)训练模型,而 LoRA 和 QLoRA 通过减少需要调整的参数和显存占用,让微调现有模型更易落地。

  2. Claude Blog67

    Anthropic 工程师分享如何为 AI 驱动的代码现代化项目做准备

    Anthropic 前线部署工程师在 Notes from the Field 系列中分享管理大规模代码现代化项目的经验:原本需数年的项目现在可在数月或数周内完成,但瓶颈从编写变更转移到组织动员。

    推荐理由:来自 Anthropic 一线工程师的实战经验,给出 AI 代码现代化项目启动前的组织性准备工作清单和可复用六步流程。

9月22日周二
  1. OpenRouter Announcements61

    OpenRouter 解析 NVIDIA Nemotron 3.5 Lightning 如何承担智能体高频执行调用

    OpenRouter 发文解析 NVIDIA 的 Nemotron 3.5 Lightning,这是一个 30B 总参数、每 token 激活约 3B 的 MoE 开源权重模型,定位于智能体工作流中的高频执行步骤。

    推荐理由:原文梳理了模型规格、与 Ultra 的分工、各端点差异和路由方法,可帮助读者判断何时用它替代大模型执行高频调用。