跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

当前仅显示精选新闻
114条精选相关主题AI 编码Agent 智能体产品更新

最新精选

第 1–20 条 · 共 114 条
10月5日周一
  1. AYi66

    作者转述铁柱跑通的方案:用苹果快捷指令通过 Webhook 把微信合并转发的图文记录自动喂给后端 Grok Bot,云端自动解压、读取多模态内容并分类沉淀进知识库,回传收录回执。快捷指令还支持截图、录音、输入想法等五种收录模式,可绑定动作按钮或轻敲背面触发;快捷指令和 Bot 配置提示词已全部公开,导入即可使用。

    引用铁柱AGI@cgnot996

    https://x.com/i/article/2106981384502059008

    推荐理由:原文拆解了用 iOS 快捷指令加 Webhook 把微信图文记录自动沉淀进 Grok Bot 知识库的完整流程,配置已公开可直接导入。

  2. AYi65

    作者转述 @distortgeekin 的万字 Grok Bot 实战指南,核心观点是使用智能体不是写提示词,而是雇佣一个数字员工。指南提出六步法则,包括招岗位而非派临时活、首单挑可撤回的脏活、权限按可撤回性分级、试用期跑满三轮、自主权按五级阶梯授予、每周复盘并删掉无效自动化,并建议在系统提示词里加上拿不准就停下来问。作者还分享了自己自动发信 Bot 曾把草稿全部群发的翻车经历。

    引用distort@distortgeekin

    Grok Bot could be the first thing you hire instead of prompt It can own a job, work inside your tools for hours and come back with finished work In this article, I show you how https://x.com/i/article/2105262478535847936

    推荐理由:作者提炼了他人万字指南的六步驭工法则,把权限分级和试用期三轮验证等可复用方法讲得具体。

  3. OpenRouter Announcements70

    OpenRouter 对比四家 AI Agent 服务端代码执行工具并实测自家 openrouter:shell

    OpenRouter 发布对比文章,介绍 OpenAI、Anthropic、Google 与 OpenRouter 四家服务端代码执行工具的沙箱能力、限制与成本,并介绍自家 openrouter:shell 和 openrouter:bash 两款 beta 工具,可为 Responses 和 Messages API 上的任意模型运行命令。

    推荐理由:作者亲自实测并横向对比四家托管代码执行工具的能力、延迟与计费,还给出何时仍需自建沙箱的边界判断,方法可迁移。

10月4日周日
  1. AYi66

    作者拆解 Anthropic 官方条款与 9 月威胁情报报告,指出今年上半年共封禁 1140 万个账号(去年下半年为 145 万),39.8 万次申诉仅 4.2 万次成功,成功率约十分之一。

    引用AYi@AYi_AInotes

    https://x.com/i/article/2106425943061413888

    推荐理由:作者基于 Anthropic 官方条款与 9 月威胁情报报告,把封号归因从指纹玄学转到多维交叉打分,并给出可执行的四层防线做法。

  2. AYi70

    作者排查国庆期间 Claude 大规模封号潮,指出官方上半年封禁 1140 万个账号、申诉推翻率仅十分之一,真正高危特征是时区撕裂、WebRTC 泄漏和终端 CLI 代理残留,而非 IP 纯度。

    引用AYi@AYi_AInotes

    https://x.com/i/article/2106425943061413888

    推荐理由:作者以自测经验拆解 Claude 封号的真实风控触发点,给出四层防线和按场景选路线的可迁移做法。

10月3日周六
  1. AWS Machine Learning Blog62

    AWS 用 Amazon Quick 和 Adjudicated Query 模式实现数万租约的合规扫描

    AWS 发布 Adjudicated Query 设计模式,用 Amazon Quick 聊天界面搭配确定性规则引擎扫描 50,000 份租约的合规性,模型只负责翻译问题和叙述结果,判定由规则引擎完成。

    推荐理由:文章给出了用规则引擎加受限 MCP 接口保证合规扫描完整性的设计模式,并分析了大语言模型在查询层与交付层各自的越界风险。

10月2日周五
  1. AYi75

    作者推荐 KobinFlow 的万字实战教程,仅用免费的混元 3D 和 DeepSeek Flash,把一张 AI 画的坐姿小狐狸做成浏览器里可拖拽、实时眨眼、随 WebAudio 节拍点头的 3D 交互电台。

    引用Kobin@KobinFlow

    https://x.com/i/article/2105994013270847488

    推荐理由:原文拆解了用免费模型与前端代码驱动无骨骼 3D 模型动起来的可复用方法,并给出压缩数据与适用边界。

  2. AYi80

    Karpathy 发推分享理解大语言模型输出的技巧:让模型用受控语言 ASD-STE100 写作,或改用图表、交互 HTML 页面输出,他最看好为任意主题生成 3b1b 风格的自定义解释视频(可用 ElevenLabs API key 配旁白)。他认为随着 LLM 自主完成更多执行工作,人类工作将上移到监督与理解层面,且可以要求模型生成用后即弃的定制软件制品。作者阿易转述并解读了这条推文。

    引用Andrej Karpathy@karpathy

    We'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.

    推荐理由:Karpathy 提出的四层输出格式阶梯和可抛弃软件制品概念,为理解大模型输出提供了可上手的做法。

  3. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  4. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

10月1日周四
  1. OpenRouter Announcements67

    OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由

    OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。

    推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。

  2. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

9月30日周三
  1. OpenRouter Announcements70

    OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试

    OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。

    推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。

  2. OpenRouter Announcements68

    OpenRouter 教程:如何从生产流量构建 Golden 评测数据集

    OpenRouter 发布教程,讲解如何从生产流量构建 golden eval 数据集,用于在每次部署前检测提示词或模型变更引起的回归。内容涵盖五步流程:抽样生产流量、去重聚类、添加经审核的预期输出、首轮评估修正评分标准、纳入 Git 与 CI,建议探索性问题约 10 条、完整回归集 100 到 1,000 条,并以生产数据为基础、合成数据补足覆盖缺口。

    推荐理由:原文给出从生产流量构建评测集的五步流程和规模建议,可迁移到自己的模型回归测试工作流。