#教程/实践
#教程/实践
今日 18 条
Dongxi 东锡 NLP@dongxi_nlpAI 评分3838Hacker News popular via buzzing.ccAI 评分6868 历史学者用Opus 5.5在荷兰东印度公司档案中发现1615年渡渡鸟目击记录
作者benbreen用Opus 5.5对GLOBALISE荷兰东印度公司档案做嵌入向量语义检索,发现一份1615年船 log 中此前未被注意的渡渡鸟捕猎记录,还修正了1890年学者对红秧鸡相关词汇的误译。作者总结AI擅长不厌倦地大规模检索档案,但难以提出问题和判断史料的历史意义,未来瓶颈将转向小众领域专家的注意力。
AYi@AYi_AInotes精选AI 评分8080
引用Andrej Karpathy@karpathyWe'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.
推荐理由:Karpathy 提出的四层输出格式阶梯和可抛弃软件制品概念,为理解大模型输出提供了可上手的做法。
Thariq@trq212AI 评分2929一直在尝试提升我游戏原型里动画的质量,所以让 Claude 教我并帮我找参考。 我让 Claude 做了一个动画编辑器,方便我们迭代跳跃动作,效果让我非常满意。 这是对比视频

AWS Machine Learning Blog精选AI 评分6060 AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线
AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。
推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。
AWS Machine Learning BlogAI 评分4444 用 Amazon Bedrock Knowledge Bases 以自然语言查询理赔数据
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档,并返回带引用的答案。
Hugging Face BlogAI 评分4343 AutoSynthData:为 Enterprise Agents 生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。
Hacker News popular via buzzing.ccAI 评分3838 2026年9月 Rust 编译器性能进展:平均编译时间缩短 4.57%
Rust 编译器在 2026-07-29 至 2026-09-28 期间平均编译时间缩短 4.57%,629 项基准测试中 555 项改善、仅 74 项退步。Clippy 启用 PGO 后最佳提升 18%,升级至 LLVM 23 带来平均 1.2% 的提速。新借用检查器 Polonius Alpha 和新 trait solver 已在 Nightly 启用,但少数场景仍有性能回退。
ginobefun@hongming731AI 评分55
OpenRouter Announcements精选AI 评分6464 OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式
OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。
推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。
OpenRouter AnnouncementsAI 评分5959 OpenRouter 比较 LangChain 与 CrewAI 编排及其原生路由的分工
OpenRouter 发文将多模型编排拆为三层:工作流编排(LangGraph、CrewAI 负责)、模型路由和提供商路由(OpenRouter 负责)。
OpenRouter AnnouncementsAI 评分5858 OpenRouter 支持机器人模型路由教程:cheap-first 处理 FAQ
OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。
AWS Machine Learning BlogAI 评分3939 在 Amazon Bedrock AgentCore 上用智能体 AI 扩展云迁移
AWS Professional Services 构建的四智能体模式在 Amazon Bedrock AgentCore 上运行,将每个应用的基础设施即代码(IaC)开发时间从 3 到 4 周缩短至几分钟,该模式已在一个覆盖 300+ 应用的迁移项目中验证。
Replit ⠕@ReplitAI 评分2020
AWS Machine Learning BlogAI 评分5252 AWS 博客演示如何用 NVIDIA NeMo Agent Toolkit 和 Amazon S3 Vectors 构建智能体记忆
AWS 博客发布教程,演示如何将 Amazon S3 Vectors 作为 NVIDIA NeMo Agent Toolkit(NAT 1.6)的自定义记忆后端,并部署在 Amazon EKS 上。
AWS Machine Learning BlogAI 评分4949 亚马逊支付如何用 Amazon SageMaker AI 上的上下文 bandit 提升获客漏斗转化
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。
AWS Machine Learning BlogAI 评分5151 AWS 用 Amazon Bedrock AgentCore 构建环境智能体:从事件驱动信号到人机协同工作流
AWS 发布基于 Amazon Bedrock AgentCore 的环境智能体(ambient agent)参考实现,用 S3 上传等事件自动触发 agent 任务,替代等待用户输入的聊天模式。
AWS Machine Learning BlogAI 评分4545 如何在 AWS 上为 Claude Platform 配置多环境访问
AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,采用专用 AI Services 账户承载订阅与工作区,通过跨账户 SigV4、工作区级 API key 和 OIDC 联合三种方式分别接入 AWS 工作负载、开发者笔记本和外部 CI/CD。生产与开发流量以独立工作区隔离,共享同一订阅,AWS 工作负载无需存储或轮换密钥。
AWS Machine Learning BlogAI 评分3636 uniopen 如何用 Amazon Nova 2 Lite 定制零售审核策略并部署上线
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词级输出优化,使其适配自身零售审核策略。
阑夕@foxshuoAI 评分22
OpenRouter Announcements精选AI 评分7474 OpenRouter 教程:如何在 CI 中用 LLM eval 门禁拦截 Pull Request
OpenRouter 发布教程,讲解用固定的 eval 集合在 GitHub Actions 中门禁 PR,当 pass rate 低于阈值时阻止合并。
推荐理由:OpenRouter 官方给出可落地的 CI eval 门禁方案,包含阈值测量和 provider 路由等易踩坑细节,方法可直接迁移到自己的仓库。
OpenRouter Announcements精选AI 评分6868 OpenRouter 发布 Agent 模型成本与质量权衡的三步选型框架
OpenRouter 发布一套为 Agent 任务选模型的三步框架,主张选满足任务质量门槛的最便宜模型,而非排行榜最高分模型。
推荐理由:原文给出按任务质量门槛选模型的三步方法和示例脚本,读者可迁移到自己的 Agent 成本优化。
OpenRouter Announcements精选AI 评分6767 OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由
OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。
推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。
Tibo@thsottiauxAI 评分2727我让我的 dot 给我画张像。它先发来一张卡通风格的,我让它再努力一点,去网上找一张我最近的照片。它画得好多了。 下面视频是我在点开我 dot 的电脑。

Peter Steinberger 🦞@steipeteAI 评分3333

eric zakariasson@ericzakariassonAI 评分3939这是我一直在用的、配合新模型构建游戏的技能 npx skills add ericzakariasson/skills --skill game-builder



Databricks BlogAI 评分3434 Lakebase Postgres 成本优化实用指南
Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。
Databricks BlogAI 评分3030 Databricks 如何规模化智能体应用而不造成 AI 蔓延
Databricks 联合 OpenAI 和 Stellantis 探讨企业规模化智能体应用,核心是随智能体自主性提升,周边基础设施更关键,需提供模型与框架选择、受治理的企业上下文、以及贯穿每次行动的控制。Databricks 以 Agent Bricks、Omnigent 和 Unity Gateway 构建统一底座,让团队新增智能体和工作流时无需各自重复集成与治理。
Thariq@trq212AI 评分1919作为一个个人副业项目,我一直在做一款电子游戏的原型。 作为一名前游戏创始人,制作游戏的过程极具满足感和创造力,不要把这件事外包给AI。用AI与你协作,把你的愿景变为现实。 以下是我的尝试方式:

LangChain Blog精选AI 评分7070 LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%
LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。
推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。
ByteByteGoAI 评分5454 DoorDash 如何为 AI Agent 构建统一的 Agent Gateway 工具接入平台
DoorDash 工程团队构建了共享的 Agent Gateway,统一控制 AI Agent 对工具的发现与调用,覆盖认证授权、凭证注入、工具目录筛选和监控审计。
Tianyi Cui@tianyiAI 评分3636【AI 倾向测试】这个只有六道二选一题目的问卷好有意思 https://pages.yqiao.me/six-questions-of-ai/

Tianyi Cui@tianyiAI 评分3838今天推荐一个功能很丰富的 DSH 上下文管理插件 dsh-context: https://github.com/bowenliang123/dsh-context
引用Tianyi Cui@tianyi从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
ginobefun@hongming731AI 评分4646引用Tw93@HiTw93想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。
OpenRouter Announcements精选AI 评分6666 OpenRouter 教程:如何测试 AI Agent 的工具调用准确性
OpenRouter 发布教程,讲解如何测试 Agent 的工具调用准确性,核心是分开测试工具选择与参数正确性这两类失败。
推荐理由:原文区分了工具选择错误与参数错误两类失败模式,并给出 LLM judge、JSON Schema 校验和轨迹比较三种可落地的测试方法。
Google Developers BlogAI 评分4242 在 TPU 上加速视频扩散模型的时空注意力
Google 分享了在 TPU 上把视频扩散模型稀疏注意力从理论稀疏转化为端到端加速的案例研究。81 帧 720p 视频的序列长度达 50K 至 400K,从 720p 升到 1440p 序列长度翻两番,全注意力在单层延迟中占比可从 55.5% 升至 88.2%。
OpenRouter Announcements精选AI 评分7070 OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试
OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。
推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。
OpenRouter Announcements精选AI 评分6868 OpenRouter 教程:如何从生产流量构建 Golden 评测数据集
OpenRouter 发布教程,讲解如何从生产流量构建 golden eval 数据集,用于在每次部署前检测提示词或模型变更引起的回归。内容涵盖五步流程:抽样生产流量、去重聚类、添加经审核的预期输出、首轮评估修正评分标准、纳入 Git 与 CI,建议探索性问题约 10 条、完整回归集 100 到 1,000 条,并以生产数据为基础、合成数据补足覆盖缺口。
推荐理由:原文给出从生产流量构建评测集的五步流程和规模建议,可迁移到自己的模型回归测试工作流。
Thariq@trq212AI 评分3131你有没有试过跟 Claude 说“我们有能力做任何事,请更勇敢一点” 另外,你有没有试过跟自己这么说

AWS Machine Learning BlogAI 评分3939 Amazon Quick 提示词工程基础指南
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式分析等场景。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例代替描述等核心原则,并给出适用于复杂请求的 CRISPE 结构化框架。