跳到正文

全部动态

今日 18 条
今天10月2日周五
  1. Hacker News popular via buzzing.cc68

    历史学者用Opus 5.5在荷兰东印度公司档案中发现1615年渡渡鸟目击记录

    作者benbreen用Opus 5.5对GLOBALISE荷兰东印度公司档案做嵌入向量语义检索,发现一份1615年船 log 中此前未被注意的渡渡鸟捕猎记录,还修正了1890年学者对红秧鸡相关词汇的误译。作者总结AI擅长不厌倦地大规模检索档案,但难以提出问题和判断史料的历史意义,未来瓶颈将转向小众领域专家的注意力。

  2. AYi80

    Karpathy 发推分享理解大语言模型输出的技巧:让模型用受控语言 ASD-STE100 写作,或改用图表、交互 HTML 页面输出,他最看好为任意主题生成 3b1b 风格的自定义解释视频(可用 ElevenLabs API key 配旁白)。他认为随着 LLM 自主完成更多执行工作,人类工作将上移到监督与理解层面,且可以要求模型生成用后即弃的定制软件制品。作者阿易转述并解读了这条推文。

    引用Andrej Karpathy@karpathy

    We'll be spending a lot more time trying to understand the outputs of language models. A few thoughts, tips & tricks: Writing. Something I've had success with: Ask your LLM to explain something in ASD-STE100, it's a controlled language specification originally developed for aerospace maintenance documentation. LLMs well-versed in this language and it comes with heavy constraints on clean writing style that I often find a lot more readable. Sometimes I've tried to soften it a bit e.g. ask for "80% of the way to ASD-STE100" because the spec is quite stringent. But even better: Diagrams / images. Instead of writing, ask your LLM to create a diagram. These can be a lot easier to process, parse, and understand. But even better: Web pages. Ask for output "in HTML" to get a beautiful, interactive webpage. LLMs are getting really good at frontend and can create beautiful experiences, animations, etc. But even better: Explainer videos. The output format I am most bullish on is fully custom / bespoke explainer videos generated on any arbitrary topic. Experiment with things like "Create a 3b1b style video explainer on X. Use my ElevenLabs API key for audio narration". (you'd need an API key for the latter or you can ask your LLM to find you decent free alternatives that use your local compute). This is actually starting to work! In summary: - As LLMs get better, they will do more and more of the legwork autonomously, and a lot more of our work will rise up the abstractions into oversight and understanding. - Luckily, LLMs can help here too because as intelligence and code are increasingly abundant, you can ask for large, custom, discardable software artifacts (e.g. web apps, video explainers) that would have never made sense to create before. Push the boundaries here and you'll be surprised.

    推荐理由:Karpathy 提出的四层输出格式阶梯和可抛弃软件制品概念,为理解大模型输出提供了可上手的做法。

  3. AWS Machine Learning Blog60

    AWS 实操教程:在 Amazon Bedrock AgentCore Runtime Instances 上搭建三智能体音乐制作流水线

    AWS 博客发布实操教程,在 Amazon Bedrock AgentCore Runtime Instances 上部署三个智能体(作曲、交付、合规)协作完成音乐制作并产出可播放的 .wav 文件。

    推荐理由:AWS 官方手把手教程,用三智能体音乐制作流程演示 Runtime Instances 的 GPU、共享会话和多日持久化等可迁移的多智能体部署模式。

  4. Hugging Face Blog43

    AutoSynthData:为 Enterprise Agents 生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹,自动生成并验证新的可执行训练任务,形成随模型能力动态调整的课程。该方法在 EnterpriseOps Gym 环境中验证,通过能力规格卡生成多样化任务,避免直接使用原始提示词和轨迹,并已发布相关数据集。

  5. OpenRouter Announcements64

    OpenRouter 详解六大 Agent 框架的工具调用 Schema 处理,并提出在 API 层统一格式

    OpenRouter 比较了 LangChain、LangGraph、CrewAI、OpenAI Agents SDK、Claude Agent SDK、Microsoft Agent Framework 和 Google ADK 如何定义工具 Schema 并在不同提供商的 wire format 之间做翻译。

    推荐理由:原文逐一拆解六大框架的工具调用格式翻译位置,并给出在 API 层统一格式的可行做法,便于开发者选型前对齐自己的技术栈。

  6. OpenRouter Announcements58

    OpenRouter 支持机器人模型路由教程:cheap-first 处理 FAQ

    OpenRouter 发布教程,介绍让便宜模型先答常规支持问题、再按需升级到更强模型的路由方法。文中比较静态规则、分类器分诊和答案检查三种模式,给出带 models 回退数组的可复制请求示例,并说明请求错误由 OpenRouter 的 fallback 重试,而答案是否合规需在应用侧检查,最后列出升级率、每工单成本和全轮延迟等应测量的指标。

  7. AWS Machine Learning Blog49

    亚马逊支付如何用 Amazon SageMaker AI 上的上下文 bandit 提升获客漏斗转化

    Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(MAB)做产品获客漏斗个性化,七周线上 A/B 测试中,一个人群组的最终漏斗转化率取得高个位数相对提升,另一人群组则未见改善。团队采用 LinUCB,按申请开始、提交、审批三个阶段各跑一个模型并线性组合其 UCB 分数,以同时优化整条漏斗。

  8. AWS Machine Learning Blog45

    如何在 AWS 上为 Claude Platform 配置多环境访问

    AWS 发布 Claude Platform on AWS(CPonAWS)多环境访问实施指南,采用专用 AI Services 账户承载订阅与工作区,通过跨账户 SigV4、工作区级 API key 和 OIDC 联合三种方式分别接入 AWS 工作负载、开发者笔记本和外部 CI/CD。生产与开发流量以独立工作区隔离,共享同一订阅,AWS 工作负载无需存储或轮换密钥。

10月1日周四
  1. OpenRouter Announcements67

    OpenRouter 指南:用置信度阈值实现便宜模型到强模型的升级路由

    OpenRouter 发布教程,讲解基于置信度的升级路由:让便宜模型通过结构化输出返回 0 到 1 的置信度字段,低于阈值时把请求转给更强模型。教程强调分数只是自报排序而非校准概率,阈值须按自己流量的分错误率设定,示例中阈值 0.7 升级 14% 的请求,把保留答案的错误率从约 10% 降到约 4%。

    推荐理由:原文给出用结构化输出实现置信度分级的完整流程,含阈值校准示例和常见误区,方法可直接迁移到自己的流量。

  2. Databricks Blog34

    Lakebase Postgres 成本优化实用指南

    Databricks 详解 Lakebase Postgres 的成本优化机制:分支共享底层存储避免重复存储开销,自动扩缩容按用量计费,缩容至零后计算成本归零,数百毫秒内可恢复。同步表建议只同步应用所需的工作集,并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式,其中源数据每周期变更超过 10% 时 Snapshot 比 Triggered 更省钱。

  3. Databricks Blog30

    Databricks 如何规模化智能体应用而不造成 AI 蔓延

    Databricks 联合 OpenAI 和 Stellantis 探讨企业规模化智能体应用,核心是随智能体自主性提升,周边基础设施更关键,需提供模型与框架选择、受治理的企业上下文、以及贯穿每次行动的控制。Databricks 以 Agent Bricks、Omnigent 和 Unity Gateway 构建统一底座,让团队新增智能体和工作流时无需各自重复集成与治理。

  4. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

9月30日周三
  1. Tianyi Cui38

    今天推荐一个功能很丰富的 DSH 上下文管理插件 dsh-context: https://github.com/bowenliang123/dsh-context

    引用Tianyi Cui@tianyi

    从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)

  2. ginobefun46

    做得真好

    引用Tw93@HiTw93

    想给大伙随便聊聊如何给产品进行一次图标升级,有哪些需要注意的以及可以优化的点。 早上给 Mole 的图标进行了一次精细化的升级,之前使用的是系统的图标,对于简单的产品场景我感觉完全够用,不过细看会感觉缺少一点灵性的感觉。 经过调研,比较适合做 App 产品 Icon 的有 Remix Icon 和 Phosphor Icon这两个,之前写 Web 的时候用 Remix 很多,简单舒服,但是放到 App 上我感觉不是很好看,于是就换上了 Phosphor 这个,展示效果很有灵性,非常不错,差不多有 70% 左右,可以不修改直接使用,然后有 30% 的图标是我用 opus 5.5 来写SVG 自绘的,这样整体更加一致。 可能大伙直接看下面的对比图很难感觉到两者的区别,很多时候需要实际放到真实的产品里面去,我一般还会考虑到本身这个模块下一组图标的搭配感,有时候全部图标单个都好看,组合到一起就不好看的情况也有,好比一个人每一个五官单独出来都好看,但是放到一个脸上却不那么好看,这里建议就是图标的根更换你一定要放到实际的产品里面去看,放到一起去看,才会有比较好的效果。 其次,我一直想着,我们做的产品应该是有灵性的,有生命的那种感觉,而非直接 AICoding 不经任何你的思考出来的那种冷冰冰的编译产物,这个时候小细节比如icon会是给这个产品带来生命力的一个很好的切入点,比如大伙看 保持常亮我使用的是 一杯咖啡,这里会有一种 Caffeine 比喻,就是让你的电脑好像喝了咖啡一样睡不着的感觉,然后关于一般会用一个感叹号,但是我想着应该是 hello,所以就用的挥手的标志,诊断正常会有排查的那种标志,但是这里使用的是一个听诊器的标志,更像是给你的问题做一次医生检查,类似这样,很多时候,可以在产品里面加入不少你的小巧思,会让整体有趣很多。 最后,好看的设计几乎都离不开对齐、整齐、错落有致这些原则,如何在人眼看到的场景下让图标和内容以及上下模块看起来是整齐的、大小一致的,甚至是上下居中对齐的,都需要一个一个去看,去调整,包括字体和icon的对齐,以及字体里面中英文本身也没有垂直对齐应该如何优化,类似这样的,可以精雕细琢很久,非常有意思。 这种看似无用功,其实是我很喜欢做的事情,AI 可以给优秀编码、及格审美带来非常大的促进,人看着好像不要做啥了,只要动动嘴就好,反而我认为不是的,人在这里的作用更大了,AI 帮你节约的时间,刚好可以放到打磨产品上,让1%的用户有种用你产品的时候,时不时有一种秒懂、卧槽、变魔术的感觉,那就非常非常有价值和意思了,或许这也是我认为做独立产品有意思的地方。

  3. OpenRouter Announcements70

    OpenRouter 教程:Prompt 或模型变更后如何对 AI Agent 做回归测试

    OpenRouter 发布教程,讲解在 Prompt、模型、工具定义或检索设置变更后如何对 Agent 做回归测试:用锁定的用例集配合结构断言和硬性不变量,模型测试固定用具体 slug 而非 alias。

    推荐理由:教程给出锁用例集、结构断言和固定 slug 对比的完整回归方法,并以一次实测换模型跑通说明落地方式。

  4. OpenRouter Announcements68

    OpenRouter 教程:如何从生产流量构建 Golden 评测数据集

    OpenRouter 发布教程,讲解如何从生产流量构建 golden eval 数据集,用于在每次部署前检测提示词或模型变更引起的回归。内容涵盖五步流程:抽样生产流量、去重聚类、添加经审核的预期输出、首轮评估修正评分标准、纳入 Git 与 CI,建议探索性问题约 10 条、完整回归集 100 到 1,000 条,并以生产数据为基础、合成数据补足覆盖缺口。

    推荐理由:原文给出从生产流量构建评测集的五步流程和规模建议,可迁移到自己的模型回归测试工作流。

  5. AWS Machine Learning Blog39

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,涵盖自定义智能体、自动化流程和对话式分析等场景。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例代替描述等核心原则,并给出适用于复杂请求的 CRISPE 结构化框架。