跳到正文

#Agent

今日 86 条
8月27日周四
  1. Linear Now64

    Linear 用 1000+ 个 PR 将 React 应用从 styled-components 迁移到 StyleX

    Linear 宣布完成从 styled-components 到 StyleX 的迁移,历时逾 1000 个 PR。迁移动机包括 styled-components 进入维护模式、React 18 并发渲染下的性能回归,以及团队希望为 Agent 参与代码库建立更清晰的样式边界。

    推荐理由:Linear 团队亲历者复盘超千个 PR 的迁移过程,给出可迁移的确定性工具加 Agent 加人工判断的方法和降险步骤。

  2. Michael Truell65

    Michael Truell 宣布 Grok Bot 现已向所有标准 Grok 或 Cursor 订阅用户开放,并表示其增长快于他们见过的任何产品。引用内容提到所有 SuperGrok 和 Cursor Pro 订阅者已可用 Grok Bot,且为所有用户重置了每周使用限额。作者称用户把电商运营(支持、广告、库存、财务)、协调客户活动、测试生产软件等任务交给 Grok Bot。

    引用Grok Bot@bot

    All SuperGrok and Cursor Pro subscribers now have access to Grok Bot. We're also resetting weekly usage limits for all users. Enjoy!

    推荐理由:作者列出用户实际交给 Grok Bot 的任务范围,读者可据此判断它在真实工作流中的落地程度。

  3. Lee Robinson39

    我们也没忘了 @Bot…… 现在所有付费用户都可以使用了。每月 $20 就能改变你用电脑工作的方式! 我们已为所有 Bot 用户重置了每周使用限额。试试看吧!

    引用Lee Robinson@leerob

    We just increased the included usage of Grok models in Cursor! Demand has been increasing with the launch of Grok 4.6. We already doubled limits last month with more compute. And now we're raising limits again permanently. Enjoy!

  4. Anthropic Newsroom60

    Anthropic 开启 Model Hardware Standard 研究预览,让 AI 智能体安全操控实验与制造设备

    Anthropic 开放 Model Hardware Standard(MHS)研究预览,这是让 AI 智能体安全操作物理设备的标准规范,首批面向科研实验室和先进制造商,可将原本需数周至数月的硬件集成缩短到数小时或数分钟。

    推荐理由:官方介绍 MHS 标准化驱动如何把硬件集成从数周缩到数分钟,并给出多家机构实测用例,对关注智能体操控实体设备的读者有参考。

8月26日周三
  1. Linear Now69

    Linear 完成 9900 万美元回购,估值翻倍至 25 亿美元,ARR 突破 1 亿美元

    Linear 完成 9900 万美元回购,估值 25 亿美元,是去年 12.5 亿美元的两倍,Accel、01A、Salesforce Ventures 和 S32 参与其中;公司现金流为正,账上现金超过历史融资总额。

    推荐理由:官方披露 2.5B 估值回购与 100M ARR 等关键数据,读者可借此了解 Linear 的经营现状与智能体业务进展。

  2. Claude Blog73

    Claude Cowork 桌面端内置浏览器上线

    Anthropic 在 Claude Cowork 桌面应用中内置浏览器,Claude 可自主导航网页、阅读、点击、填表,本周起向 Pro、Max 和 Team 计划推送,Enterprise 管理员即日起可开启。

    推荐理由:官方说明了内置浏览器与 Claude in Chrome 的分工、登录方式和安全边界,读者可据此判断网页类任务该交给哪条路径。

8月25日周二
  1. Hugging Face Blog63

    IBM 发布 Granite 4.2 推理模型家族并详解构建过程

    IBM 发布 Granite 4.2 密集 decoder-only 推理模型家族,含 3B、8B、30B 三个规格,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文窗口扩至 512K),经 SFT 与多阶段 GRPO 强化学习训练,全部以 Apache 2.0 许可开源。

    推荐理由:IBM 官方详解 Granite 4.2 训练全程,从五阶段预训练到多阶段 RL 课程,可复用的训练细节较完整。

  2. Sierra Blog38

    Sierra 在韩国首尔设立办公室,正式进军韩国市场

    Sierra 宣布在首尔开设办公室,正式进入韩国市场。其 Horizon 智能体可跨系统、跨渠道运行数周至数年,并借助 Context Engine 从每次交互中持续学习;Singtel 10 周上线后解决率超 70%,Next 6 周上线并覆盖 83 个国家 48 种语言,BBVA 30 天上线首个 Horizon 智能体。Sierra 按结果而非用量收费。

  3. OpenRouter Announcements60

    OpenRouter 发布 Video Generation API 代码指南,一个端点调用 Seedance、Veo、Wan

    OpenRouter 发布视频生成 API 教程,通过 POST /api/v1/videos 提交任务、轮询状态、下载 MP4,同一集成可用 Seedance 2.0、Veo 3.1、Wan 2.7,切换模型只需改 model 标识符。

    推荐理由:OpenRouter 官方教程给出完整的异步视频生成集成代码,包括轮询、失败状态处理和换模型时需注意的参数差异,可直接迁移到自己的项目。

8月24日周一
  1. Import AI47

    Import AI 470:机器不应享有权利;SPADE 自动化环境生成;Hawkeye 构建更优 GPU kernel

    METR 研究显示 AI 对科学的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域仅小幅加速,AI 研究本身则无可测量加速。多校团队提出 SPADE 自博弈框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。

8月23日周日
8月22日周六
  1. Google Research41

    Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中优先筛选候选生物标志物

    Google 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。该系统在三个队列共 9,279 条参与者观测中自主识别出 41 个心理健康候选数字生物标志物和 25 个代谢候选标志物,并构建出睡眠时长变异性、心血管适能指数等新复合特征。

8月21日周五
8月20日周四
  1. Mistral AI66

    Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

    Mistral 发布 Agentic Search,通过 search、open、navigate、read、grep 五个工具让模型多步检索、翻阅并验证复杂文档,可通过 Mistral Search Toolkit 及 Studio 和 Vibe 中的 Libraries 使用,无需微调。

    推荐理由:官方给出多步检索循环的完整工具设计和两个基准的具体数字,读者可据此评估它替代一次性 RAG 的适用场景。

8月19日周三
8月18日周二
8月17日周一
  1. OpenRouter Announcements62

    OpenRouter 推出 Activity 仪表盘与 Analytics API,按 Agent、模型和请求分析 AI 用量

    OpenRouter 发布 Activity 仪表盘和 Analytics API,可按 Agent、模型、用户和请求维度查看支出、token 用量、缓存命中率和延迟等指标。

    推荐理由:原文给出仪表盘各项功能、Analytics API 端点和内部降本案例,读者可以据此评估如何排查自家 Agent 用量成本。

8月15日周六
  1. Nathan Lambert: Interconnects71

    Nathan Lambert 解析 GLM-5.3 为何能紧跟前沿

    Z.ai 发布 GLM-5.3,目前仅在 coding plan 提供,两周内将开放权重到 Hugging Face。作者认为其与 GLM-5.2 同底座、靠大幅扩展后训练提升成绩,在部分智能体编码基准上超越 Kimi K3 甚至个别超越 Claude Fable 5 或 GPT-5.6-Sol,参数约 750B。

    推荐理由:作者给出了对 GLM-5.3 成绩来源的解释框架,包括发布节奏、后训练策略和 RL 数据产业等背景,可用于理解中美前沿模型竞争的成因。