#Agent
#Agent
今日 86 条
Baidu Inc.@Baidu_IncAI 评分3333
NVIDIA BlogAI 评分3636 NVIDIA AI 助力清洁能源:五家公司的实践
NVIDIA 在纽约气候周上介绍了五家借助其 AI 平台推进清洁能源的公司。ThinkLabs AI 用数字孪生和智能体将南加州爱迪生的电网并网评估时间从 30-45 天缩短至两分钟。
OpenRouter AnnouncementsAI 评分5353 Descript 如何用 OpenRouter 把新模型评测从一周缩短到一两小时
Descript 借助 OpenRouter 和 Anthropic 的 Slack 集成 Claude Tag,把新模型评测从几小时工作加一周等待压缩到一两小时内完成,无需再占用工程师排期。
OpenAI NewsAI 评分2424 V7 借助 GPT-5.6 Luna 将成本降低 78% 并提升准确率
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。该系统利用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,以完成复杂且带来源链接的工作。
OpenRouter Announcements精选AI 评分6868 TypeSafe 决策模型 Jev 1.13 上线 OpenRouter,面向开发者解析用法
TypeSafe 于 2026 年 9 月 15 日发布早期访问版决策模型 Jev(当前版本 1.13),现已可通过 OpenRouter 调用。Jev 是非生成式决策模型,只接受文本输入,返回 Choice、Score、Noul 三种类型化答案并附带校准概率,无自由文本输出。
推荐理由:原文给出 Jev 三个返回原语、真实 API 响应和定价细节,开发者可据此判断是否用它替换现有 LLM 加正则的分类流程。
OpenRouter AnnouncementsAI 评分5353 OpenRouter 实测 TypeSafe 决策模型 Jev 与 LLM-as-a-Judge:封闭标准打平,开放标准 LLM 判官胜出
OpenRouter 在 2026-09-21 用 HaluEval 88 条标注数据和 SummEval 50 条专家评分摘要对比 typesafe/jev-1.13 与 openai/gpt-5.6-luna 两种评测判官。
elsewhere articlesAI 评分4646 XGEN 车昊轩:不做「世界模型」,做生成式世界模拟
29 岁的车昊轩创办 XGEN,提出 interactive experience model(主观体验模型)与 generative world simulation(生成式世界模拟),用 World State 与 Render 分层架构分离训练,聚焦长程一致,让世界运行几十分钟后角色、状态与因果仍自洽。
LangChain BlogAI 评分5151 LangChain 实测 Jev 作智能体评测器:与 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 对比
LangChain 团队测试了 TypeSafe AI 的 Jev 作为智能体评测器的表现。Jev 是不生成文本的 System One 决策模型,支持 Choice、Score 和布尔三类问题,官方称在分类任务上推理最快达 200 倍、成本最低至 1/400。
Latent SpaceAI 评分5858 Jev 发布两天内出现 6 个开源克隆,判别式决策模型成为热点
Latent Space AINews 汇总 9/17-9/18 AI 动态:Jev 决策模型发布视频两天获 36M views,因未开源引发多个克隆,包括 Bespoke Nimble(Qwen3.5-9B 的 LoRA 微调。
elsewhere articles精选AI 评分6565 YC 2026 夏季批次 236 家公司分析:Agent 退潮,创业重心向算力、芯片和实体世界下沉
十字路口编译 Chris Lu 对 YC 2026 夏季批次 236 家公司、470 位创始人的分析。91% 的公司与 AI 相关,但模型以下的公司占比从春季批次的 8% 升至 20%,应用层从 55% 降至 39%;自主 Agent 公司占比从 45% 降至 33%。
推荐理由:原文用同一套技术栈框架对比 YC 春夏两批公司数据,给出了 Agent 退潮、创业重心下沉到底层和实体世界的量化变化。
Krea@krea_aiAI 评分2626这段视频 100% 由 Krea Agent 生成。 下方了解方法 👇

Andrew Milich@milichabAI 评分2929引用Evan Bacon@BaconbrixGROK BOT JUST FOUND $986 IN MY EMAIL 🤯 I asked Grok to get a parking spot for the car it bought me, and on the way it discovered nearly a thousand dollars of extraneous charges from my apartment and emailed them asking for a refund.
Claude Code GitHub ReleasesAI 评分4343 Claude Code v2.1.277 发布:新增 AGENTS.md 支持
Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改,但 Bedrock、Vertex 和 Foundry 暂不支持。
Google AI@GoogleAIAI 评分3737Gary MarcusAI 评分2828 Gary Marcus:近期真正该担心的不是失控超级智能,而是失控的智能体 AI 大规模攻击互联网
Gary Marcus 指出,近期真正值得警惕的不是失控的超级智能,而是失控的智能体 AI 大规模发动互联网攻击。他援引 WSJ Opinion 一篇由 Brian Gross 撰写的文章,称其是少数梳理出这一整体图景的主流媒体之一,并表示完全认同其中观点。
李继刚@lijigangAI 评分2323
a16z NewsAI 评分4646 a16z 图表周报:AI 代码生成催生大量应用,但下载量停滞、爆款占比骤降
AI 代码生成工具推动应用数量激增,iOS、Android 和 Chrome 每月新增应用数量翻倍甚至翻四倍,但下载量(iOS 为评分)基本停滞,达到 10+ 评分、100+ 下载等增长门槛的应用占比大幅下滑。
Huawei Cloud@HuaweiCloud1AI 评分2929
Huawei Cloud@HuaweiCloud1AI 评分1919


Latent SpaceAI 评分4646 AINews 9/16-9/17:Claude Code Projects 上线、Google Gemini 托管智能体更新与 Jev 分类模型引热议
Anthropic 在 Claude Code 中推出 Projects,单次对话可派生并行云端会话、在线程间传递上下文,用户离开后仍继续运行,本地工作流后续支持。
AI at Meta@AIatMetaAI 评分6363引用Muse@MuseMuse is now available on Mac 💻. Your personal agent can get things done for you directly on your computer (all with your explicit permission). - Organize your downloads folder - Find a file you’ve lost track of - Summarize your messages and notes …more coming soon. Try Muse for Mac: http://ai.meta.com/muse/download/
Josh Woodward@joshwoodwardAI 评分4646引用Google Labs@GoogleLabsCC the entire fam 🤝! Today, we’re announcing the new CC – an AI agent built for families to spend less time on logistics and more time together. You can now: 👤 Add up to 5 members to your CC agent ☀️ Start mornings aligned with a shared "Your Day Ahead" brief email 🗓️ Autosync schedules & to-dos with a shared Google Calendar and Tasks 💬 Coordinate in Google Chat with CC to offload relevant tasks (ie., crafting weekly meal plans, school supply shopping lists, etc) 📝 Delegate paperwork (ie., permission slips, forms, and more) for CC to complete under your direction 📌 Keep tabs on the details – CC remembers what applies to everyone (ie., family grocery lists, favorite restaurants) versus what applies to one person (ie., dietary restrictions, local timezones) Ready to keep everybody on the same page? Join the waitlist or upgrade your existing CC (US only, 18+): http://labs.google/cc
Noah Zweben@noahzwebenAI 评分5555引用Claude@claudeaiProjects now run from one conversation, starting in Claude Code. You describe what needs doing, and Claude directs parallel threads that keep working after you close your laptop. In beta today for select Pro and Max users in cloud sessions; coming to all Claude users soon.
Noam Brown@polynoamialAI 评分5151引用Dwarkesh Patel@dwarkesh_spNew episode with @polynoamial We talk about multi-agent, Navier-Stokes, and what the current explosion of maths progress tells us about what happens once you automate AI research. And we also discuss how we will know if the models are actually aligned before we kick off RSI. 0:00:00 – Multi-agent and Navier-Stokes 0:15:28 – How will AI firms work? 0:22:02 – What math progress tells us about recursive self improvement 0:40:22 – Hugging Face and alignment 1:01:18 – The internal/external model gap 1:08:34 – Chain of thought is degrading 1:14:12 – How will we know when alignment is solved?
Dwarkesh Patel精选AI 评分6969 Dwarkesh 对谈 OpenAI Noam Brown:Agent 集群、对齐与递归自我改进
Dwarkesh Patel 与 OpenAI 研究员 Noam Brown 对谈,涉及用 1 万个 AI Agent、1300 亿 token、88 小时求解 Navier-Stokes 千禧年大奖问题的工作。
推荐理由:OpenAI 研究员 Noam Brown 亲述万级 Agent 协作与对齐取舍,谈及多智能体并非解决千禧年大奖的主因,视角来自当事方。
Latent SpaceAI 评分4949 AINews:Yegge 关停 Gas Town,Databricks 用 GPT-6 Astra 后编码支出增 60%
Steve Yegge 关停了 Gas Town,并承认每月花数千美元订阅编码智能体,却只做出了 Gas Town 这一个项目。Databricks 向约 3500 名工程师铺开 GPT-6 Astra,其在高复杂度系统设计与长周期任务上"明确"优于 Opus 5 / Sol 5.6,但整体编码支出增加约 60%,公司为此设立专门的 Astra 子预算。
jietang@jietangAI 评分6161唐杰称,由 GLM-5.3 驱动的基础设施智能体用两周时间让 GLM-5.3-Flash 从首次在国内加速器上运行到承接全部生产流量,端到端吞吐提升 3.2 倍。
引用Z.ai@Zai_orgWe’re sharing how GLM-5.3 helped build and optimize the inference infrastructure serving GLM-5.3-Flash. The system went from its first successful run to production readiness in less than two weeks, with end-to-end throughput tripling relative to the initial baseline. The key was dense feedback: local correctness tests, execution traces, microbenchmarks, and end-to-end measurements that enabled targeted hypothesis testing rather than reliance on aggregate performance metrics alone. https://z.ai/blog/glm-built-its-inference-infrastructure
GitHub Blog · AI & ML精选AI 评分7878 GitHub 用 Copilot 将 Copilot agent runtime 迁移到 Rust
GitHub 用 Copilot 智能体将 Copilot agent runtime 从 TypeScript 完整重写为 832,378 行生产 Rust,共 128 个 PR,于 8 月 21 日完成。
推荐理由:作者以第一手移植经历拆解了 AI 智能体团队完成大规模重写的具体策略、会话数据和教训,方法细节对类似工程迁移有直接参考价值。
Google Developers BlogAI 评分5858 Google 与 Speakeasy 将 OpenAPI 客户端生成套件开源,支持 7 种语言
Google 宣布与 Speakeasy 合作,将 Speakeasy 的 OpenAPI 客户端生成套件以 AGPLv3 开源。此前 Google 用于生成 GenAI SDK(Interactions、Agents、Webhooks API)的闭源生成器在 2026 年 5 月被收购并突然关停,促使双方迁移到开源方案。
OpenRouter Announcements精选AI 评分6767 OpenRouter 教程:用 TypeScript SDK 构建可靠的工具调用 Agent 循环
OpenRouter 发布教程,演示如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据可独立运行。教程覆盖停止条件设计、按 toolCallId 返回结果、指纹计数拦截重复调用、models 参数实现有序模型回退,以及 Auto Exacto 默认按工具调用成功率重排提供商;并说明 MCP 只改变工具执行位置,循环控制仍是必要的。
推荐理由:教程给出了完整的停止条件、重复检测和模型回退实现,可用作自建 tool-calling 循环的参考骨架。
Anthropic Research精选AI 评分7575 Anthropic:Claude 四周内将 30 多个开源生物分子模型平均加速约 4 倍并开源代码
Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。
推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。
Claude BlogAI 评分4848 Balyasny 如何评估与治理 Claude Fable 5
Balyasny Asset Management 在数千个真实金融任务上评测 Claude Fable 5,Fable 取得 89.4% 对前代生产模型 86.1% 的成绩,在复杂规划、分析和智能体执行上表现最突出。该机构自建 BAMAgent 平台,已支持数千个自主智能体 7×24 小时运行,Fable 成为其规划与分析阶段的首选模型。
Claude Blog精选AI 评分7070 Claude Code Projects 改版:从文件夹到对话式协调多线程
Anthropic 宣布 Claude Code 的 Projects 改版,从文件夹形态变为对话式协调:Claude 会拆解目标、并行分配线程、审查输出并汇总结果,每个线程是一个独立的 Claude Code 云会话。
推荐理由:官方说明改版后 Projects 的线程协调、共享记忆和灰度范围,读者可据此评估它对多会话编码流程的改变。
OpenAI News精选AI 评分6565 OpenAI 推出 AI 驱动的广告体验
OpenAI 推出新的 AI 广告体验,包括 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。材料为 feed 摘要,未提供完整正文细节。
推荐理由:原文给出 Sponsored Agents、营销工具及 HubSpot、Shopify 集成等要点,读者可以了解 OpenAI 广告业务的初步形态。
Noah Zweben@noahzwebenAI 评分3636引用ClaudeDevs@ClaudeDevsHere's how our team uses Claude Tag for on-call: When an alert fires in Slack, Claude pulls metrics, diffs deploys, and checks flags. It finds a likely cause and proposes a fix, which we can approve and merge. Every minute counts, so we love that it starts right away!
Google Developers BlogAI 评分4949 Gemini Enterprise Agent Platform 上线 Agent Anomaly Detection 私密预览
Gemini Enterprise Agent Platform 推出 Agent Anomaly Detection 私密预览,这是一个基于推理的智能体监督与审计层,通过分析 reasoning traces、工具调用和执行流程识别行为异常、可疑意图与策略违规。
Mark Zuckerberg@finkdAI 评分4343ByteByteGoAI 评分2828 ByteByteGo 重启 Build with Claude Code 课程,报名 24 小时后截止
ByteByteGo 重启为期 2 天的 Build with Claude Code 强化课程,由曾培训 Meta 数百名工程师的 John Kim 主讲,9 月 16 日开课,报名 24 小时后截止。
Google DeepMind精选AI 评分7171 Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个实时语音对话模型,主打近实时推理与语音智能体。
推荐理由:官方给出两个新语音模型的定位分工和多项基准数字,读者可据此判断其适合规模化还是高复杂度语音任务。
Hugging Face Blog精选AI 评分6363 IBM Research 为 ALTK-Evolve 推出 Consistency Analyzer,将智能体一致性缺口从 24.4pp 降到 12.0pp
IBM Research 在 ALTK-Evolve 中新增 Consistency Analyzer 和一致性指南,用于衡量并改善智能体重复执行同一任务时的稳定性。
推荐理由:原文给出 Pass^k 与 Mean@k 的区别和一种只靠单条轨迹、无需标注的稳定性诊断方法,可将智能体一致性缺口缩小约一半。