推荐理由:Codex 接入 Chrome 后可跨标签页并行运行,读者能借此了解浏览器内编码智能体的工作方式变化。
Agent 智能体
全部主题让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
最新精选
第 361–380 条 · 共 395 条@OpenAI@openai精选AI 评分6969 
@TencentHunyuan@tencenthunyuan精选AI 评分6969 


推荐理由:官方公布 Hy3 preview 上线两周后的 OpenRouter 用量与排名,可据此观察开发者对其的采用速度。
Google DeepMind精选AI 评分6767 Google DeepMind 发布 AlphaEvolve 一年成果汇总:从基因测序优化到下一代 TPU 设计
Google DeepMind 发布 AlphaEvolve 一周年成果汇总,介绍这款 Gemini 驱动的算法设计智能体在各领域的落地成果。
推荐理由:官方汇总了 AlphaEvolve 一年来在科研、基础设施和商业场景的具体成果与数字,读者可据此评估算法发现型 Agent 的落地范围。
Anthropic Newsroom精选AI 评分6363 Anthropic 发布十款金融服务智能体模板并接入 Microsoft 365
Anthropic 发布十款面向金融服务的开箱即用智能体模板,覆盖 pitchbook 制作、KYC 筛查和月末结账等耗时工作,以 Claude Cowork、Claude Code 插件及 Claude Managed Agents 的 cookbook 形式提供。
推荐理由:原文给出了十类金融智能体模板的构成与接入方式,读者可据此判断其在投研与合规流程中的落地路径。
Sierra Blog精选AI 评分6464 Sierra 发布 𝜏-voice 基准,在真实语音条件下评测实时语音 Agent
Sierra 团队推出 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工实时语音、可控真实音频结合,任务、工具和评估器与文本版逐字节一致,语音成绩可与文本 Agent 直接对比。
推荐理由:语音与文本能力可在同一套任务上直接对比,还给出了噪音与口音下各厂商的具体失败模式。
Claude Blog精选AI 评分6464 构建 Claude Code 的经验:提示词缓存决定一切
Claude Code 团队发文总结围绕提示词缓存构建智能体的工程经验,核心是提示词缓存按前缀匹配,前缀中任何改动都会使其后的缓存失效,因此要把静态内容放前面、动态内容放后面。
推荐理由:Claude Code 团队公开了围绕提示词缓存设计智能体的具体取舍,可迁移到自建 Agent 的提示词组织与工具管理。
Hugging Face Blog精选AI 评分8080 NVIDIA 发布 Nemotron 3 Nano Omni 长上下文多模态模型
NVIDIA 发布开源全能多模态理解模型 Nemotron 3 Nano Omni 30B-A3B,在 OCRBenchV2-En 得分 65.8、MMLongBench-Doc 57.5,并新增音频与视频理解能力。
推荐理由:原文列出文档、视频与音频榜单成绩及吞吐对比,读者可据此判断该开源全能模型的能力边界。
inclusionAI Hugging Face models精选AI 评分6464 inclusionAI 开源 Ling-2.6-flash,104B 总参数、7.4B 激活参数
inclusionAI 开源发布 Ling-2.6-flash,这是一个总参数 104B、激活参数 7.4B 的指令模型,面向高频智能体场景优化推理效率与 token 效率。
推荐理由:官方给出 104B 总参数与 7.4B 激活参数的具体配置和评测数据,可用于评估高频智能体场景下的推理成本与部署取舍。
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 开源 Ling-2.6-flash 模型,总参数 104B、激活参数 7.4B
inclusionAI 在 Hugging Face 开源 Ling-2.6-flash 指令模型,总参数 104B、激活参数 7.4B,主打推理效率与 token 效率。
推荐理由:模型以 7.4B 激活参数和混合线性架构给出推理吞吐与 token 效率数据,可供评估高并发 agent 场景的部署成本。
inclusionAI Hugging Face models精选AI 评分6161 inclusionAI 发布 DR-Venus-4B-SFT-GGUF,基于 Qwen3-4B 的深度研究智能体
inclusionAI 在 Hugging Face 发布 DR-Venus-4B-SFT-GGUF,这是由 Qwen/Qwen3-4B-Thinking-2507 微调而来的 4B 深度研究智能体,也是 DR-Venus 的监督初始化检查点。
推荐理由:用约 1 万条开放轨迹训练出 4B 深度研究智能体,并在多个基准上超过此前同规模开源模型。
inclusionAI Hugging Face models精选AI 评分6262 inclusionAI 发布 DR-Venus-4B-SFT 深度研究智能体模型
inclusionAI 发布 4B 深度研究智能体 DR-Venus-4B-SFT,基于 Qwen3-4B-Thinking-2507 在清洗后的开源 REDSearcher 轨迹上做智能体监督微调,最大训练长度 200K,使用 search 与 visit 工具。
推荐理由:给出 9B 以下开源深研究智能体的基准对比,读者可据此判断 4B 模型的深研究能力位置。
Claude Blog精选AI 评分6565 华盛顿大学 MacCoss 实验室用新开发者入职法让 Claude Code 接管 70 万行遗留代码
华盛顿大学 MacCoss 实验室的 Brendan MacLean 将17年培养新开发者的入职方法应用于 Claude Code,把 AI 上下文放入独立仓库 pwiz-ai,用 CLAUDE.md、技能库和 MCP 集成管理 70 万行 C# 的 Skyline 代码库。
推荐理由:原文给出维护17年、70万行C#代码库的上下文分层和技能库方法,对长期项目接入 Claude Code 有可迁移的参考。
OpenAI News精选AI 评分7171 OpenAI 模型、Codex 与 Managed Agents 上线 AWS
OpenAI 宣布 GPT 模型、Codex 和 Managed Agents 已在 AWS 上线,企业可以在自有 AWS 环境中构建安全的 AI 应用。
推荐理由:OpenAI 的模型、Codex 与 Managed Agents 上线 AWS,企业多了一条在自有云环境内构建 AI 应用的路径。
Anthropic Newsroom精选AI 评分6161 Anthropic 为 Claude 发布创意工具连接器并推出 Claude Design
Anthropic 发布一批面向创意工作的 Claude 连接器,可直连 Ableton、Adobe Creative Cloud、Affinity by Canva、Autodesk Fusion、Blender、Resolume Arena 与 Wire、SketchUp 和 Splice。
推荐理由:连接器把 Claude 嵌入创意行业既有软件,Blender 的 MCP 连接器还向其他 LLM 开放。
OpenRouter Announcements精选AI 评分6565 用 Agent SDK 构建自己的编码智能体 Harness
OpenRouter 发布教程,介绍用 create-agent-tui 和 create-headless-agent 两个 skill 在几分钟内搭建个性化的编码智能体。两种 skill 分别对应终端界面和无头模式,后者可用于脚本与流水线。
推荐理由:原文给出两个 skill 的用法,读者据此可在几分钟内搭出带终端界面或无头运行的编码智能体。
微信公众号(Wechat2RSS 自建)精选AI 评分8787 DeepSeek-V4 预览版发布并开源,1M 上下文成为官方服务标配
深度求索上线并开源全新系列模型 DeepSeek-V4 预览版,按大小分为 V4-Pro 与 V4-Flash 两个版本,1M(一百万)上下文成为其所有官方服务标配。
推荐理由:DeepSeek-V4 预览版把 1M 上下文设为官方服务标配,并同步开源 Pro 与 Flash 两个版本。
Hugging Face Blog精选AI 评分8080 DeepSeek-V4 发布:百万 token 上下文面向智能体任务
DeepSeek 发布 V4,Hub 上提供两个 MoE 检查点:DeepSeek-V4-Pro 总参数 1.6T、激活 49B,DeepSeek-V4-Flash 总参数 284B、激活 13B,两者均支持 1M token 上下文窗口。
推荐理由:原文拆解了 V4 面向长上下文智能体的注意力与后训练设计,可据此判断开源模型跑长任务时的成本变化。
@TencentHunyuan@tencenthunyuan精选AI 评分6666 引用OpenRouter (@OpenRouter)@OpenRouterThe new Hy3-Preview model from @TencentHunyuan is live for free on OpenRouter! It’s a 295B MoE model (21B active) with controllable reasoning effort. A cost-effective, practical model that performs strongly in coding agents and delivers comprehensive general capabilities.
推荐理由:腾讯混元 Hy3-Preview 上线 OpenRouter 并限时免费,读者可了解其 MoE 规模与可控推理强度设定。
Hugging Face Blog精选AI 评分6767 如何在 Chrome 扩展中用 Transformers.js 运行本地 Gemma 4 模型
Hugging Face 发布指南,讲解如何在 Chrome 扩展(Manifest V3)中用 Transformers.js 运行本地模型,并复现其 Gemma 4 浏览器助手的核心架构。
推荐理由:用一个已上线的浏览器扩展拆解 MV3 下的分层架构,可供搭建本地模型扩展时参考分工与数据边界。
Claude Blog精选AI 评分6666 Claude Managed Agents 内置记忆功能开启公开测试
Anthropic 宣布 Claude Managed Agents 的内置记忆功能今日起开放公开测试,智能体可跨会话持续学习。记忆以文件形式挂载在文件系统上,可导出、通过 API 管理,支持多智能体共享同一 store、权限分级、审计日志和版本回滚。Netflix、Rakuten、Wisedocs 等团队已在用例中称首过错误减少 97%、验证提速 30%。
推荐理由:官方公告给出记忆机制原理和企业用例数据,开发者可以据此评估是否用它替代自建记忆基础设施。