跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

当前仅显示精选新闻

最新精选

第 41–60 条 · 共 798 条
10月1日周四
  1. 硅星人Pro · 微信公众号65

    Muse爆火后,谁能做出中国版个人AI智能体

    Meta个人AI智能体Muse上线13天下载量超250万、美移动端日活64.2万,OpenAI随后发布Dots回应,阿里、腾讯、字节及Manus均在推进对标产品。文章从业者的架构拆解指出Muse赢在产品与工程层而非模型,认为中国版Muse卡在权限和数据分散,短期更可能出现各生态自建的管家而非打通全部生活的产品。

    推荐理由:文章以入口、支付、生态、执行四项能力拆解Muse,并逐家评估国内大厂与Manus的差距和权限瓶颈。

  2. AGI Hunt · 微信公众号80

    谷歌 DeepMind 发布 Gemini 4 Argon,单次输出达 100 万 token 但编程偏科

    谷歌 DeepMind 发布新旗舰模型 Gemini 4 Argon,未带 Pro、Flash 后缀,单次输出上限从上一代 64K 提升到 100 万 token,介绍价每百万 token 输入 $2、输出 $10。

    推荐理由:作者汇总了官方跑分、第三方榜单和彭博社爆料,读者可以对照看到 Argon 各项能力的强项与短板。

  3. DeepTech深科技 · 微信公众号76

    Google 发布 Gemini 4 首款旗舰模型 Argon,18 项评测领先 12 项,先开放给网络安全团队

    Google 于当地时间 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,暂不面向普通用户,先通过 Fairwind 项目开放给受信任的网络安全防御机构。

    推荐理由:文章汇总了 Gemini 4 Argon 的基准成绩、定价和分阶段开放策略,并指出其在部分基准上仍有落后,便于比较各家旗舰模型差距。

  4. The Decoder79

    Google 发布 Gemini 4 Argon,追赶 OpenAI 与 Anthropic 但未取得明确领先

    Google 发布新旗舰模型 Gemini 4 Argon,是其七个多月来首款前沿模型,Artificial Analysis 测试中得 53 分,与 GPT-6 Astra (max)、Claude Fable 5.1 持平,但仍落后 Claude Opus 5.5 的 58 分。

    推荐理由:原文汇总了第三方测试与定价细节,指出 Gemini 4 Argon 缩小差距但未领先,且单价优势来自低 token 价格而非效率。

  5. AI前线 · 微信公众号75

    谷歌发布 Gemini 4 Argon,输出上限提升至百万 Token 并优先开放网络安全防御

    谷歌发布新一代模型 Gemini 4 Argon,输出 Token 上限从 64K 提升至 100 万,在 DeepSWE v1.1 取得 77.9%、LVBench 得分 91.7%、AutomationBench 以 51.3% 排名第一。

    推荐理由:文章汇总了模型跑分、内部工程案例和先向受信任团队开放的分阶段发布策略,能帮助读者了解能力之外的开放节奏问题。

  6. InfoQ · 微信公众号71

    Google 发布 Gemini 4 Argon:输出上限提升至百万 Token,已参与 80 万行内核代码迁移

    Google 发布新一代模型 Gemini 4 Argon,面向长流程软件工程、企业知识工作与网络安全防御,输出 Token 上限从 64K 提升至 100 万,初期每百万输入 Token 2 美元、输出 10 美元。

    推荐理由:梳理了 Gemini 4 Argon 的跑分、定价与分阶段开放节奏,读者可以据此评估其能力与实际可用性之间的距离。

  7. Aravind Srinivas69

    Perplexity 开放 Computer 邮件代理功能,任何人无需 Perplexity 账号即可使用,限时免费运行所有经邮件委派的任务。转发或抄送 computer@perplexity.com 即可启动,智能体在后台完成任务并保留邮件上下文,每个邮件任务作为普通会话可在网页和移动端查看,并带有与应用内任务相同的审计记录。

    引用Perplexity@perplexity_ai

    Computer now works in email. Send, forward, or cc computer@perplexity.com on any thread. Every email task runs as a normal session in Computer, viewable on web and mobile, with the same audit trail as any task in the app.

    推荐理由:作者以当事方身份说明开放入口和限时免费政策,读者可以直接据此试用并了解其邮件代理工作方式。

  8. LangChain Blog70

    LangChain 如何在 harness 中构建模型路由器,Open SWE 单线程中位成本降 64%

    LangChain 为其开源编码 Agent Open SWE 构建了模型路由器,在 973 条线程的 A/B 测试中,相比始终使用 GPT-6 Astra,中位成本从 $2.61 降至 $0.94(降 64%),PR 合并率无显著差异(29.2% vs 27.3%,p=0.49)。

    推荐理由:作者用自身 Open SWE 的 A/B 数据说明路由放在 harness 内的理由和成本收益,方法可迁移到其他多任务 Agent。

  9. Anthropic Research73

    物理学家 Schwartz 分享用 Claude 与 BootLoops 做跨领域定量科学的方法与成果

    物理学家 Matthew Schwartz 发文介绍一种 AI 加速科研的新思路:不再对抗模型短板,而是寻找适合当前 LLM 的 "Claude-shaped" 问题,并开源了定量科学计算工具包 BootLoops。

    推荐理由:作者复盘了寻找 AI 擅长问题并联合领域专家雕琢结果的完整方法,这套协作模式对科研用户可直接借鉴。

9月30日周三
  1. 阑夕69

    作者转述 Instinct 创始人 Noah Shinn 在 Patrick O'Shaughnessy 播客中的访谈要点。Instinct 投后估值超100亿美金,10万余邀请制用户经办的付款预计一年内超10亿美金,其中50%为旅行场景;三周内40%用户主动提交信用卡权限,此类用户留存率达80%。

    推荐理由:作者听完 Instinct 创始人首次播客访谈后蒸馏出核心数据与产品思路,读者可以据此了解 Personal Agent 的商业模式与用户行为细节。

  2. 晚点LatePost · 微信公众号72

    晚点调查:从 ZCode 上传数据事件到 AI 个人助理,用户数据的边界在哪里

    《晚点》复盘智谱 ZCode 默认上传用户 .git 项目历史的事件,涉事存储桶已删除、智谱道歉并向用户补偿 Token,并对比 xAI Grok Build 的类似行为。

    推荐理由:以 ZCode 和 Grok Build 上传事件为切口,拆解 7 款 AI 产品协议条款,帮读者理解 AI 个人助理时代的隐私边界问题。

  3. Founder Park · 微信公众号68

    Instinct 创始人 Noah Shinn 长访谈:无 App 的 Personal Agent 与 100 亿美元估值

    Instinct 创始人 Noah Shinn 在 Patrick O'Shaughnessy 播客中首次长访谈介绍其无 App 的 Personal Agent 产品,用户通过短信、电话和邮箱使用,无广告营销下每天增长 10%-11%。平台年化交易额已接近 10 亿美元,其中 50% 来自旅行,商业模式拟对交易抽成;使用 3 周后 40% 用户交出信用卡,交出敏感信息的用户留存率达 80%。

    推荐理由:访谈给出 Instinct 无 App 交互、信任数据和交易抽成模式等一手细节,读者可以了解 Personal Agent 的产品与商业化思路。

  4. Z Finance · 微信公众号67

    对话 Instinct 创始人 Noah Shinn:个人 Agent 需自研推理管线,商业模式终局是向商户抽佣

    Instinct 创始人 Noah Shinn 在访谈中系统阐述个人 Agent 路线。Instinct 于 2026 年 9 月 28 日完成 10 亿美元 C 轮融资,估值 100 亿美元,用户日增长 10% 至 11%,年化 GMV 超 10 亿美元且约一半来自旅行。

    推荐理由:创始人在首次系统性公开访谈中拆解了个人 Agent 的成本结构、安全架构与商户抽佣模式,提供了可对照的产品思路。