火山引擎钱世俊:如何为大规模 Agent 构建可观测与质量保障体系
火山引擎应用观测技术负责人钱世俊在 QCon 北京站分享了大规模 Agent 的可观测与质量保障实践,提出用统一观测底座解决业务应用、Agent 框架、大模型推理服务、云基础设施四层之间的链路断、语义断、因果断问题。团队自研采集器 OneAgent,在 200K QPS 下数据吞吐量约为 OTel Collector 的两倍,线上重载节点整体负载降低 50% 以上,部分极端场景性能提升近三倍。
按公众号阅读文章与观点
火山引擎应用观测技术负责人钱世俊在 QCon 北京站分享了大规模 Agent 的可观测与质量保障实践,提出用统一观测底座解决业务应用、Agent 框架、大模型推理服务、云基础设施四层之间的链路断、语义断、因果断问题。团队自研采集器 OneAgent,在 200K QPS 下数据吞吐量约为 OTel Collector 的两倍,线上重载节点整体负载降低 50% 以上,部分极端场景性能提升近三倍。
模型和编码工具正让原型开发变得廉价,Codex、Claude Code 等能在一两个晚上做出可演示产品,单纯拥有功能已难构成长期优势。文章主张把顺序倒过来:先确认客户要的结果,再找最小切口嵌入其工作流,并以咖啡渠道商接入协作系统主动提醒订货为例说明。壁垒来自客户数据、行业流程与交付经验,而非易被复刻的通用功能。
招商局狮子山人工智能实验室在 WRC 2026 首次公开亮相,依托自研 LiOS 端云协同基础设施演示柔性衣物自主折叠。LiOS 采用云侧、端侧、端云协同三层架构,支持模型参数扩展至百亿规模,其图传方案实现约 30ms 单向端到端延迟,较通用中继方案加速 2.1~6.9 倍。该实验室此前以自研 VLA 模型在 ICRA 2026 LeHome Challenge 中斩获全球第一名。
量子位面向 AI 产业、AI 财经、AI 产品三个方向招聘编辑、主笔、主编,岗位均为全职,工作地点北京中关村,校招接受实习且可转正。AI 产业方向关注芯片、AI Infra、云计算,AI 财经方向关注创投与财报,AI 产品方向关注 AI 应用与硬件终端落地。简历投递至 zhaopin@qbitai.com,需附科技行业代表作品。
厦门大学、上海创智学院、上海交通大学团队提出TennisVAR,通过事件解析与战术图推理,让多模态大模型在网球视频中还原多拍战术逻辑并定位关键击球证据。团队同时发布TRACE基准,含11189个回合视频、41485次击球事件和三级战术体系。在T-F1@8上TennisVAR达73.04,GPT-5.5零样本仅37.03。
百度在 AI DAY 发布文心助手任务引擎2.0,把任务规划、智能路由与长上下文记忆串成完整链路,并称这套高阶 Agent 能力完全免费。与之配套的搜索结果页新增 GUI 交互式答案,已上线2326个交互组件,覆盖 K9 数理化高频考点。
在2026世界机器人大会上,宇树科技创始人王兴兴提出具身智能大爆发的量化临界点,即机器人能在80%左右陌生场景中通过语音指令完成80%左右的任务。他还介绍正在预研的物理AI机器人自进化路径,用前沿大模型串联论文检索、代码生成、仿真训练、真机测试与评价反馈形成闭环。演讲中他展示了语音驱动的AI动作生成、会议室整理等演示,并提到最新一代轮足复合四足机器人Unitree As2-W。
跨维智能创始人兼 CEO 贾奎在 WRC 2026「物理 AI 引领者论坛」发表《Physical Token 经济学》演讲,提出以「单位可靠物理智能」衡量机器人的智能生产成本,核心指标是获取新能力的边际成本。
新加坡南洋理工大学 AutoMan Lab 团队以 F1 级别自动驾驶方程式赛车为平台,构建了以世界模型为中心的具身智能体架构,同时预测对手交互、自车动力学与可行运动范围。
Ship it Sunday 第 11 场黑客松以「Agent,得有点品味」为主题,现场票选出 7 个获奖项目。Tasto 用视觉风格库让用户先选审美方向再生成,楚门的世界让观察者 Agent 从多个 NPC 互动中筛选值得拍的片段,AnyTaste 用两个 Agent 把情绪翻译成菜单,Tina 输入法从语音中提取记忆并回填上下文。
事件管理厂商 Rootly 官宣取消长期执行的小 PR 规则,原因是 AI 智能体已承担大部分编码工作,旧规则不再适用。Rootly 转为衡量代码变更的故障影响范围,并构建内部 AI 代码审查器,为每个 PR 输出风险评估、标准化评分、置信度评分以及按严重程度分类的问题清单,只回答这个变更若存在缺陷会破坏哪些面向用户的功能。
开源框架 LLM-as-a-Verifier 发布 v0.2.0,新增 DeepSeek V4 Flash 验证支持与 Terminal-Bench 2.1 自验证基准,并冲上 GitHub 热榜第二。
闪极发布第二代 AI 眼镜 loomos L1,首发价 2699 至 2999 元,预计年底大规模交付。整机最轻 43 克,镜腿内置 258mAh 可更换电池,约 5 秒完成换电,折叠充电仓可额外提供 3 至 4 次充电循环。LoomOS 新增「主动记忆」,可将对话、手机通知、通话录音与日历整理成个人时间线,飞书和腾讯 WorkBuddy 也将接入。
硅星人上线 Demo Agent,创业者可让自己的 Agent 通过 skill 对接,完成项目介绍、回答追问并留下整理好的档案,同时保留真人直接沟通的“碳基入口”。该 Agent 由 Claude Code 负责开发实现,对话环节选用 DeepSeek,最终推荐、报道与投资对接等决策仍由真人负责。团队计划将通用部分开源,并把 A2A 交互用于 Agent 评估。
宇树科技在A股上市,股价较发行价涨超6倍,收盘总市值3418亿元,同时2026年Q1、Q2扣非净利润连续同比下滑。上市前宇树与DeepSeek签署战略合作备忘录,覆盖通用AI联合研发、通用机器人和AI大模型,DeepSeek获配93.34万股、耗资1.41亿元并锁定36个月。文章指出宇树人形机器人2025年销量5511台、位居全球第一,但落地集中在科研、租赁和二开群体,具身大模型仍是短板。
Moderna 与默沙东的癌症疫苗在 III 期临床中首次取得成功,Moderna 股价翻了 3 倍。文章由此展开,认为癌症正在从随机难测的命运变成可测序、可计算、可编码的信息,人的身体也逐渐成为一种可被计算的信息系统。文中还提到,前几天有研究者让 AI 去设计病毒并取得成功。
无界动力自研具身通用大脑 MWA™ 在斯坦福等发起的 RoboCasa GR1 TableTop 榜单上霸榜全球第一,该大脑采用"隐空间世界模型+强化学习"双轮驱动,而非主流 VLA 直连路线。
DeepSeek Harness 在发布第 7 天迎来版本更新,增强多模态支持,DeepSeek 模型适配器可配置启用原生图片请求,但 DeepSeek v4 尚未发布支持视觉的版本。
Anthropic 公布实验,Claude 从头设计 1320 个蛋白质候选,354 个成功结合,15 个靶点拿下 14 个,最高命中率 35.1%,而该领域典型命中率通常为 10%~15%。
文章认为中美科技产业正在互换融资剧本:美国 AI 基建复制中国地产年代的影子银行模式,中国则重演纳斯达克式的 IPO 循环。
特斯拉车机已陆续推送豆包大模型,可提供实时信息与自然对话,需开通高级车载娱乐服务方可使用。宇树科技登陆科创板首日收涨460.34%,总市值3417.7亿元。李彦宏在百度Q2财报电话会上称,有信心加快AI迭代,让文心重回基础大模型第一梯队。
一家不到40人的公司AI渗透率接近100%,财务、HR、法务、商务等岗位均用Agent搭建流程工具,但员工数量反而增加、办公室再次不够用。创始人主张百人以内公司慎设AI中台,采用“薄中台、厚一线”结构,让业务人员自己用Codex、Claude Code等解决贴近业务的问题,并强调数据沉淀与治理比Agent本身更重要。
DeepSeek Harness 放出 RC.8 版本更新,距 RC.7 发布仅两天,覆盖多模态输入、子代理、工具调用、Windows 终端与底层存储等多个方向。
北京大学与微软亚洲研究院提出 Bernoulli-Continuation Policy(BCP),冻结基座 VLA、仅训练 16.4M 参数的轻量级 head,把「执行多久」拆解为一系列「继续执行还是重新规划」的伯努利决策,并用 GRPO 从轨迹级结果优化。
DeepSeek Harness 发布 RC.8 版本,DeepSeek 模型适配器支持配置启用原生图片请求,/goal、/plan 等命令可接收图文输入,@ 菜单支持引用文件和会话。
Moderna 与默沙东宣布个性化 mRNA 癌症疫苗 intismeran(V940/mRNA-4157)三期试验 INTerpath-001 在无复发生存期和无远处转移生存期两项主要终点上取得阳性结果,Moderna 股价单日涨超110%。
推荐理由:材料给出三期试验的入组规模与双盲设计,读者可据此了解AI在新抗原筛选环节承担的具体工作。
Cursor 的 Git 存储团队工程师 Vicent Marti 发表长文《任意规模的 Git》,介绍 Cursor 自研的 Git 存储系统 Continuity(Cnt),把仓库的事实来源从本地磁盘转移到 S3 上的预写日志,在保持完全一致的前提下实现水平扩展。
文章提出,文明长期受限于人的寿命、记忆与理解能力,文字让知识脱离肉身得以跨代积累,但如今知识总量已庞大到抵达前沿所需的学习时间可能超过人的一生。作者认为 AI 让人类无需完整掌握此前全部知识即可参与前沿探索,大量思考、理解、推理、组合与试错可由机器完成,知识第一次能在脱离人的情况下继续生长。
银河通用在 WRC 论坛首次发布双足人形机器人 Galbot ET1,搭载自研全身全手端到端具身大模型 AstraBrain,其中通用小脑 AstraBrain-WBC 1.0 负责将运动意图稳定映射为全身动作,AstraBrain-Agent 负责理解与决策。
硅谷科技公司正集中清理AI生成的劣质内容。Spotify 去年删除 7500 万条垃圾曲目,谷歌研究人员六个月内清除了 YouTube 上 13 万个低质量频道,TikTok 已自动标记超 30 亿条 AI 生成视频并因违反 AI 政策删除超 37.7 万条视频。领英、Pinterest、Substack 等也推出举报按钮或 AI 检测工具应对这一由自家 AI 工具催生的内容泛滥。
8月18日美国30年期国债收益率一度升至5.338%,创2007年6月以来新高,日本10年期国债收益率同期升至2.95%、创1996年以来新高。长端利率高企直接压制成长股估值,而美股标普500和纳斯达克今年仍保持两位数涨幅,尚未出现匹配调整。妙投认为,叠加AI巨额资本开支回报跟不上投入,市场需要一次深度调整来挤出高估值泡沫。
宇树科技8月19日登陆科创板,发行价150.80元/股,开盘报1100元/股、较发行价上涨629.44%,总市值一度达到4449亿元。IPO前美团系合计持股9.6488%,按开盘市值计算账面价值一度接近386亿元;红杉中国2019年12月以1500万元投资、对应投后估值仅1.5亿元。发行价下一签500股需缴款7.54万元,若中签者在开盘即卖出,一签可盈利47.46万元。
智谱创始人、清华大学教授唐杰在X发帖提出,大模型已不能只靠参数量理解Scaling,还需同时看用了多少数据、算力花在哪里以及模型由谁在什么条件下运行。他复盘了从Kaplan到Chinchilla、再到把推理成本纳入账本的几次转向,认为早期万亿参数竞赛是一段后来折返的岔路。
星尘智能在 WRC 首次亮相最新一代绳驱人形机器人 T1,起价 8.99 万元,并展示由基座模型 Lumo-2、星尘 AOS 操作系统与绳驱本体组成的全栈能力。
虎嗅AI100第八期闭门会上,酷哇科技彭湃、千寻智能郭俊良、光轮智能廉和、刻行时空郑宇靖与虎嗅陈伊凡对谈具身智能数据问题,提出5个判断:百万小时数据量暂时无法验证也无法证伪。
字节跳动大模型部门 Seed 于上周完成组织调整,Seed Foundation Model 成立四个新一级部门:Pretrain Data(负责人李成刚)、Horizon RL(唐晟宇)、Product Posttrain-Work(秦禹嘉)和更名后的 Product Posttrain-Chat,负责人均向吴永辉汇报。
鹿明机器人推出 NexCore 平台,将模型封装为机器人技能,打通数据采集、治理、训练、技能生成、评测到部署的完整闭环。该平台支持本地部署并兼容非鹿明生态机器人,让工厂自行开发专属技能。鹿明与三菱电机从 PLC 质检起步,逐步拓展至推料箱、打螺丝、搬运等任务,后者由客户转为投资人。
宇树以 150.80 元发行价上市,开盘报 1100 元、涨幅 629.44%,总市值一度达到 4449 亿元,从 IPO 申请获受理到敲钟用时 152 天。王兴兴在上市当天提出「物理 AI 机器人自进化 V1.0」,设想由 AI 自动检索论文与开源代码、生成训练代码,再经仿真与真机训练测试、评价反馈形成闭环。
扣子桌面版上线,为 Agent 提供与用户、项目共用的云盘空间,电脑里的文件修改后内容会自动同步回云盘,Agent 可读取资料与 skill 并输出文件。该版本还带来本地文件处理、深度截图和手机遥控三项能力,深度截图通过 mac 辅助功能接口读出窗口界面结构树,把截图与结构文字一起送进输入框,免费版容量 4GB 并支持扩容到最大 20T。
据 The Information 报道,Anthropic 正为 CEO Dario Amodei 和其他联合创始人准备一类拥有额外投票权的股票,目的是上市后创始团队不被外部股东左右。Dario 目前仅持有约 2% 股份,七位联合创始人每人比例大致相当。公司还通过 Class T 股票让长期利益信托可选举七人董事会中的多数成员,与创始人投票权形成平衡,IPO 最快可能在今年 9 月底启动。