Harness Engineering:构建可靠 Agent 直播预告
7 月 15 日 20:00-21:30,阿里云张鑫、NoDesk AI 王仿与腾讯任磊达三位一线实践者将直播探讨 Harness Engineering 如何构建可靠 Agent。内容围绕 Context、Runtime 到 Quality Loop,拆解可靠 Agent 的工程体系,并分享各自实践与思考。
微信公众号
7 月 15 日 20:00-21:30,阿里云张鑫、NoDesk AI 王仿与腾讯任磊达三位一线实践者将直播探讨 Harness Engineering 如何构建可靠 Agent。内容围绕 Context、Runtime 到 Quality Loop,拆解可靠 Agent 的工程体系,并分享各自实践与思考。
红帽推出 Red Hat AI 3.4,围绕推理、数据和智能体治理三部分展开,其中 llm-d 分布式推理可运行在任意操作系统和任意 Kubernetes 平台上,不绑定红帽平台。
覆盖约6000名产品、工程、设计等岗位的年度《科技从业者情绪调查》显示,AI已改变几乎所有人的职业身份认同,仅3%认为未受影响,近50%感觉自己被增强,另有27%认为岗位正被重新定义、14%感到失稳、5%感到价值被削弱。
外媒报道白宫正考虑出台行政命令限制开源 AI,尤其针对中国公司开发的系统,相关讨论仍处于早期阶段。OpenRouter 数据显示 DeepSeek V4 Flash 每周处理约 5.3 万亿 Token 居首,Opus 4.8 约 2 万亿,但 Opus 4.8 平均每百万 Token 成本约为 V4 Flash 的 23 倍。
开源模型在 Token 流量上快速上升,但 Anthropic 等前沿模型实验室仍占据大部分模型支出。
Cursor 正在开发通用型 AI 智能体 Sand,已于 2026 年 6 月下旬在公司内部上线测试,目标接管回复邮件、管理短信、整理电子表格等日常琐碎任务,是其首款面向非开发者用户的产品,将与 Claude Cowork 竞争。Sand 尚未公布对外发布时间,而 SpaceX 此前宣布以 600 亿美元估值全股票交易收购 Cursor,预计今年下半年完成,可能影响其产品路线图。
阿里云在「飞天发布时刻」推出 AI 原生数据库服务 AIDBS,定位企业级 Data-Centric Agent 一站式开发与服务平台,支持 40 余种跨云、多模态数据源接入。
Block 将 Cash App 与 Square 工程组约 450 个 JVM 仓库合并为单一 monorepo,以解决 polyrepo 下的依赖版本漂移与跨服务不兼容问题。该 monorepo 目前每周支持约 8800 次构建,main 分支保持稳定,p90 CI 时间约 10 分钟。Block 还开发了定制 IntelliJ 插件、采用合并队列与共享 Gradle 插件来支撑规模。
蚂蚁集团医疗健康资深专家郭春晓在 QCon 2026 北京站分享了蚂蚁阿福医疗 Agent 从 0 到生产的工程化落地经验。针对医疗场景对确定性和循证推理的要求,团队以 Benchmark 加 Badcase 双循环驱动迭代,自动化评测耗时从 12 天缩短到小时级,大模型复读机问题从十万分之五降到万分之二左右。
Anthropic 再度延长 Claude Fable 5 面向付费用户(Pro、Max、Team、Enterprise)的免费使用期至 7 月 19 日,Claude Code 每周额度提高 50% 的活动也延长到同一时间。
PostHog 工程师用多个长时间运行的并行 Claude Code 会话,于 2026 年 5 月重写了其 SQL 解析器(由 Claude Opus 4.7 生成、Rust 编写),产出约 16K 行手写解析器代码和 5K 行工具代码,在生产环境查询中平均比旧的 C++ ANTLR 解析器快 454 倍,笔记本基准为 70 倍。
Model Context Protocol 团队的企业托管授权扩展已进入稳定状态,企业可通过身份提供商集中控制对 MCP 服务器的访问,终端用户登录一次即可访问全部已获批准的服务器。
观测云创始人兼 CEO 蒋烁淼在 InfoQ《C 位面对面》中提出,Agent 时代可观测平台应成为系统的统一上下文平台,并已推出 OWL、Obsy AI Copilot 和 Guance AI Agent Teams 三层能力。
Meta 发布 Muse Spark 1.1,一款面向智能体编程的多模态 AI 模型,由 Alexandr Wang 领导的超级智能实验室训练,并促使 CEO 扎克伯格时隔三年首次在 X 平台发帖。
前华为“天才少年”李博杰吐槽 DeepSeek 面试后被投资人杜均指控诈骗,称其创办的 Metagent 获 ABCDE Capital 150 万美元投资后违约,DeepSeek 未作回应。
ServiceTitan 首席 AI 工程师 David Stein 在 QCon 分享了其报告指标迁移项目:把任务拆解到可验证的粒度,再用验证器和上下文获取驱动的自愈循环让 Agent 自主执行,85% 的迁移工作由 AI 完成,剩余 15% 的复杂案例才需要工程师介入。
Hardwood 发布 1.0.0,其 close() 方法实现幂等,AvroRowReader 支持列投影;Endive 1.0.0 带来 WasmGC 主机集成与尾调用优化。
Anthropic 7 月 7 日宣布 Claude Cowork 扩展至网页端和移动端,首批面向 Claude Max 用户,执行环境迁到远程,合上电脑任务仍可继续并可在手机审批。
Elastic 开源了 Atlas,一个基于 Elasticsearch 为智能体维护情景、语义、程序三类记忆的系统,通过 MCP 与智能体集成并保持用户记忆相互隔离,问答评估中 Recall@10 为 0.89。
Decagon CEO Jesse Zhang 提出,开源模型承担了更多工作负载,但企业在前沿模型上的整体支出几乎没有下降。TechCrunch 引用的 Vercel AI Gateway 数据显示,DeepSeek 的 Token 处理量已升至第一、占其总流量三分之一以上,而 Anthropic 仍占该平台 AI 总支出的半数以上。
当地时间 7 月 10 日,苹果向美国加利福尼亚北区联邦地区法院起诉 OpenAI 及其硬件子公司 io Products,指控其通过挖走苹果员工、获取内部文件和接触供应商盗用商业秘密,案件编号 5:26-cv-07078。
推荐理由:诉状列出前员工下载千页机密文件、带零件面试等细节,可与上月 xAI 诉 OpenAI 被驳回对照看举证门槛。
Anthropic 发布研究论文《可言说表征在语言模型中形成全局工作空间》,称通过新的可解释性工具 Jacobian 透镜(J-lens)发现 Claude 内部存在一个规模较小、一次仅容纳几十个概念的 J 空间,概念在其中可被报告、调节和推理,而不必输出为语言。
多位安全专家在虚拟座谈会上指出,提示词注入、越狱和间接提示注入是当前最常见且危害最大的 AI 攻击方式,攻击者无需攻破模型,只需将恶意指令植入模型摄入的不可信内容即可劫持代理行为。AI 增强的大规模社会工程学攻击同样破坏力巨大,生成式 AI 使攻击高度个性化且可规模化,深度伪造语音已能诱导高管批准付款或重置账户。专家强调,AI 安全工程师需从代码安全扩展到数据、模型和代理安全,并掌握对抗性思维。
OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。
推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。
一项推理成本模型测算显示,自建 GPU 部署大模型的临界利用率约为 52%,低于该值自建反而比 API 更贵,而多数 AI 创业公司利用率仅 30%-50%。以 4×H100 部署 70B 模型为例,利用率从 80% 降至 30% 时每千 Token 成本从 $0.011 涨至 $0.045,涨了 4 倍。蒙特卡洛模拟显示 95% 置信度下临界点落在 48%-56% 之间。
Bun 项目于 2026 年 5 月借助 Claude Code,用 11 天完成从 Zig 到 Rust 的代码迁移,涉及超 100 万行代码变更、6778 次提交和约 50 个动态工作流。
推荐理由:Bun 借助 Claude Code 在 11 天内把 53 万行 Zig 重写为 Rust,文中给出多工作流协作方式与 16.5 万美元成本账,可供评估 AI 大规模重构的现实边界。
HeroUI(前身 NextUI)发布 v3,针对 React 和 React Native 从头重写,基于 Tailwind CSS v4 构建,包含超 75 个 Web 组件(21 个新增)和 37 个组件的全新 React Native 库。
InfoQ 极客传媒与 GMI Cloud 等联合出品的《中国 AI 产业核心要素出海发展白皮书》将于 7 月 10 日晚 19:30-21:00 直播预热,InfoQ 总编王一鹏对话 GMI Cloud 蒋剑彪、火山引擎周文、商汤马林。直播聚焦 Agentic Workflows 爆发下 Token 消耗百倍千倍增长带来的算力稀缺,以及 AI 应用出海高 ARPU 市场的生存路径。
蚂蚁灵波开源面向具身智能的视频生成基座模型 LingBot-Video,采用 MoE 架构,总参数 30B、单次生成激活约 3B,定位为机器人大脑的物理引擎。在北京大学联合字节跳动发布的 RBench 上,其总分 0.620,超过 Wan2.6、Seedance 1.5 Pro 和 Cosmos3 Super。团队称其为业界首款面向具身智能的大规模 MoE 视频基础模型,并开源供研究社区使用。
记忆张量 MemTensor 创始人熊飞宇在 QCon 2026 北京站分享了 MemOS 记忆系统的工程化实践,该系统通过分层架构统一管理明文记忆、激活记忆与参数记忆。MemOS 2.0 于 25 年 12 月发布,面向长程任务新增运行状态管理与记忆版本化能力,其开源框架在 GitHub 获 9.7k star,日调用量超 100 万次。
360 在 ISC.AI 2026 发布 AI 安全“倚天屠龙”能力:漏洞自动化挖掘智能体“图龙锋”和网络安全自动化防御系统“仪天阵”,并发起“磐石之盾”安全协作计划。周鸿祎称做中国版 Mythos 不能照搬美国路线,国产基模能力有差距,但可通过智能体 harness 补齐。图龙锋已累计挖掘漏洞 3432 个,其中 105 个高价值漏洞经监管机构确认。
由3名资深工程师组成的 Slopfix 推出专门清理由 AI 生成代码的服务,标准服务周期为一周、基础报价1万美元,最终费用按代码缩减目标的实际完成比例计算。团队在改代码前会与客户逐项梳理应用功能并形成质量保证检查清单,交付更小更易维护的代码库和包括 CLAUDE.md、代码检查规则、持续集成检查在内的工程护栏,并提供两周质保。
7月8日20:00,InfoQ 直播邀请华为 AI 开源生态总监黄之鹏、Inferact vLLM committer 莫梓峰、范式智能(第四范式)系统研发专家杨守仁同台,拆解 AI Infra 推理工程最前沿。直播聚焦多模态、长上下文与异构算力等核心挑战,探讨 AI Infra 下一阶段技术演进方向。
淘宝闪购高级技术专家邓立山在 QCon 北京站分享了一套可复制的 AI Coding 全栈实战方案,用 rules 承载硬约束、skills 打包业务流程与 spec,把业务逻辑与编码规范解耦以便推广。
TGO 杭州十周年庆暨 GTLC 全球科技领导力大会·杭州站于 2026 年 6 月 27 日举办,现场超 500 人参与,鲁肃、叶军、汪源、许式伟等近二十位嘉宾围绕智能体架构、组织转型与数据底座展开分享。汪源提出上下文工程已成智能体最大卡点,其自研 KRL 语言仅占原始格式 8% Token、问答准确率超 90%;许式伟建议企业为 AI coding 补足单元测试覆盖率。
Ralph Loop 创造者 Geoffrey Huntley 在播客中称软件开发已死,因为现在任何人都能用 Cursor 生成代码,真正的分野在于能否用 300 行代码构建一个 Coding Agent 并讲清架构。
InfoQ 文章梳理了 Karpathy 的 Loop 实验与 Hugging Face 工程师 Joel Niklaus 的研究,指出 Agent 性能提升往往来自模型外层的执行机制(Harness)而非模型本身。
阿里云在 7 月 3 日飞天发布时刻正式发布「睿系列」,将内部三年落地的 28 类 AI 数字员工能力产品化,采用 RaaS(Result as a Service)模式交付可量化业务结果。
上海交通大学 ScaleLab、上海人工智能实验室联合百度智能云发布世界动作模型 AHA-WAM,用低频世界规划器与高频动作专家的双 DiT 异步架构降低机器人控制的推理延迟。
Cursor 在旧金山 Compile 大会上宣布与 Git 兼容的代码托管平台 Origin,面向由智能体完成大部分工作的场景设计,目前限候补名单、计划秋季正式发布。