衔远科技发布企业 Agent 评测基准 EnterpriseClawBench
衔远科技大观研究院发布企业 Agent 评测基准 EnterpriseClawBench,从真实企业工作会话中构建 852 个可复现任务,并人工审计出 120 个 Lite 任务子集。
按公众号阅读文章与观点
衔远科技大观研究院发布企业 Agent 评测基准 EnterpriseClawBench,从真实企业工作会话中构建 852 个可复现任务,并人工审计出 120 个 Lite 任务子集。
阿里云在 7 月 3 日飞天发布时刻正式发布「睿系列」,将内部三年落地的 28 类 AI 数字员工能力产品化,采用 RaaS(Result as a Service)模式交付可量化业务结果。
上海交通大学 ScaleLab、上海人工智能实验室联合百度智能云发布世界动作模型 AHA-WAM,用低频世界规划器与高频动作专家的双 DiT 异步架构降低机器人控制的推理延迟。
Cursor 在旧金山 Compile 大会上宣布与 Git 兼容的代码托管平台 Origin,面向由智能体完成大部分工作的场景设计,目前限候补名单、计划秋季正式发布。
ICML 2026 在韩国首尔开幕,共收到 23918 篇有效投稿,录用率 26.6%,清华大学黄高团队的《The Flexibility Trap》获杰出论文奖,Google DeepMind 2016 年发表的 A3C 论文《Asynchronous Methods for Deep Reinforcement Learning》获时间检验奖。
字节Seedance视频模型正在被好莱坞独立电影人和创作者采用,进入电影及长片制作流程。据《洛杉矶时报》报道,95分钟长片《Hell Grind》由15人团队用Seedance 2.0在两周内完成,AI奇幻剧集《骸骨编年史》单集平均观看量达300万。Artificial Analysis数据显示,Seedance生成视频加音频的成本约为每分钟9美元,低于Google Veo的每分钟24美元。
GPT-5.6 Sol 首批内测报告显示,英伟达首席工程师称其用 30 小时跑赢了 Opus 64 小时的 CUDA 加速效果,代码行数仅为 Opus 的 1/5。Sol 每百万输入 Token 5 美元、输出 30 美元,成本约为 Fable 5 的一半,但整体代码质量与体验仍略逊于 Fable 5。模型预计最近两天正式全量上线。
陈勇超在x平台宣布创立Apex Intelligence(超衍智能),主攻自主进化基础模型(Self-Improving Model),目标让大模型从复刻人类已有知识转向自主发现未知规律。他3月刚从哈佛和MIT博士毕业,8月将入职清华大学任助理教授,此前婉拒了DeepMind工作邀约。公司正招募首批核心成员,方向涉及Agent Harness、Agent Infra及机器人、芯片、生命科学等。
这篇 WorkBuddy 基础教程演示如何将 three.js 太阳系网页通过 tcb hosting deploy 部署到腾讯云 CloudBase 静态托管,并绑定自定义二级域名。
Linus Torvalds 在一场开源技术会议上表示,LLM 能帮助发现 Linux 内核的 bug,但生成的代码往往不能直接使用,补丁常是未修复底层问题的创可贴式修复。他认为 LLM 生成的幻觉 bug 报告仍会消耗维护者资源,目前还无法替代长期维护者的架构判断、工程经验与代码品味。对谈还谈到 Linux 7.1 的 486 支持移除、NTFS 子系统更新,以及 C 与 Rust 的取舍。
波士顿动力创立34年没有一年实现过盈利,技术登顶不等于商业登顶。今年上半年国内具身智能涌入460亿热钱、288起融资,头部5家公司分走171亿;2025年中国具身智能整机企业突破140家,人形机器人产品超330款,但真正在产线稳定运行、客户愿意续费的寥寥无几。
Slash 战略业务负责人 Nicolas Brilliante 用 Vibe Coding 做出一款脑腐射击小游戏,自称一周烧掉 81267 美元 AI Credits,游戏上线 48 小时吸引 6912 名玩家、累计游玩 8986 小时,并带来 3 家品牌主动询问广告合作,公司称其为平台带来 1 亿美元新增 AUM(属自报数据,未提供第三方验证)。
开源工具 pxpipe 把 Fable 5 的文本上下文渲染成 PNG 图片再喂给模型,借图片 token 按像素计价的差异,实测把端到端账单降低了 59% 到 70%。它本质是一个本地代理,拦截 Claude Code 请求,只压缩系统提示词、工具文档和较早历史等又长又密的内容,保留 ID、哈希、密钥和精确数字。作者提醒这是有损压缩,Opus 4.8 在图片化内容的逐字读取和词频统计上容易失误。
纳瓦尔·拉维坎特提出"判断力是最重要的技能",但AI正在系统性侵蚀这一能力。MIT研究发现,使用ChatGPT写作的小组大脑创造力相关α波和工作记忆相关θ波活跃度显著降低,且答案高度同质化;康奈尔大学研究显示AI辅助写作会抹平文化差异。当判断力被外包,知识工作者正沦为"判断力的无产阶级"。
Claude Code 团队成员 Thariq 发布《A Field Guide to Fable: Finding Your Unknowns》指南,认为驾驭 Fable 5 的关键技能是发现自己的未知数。
北京现代总经理李凤刚在独家对话中披露,公司2025年销量从2016年巅峰的114万辆锐减至21万辆,他将原因归结为新能源产品布局不足与全球统一标准带来的高成本。为此他开出三剂药方:出口反哺内销(2025年出口约8.2万辆、同比增长48%)、启动"星驰计划"重塑渠道,以及与宁德时代、Momenta、百度合作推进本土化研发。
罗福莉加入小米负责大模型 MiMo,孙天祥出任百度基础模型研发部负责人,姚顺雨 27 岁成为腾讯首席 AI 科学家,几位受关注的年轻 AI 人才在 2026 年走进大厂。基础模型时代算力与账单门槛陡增,MiniMax 招股书披露预期每月现金消耗约 2790 万美元,创业公司难以独扛。曾国洋等另一批人则留在面壁智能,继续押注端侧小模型。
AGI Bar 活动小程序正式上线,各类行业活动、场外投送、招聘和政策宣讲将通过该小程序同步。小程序支持一键报名、主办方自定义报名问题与 Markdown 导出,并将流水记账、发票合同、结案报告等流程 Agentic 化,所有记录可导出为 Markdown。该小程序开发历时 2 周、迭代 800+ 次,已通过 ICP 备案与信息审核。
上海AI Lab等团队提出ComAct(COM-as-Action)范式,让Agent直接生成COM代码操纵SolidWorks、AutoCAD等专业软件,而非模拟鼠标键盘操作。
Fable 5 二次开服后,网友用一条提示词就能复刻《塞尔达传说 荒野之息》《上古卷轴 5》《Minecraft》等经典游戏,耗时从 20 分钟到一两天不等,初代宝可梦仅用 1 小时推理加 8000 行代码生成 151 只精灵。
Anthropic 在最新演讲中表示已删掉 Claude Code 80% 的系统提示词,技术团队成员 Tariq Shihipar 称示例反而会限制新模型 Fable 5 的发挥,反映出大模型引导方式的变化。
腾讯混元与新南威尔士大学联合提出 E-GRM 框架,将模型不确定性作为算力调度信号,仅对困难样本投入完整 CoT 推理。在 MATH 数据集上,58% 样本走短路径,延迟从 3.8 秒降至 2.2 秒(-62%),FLOPs 从 23.7T 降至 15.7T(-49%),准确率从 75.1% 提升至 78.4%。
傅聪团队联合厦门大学提出生成式推荐框架 ManCAR(流形约束自适应推理),将多步推理重构为用户协同行为流形上的结构化导航,避免隐式漂移。实验显示自适应测试时计算带来 NDCG@10 最高 46.88% 提升,论文已被 KDD2026 接收,并在 Hugging Face Daily Paper 当日排名第二。
Spotify 工程副总裁 Niklas Gustavsson 与 Claude Code 创始人 Boris Cherny 对话,介绍 Spotify 约 2900 名工程师中约 73% 的 PR 可由 AI 生成,PR 提交频率提升 75% 以上,每天约 4500 次生产部署。
谷歌 GKE Labs 推出开源项目 OpenRL,为在标准 Kubernetes 集群上对 LLM 进行后训练和微调提供自托管 API。它通过并行运行多个强化学习任务提高 GPU 利用率,并支持在 Mac 上运行强化学习循环、指向 Kubernetes 集群或虚拟机上的训练 API。
中国信通院推出首个面向 AI Infra 运维的智能体评测基准 AISHPerf-智算运维智能体评测基准,无问芯穹作为重点技术支持单位参与建设,基于近百亿条真实运维数据抽象出 103 条评测用例。
用户通过 WorkBuddy 连接腾讯 Agent Mail,让 AI Agent 读取邮箱中的保单 PDF 并逐条分析报销条件、风险与流程。操作中需用 GLM-5.2 完成配置,因沙箱权限限制可能需多次浏览器授权。材料齐全时保险公司通常 3-5 个工作日完成报销。
影目INMO与WHL联合打造、王嘉尔参与设计并佩戴的AI眼镜Magic AI Glasses首批预定达5万台。沙利文《白皮书》显示,影目INMO以37.8%份额领跑中国AI+AR智能眼镜全渠道累计销量,并与雷鸟、Rokid构成第一梯队。其AIR3和GO3海外双线众筹均突破100万美元,零售网络已覆盖全国44个城市、500家门店。
开源视频制作系统 OpenMontage 在 GitHub 热榜持续霸榜,几天内涨到 15.4k stars,一度冲到 Top 1。它内置 52 个工具模块、12 条标准化视频流水线和 400+ 可组合技能,用户对 Claude Code、Cursor、GitHub Copilot 等编程工具说出需求,就能自动完成脚本、素材、配音、字幕到剪辑。
北京大学杨超教授领衔的团队已完成首轮过亿融资,正式布局物理 AI 底层基础设施赛道。杨超是我国首位 ACM 戈登贝尔奖得主,团队搭建起"高性能计算+物理仿真+AI"三位一体的全栈技术体系。该团队入场有望填补国内物理 AI 底层基础设施自主可控领域的空白。
埃森哲一段内部录音被曝光,其负责智能体AI战略的高管讨论员工AI用量过大导致账单失控,Token消耗的大头并非工程师写代码,而是非技术员工把PDF转PPT、转Markdown这类办公任务。
上海交大、马来亚大学、CMU、MBZUAI、KIT 和 KAUST 团队提出 VisNec(视觉必要性分数),通过对比看图与不看图两次前向的损失差衡量每条样本的视觉价值,被 ECCV 2026 收录。
蓝驰将于7月16日WAIC前夜举办Booming Night,只面向AI founder开放100张船票,参与者99%是AI创业者、1%是蓝驰。活动取消所有议程,设面具角色扮演、具身机器人和AI产品互动、小游戏与乱讲局等环节,去年首届曾有几百位founder戴面具参加。
Sowii 创始人冯威赫把 AI 藏进 NFC 蘑菇盲盒「一日一菇」,用户手机碰一下就能在 App 里看到秃秃的虚拟生活,硬件完全不带电、不插电。他明确砍掉聊天机器人形态,下一版将彻底去掉聊天框改为「便利贴」式异步留言,并倾向不做订阅制。秃秃抖音两个多月零投放做到近 130 万粉,早期无 AI 版本测试次留超 80%、30 日留存 50%。
阿里推出 QoderWork,新用户注册可免费使用 1 个月 Pro 版。中文处理用 DeepSeek-V4-Flash 即可,耗费仅 0.1X;复杂 coding 可选用 GLM-5.2 或 KIMI-K2.7-Code。
全球市值超万亿美元的七家科技公司全部在美国,欧洲一家都没有;市值超100亿美元的科技公司欧洲有48家,美国有206家。欧洲养老基金手握约3.4万亿美元资产,但配置给VC的比例仅0.1%,远低于美国的10%,导致创业公司面临"B轮死胡同",DeepMind、ARM、Skype等最终被美国买家收购。
Anthropic 被曝已进入定制 AI 芯片的早期研发阶段,正与三星电子洽谈制造合作,并接触微软和英国初创公司 Fractile。文章称 Anthropic 还挖来前 OpenAI 硬件团队成员 Clive Chan,此前它主要作为参与者使用 AWS Trainium、谷歌 TPU 和英伟达 GPU。
藏师傅的 PPT Skills 迎来大波更新,配合 Pencil 可一次性查看所有生成的 PPT 页面,并支持导出网页和对应编辑文件。AI 生成排版中的元素重叠、对齐不准等问题,可在 Pencil 中手动调整对齐、字体和重叠部分。
百曜科技发布全球首个基于 LLM-JEPA 架构的 AI 虚拟细胞世界模型 AURA CellOS,基于 3.905 亿个人类单细胞转录组训练,覆盖 40 余种人体组织、260 余种细胞类型,为目前公开报道中参数规模最大的单细胞基础模型。
工程师 Abdur Rahim 把 DeepSeek 在 6 月 27 日开源的 DSpark 移植到苹果芯片,做出 Mac 原生版本 mlx-dspark,支持 Gemma-4 12B 和 Qwen3-4B,输出与原模型逐字节相同。