RoboDojo 发布具身智能评测基准,真机最强模型成功率仅 12.8%
曾推出 RoboTwin 的团队发布统一仿真与真机机器人操作评测基准 RoboDojo,含 42 个仿真任务、18 个真机任务,集成 30 个主流机器人策略。仿真榜第一的 Hy-Embodied-0.5-VLA 平均成功率 8.80%,真机表现最好的 π0.5 为 12.8%,人类专家则分别为 76.03% 和 100%。榜单还显示最强模型在开放语义任务上的成功率仅约 1.67%。
按公众号阅读文章与观点
曾推出 RoboTwin 的团队发布统一仿真与真机机器人操作评测基准 RoboDojo,含 42 个仿真任务、18 个真机任务,集成 30 个主流机器人策略。仿真榜第一的 Hy-Embodied-0.5-VLA 平均成功率 8.80%,真机表现最好的 π0.5 为 12.8%,人类专家则分别为 76.03% 和 100%。榜单还显示最强模型在开放语义任务上的成功率仅约 1.67%。
魔芯科技联合浙江大学潘云鹤院士、华为发布首个全栈基于国产NPU的实时交互世界模型MoWorld,推理速度超50FPS,部署成本仅为同规模GPU方案的30%。该模型为14B参数MoE架构,支持2000帧超长训练与推理、6自由度相机控制及1080P以上分辨率,近期将开源权重和代码并基于国产NPU超节点对外提供服务。魔芯科技近期完成亿元美金融资。
Lilian Weng 在博客中提出,递归自我改进(RSI)在近期很难靠模型直接重写自身权重实现,更可行的路径是优化环绕基础模型的 Harness 系统,即负责协调执行、规划、调用工具、管理上下文和评估结果的系统层。
马斯克预告 Grok4.5 将于明天发布,与 GPT5.6 同期亮相抢风头。原文未披露 Grok4.5 的参数量、benchmark 分数或可用性等具体信息。
OpenAI 前研究员田永龙(Yonglong Tian)已于近期加入腾讯,知情人士称其后续或将参与 VLM(视觉语言模型)相关研发。他此前在 OpenAI 担任 Member of Technical Staff,研究方向包括计算机视觉、视觉表征学习与生成式模型,2024 年 5 月从 Google Research 转入 Google DeepMind。
ICML 2026 于 7 月 7 日进入正会第一天,共接收 6352 篇论文,其中 Spotlight 论文 536 篇、Oral 论文 168 篇。
AI科技评论对 Hugging Face 上开源的 10B 图像模型 Boogu-Image-0.1 的 Base、Turbo、Edit 三个版本做了实测。在 Qwen-Image-Bench 上它以 53.58 分领先 20B 的 Qwen-Image-2512(52.06)和 80B 的 Hunyuan-Image-3.0(50.81)。
95 后何鋡威在华为、传音、拓竹历练后,于去年 12 月启动 AI 智能母婴硬件创业,项目 Coddie 要做从孩子 0 岁起持续积累数据的 AI 育儿大脑。其方案通过端侧 10-15 TOPS 算力与云端大模型联动,让 AI 识别宝宝状态后直接联动智能硬件完成安抚、喂养等动作,形成执行闭环。
IDC 2025 年调研显示,应用大模型及智能体的工业企业比例从 2024 年的 9.6% 升至 2025 年上半年的 47.5%,但一家千亿营收制造企业上万个智能体中仅 5% 产生业务价值。
智源研究院悟界·RoboBrain Orca Team 发布技术报告《Orca: The World is in Your Mind》,主张先让模型学习统一的世界状态表征,再从中读出理解、预测与行动能力,而非一开始就针对单一输出模态训练。
翁荔发布博客《Harness Engineering for Self-Improvement》,提出 AI 自进化更现实的路径并非让模型直接改写权重,而是先从模型外部的运行系统 Harness 开始。
7 月 7 日 Anthropic 宣布 Claude Cowork 开始扩展至网页端和移动端,首批面向 Claude Max 用户,执行环境从本地电脑迁移到远程基础设施,合上电脑任务仍可继续。
分析指出,自建 GPU 推理要便宜过 API,GPU 利用率必须超过 52% 这一临界点,而多数 AI 创业公司利用率仅 30%-50%,实际在亏钱。以 4×H100 跑 70B 模型为例,利用率从 80% 降到 30%,每千 Token 成本从 $0.011 涨到 $0.045。API 厂商靠 90%+ 利用率摊薄折旧,赚的是客户算不清利用率的信息差。
360 在 ISC.AI 2026 发布 AI 安全“倚天屠龙”能力:漏洞自动化挖掘智能体“图龙锋”和网络安全自动化防御系统“仪天阵”,并发起“磐石之盾”安全协作计划。周鸿祎称做中国版 Mythos 不能照搬美国路线,国产基模能力有差距,但可通过智能体 harness 补齐。图龙锋已累计挖掘漏洞 3432 个,其中 105 个高价值漏洞经监管机构确认。
由3名资深工程师组成的 Slopfix 推出专门清理由 AI 生成代码的服务,标准服务周期为一周、基础报价1万美元,最终费用按代码缩减目标的实际完成比例计算。团队在改代码前会与客户逐项梳理应用功能并形成质量保证检查清单,交付更小更易维护的代码库和包括 CLAUDE.md、代码检查规则、持续集成检查在内的工程护栏,并提供两周质保。
7月8日20:00,InfoQ 直播邀请华为 AI 开源生态总监黄之鹏、Inferact vLLM committer 莫梓峰、范式智能(第四范式)系统研发专家杨守仁同台,拆解 AI Infra 推理工程最前沿。直播聚焦多模态、长上下文与异构算力等核心挑战,探讨 AI Infra 下一阶段技术演进方向。
GPT-5.6 全家桶官宣本周四上线。原文未披露具体模型版本、参数规模或可用性细节,仅提到作者手握 Codex 的 4 次重置权。
北航、NTU、ETH 团队提出免训练扩散加速方法 MrFlow,采用低分辨率生成结构、像素空间超分、单步高分辨率精修的三阶段流水线,在 Qwen-Image 上把端到端生成时间从 49.32s 压到 4.77s、加速 10.35 倍,FLUX.1-dev 上加速 8.25 倍。
OpenAI 首席未来学家 Joshua Achiam 在 X 上宣布离职,将于 7 月 24 日正式离开这家待了 9 年的公司。他 2017 年以实习生身份加入,曾领导 Mission Alignment 使命对齐团队,今年 2 月该团队解散后转任首席未来学家。据 WIRED 消息,OpenAI 目前尚未宣布接替人选。
蚂蚁灵波发布面向复杂物理世界任务的通用VLA模型LingBot-VLA 2.0,并开源代码、技术报告和模型权重。其预训练数据达60000小时,由50000小时机器人轨迹数据和10000小时第一视角人类操作视频构成,覆盖20种机器人构型,数据规模较1.0的20000小时扩大至3倍。
美国商务部已放行 GPT 5.6 全面发布,OpenAI 宣布 GPT-5.6 Sol 将与 Terra 和 Luna 一起于本周四公开推出。放行前 OpenAI 与政府官员进行了追加测试和多次会面,测试由商务部下属的 AI 标准与创新中心(CAISI)完成,OpenAI 的技术专家目前仍留在华盛顿。
字节 Seed 发布 Agent 评测项目 EdgeBench,让 5 个前沿模型(Claude Opus 4.8、GPT-5.5、GPT-5.4、GLM-5.1、DeepSeek-V4-Pro)在 134 个任务上累计跑了约 38,000 小时,测量 Agent 浸泡在陌生环境后能变强多少。
字节、阿里、腾讯在AI上从追随硅谷巨头转向「基因驱动」,各自回归自身长板。字节重提「大力出奇迹」,把豆包做成超级AI App,近期开始卖会员;腾讯回到「左手微信、右手投资」,微信Agent预计下半年全面铺开,并投资了AI六小龙中的五家、DeepSeek首轮融资投了100亿元;阿里让千问转向交易,与淘宝天猫全域互通、接入飞猪高德等票务服务。
Anthropic 官宣将 Fable 5 延期 5 天至当地时间 12 号,并上线 Claude Cowork 移动端。
路透社7月7日援引三名知情人士称,DeepSeek正在自主研发面向推理场景的AI芯片,项目约一年前启动、目前处于早期阶段,已与芯片设计、晶圆代工和存储厂商接触。该芯片主要承担模型训练完成后的用户请求处理与内容生成任务,意在减少对英伟达、华为等外部供应商的依赖。DeepSeek未回应置评请求,芯片架构、制程工艺与代工方等信息均未公开。
Anthropic 研究团队用基于雅可比矩阵的可解释性技术在 Claude 内部发现名为 J 空间的机制,其作用类似神经科学中的全局工作空间,可让模型不写文字就默默推理。
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出图像生成模型 Muse Image,并同步预览了 Muse Video。
路透社消息称,DeepSeek 正在秘密开发一款自研AI芯片,定位是推理而非训练,项目约一年前已经启动,目前仍处于早期阶段。知情人士透露,DeepSeek 已与芯片设计公司、晶圆代工厂和存储器供应商展开接洽,近几个月还在不公开发布职位的情况下招聘芯片设计工程师。该公司2026年6月完成成立以来首轮外部融资约510亿元人民币(约74亿美元),资金用途包括自研AI芯片和扩建以国产芯片为主的算力中心。
Meta MSL 发布图像模型 Muse Image,同步开启视频模型 Muse Video 预览。Muse Image 在 Arena 文生图、单图编辑、多图编辑三项均列第二,Muse Video 位列文生视频第三。
歸藏把他为 Claude 文章配图调好的提示词做成开源 Skill guizang-material-illustration,用 Codex 调用 GPT-Image 2.0 生成带图内中文标签的解释图。
微软开始在Excel、Outlook中以自研MAI模型取代OpenAI和Anthropic的模型,每周已有数万条AI提示由MAI处理,这是其自研模型应用规模的首次曝光。消息称DeepSeek正开发面向推理任务的自研AI芯片,以减少对英伟达的依赖,项目约一年前启动,公司暂未回应。
数字生命卡兹克把斯坦福《人生设计课》的方法论做成一份可直接复用的 Prompt,通过分阶段提问陪用户设计人生。该提示词分看清现状、找到指南针、寻路、找到锚问题和制定奥德赛计划四个阶段,主线问题控制在 6 到 9 个,最终输出 8000 到 12000 字的《个人人生设计蓝图》。作者用 Opus 4.6 实测,并提到公司多名同事试用后的体验。
Fable 使用期延长到 12 号。原文未披露 Fable 的具体功能、版本或所属公司信息。
2026年招聘市场上,"熟悉AI工具优先""具备AIGC应用能力"已出现在越来越多岗位要求中,AI能力从加分项变为求职及格线。消费电子公司等企业开始安排三小时AI能力测试,全程录屏观察候选人如何借助AI工具完成方案任务;技术岗还兴起VibeCoding测试,考察提示词工程与调试纠错能力。AI初筛面试也已成为互联网大厂、外企、车企的标配。
2026年上半年A股日均成交额达2.74万亿,远超2025年全年的1.73万亿,但截至6月30日全市场5526只股票涨跌幅中位数为-15.4%,仅半导体光模块上涨。大机构上半年减持约1万亿,叠加美股半导体周期(费城半导体指数涨101%),资金集中涌入半导体,红利指数6月回撤12%。
虎嗅将在 WAIC 2026 期间发起「AI账本公开大讨论」,把关注点从 AI 能力转向 AI 收入。活动包括主会场 10 小时 6 场直播,追问从 Token 成本到组织重构的完整链路,并定向邀请二三十名企业 CEO 和决策层参加闭门夜话,主题为「谁在用 Token 赚钱」。
至简动力在苏州宣布完成首批百台 i7 Pro 工业具身机器人交付,并落成一条 CNC 智能化具身机器人产线,此时距公司成立不足一年。该产品定位开箱即用,客户可在一周内完成部署;首批最大客户绿的谐波测算,一台机器人综合使用成本与一名人力相当但可 24 小时运转,约一年回本。至简动力核心团队来自理想汽车,贾鹏判断行业仍处于 0 到 0.1 阶段,万台年交付才算真正的 0 到 1。
AMI Labs 联合创始人冯雁在 ICML 2026 首个特邀演讲中提出,AI 智能体从数字空间走向物理世界需要世界模型,并论证 JEPA 路线相较生成式世界模型在推理速度、参数量与鲁棒性上更具结构性优势。
Anthropic 发布论文《Verbalizable Representations Form a Global Workspace in Language Models》,称用 Jacobian Lens 在 Claude 神经网络中找到名为 J-space 的区域,对应神经科学的全局工作空间理论,是模型多步推理的关键。
网易智企副总经理肖钰妍指出,AI Native组织的关键不是人人会用Prompt或上线几个Agent,而是让AI进入流程、岗位、数据和指标体系。其内部实践中,技术支持Agent“懂鱼帝”沉淀近10万条FAQ、问题解决率超80%,排障Agent把单次排查从20分钟压缩到10分钟,案例生成Skill一晚产出120多份客户案例。