谷歌发布视频模型 Gemini Omni 1.1 Flash,文生视频榜单登顶
谷歌发布新视频模型 Gemini Omni 1.1 Flash,可读取最长 10 秒的前序视频上下文并在此基础上续写,单次延展 10 秒、累计视频长度最高可达 40 秒。
微信公众号
谷歌发布新视频模型 Gemini Omni 1.1 Flash,可读取最长 10 秒的前序视频上下文并在此基础上续写,单次延展 10 秒、累计视频长度最高可达 40 秒。
Anthropic 宣布推出硬件用 MCP 标准 MHS(Model Hardware Standard),让 Claude 等大模型驱动的智能体可以操作显微镜、机械臂、液体处理器、激光器等物理设备,目前已面向首批科研实验室和先进制造商开放研究预览。
阿德莱德大学吴琦团队提出最小接口探针(MIP),把 Claude Code、Codex 等 coding-agent 不做任何导航训练直接接到机器人上,在 R2R-CE val-unseen 随机抽取的 100 条路径上取得 78% 成功率,追平甚至超过用大规模数据专训的工业级导航模型,人类在该基准的成绩是 94%。
灵犀智涌机器人在 2026 世界人形机器人运动会工业场景赛「装配上料岗」赛项中纯自主完成搬运上架、拣选上料、物料装配三项任务,三项得分 84 分、65 分、21 分,计入 10 分专项扣分后以总分 160 分完赛,按企业维度排名全国前三。
Einsia 旗下 Navers Lab 发布新基准 SWE Refactor Bench,考核编码智能体对整仓库做技术栈迁移的能力,8 个前沿模型 26 种配置共 520 次尝试中只有 28 次通过全部三轮评测,成功率 5.4%。
Barret Zoph 在 𝕏 上宣布加入谷歌 DeepMind,据路透社报道其职位为研究副总裁,专注强化学习与后训练方向。他此前是 Thinking Machines Lab 联合创始人兼 CTO,2026 年 1 月被解除雇佣 58 分钟后回流 OpenAI 负责企业业务,五个月后再次离职,《The Verge》6 月 19 日报道 OpenAI 已确认其离职。
Claude Code 新增自动起草反馈报告功能,当工具持续失败或 Claude 意识到出错时,会通过 SendFeedback 工具生成草稿并保存在本地 ~/.claude/feedback/drafts/,用户可在发送前查看、编辑或批准。
香港理工大学 PolySmart Group 的论文 OmniColor 被 ECCV 2026 接收,提出统一多模态线稿上色框架,将控制信号分为空间对齐条件(线稿、颜色提示、近期历史帧)与语义参考条件(文本、身份参考图、长期历史帧),并设计双编码器、TRE 冗余消除与 AS-Gate 自适应门控处理条件冲突。
深至科技推出橙欣健康(Cx)、暖欣健康(Dx)、信欣健康(Px)三端产品矩阵,以双 Agent 架构管理乳腺癌患者,AI 承接 80% 以上低风险场景,中高风险信号推送医生复核。其 Cx 端已覆盖超 15000 名乳腺癌用户,次日留存 >70%,月增 3000+;某 TOP20 药企引入 Px 后患者依从性提升 22%。
斯坦福团队提出无需额外训练的通用验证框架 LLM-as-a-Verifier,让 DeepSeek V4 Flash 对同一任务生成 5 条候选 Agent 轨迹。
据 The Information 报道,英伟达已同意以 129 亿美元收购 Hugging Face,后者是全球最大的 AI 模型社区之一。Hugging Face 最近的年化收入超过 1.5 亿美元,129 亿美元相当于其八十多倍年化收入。原文认为英伟达真正看重的是 Hugging Face 背后的开放模型生态和开发者入口,并指出这笔交易若最终落地,平台能否继续保持中立会成为后续看点。
推荐理由:原文把英伟达押注开放模型生态、抢开发者与算力入口的逻辑串了起来,也点出平台中立性可能生变。
阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。
推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。
香港科技大学(广州)与腾讯 AI 平台部提出并开源 VibeWorlding,一个通过多轮对话、调用 MCP 工具、观察渲染反馈来自主构建和编辑交互式 3D 世界的多模态智能体框架,同时开源 VWE-Bench 评测基准、VibeWorlding-Gym 训练框架与 CLI 原型。
科沃斯在 2026 年世界机器人大会上发布开源机器人底座「八界」,把底盘移动、物体 6D 位姿计算、机械臂与夹爪控制等 45 项能力封装为 API 供开发者调用组合。八界支持 Linux 和 ROS 2、Python 与 C++ 双语言,线上开源社区已上线,苏州的八界开源智创空间同步落地,开发者可免费入驻。钱东奇称八界还需打磨一到两代产品,真正走进家庭乐观来看约需 3 年,悲观来看则需 5 年。
穹彻智能发布具身智能预训练模型 Noe-0,其预训练与后训练全链路均采用无本体采集数据,不依赖传统遥操作数据即可完成真实机器人任务执行。数据来自超 50 个城市、数十万小时、数十万种任务类型的真实操作记录,配套采集设备 RoboPocket 与 AI-native Data Engine 支撑数据生产。
OpenAI 公布首款自研推理芯片 Jalapeño 的测试结果,称在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个模型上,其能效与延迟表现优于 NVIDIA GB200、GB300 系统。
清华大学助理教授陈勇超联合 MIT、哈佛、CMU、中科大、微软研究院等十余所机构发布 ASI-Bench,一个衡量 AI 科学自主性的基准测试,首版含 60 道覆盖数学、物理、生物等 11 个领域的项目级任务。
面壁智能发布「前进四」顶尖人才计划,符合条件的顶尖技术实习生可在毕业前按当期估值提前授予期权,并担任明星项目核心技术骨干。截至今年8月,MiniCPM 系列全球下载量突破 4400 万次、GitHub 星标超 15 万,MiniCPM 已搭载三星旗舰机上市。今年5月发布的 ForgeTrain 是全球首个完全由 AI 编写、零人类代码介入的生产级大模型训练框架。
Mila、蒙特利尔大学、A*STAR、牛津、剑桥、清华等 16 家机构 22 位研究者提出 ComBodied Agents(伴身智能体),一种以人的长期状态与主体性为优化对象的 Agentic AI 新范式。论文给出人类状态感知、纵向记忆、个人世界模型(PWM)与干预规划四项能力构成的闭环框架,并提出 CombodiedBench 评测蓝图与 edge-native 本地优先部署路径。
a16z 合伙人 Martin Casado 称刚获得一个新模型访问权限,并称这将是今年最重要的模型发布。多条线索指向 Ilya Sutskever 创立的 SSI 的首款模型,Andrew Curran 提到有一家非头部实验室在持续学习上取得突破,但该消息尚未验证。SSI 于 2025 年完成 20 亿美元融资、估值 320 亿美元,7 月与英伟达达成合作并获得 Vera Rubin 硬件。
新加坡国立大学与牛津大学的研究者提出视频表征自编码器 V-RAE,以冻结的视觉基础模型作编码器,通过轻量级 temporal attention pooling 实现 4× 时间压缩,把预训练视觉表征直接用作视频生成的 latent space。
原方智能(Cirquar AI)正式启动,由南京大学 LAMDA 实验室博士生林浩鑫与机器人学院助理研究员唐开强共同创立,将世界模型确立为核心技术路线。公司称其技术积累源于 LAMDA 团队自 2018 年起围绕环境模型、因果世界模型和具身世界模型的八年研究,2026 年进一步提出 VLA-MBPO,在交互式世界模型中训练视觉—语言—动作模型。
OpenAI Codex 产品负责人 Tibo 在播客中确认,用于全局重置用户额度的按钮是真实存在的物理实体,他可在认为合适时随时按下。他透露 ChatGPT 与 Codex 将因未来模型需求而合并,不再区分技术用户与普通用户。他还称常规推理速度较三个月前提升约 60%,工具调用少的场景可获十倍以上提速。
NVIDIA 首次公布基于真实芯片的 Vera Rubin 性能测试结果。在 SemiAnalysis 的 AgentX 智能体代码推理工作负载上以 DeepSeek V4 Pro 运行。
华东师大智金院团队孵化发布金融原生 Agentic Foundation Model 家族 Mint-Agent,含 9B 的 Mint-Cu 与 27B 的 Mint-Ag。
斯坦福大学教授 Percy Liang 与 Marin 开放实验室启动 Marin 535B-A23B 模型训练,并全程公开训练过程。该模型有 5350 亿总参数、230 亿激活参数,准备 18.75 万亿 token 训练数据,部署 11 套 GB200 NVL72 约 792 颗 GB200 GPU,预计连续训练约 3 个月,总训练计算量约 2.7e24 FLOPs。
推荐理由:训练数据配比、实时 loss 曲线与实验日志全程公开,为观察前沿大模型训练过程提供了少见的一手材料。
据彭博社报道,英伟达已通知部分最大客户,搭载其AI芯片的服务器价格将上涨超过15%,预计2027年初生效,覆盖 Grace Blackwell、Vera Rubin 等旗舰平台,具体涨幅随芯片和内存配置变化。
PixVerse(爱诗科技)发布实时视频世界模型 R2,从 R1 的单句 Prompt 实时响应,升级为可持续稳定运行、支持多模态输入的交互世界。官方释放的内测 case 包括用 WASD 控制角色同时以自然语言改写剧情、临时召唤坐骑后仍能接回主线,以及数字人在讲话中接受文字和语音插话。
江行智能 CEO 庞海天在 2026 世界机器人大会具身智能商业落地论坛上,提出以"一脑多体"架构推动物理 AI 工业落地,技术体系由 JX-Phi Brain 决策中枢与 JX-Phi World 演进底座构成。
蚂蚁 AI 安全实验室与厦门大学联合提出 MedGuard,一个面向中文医疗场景的医疗事实核查与诊疗风险识别系统,论文已被 npj Digital Medicine 接收。
2026年「科学探索奖」揭晓,50位青年科学家入选,信息电子领域5人包括清华黄高、北大刘譞哲、清华钱学海、哈工大肖淑敏和郑大杨西贵。黄高是DenseNet主要提出者之一,其团队扩散语言模型研究获2026年ICML杰出论文奖;刘譞哲任北大—字节跳动豆包大模型系统软件联合实验室主任,团队参与提出DistServe推理系统。
清华大学赵明国团队联合字节跳动 Seed、中国农业大学在 Science Robotics 发表论文,提出视觉驱动的反应式足球技能学习框架,让人形机器人仅靠机载视觉完成找球、追球、调整步态和多方向射门。
开发者在 Anthropic API 中发现两个未公开模型代号 claude-marshmallow-eap 和 claude-melon-eap,后缀 eap 表明其处于早期访问计划阶段,仅对少量开发者开放。
香港大学、香港科技大学与腾讯 ARC Lab 联合提出 SCoPE(Sightline-Coordinate Positional Encoding),将视频 DiT 的位置编码从 (u, v, t) 张量网格改为相机射线空间,为每个视频 token 计算 Plücker 射线并注入 attention 的 query/key,新增参数不到原模型的 0.1%。
优必选在 WRC 2026 展出 Cruzr Y1、Cruzr S2、Walker C1 等机器人,用真机作业取代 Demo 演示,覆盖搬运、拆码垛、汽车上下料和物流分拣等场景。其 Thinker-VLA 端侧部署后推理效率提升 176%、存储用量降低 60%,GPU 显存需求从 64GB 降至 32GB,工业场景定位精度控制在 1mm 以内,物流分拣平均抓取接近 1100 件/小时。
曾借助 ChatGPT、Gemini 和 Grok 为患癌爱犬 Rosie 设计个性化 mRNA 疫苗的 Paul Conyngham 宣布,其新公司 Gamgee 获得 400 万美元种子轮融资,由 Founders Fund 领投,公司是 Y Combinator 2026 年夏季批次成员。
香港大学、香港中文大学、浙江大学与快手可灵团队提出世界模型评测基准 PlayWorld,用 Agent Player 操作模型完成长程目标,并已开源评测集和代码。该基准从几何一致性、交互保真度、视野外演化和视野内演化四个维度评测,共筛选 171 个样本、设计 820 余个问题。实验显示持续世界演化是最大瓶颈,SANA-WM 轨迹验证通过率达 80.4%,但四项 rubric 总体得分仅 1.48。
随着 LLM 从训练竞赛转入长期运行阶段,递归式自我改进(RSI)正取代「更大参数量+更多数据」的规模路径,成为头部实验室的核心战略方向。2026 年以来,BigBang-V1、HiSME、Soft-SVeRL 等「AI Build AI」工作开始让人工智能直接参与自身训练与改进,但按 Yampolskiy 的三级分类,这些「框架内优化」仍属「弱 RSI」。
普林斯顿大学刘壮团队发布 3B 文生图模型 i1,训练代码、模型权重与数据配方全部公开,其结论来自 300 多组控制实验和超过 70 万 TPU v6e 小时。
在第二届世界人形机器人运动会开幕式上,银河通用的网球机器人与网球冠军郑洁先搭档完成全球首场人机混合双打表演,随后进行全球首场人形机器人与人类运动员的网球单打。比赛由银河通用自研的具身智能大模型银河星脑(AstraBrain)支撑,机器人自主看球、判断落点、移动和挥拍,训练结合人类动作数据与虚拟网球环境,再通过 Sim2Real 迁移到真实赛场。