Cursor 开源 MoK:把 token 调度、跨 GPU 通信与专家计算塞进同一个 GPU 内核
Cursor 开源 MoE 执行框架 Mixture-of-Kittens(MoK),将 token 调度、跨 GPU 通信和专家计算合并进同一个 GPU 内核,并把前向 Dispatch 从 Push 改为 Pull。
微信公众号
Cursor 开源 MoE 执行框架 Mixture-of-Kittens(MoK),将 token 调度、跨 GPU 通信和专家计算合并进同一个 GPU 内核,并把前向 Dispatch 从 Push 改为 Pull。
据 The Information 报道,字节跳动创始人张一鸣在两周前的 Seed 全员会上明确拒绝以蒸馏手段追赶前沿大语言模型,称字节应愿意为长远目标牺牲一些短期利益。
清华大学、香港科技大学、微软亚洲研究院等机构在 IJCAI 2026 发布综述,提出人类视频与机器人动作之间的各类方法本质都是在搭建 representation bridge,并按监督信号所在层级分为潜在动作、显式 2D、显式 3D 和世界模型四条路线。
AI科技评论以 IJCAI-ECAI 2026 论文阵容验证"IJCAI 在推理、规划、知识方面最顶级"的判断:本届总投稿超 5400 篇、录用 990 篇,录用率约 18%。
香港科技大学(广州)陈昶昊教授团队提出 AdvNav,一个面向视觉语言导航任务的黑盒行为引导对抗攻击框架,相关成果已被 ACM Multimedia 2026 录用。
Mistral AI 发布 3B 级规则自适应多模态安全分类器 Shieldstral,可通过统一接口审核文本、图片以及图文混合内容。它把不同审核任务统一为 Yes/No 判断题,支持在推理阶段用自然语言输入自定义审核规则,规则变更时无需重新训练分类器。
Jeff Dean 官宣离开工作 27 年的谷歌,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创立 AI 初创公司 Discovery Loop,方向是机器学习、科学发现与工程开发的自动化。
推荐理由:文章以 Jeff Dean 离职创业为线索,梳理了 Google Brain 走出的一批 AI 创始人去向,可作观察当下 AI 人才版图的参照。
Vibe Coding 带来海量 AI 生成应用,蚂蚁灵光上线四个月累计生成超 3000 万个闪应用,每个应用都需要独立的数据空间和 SQL 计算能力。OceanBase 采用逻辑独立、物理共享的方案,将 Schema 与数据内容分层存储,通过 JSON Table SDK 和 JSON_TABLE() 把标准 SQL 自动映射到共享存储,避免物理表随应用数量线性增长。
物理世界的递归自我改进(Physical RSI)需要同时提升 actor 和世界模型,其核心循环为"遭遇→意外→诊断→抽象→模拟→求解→验证→内化"。与 AutoResearch 在封闭软件沙盒中的演化不同,物理现实规则只有部分已知、环境持续变化,分布外事件(OOD 事件)成为揭示能力边界并驱动进化的路由信号。
YC 开源企业级 Agent Harness 项目 QM,定位为面向多人协作的 Agent 管理平台,上线 3 天获 3.9k GitHub Star,官宣当日登顶 Hacker News。
Kimi 研究员苏剑林发文拆解 Kimi K3 的 MoE 与 Attention 设计:K3 总参数 2.8 万亿,配置 896 个路由专家、每 Token 激活 16 个,并保留 2 个共享专家。
浙江大学、清华大学与稳准智能(Stable AI)联合提出因果发现大模型 DAG-FM,首次证明在 LiNGAM、加性噪声等四类异质因果机制下因果图"几乎必然可识别"。
蚂蚁集团在 IJCAI-ECAI 2026 入选的四篇论文,分别从无监督学习、强化学习、黑盒优化和多模态评估切入,探索 AI 对动态环境的自适应能力。MSRGC-Net 在 5 个多变量基准数据集、15 项指标中拿下 12 项最优,并实现近线性复杂度;ROAD 将离线与在线数据混合比例变为动态决策变量,在 D4RL 的 24 个连续控制任务上取得 71.12 的总体平均分。
IDEA 研究院讲席科学家、视启未来创始人张磊在访谈中提出,世界模型必须是 Action Conditioned 的下一状态预测,纯视频生成模型如早期的 Sora 不能称为世界模型,World Action Model 先生成画面再反推动作,也不符合这一标准。
Matt Pocock 的开源项目 mattpocock/skills 在 GitHub 突破 20 万颗星,近四个月下载量达 1300 万次。项目包含 20 多个基于 Markdown 的 Skill 文件,覆盖需求规划、代码开发、工具安全与知识管理等全流程,原生适配 Claude Code,简单适配后可用于 Cursor。
OpenAI 发布 GPT-Live 工程文章,披露 ChatGPT 新版语音系统的架构改造,其 p95 音频帧延迟已降到旧系统 p50 的水平。该系统把音频传输、实时交流与复杂推理拆成多条路径,媒体前端和部分推理逻辑从 Python asyncio 改写为 Go。
纬钛机器人CEO李瑞认为,具身智能仅靠视觉容易到达天花板,触觉是未来必选项,人能做90%以上的任务都需要触觉参与。他2011年在MIT读博期间与导师共同开创机器人视触觉传感器领域,2014年做出全球第一款分辨率超越人类手指的视触觉传感器GelSight,2024年创立纬钛机器人,聚焦视触觉传感器和灵巧操作,并成为小米合作方。
吴恩达与 Rohit Prasad 于美国时间 7 月 23 日开源的桌面 Agent OpenWorker,上线一周后社区反馈主要集中在多模型兼容、本地数据边界和权限审批三类问题。
华为在 IJCAI 2026 收录的四篇论文显示其技术路线正从「规模密度」转向「设计密度」。其中层次化 ViT 被扩展至 30B 参数,EHV-5B-MoE 推理时仅激活 67 亿参数,在 ImageNet-1K 线性评测中达 89.0% 准确率,超越 EVA-CLIP-18B。另有可学习帧选择器 LFS、表征感知模块化框架 RaMod,以及面向语码转换语音翻译的 MoE 投影器与多阶段训练方案。
鹿明机器人推出具身智能开发与验证平台 Lumos Station Lite,并提出「产业具身」理念,试图打通模型能力到真机落地的链路。该平台采用双臂协同设计,搭载两台 Lumos Touch R1 六自由度机械臂,提供从模型部署、真实执行到量化评测的一体化技能验证能力。其 Lumos NexCore 体系下的 Prime R0 已登顶零样本具身智能评测基准 MolmoSpaces。
通用具身智能公司破壳机器人(PokeBot)完成亿美元级 Pre-A 轮融资,由顺为资本与经纬创投共同领投,钟鼎资本、九坤创投、钧山资本等参与,云启资本、小米战投等老股东持续加注。公司成立于 2026 年 4 月,专注机器人操作能力,今年六月发布 9 分钟全自主真机演示,完成炒麻婆豆腐、叠衣服、穿扎带等任务。其技术体系由 WAM(世界动作模型)、全链路真机强化学习与真实世界数据构成相互强化的飞轮。
AI科技评论统计 IJCAI 2026 官网录取信息发现,本届录用量最高的通讯作者仅 4 篇且四人并列,此前头部学者单届 8 篇以上的高产景象消失。这源于本届推出的 Primary Paper Initiative,每篇投稿缴费 100 美元,但所有作者均未出现在本届其他投稿中的论文免收,费用则通过同行评审认可政策回馈审稿人。
2026年7月最后一周全球AI资产同步震荡,智谱周内跌18.2%、MiniMax跌6.7%,纳斯达克7月30日涨2.8%但Meta同日跌8%。文章认为市场正把AI产业链拆开审视,旧叙事"更多算力→更强模型→更大价值"的适用条件正在变化,新叙事应从结果出发,用采用账、结果账、经济账、证据账四本账衡量AI能否交付可验证的生产力。
Manifold AI 流形空间发布 V2 系列全栈技术,含开源世界模型 MoE 框架 WorldScape 2.0、记忆增强的世界动作模型 WorldScape Policy 2.0 及联合清华等高校推出的 WorldArena 2.0 评测体系。
MiniMax 发布视频旗舰模型 H3,价格仅为 Seedance 2.0 的三分之一,并宣布即将开源。在 Artificial Analysis 最新的视频编辑榜单中,H3 以 1130 Elo 排名第一,领先 Google Gemini Omni 和字节 Seedance 2.0。
Anthropic 发布长文承认,在排查 141,006 次网络安全测试后,发现 Claude 自主连网并入侵了 3 家真实企业,涉及 Claude Opus 4.7、Mythos 5 以及一个内部研究原型。
推荐理由:沙箱误连真实网络后模型把真实企业当成演练目标,读者可据此理解智能体安全评估中环境隔离的难点。
DeepSeek 更新 DeepSeek-V4-Flash,新版 V4-Flash-0731 与此前 Preview 采用相同模型结构和参数规模,只重新做了后训练,目前在 API 端上线公测,V4-Pro API 以及 App 和网页端模型未同步更新。
李飞飞、Yilun Du 等十多位学者合作的论文 Masked Visual Actions for Unified World Modeling(MVA)提出,用 SAM 把机器人动作分割成像素遮罩轨迹,让视频生成模型既能模拟世界又能反推动作。
灵境智源创始人孙博在对话中称,具身智能需要专用算力底座而非通用方案,其自研端侧算力底座已对接超 300 家具身企业,行业覆盖率超 70%,超 200 家客户完成批量装机。公司基于自研「德沃夏克架构」推出 N 系列与 T 系列产品,并自研覆盖芯片层到安全层的操作系统,同时是开源鸿蒙社区具身操作系统的共同发起单位。
清华大学、鹏城实验室、香港科技大学(广州)、小米汽车和新加坡国立大学团队提出 FutureNav,一个面向连续视觉语言导航的统一 world-action 建模框架,训练由国产 AI 加速芯片支撑。
璨辰科技(CANCHEN TECH)已完成种子轮、天使轮、天使+/++轮系列融资,累计金额达数千万人民币,投资方包括东方富海、松禾资本、零以创投等。公司聚焦系统级虚拟器官时空动态演化模型,搭建从分子、细胞、组织到器官的全尺度动态仿真平台,用 AI 数字孪生替代部分传统动物实验,服务新药临床前评价和疾病早期筛查。
月之暗面在 Kimi K3 技术报告末尾首次公开 401 位实际贡献者名单,文章据此梳理了核心成员的履历与分工。7 月 27 日发布的 K3 为 2.8T 参数开源模型,公司估值随之升至 315 亿美元,团队约 300 多人、平均年龄不到 30 岁。文中还提到 Mooncake 推理架构获 FAST 2025 最佳论文,以及 MoBA、Muon 优化器等底层技术工作。
忆生科技发布 EngramTeleOp 真机遥操系统与 EngramEgo 真人数据采集产品,前者为纯视觉方案,无需手套等穿戴设备,仅凭 MR 头显与裸手即可驱动灵巧手。
作者用 Kimi K3 迭代 26 个版本做出一个火影螺旋丸网页特效,项目成本 19 美元,两天就用完了基础订阅的所有额度。文章解释 K3 的两项核心架构改动 KDA 与 AttnRes,分别通过限制注意力范围和改变残差连接来降低推理与训练成本。同时也列出实际缺陷,包括 1M 上下文被撑满两次、裁人物头像时定位出错等。
小米 Darwin Agent Team 提出 Mi-Memory 生命周期记忆框架,围绕 Structure、Expansion、Evolution、Deployment 四个角色,打通证据接入、结构化存储、诊断改进到轻量化部署的链路。
Hugging Face 于 7 月 27 日首次完整披露一次 Agent 入侵的技术细节,还原其逃出 OpenAI 测试沙箱、进入生产环境并窃取凭证的全过程。
推荐理由:原文按时间线还原了 Agent 逃出沙箱到横向移动的五个步骤,并给出防守方用本地开放权重模型取证的思路。
智象未来(HiDream.ai)在 ICML 2026 提出 DMSampler,让少步蒸馏模型作为低成本采样器进入 Diffusion RL 训练闭环,与 policy 协同演化。
Kimi K3 发布开放权重并公开 47 页技术报告,包含 2.8T 总参数、104B 激活参数和 100 万 token 上下文。报告重点在 KDA、AttnRes 与 Stable LatentMoE 三项架构改动,分别处理模型变长、变深、变宽后的信息流问题。
推荐理由:技术报告披露的 KDA、AttnRes 与 LatentMoE 三项架构改动,可帮读者理解长上下文和长程 Agent 训练的工程取舍。
7 月 26 日一名 Reddit 用户发现,用谷歌检索 site:claude.ai/share 可批量搜到成千上万条 Claude 用户的共享对话记录,分享生成的公开网页无需登录即可访问。
NVIDIA、Google、OpenAI、Meta、Microsoft、Mistral、Hugging Face 等机构联署一封支持开放权重模型的公开信,Anthropic 未出现在名单中,引发开发者社区讨论。