Cursor 开源 MoK:把 token 调度、跨 GPU 通信与专家计算塞进同一个 GPU 内核
Cursor 开源 MoE 执行框架 Mixture-of-Kittens(MoK),将 token 调度、跨 GPU 通信和专家计算合并进同一个 GPU 内核,并把前向 Dispatch 从 Push 改为 Pull。
按公众号阅读文章与观点
Cursor 开源 MoE 执行框架 Mixture-of-Kittens(MoK),将 token 调度、跨 GPU 通信和专家计算合并进同一个 GPU 内核,并把前向 Dispatch 从 Push 改为 Pull。
据 The Information 报道,字节跳动创始人张一鸣在两周前的 Seed 全员会上明确拒绝以蒸馏手段追赶前沿大语言模型,称字节应愿意为长远目标牺牲一些短期利益。
腾讯多模态 RL Infra 负责人朱文熙将在 AICon 深圳站分享 UniRL 统一多模态 RL 框架,通过 Role/Worker 分离架构、Bitwise 训推一致性和自研 FalconGEMM 算子实现端到端性能优化。
Anthropic 详解 Claude 在 Web、Claude Code 和 Claude Cowork 中的安全隔离架构,核心观点是 Agent 安全不能只依赖权限确认或模型自身机制,而要靠文件系统、网络和执行环境建立确定性边界。
腾讯、百度智能云与 Cloudflare 专家在 InfoQ《极客有约》X AICon 直播中指出,Agent 已从 demo 进入生产环境,风险从“内容对不对”转向“行为可不可控”,提示词注入、工具滥用与过度授权成为主要隐患。专家建议企业第一步做到可视、可管、可追溯:先盘点 Agent 的身份、工具、数据与通道,权限从最小开始并配保底策略,全链路打 log 以便溯源。
OpenCode 工程师 dax 发帖讨论 DeepSeek 即将涨价,他认为当前服务负载过高,涨价更像是压低需求的流量调控手段,而不是因为亏钱。
Anthropic CEO Dario Amodei 内部担忧新员工加入是为钱而非使命,引发全网嘲讽,网友指其开出 AI 界最高薪却抱怨此事,与其反开源立场自相矛盾。有知情人士称部分初级、中级工程师在 Anthropic 可拿到 200 万美元,主要来自股权增值。AI 研究员在 OpenAI、Anthropic、Meta 等巨头间频繁流动,苹果上月起诉 OpenAI 及两名前员工窃取商业机密。
Seedance 2.5 的 API 正式上线,作者结合自己的使用和对多位 AI 视频创作者的访谈,分析了它相比 2.0 的改变。2.5 原生支持生成 30 秒视频,可一次参考 30 张图片、10 段视频和 10 段音频,支持时间戳级编辑和白模参考,指令遵循更强也更可控,但需要更具体的 Prompt。
清华大学、香港科技大学、微软亚洲研究院等机构在 IJCAI 2026 发布综述,提出人类视频与机器人动作之间的各类方法本质都是在搭建 representation bridge,并按监督信号所在层级分为潜在动作、显式 2D、显式 3D 和世界模型四条路线。
海淀发起百年京张 AI 创新带城市设计开源征集,把京张铁路沿线 43.6 平方公里的城市规划任务开放给 Agent,通过 GitHub 提交方案,8月31日截止,9月公布结果。
openJiuwen 开源 AI Agent 平台发布企业级分布式蜂群架构,将 JiuwenSwarm 蜂群能力扩展到企业级分布式集群,并内置与昇腾、鲲鹏算力基础设施亲和的算力亲和设计。中国邮政储蓄银行已基于该架构构建金融领域蜂群智能体平台并投入生产环境,成为分布式蜂群架构首次落地企业级生产环境。该平台已全部开源。
Keep 借 88 全民健身日推出「超级AI会员」,主打 AI 语音互动跑:跑步中可直接提问,AI 结合实时状态判断节奏,并调用节拍器执行,还能切歌,但拒绝点外卖等越界请求。该会员面向需要个性化安排、实时判断和持续陪伴的用户,与提供课程和工具的普通会员并存。Keep 自研运动健康大模型 Keepace.ai 已于今年 4 月亮相,覆盖课程生成、运动问答和数据解读。
AI科技评论以 IJCAI-ECAI 2026 论文阵容验证"IJCAI 在推理、规划、知识方面最顶级"的判断:本届总投稿超 5400 篇、录用 990 篇,录用率约 18%。
香港科技大学(广州)陈昶昊教授团队提出 AdvNav,一个面向视觉语言导航任务的黑盒行为引导对抗攻击框架,相关成果已被 ACM Multimedia 2026 录用。
HAMi 于 7 月 2 日通过 CNCF 技术监督委员会评审,正式进入孵化阶段,项目已被数百家企业直接或间接采用。HAMi 是异构 AI 计算虚拟化中间件,把整张 GPU 切分为可隔离、可调度的细粒度资源;据张潇介绍,部分推理场景中企业原有 GPU 利用率不足 20%,采用开源 HAMi 后提升至 40% 至 50% 左右,企业产品目标接近 70%。
一份流出的DeepSeek股权投资材料声称,未发布的V4-Pro编程性能仅比Claude旗舰低0.3%,DeepSeek Harness团队负责人崔添翼在社交平台调侃“也不能说完全是瞎编,对吧?
SpaceX 宣布与英伟达合作,联合设计名为 Starmind AI1 的天基 AI 计算卫星载荷,搭载 NVIDIA Rubin GPU 和 Vera CPU。
OpenAI 将 ChatGPT 免费版默认模型换成 GPT-5.6 Luna,Chat 模式不再限制聊天次数,本周内陆续推送。
2026年8月5日,在 Google 工作27年的 Jeff Dean 与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 一同离职创办 AI 科研公司 Discovery Loop。
推荐理由:文章把 Google AI 三年组织调整与人事变动串成一条线,便于理解 Koray 接掌模型业务背后的权衡。
SkyPilot 结束隐身,宣布完成 2000 万美元种子轮融资,由 Lux Capital 领投,Coatue、Amplify Partners、Foundation Capital 等参投,个人投资者包括 Jeff Dean、Clem Delangue、Ali Ghodsi。
同济大学任捷量子声子学与量子人工智能课题组提出无监督 AI 框架 TFCAD(时间波动复杂度放大距离),仅凭可观测量子时序数据即可自动划分量子动力学相,无需物理先验知识。该成果发表于《Physical Review E》2026年6月刊,在五大量子体系上验证了分类优越性与鲁棒性,代码与理论公开于论文补充材料。
华尔街对冲基金 Point72、Citadel、Millennium 遭 AI 语音克隆入侵,攻击者通过监听通话模仿声音、语调和措辞,诱使员工泄露账户信息或授予系统访问权限。
月之暗面Mooncake与NVIDIA CMX共同指向一个趋势:推理状态正成为AI基础设施的一级资源,存储进入Token生成实时主链路。
由国内外二十多所高校与研究机构联合发起的 Agent Memory Leaderboard(AML)正式发布,并启动首届 Agent 记忆挑战赛,报名于 2026 年 7 月 29 日开放、8 月 7 日截止提交,8 月中旬放榜。
OpenAI 在 ChatGPT 中推出 GPT-5.6 Sol 和 GPT-5.6 Luna,付费用户的 Sol 侧重事实准确与回答克制,免费和 Go 用户默认模型将升级为 Luna。
OpenAI 更新 ChatGPT,免费用户和 Go 用户的默认模型换成 GPT-5.6 Luna 并获得无限文本对话权限,Plus 和 Pro 用户即日起可用 GPT-5.6 Sol。
大语言模型推理同时撞上容量墙和 I/O 墙,SSD 正从模型文件的静态存放设备进入推理实时数据路径,成为 HBM、VRAM、DRAM 之后的正式存储层级。英伟达 2026 年推出 CMX 上下文内存存储平台,在 Vera Rubin 中增加面向 KV Cache 优化、由 BlueField-4 管理的以太网闪存层级。
OpenAI 更新 ChatGPT,免费用户和 Go 用户默认模型换成 GPT-5.6 Luna,并获得无限文本对话权限,Plus 和 Pro 用户则可使用更新后的 GPT-5.6 Sol。
ChatGPT 免费版默认模型换成 GPT-5.6 Luna,Chat 模式取消次数限制,本周内陆续推送。Plus 和 Pro 用户在 Chat 中使用的 GPT-5.6 Sol 获得更新,官方称事实准确性和回答质量均有提升,Work 和 Codex 中的 Sol 不在本次范围。
宇树科技8月6日公布科创板IPO战略配售结果,深度求索获配93.339万股,按150.80元/股发行价计算认购金额约1.41亿元。公告将深度求索列为具有战略合作关系的产业投资者,双方计划在通用人工智能研发、高性能通用机器人采购及大模型训练服务等方面合作。深度求索所持股份锁定期为36个月,高于多数产业战略投资者12个月的期限。
深圳具身智能产业催生"数据采集员"岗位,应届生头戴摄像头头盔、腰挂电池包,在超市或写字楼反复做拿取、叠衣等动作上百次,为机器人采集动作数据。该岗位初期月薪可达8000至10000元,今年已流水线化转为时薪或计件制,正常月入降至6000至7000元,并下沉至二三线城市居家采集。
8月5日 Google DeepMind 领导层调整,Demis Hassabis 不再负责 GDM 日常运营,转任 GDM 董事长和 Alphabet 首席科学家,由原 DeepMind CTO Koray Kavukcuoglu 接手日常运营并负责包括 Gemini 在内的模型开发,直接向 Sundar Pichai 汇报。
推荐理由:文章串起 Gemini 3.5 Pro 延期与 DeepMind 组织调整,帮助读者看清这次高层变动与核心人才出走的关联。
OpenAI 宣布 ChatGPT 免费用户文字聊天不再受限,默认模型升级为 GPT-5.6 Luna,免费及 8 美元 Go 套餐用户可用新的"思考"按钮,更新预计下周发布。DeepSeek 公告计划近期整体上调 API 定价,预计涨幅较大。美股存储芯片股大跌,西部数据跌超 13%,SK 海力士跌约 5%。
工信部等部门自2026年起密集落地汽车监管新规,可靠性试验强制准入、OTA新规以及针对L2级辅助驾驶、L3/L4自动驾驶和动力电池的三项强制性国家标准将在2027年前后实施,车企让消费者充当测试员的公测模式走向终结。
8 月 6 日字节跳动全员会上,梁汝波与管理层明确 AI 战略转变:C 端维持豆包产品竞争力,战略重心转向 ToB 生产力赛道,此前一周飞书产品团队已并入豆包、其市场销售与客服体系划入火山引擎。文中提到腾讯 WorkBuddy 6 月单月访问量 2097 万次、居国内 PC 端 AI 原生办公智能体首位,豆包月活 3.45 亿,豆包大模型日均 Token 调用量 180 万亿。
至知创新研究院(IQuest Research)与合作伙伴拆解了 Hyperball 优化器 MuonH 的训练动态,发现其优势主要来自隐式形成的角有效学习率调度,而非更优的更新方向。
黎曼动力、光轮智能和诺亦腾机器人宣布共建具身智能数据底座,计划到2026年底完成100万小时机器人训练数据采集。三方分别负责模型训练、仿真与评测、真实动作数据采集,并将共建数据规范、标注标准和评测基准,部分具身训练数据面向社区开源。据亿欧智库报告估算,当前全球高质量具身交互数据仅约50万小时,而黎曼动力此前已用23.2万小时数据训练出Riemann-1.0。
虎嗅第7场 AI100 闭门会上,智魔科技郭炜凯、智梦可杜宇、维塑科技朱继和云沐资本李津瑶指出,AI 健康硬件把测量精度提升等同于健康问题解决是典型误判。维塑体测仪由教练完成服务交付,智梦可睡眠产品让设备直接干预,智魔足疗仪分体加电池后开机率提高两倍以上。收费方式取决于价值交付给谁:持续影响个人决策可订阅,提高专业机构效率由 B 端付费,即时舒适感靠多 SKU 与耗材复购。
Mistral AI 发布 3B 级规则自适应多模态安全分类器 Shieldstral,可通过统一接口审核文本、图片以及图文混合内容。它把不同审核任务统一为 Yes/No 判断题,支持在推理阶段用自然语言输入自定义审核规则,规则变更时无需重新训练分类器。
Jeff Dean 官宣离开工作 27 年的谷歌,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创立 AI 初创公司 Discovery Loop,方向是机器学习、科学发现与工程开发的自动化。
推荐理由:文章以 Jeff Dean 离职创业为线索,梳理了 Google Brain 走出的一批 AI 创始人去向,可作观察当下 AI 人才版图的参照。