指令遵循媲美Seedance 2.0,复旦腾讯联合提出Baton,多说话人场景M-WER暴降76%
复旦与腾讯混元团队提出 Baton,一个基于显式语义蓝图引导的联合视频音频生成框架,先用可学习 MLLM 完成跨模态语义规划,再把 planned tokens 注入扩散模型指导生成。
微信公众号
复旦与腾讯混元团队提出 Baton,一个基于显式语义蓝图引导的联合视频音频生成框架,先用可学习 MLLM 完成跨模态语义规划,再把 planned tokens 注入扩散模型指导生成。
Meshy 发布 3D 创作 AI Agent「Meshy 3D Agent」,称其为全球首个 3D 创作 AI Agent,可通过多轮对话完成从概念探索到模型导出的完整流程。
八点八数字旗下 AI 短剧协作平台 AniShort 完成近亿元融资,由北京泰中合领投,老股东全线加码,为 2026 年国内 AI 短剧工具类产品最大单笔融资。
6月10日,阿里千问发布高考志愿填报Agent,免费为全国考生提供志愿填报咨询,核心能力包括志愿日历、志愿报告和志愿问答。该Agent基于专门针对高考志愿填报打磨过的Qwen大模型,结合夸克8年高考服务数据与经验,知识库覆盖全国近3000所高校、2000多个专业。
2026年谷歌I/O大会上,抖音作为中国区首席内容合作平台携12位科技创作者组成“前沿科技首发团”赴现场,创作者用Gemini手搓AI求签器让Google DeepMind CEO Demis Hassabis现场抽签。
商汤科技执行副总裁林达华在 2026 中国 AIGC 产业峰会上提出,AI 需打破"预测下一个 token"范式,将理解、推理与生成统一到同一模型。商汤今年 4 月发布的 SenseNova-U1 仅 8B 体量,就在空间智能多个国际权威榜单上超越 GPT-5 和 Gemini,并在理解、推理、生成三方面达到单一模型 SOTA。
抖音发起 AI 创作大赛,总奖池 400 万现金加 2000 万即梦积分,单人最高可获 100 万现金加 100 万积分。赛事设开放赛道和命题赛道,要求原创 AI 叙事片时长不低于两分钟,工具和模型不限,命题赛道由贾樟柯、陈思诚、薛晓璐、紫金陈出题。征稿从 6 月 10 日持续到 8 月 20 日,共 128 个获奖名额,即梦为深度合作伙伴。
香港科技大学(广州)、中南大学和上海大学联合团队在 KDD 2026 开源多层次学习框架 BatteryMFormer,用于早期电池衰老轨迹预测(BDTF)。该模型在 Li-ion、CALB、Na-ion、Zn-ion 四个电池域上均取得最优性能,相较次优模型 MAPE 最多降低 17.66%、MAE 最多降低 17.65%。在仅保留 50% 训练电池的低数据设置下,它仍优于强基线模型。
Anthropic 今天凌晨发布 Fable 5 与 Mythos 5 后,多位用户实测发现 Fable 5 的安全护栏触发频率远高于官方宣称的不到 5%,普通编码任务或日常打招呼都可能被自动切回 Opus 4.8。
推荐理由:文章梳理了 Fable 5 安全护栏与防蒸馏机制的设计细节,可帮助读者理解用户实测中被切回 Opus 4.8 的体感落差。
OpenAI 内部正在测试代号 kindle 和 kepler 的两个 GPT-5.6 检查点,其中 kindle-alpha 被选为发布候选版,网友实测显示其前端/UI 生成能力大幅提升,无需复杂提示词即可产出更强界面。
Anthropic 发布 Claude Fable 5,称其进入 Mythos 新段位,模型开放首日开发者集中实测其编码、设计与网页搭建能力。网友将其与 GPT-5.5 同台对比,在《我的世界》复刻推特中 Fable 5 还原度更高,另有开发者称其在 FC Diamond 榜单成功率从 Opus 4.8 的约14%升到30%以上。
推荐理由:汇总模型开放首日开发者在编码、设计与网页搭建上的实测反馈,可与前代及竞品表现对照。
Anthropic 发布 Claude Fable 5 与 Claude Mythos 5 两个版本,Fable 5 面向所有用户开放,Mythos 5 只给少数受信任用户使用,两者统一定价为每百万输入 Token 10 美元、每百万输出 Token 50 美元,比之前的预览版便宜一半以上。
推荐理由:两款同内核模型按权限分级,Fable 5 用分类器降级路由兼顾能力与安全,可观察前沿模型的形态变化。
奇绩创坛2026春季路演日上,56个早期AI创业项目中39个聚焦Agent,19个做具身智能,Researcher Founder占比达45%。陆奇称2025年11月Claude Opus 4.5与Claude Code结合让AI具备能动性,是里程碑拐点。肆爱科技等公司通过外卖骑手众包网络采集室内多模态数据,为具身智能打造「导航大脑」。
远景联合腾讯在赤峰建成全球首个系统级"算电协同"项目,基于2GW级100%新能源独立电力系统,通过EnOS智能物联操作系统和能源大模型实现风电、光伏、储能、算力与氢能的动态实时协同,数据中心综合能源成本降低40%以上。远景同时在乌兰察布推进吉瓦级"星河基地",尝试能源与算力系统的一体化原生融合。
字节跳动 Intelligent Creation Lab 开源原生统一多模态模型 Lance,激活参数仅 3B,在同一个模型里打通图像与视频的理解、生成和编辑。
AppLovin创始人兼CEO Adam Foroughi在UC Berkeley毕业演讲中自述"平庸",却带领公司市值一度逼近2500亿美元。2022年股价暴跌92%后,他关停投资者关系部门、举债约60亿美元回购股票,并推动广告引擎Axon 2.0重构,两年多股价从9.14美元涨至最高745.61美元。上季度营收18.42亿美元、净利润12.06亿美元,调整后EBITDA利润率85%。
OpenAI 确认已向 SEC 提交保密版 S-1,正式启动上市准备程序,并同日发布 Sam Altman 与首席科学家 Jakub Pachocki 联合撰写的第三阶段战略长文《Built to benefit everyone: our plan》。
推荐理由:OpenAI 在 Anthropic 递交保密版 S-1 后公开自身 S-1,并发布第三阶段战略长文,读者可看到其上市叙事与竞争节奏。
小冰之父李笛创立的 Nextie(明日新程)发布行业首个认知模型「新程Alpha」,仅 4B 参数,可在苹果 MacBook 等端侧设备直接部署。该模型在群体智能任务上效果不输 GPT-5.4 等大参数模型,算力成本下降一个数量级,并解锁 Agent 7x24 小时主动规划执行。Nextie 透露泛化能力更强的 8B 认知模型正在加速训练。
DeepSeek 官网最新上线“IDC 设计规划工程师”岗位,招聘信息明确将参与从 MW 到 GW 级基础设施的规划与建设。该岗位覆盖数据中心园区规划、电力与制冷系统评审、液冷与高密度供配电、模块化建设等技术方向,工作经验不限,并为 7 年以上资深候选人设置独立进阶通道。
云知声推出新一代基座模型 U2,以 2660 亿参数达到 1.2 万亿参数模型的性能,参数效率接近后者 5 倍,思考 Token 消耗可减少约 25%。U2 定位原生智能体模型,在 IFBench、Claw 系列 Agent 评测和 GDPval 办公能力评测中进入前排,并已上线云知声 Token Hub,支持 OpenClaw/Hermes 等主流 Agent 脚手架。
M-A-P 开源社区与南京大学等团队发布 Lean 4 定理证明框架 OProver,将检索增强、编译器反馈与多轮修复内化到训练策略中。OProver-32B 在五个 Lean 4 whole-proof prover 评测中取得三项第一、两项第二,并在全部五项评测中超越 671B 的 DeepSeek-Prover-V2。
苹果在 WWDC 2026 上把 Siri 升级为 Siri AI,其新一代 Apple Foundation Models 由谷歌 Gemini 深度定制,并补上屏幕感知、跨 App 搜索、联网检索与多步骤任务执行等 Agent 能力。
腾讯在 2026 腾讯云 AI 产业应用大会上正式发布 WorkBuddy 企业版,定位「企业 AI 办公统一入口」,通过专家、助理、团队三层能力让任务、角色、上下文与经验在组织内协同沉淀。
量子位面向 AI 产业、AI 财经、AI 产品三大方向招聘全职编辑作者,工作地点为北京中关村,社招覆盖编辑、主笔、主编各层级,校招接受应届生实习并可转正。应聘者需将简历及代表作品发送至 zhaopin@qbitai.com,邮件主题注明“量子位XX方向应聘 - 姓名”。截至 2025 年,量子位微信公众号订阅用户超 240 万,全网用户超 700 万。
小红书正式上线 RED Skill,目前处于内测阶段,创作者可在笔记下方挂载 Skill,用户点开即可一键复制到自己的 AI 助手里使用。上传支持文件夹和对话口令两种方式,也可让 Codex、Claude Code 等助手代为上传;内测期间站内已发布近千个原创 Skill。该功能已在「新功能体验」上线,后续计划 7 月全量覆盖所有创作者,Skill 站内直接运行和付费售卖能力尚未打通。
伦敦大学学院团队开源长视频理解框架 VAM(Visual Agentic Memory),通过在线索引、分层记忆与智能体检索,把视频转为可回溯的视觉记忆。在 OVO-Bench 上 VAM 取得 68.41 的 RT+BT 平均分排名第一,底座模型一致时性能提升约 1 个百分点;在跨度 51 天、总时长 105.6 小时的 MM-Lifelong 测试中也展现出高效表现。论文与核心代码已公开。
量子位正在招聘一名小红书AI内容运营,负责追踪X、arXiv、论文和发布会等AI热点,并将硬核AI资讯转化为小红书笔记,同时承担数据复盘、增长和评论区维护。该岗位不卡年龄学历经验,要求网感在线、能把复杂技术讲简单,有新媒体运营或科技资讯账号案例者加分。简历和作品可投至 zhaopin@qbitai.com,邮件标题为“小红书编辑+姓名”。
同一张高考数学卷以图像输入分别交给豆包思考模式和 ChatGPT(GPT-5.5)作答,两者在选择题和填空题上全部回答准确,解答题过程分仍需专业老师评估。测试显示,头部 AI 已能稳定完成多步推理、函数分析、概率建模和解析几何计算,但多选题和压轴题仍建议人工复核关键步骤。
微软亚洲研究院与清华大学提出 VITRA 预训练框架,将海量无标注真实人类活动视频自动转化为与机器人 V-L-A 训练格式对齐的数据,构建了包含 100 万个片段、2600 万帧的手部 V-L-A 数据集。
原力灵机通过股权并购完成与物流机器人公司 Atomix 的合并,将自研 DM0 具身原生大模型与真实仓储分拣场景打通。智谱、阶跃星辰、商汤、阿里共同押注其新一轮融资。创始人兼 CEO 唐文斌提出,Picking 之于具身智能正如 Coding 之于大模型,能让数据从采集型走向场景型飞轮。
SpaceX 在 IPO 路演 PPT 中计划于纳斯达克上市,发行 5.556 亿股、每股 135 美元,预计 6 月 11 日定价,估值 1.77 万亿美元。PPT 把 SpaceX 重新定位为横跨太空、通信与 AI 算力的未来基础设施公司,募资用于扩建 AI 算力基础设施、升级发射设施与运载火箭等。文件还给出轨道 AI 算力路线图,并提到谷歌将每月付费 9.2 亿美元租用 xAI 的算力。
推荐理由:SpaceX 在 IPO 路演中将 AI 算力写进核心叙事,读者可据此看到太空、通信与 AI 如何被打包成同一套估值逻辑。
中国公司安纳智芯(Anatrix)基于存储器阵列搭建非冯诺依曼架构芯片,将矩阵方程直接映射进物理电路,实现一步原生求解,而GPU求解同类512×512矩阵方程需上亿次乘法迭代逼近。团队去年完成精度媲美数字芯片的原理性验证,相关芯片今年已进入流片阶段,其模拟芯片在接口、数据格式和互联方式上兼容现有GPU体系,且不依赖最先进制程。
OpenAI 高管提出「Chat 已死」,公司正推进 ChatGPT 诞生以来最大规模改版,目标是从聊天机器人变成个人 Agent 式的超级应用。改版由 Codex 承担 Agent 能力,其周活已超 500 万、非开发者用户占 20%,并新增可直接操作电脑、并行运行多个 Agent 等能力。动因是 ChatGPT 虽在 5 月突破 10 亿月活但多数用户免费,企业端支出正被 Claude 抢占。
推荐理由:文章梳理了 OpenAI 把 ChatGPT 从聊天框转向 Agent 超级应用的路线,并用 Codex 与 Claude 的数据呈现其转型压力。
OpenAI 自研芯片项目硬件二号员工 Clive Chan 在 X 上宣布离职,并于本周加入 Anthropic。他自 2024 年 1 月加入 OpenAI,主要参与与博通合作的 10GW 定制 AI 加速器设计,据称采用台积电 3nm 工艺,此前他曾透露该芯片将于 9 个月后量产。
城大与快手可灵提出 VLM-as-Teacher,让 VLM 不再先写答案,而是在测试时充当老师,自动生成 final-goal 查询和若干 process 查询,把 VLM 回答 Yes 的概率转成可微 VQA reward,再通过在线测试时优化只更新 VGM Reasoner 的轻量 LoRA 模块,冻结 VGM 主干和 VLM Teacher。
Wall Street Prompt 由 Felipe Sinisterra 和 Dave Wang 创立,向花旗、美国银行、T. Rowe Price 等金融机构提供每节 2.5 万美元的 AI 培训课,教员工用 AI 分析路演视频和财报电话会议。两人还搭建了理解金融机构思维方式的 AI Agent 库,目标让 AI 承担 90% 的事务性工作,并计划推出约 1500 美元一人的直播课。
量子位面向 AI 产业、AI 财经、AI 产品三大方向招聘编辑、主笔、主编,岗位为全职,工作地点在北京中关村,社招与校招(可实习转正)均开放。应聘需将简历及代表作品发送至 zhaopin@qbitai.com,邮件主题注明“量子位XX方向应聘 - 姓名”。
京东开源长视频生成框架 JoyAI-Echo,用跨模态音视频记忆库、记忆驱动后训练和轻量化实时超分,应对长视频中角色与音色前后不一致、生成慢和清晰度低的问题。官方评测显示其语音准确率为 0.8646,用户盲测中对音频质量的偏好达 81.7%、画面偏好 63.6%、提示词遵循偏好 80.6%、IP 一致性偏好 59.4%。
图灵奖得主、AI 教父 Geoffrey Hinton 在最新访谈中表示,他相信 AI 已经有意识,人类必须接受智能不一定来自生物体。他把这看作继哥白尼、达尔文之后人类再次意识到自己并不特殊的时刻,并说自己对此很不快乐,因为人们在 AI 风险控制上投入不够。他提到短期风险包括可能的大规模失业,长期风险是超级智能比人类聪明得多,届时人类很难再掌握控制权。
上海交通大学 IPADS 与华为鲲鹏团队提出操作系统级抽象 DeltaState,并基于此实现智能体沙箱原型系统 DeltaBox,将存档延迟压到 11 毫秒、读档回滚压到 2 毫秒。