Ming-Flash-Omni:蚂蚁集团千亿参数全模态统一大模型的关键技术与实践
蚂蚁集团高级算法专家郭清沛在 QCon 北京站分享了千亿参数全模态统一大模型 Ming-flash-omni 的技术方案。该模型通过 multi-router 与 AnyExperts 解决多模态专家分化与冗余问题,并采用原生多模态训练范式,将多模态与语言的对齐前置到 LM 训练阶段。
按公众号阅读文章与观点
蚂蚁集团高级算法专家郭清沛在 QCon 北京站分享了千亿参数全模态统一大模型 Ming-flash-omni 的技术方案。该模型通过 multi-router 与 AnyExperts 解决多模态专家分化与冗余问题,并采用原生多模态训练范式,将多模态与语言的对齐前置到 LM 训练阶段。
Remix 团队发布 Remix 3 beta 预览版(v3.0.0-beta.5),由联合创始人 Michael Jackson 宣布,这是一次从底层重新构建的版本,将项目从 React 迁移到 Web 平台原生基础能力之上。
OpenAI 在官网刊出题为「Apple is getting this wrong」的文章,回击苹果近期对其提起的诉讼,称苹果的初步禁令申请既基于虚假信息也完全没有必要。
海外独角兽(拾象)基于在硅谷的密集访谈,系统梳理了 frontier lab 外部数据预算背后的 post-training 供应链。文中援引公开报道给出头部玩家增速,Mercor 的 run rate 从去年下半年 5 亿美元升至今年年中 20 亿美元,Handshake 从 5.5 亿美元升至 10 亿美元,Fleet 从 100 万美元突破 6000 万美元并再次翻倍。
DeepSeek V4 Flash 的低价让海外平台争相补贴,OpenCode 称 8 月 1 日单日就跑出 8T tokens,Nous Portal 给 V4 Flash 打了一折、限时 7 天,Cline 则把免费额度翻了三倍。
Founder Park 发布 2026「中国 AGI 创新影响力机构 TOP 30」,从商业价值创新、交互体验升级、技术能力突破、场景深度融合四个维度评选出 30 家公司与产品,横跨模型、Agent、视频生成、具身智能、企业服务、消费硬件和基础设施。
资深 Builder 手工川从 2024 年 10 月起将 99% 的编码工作交给 AI,借助多 Agent 分工与共享上下文,通常能在一周内交付 MVP、一个月左右上线产品。他把开发分为验证需求的 MVP 层和补上并发、测试、稳定性的生产层,并推出开源产品 YODA,统一接入 Codex、Claude Code 等多种 Agent,支持便捷归档与归档前自动提交推送。
Seedance 2.5 于 7 月 31 日正式发布,陆续上线即梦、豆包、扣子、小云雀,API 将在近期通过火山引擎开放,发布当日公布的合作方包括徐工集团、灵初智能、微分智飞、穹彻智能。
灵珠是一个AI应用生成平台,用户可以用自然语言生成小应用,也可以基于他人公开作品用“魔改”功能二创。灵珠于4月20日开启内测、6月25日进入全网公测并上线魔改功能,接入DeepSeek V4后需求分析时间由接近20秒缩短至5秒以内。截至7月16日,公开广场共有1437个上架作品,30至50岁用户占比超过60%,平台累计Token消耗接近100亿。
OpenAI 在纽约哈德逊河谷举办面向创作者的豪华夏令营以推广 ChatGPT Work,参与者每晚房价超 2000 美元,活动帖子发布后遭网友批评虚伪。
特朗普8月3日称美伊谈判第一阶段是开放霍尔木兹海峡,海峡可能最迟周二重开,并称这是伊朗的"最后机会"。亚马逊股价周一盘中涨逾5%,市值首次突破3万亿美元,成为史上第五家达到这一里程碑的公司。智元机器人回应首席科学家罗剑岚离职传闻称"暂未离职,内部岗位调整";知情人士回应月之暗面计划本月内提交香港IPO申请、或募资约30亿美元的消息不实。
阶跃星辰在2026年世界人工智能大会前夕举行的发布会上亮相首款智能体手机 STEPX Neo,印奇也第一次以董事长身份公开亮相,但未公布价格、配置、商业模式和量产节奏。
一位零基础作者用 Codex 全程对话式开发,做出了一个久坐提醒猫爪硬件:ESP32 开发板加舵机,Codex 负责选型、连线指导、代码编写与烧录,还额外生成了一个网页控制台用于调试拍打动作。整个制作周期 5 天,其中 3 天在等快递,作者称手边有零件的话 2 天就够。
Genspark 联合创始人兼 CEO 景鲲在 AGI Playground 2026 的对话中提出,AI 产品的 All in One 核心是上下文的一体化,未来模型会走向商品化,而长期壁垒在于沉淀用户的工作上下文。
牛津、剑桥与帝国理工研究者已用数学证明"模型崩溃":AI用前代AI生成数据训练会导致输出质量不可逆退化。arXiv论文进一步显示,AI生成内容在信息生态中的再生数R₀大于1,无需主动使用AI,正常搜索、阅读、转发就会成为传播链一环。斯坦福2026年AI指数报告称,互联网上超过一半新内容已由AI生成或辅助生成,而Gemini 3给出的"正确答案"中56%无可验证来源。
OpenAI 于 7 月 31 日将 GPT-5.6 Luna 的 API 输入和输出价格均下调 80%,Terra 下调 20%,Codex 与 ChatGPT Work 调用这两款模型时扣除的额度同步减少,旗舰模型 Sol 维持原价。
月之暗面7月17日发布的Kimi K3将输出定价定为100元/百万token,较K2.6/K2.7的27元涨超3.5倍,仍不到Anthropic旗舰Fable 5的一半;一周后Anthropic推出性能接近Fable 5、定价仅其一半的Claude Opus 5。
AGI Playground Singapore 首日活动在滨海湾花园举行,吸引 400+ 名 AI Founders、Builders 及 VC 投资人到场,Genspark CEO 景鲲、OpenAI 亚太区创业生态负责人 Thomas Jeng、AMI 首席科学家 Min Lin 等嘉宾登台分享。
MiniMax 开源视频生成模型 H3,benchmark 上与 seedance2.0 打得有来有回,成本约为后者的 1/2 至 1/3。已有博主用 5090 甚至 4060 显卡在本地跑起来,作者提醒量化版本可能有质量损失。作者把它与 DeepSeek-V4-Flash 以将近 1/100 价格达成接近性能作对比,认为视频生成仍是无限接近但尚未真正到来的 DeepSeek 时刻。
硅星人自建 Agent Long-Task Benchmark,用功能完成度占 70%、证据与可交付性占 30% 的评分测试六个完整项目,发现 Qwen3.8-Max 能把复杂需求拆成项目骨架并完成主体功能,但部署、复现和长程状态一致性仍明显拖分。
千问 Qwen3.8-Max 正式版发布,2.4T 参数、单次激活 95B、100 万上下文,作者实测其综合能力与 Kimi K3 处于同一档位、互有胜负。定价为 $2/百万输入、$6/百万输出,约为 Opus 5 的 30%、K3 的 50%,作者称其前端与写作表现不错。该模型下周正式开源,同时还会开源供开发者本地部署的 Qwen3.8-27B。
DeepSeek V4 Flash 正式版 API 上线公测,用户实测一次提示即可生成能跑能跳能打枪的第一人称 3D 射击游戏,账单约 0.07 美元。
商汤面向社区开源轻量级原生统一多模态模型 SenseNova U1.5-Lite-Preview 的早期预览版,参数规模为 8B-MoT,支持原生 4K 直出。
吴恩达与 Rohit Prasad 于美国时间 7 月 23 日开源的桌面 Agent OpenWorker,上线一周后社区反馈主要集中在多模型兼容、本地数据边界和权限审批三类问题。
一家DAU破亿的AI穿搭出海应用因单用户ARPU仅2美元、云端算力与传输成本却达3美元而陷入"越跑越亏",其原用NVIDIA L4生成一张AI高清图需12秒。该团队转向Akamai推理云并将GPU换为NVIDIA RTX PRO 6000,生图耗时降至3-5秒,所需服务器集群规模缩减75%,流量成本降至$0.005/GB。
智元机器人官网合伙人团队名单中已不见原首席科学家罗剑岚的名字,其个人主页和X简介也不再保留智元相关职务。罗剑岚2025年4月加入智元,曾任合伙人、高级副总裁兼首席科学家,并牵头组建智元具身智能研究中心。此次变动发生在智元2026年7月24日确认启动赴港上市流程后不久,截至发稿双方均未公开宣布。
红熊AI推出分层主动记忆系统MemoryBear,并基于其记忆底座研发通用推理基座OpenBear与AI编程模型CodeBear,MemoryBear已在LoCoMo和LongMemEval两项记忆测试中登顶并开源。该系统由工作记忆、短期记忆与长期记忆三层构成,加入自动遗忘与自我反思机制,区别于传统RAG的被动检索。红熊AI同期发布面向智能客服、智能营销、ChatBI和智能教育四类Agent应用。
Andrej Karpathy 用 100 万 Token 推理预算(约 10 美元)让 Claude Opus 5 把《指环王》第一章开头渲染成 Three.js 三维场景,模型运行约两小时写出约 5500 行代码,成品粗糙但能在浏览器中运行,该帖浏览量已超 280 万。
作者用两周体验荣耀 Robot Phone,认为机身顶部的钛合金机械云台与 YOYO 智能体结合后,手机多了实体化的伙伴感。YOYO 能跨飞书、高德地图、小红书、美团等 App 完成多步骤任务,且任务可全程隐藏在后台运行;云台还会跟随手势做出表情动画,并随音乐节拍摆动。作者判断这台产品仍有瑕疵,更像一次带着很强探索感的尝试。
硅星人 Pro 借一起英国餐馆老板带 AI 上法庭、诉状充斥虚构判例和「[Name of Agent/Third Party]」占位符而被驳回的案例,讨论 AI 从帮你准备滑向替你上场的现象。
Genspark 以 Palo Alto 总部、OpenAI 与 Anthropic 的品牌背书塑造美国 AI 公司形象,其联合创始人景鲲、朱凯华的百度经历被系统性淡化。硅星人Pro 的调查称,支撑其产品扩张的工程团队实际在北京中关村办公,公司对中国开放权重模型只通过 Groq、Fireworks 等第三方推理平台间接调用,同时又签署了黄仁勋发起、支持开放权重的联名公开信。
中美 AI 公司正把教育 AI 的重心从学生端转向教师端,让 AI 进入备课、授课、评价和教学管理流程。
阿里把 QoderWork、悟空、MuleRun(骡子快跑)三个产品的技术整合为千问办公(QwenWork),千问办公事业部由陈宇森带队,8月3日正式开启公测,网页版和独立 PC 客户端已开放。
阿里巴巴发布新一代基座大模型 Qwen3.8-Max,总参数量达 2.4 万亿,在编程、专业工作、长程任务、多模态智能体等场景表现提升。该模型在第三方榜单 Arena 中进入全球第一梯队,编程表现超过 Claude Opus 5 和 Fable 5 的 High 版本。
卡帕西提出用《指环王》替代鹈鹕骑自行车 SVG 测试,作为考察大模型规划与空间理解的新基准。他让 Opus 5 依据《指环王》开头文本,用 Three.js 生成可在浏览器运行的 3D 中土世界,共消耗 100 万 token、2 小时和 5500 行代码。卡帕西表示,模型目前还无法真正进入自己生成的世界,也看不懂视频,项目已开源。
一项 LangChain4j 元实验让代码助手仅凭框架文档就设计出多智能体编码系统,采用监督者模式协调 Explorer、Planner、Implementer、Executor 四个子智能体。该系统成功修复了含 4 个错误方法的 Calculator 类,`mvn test` 运行 11 项测试全部通过,0 失败 0 错误。项目已发布在公开代码库中。
阿里 Qwen 团队算法工程师章程瑞东将在 AICon 深圳站分享《面向 Qwen 系列模型线性注意力的高性能优化实践》,介绍基于 TileLang 的线性注意力算子库 FlashQLA。
Snowflake 携手 InfoQ 于 8 月 4 日 19:00 发起「2026 Data+AI 中场纪实」直播,讨论本体论与企业级智能体落地。
DevOps 一词提出者 Patrick Debois 认为,企业只给开发者发 Claude Code、Cursor 等工具并不等于 AI 转型,Agent 效果不好不该由使用者背锅。
华为在 IJCAI 2026 收录的四篇论文显示其技术路线正从「规模密度」转向「设计密度」。其中层次化 ViT 被扩展至 30B 参数,EHV-5B-MoE 推理时仅激活 67 亿参数,在 ImageNet-1K 线性评测中达 89.0% 准确率,超越 EVA-CLIP-18B。另有可学习帧选择器 LFS、表征感知模块化框架 RaMod,以及面向语码转换语音翻译的 MoE 投影器与多阶段训练方案。