inclusionAI 发布开源全模态模型 Ming-flash-omni 2.0
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
inclusionAI 在 Hugging Face 发布开源全模态模型 Ming-flash-omni 2.0,基于 Ling-2.0 MoE 架构,总参数 100B、激活 6B,称在开源全模态 MLLM 中达到 SOTA。
AMD 收购李飞飞创立的空间智能公司 World Labs,因 AMD 是上市公司,收购价格 82 亿美元得以确认。World Labs 发布的 Atlas 是从零训练的全域模型架构,能从 2D 图像输入预测下一个视角,结合生成模型与多视角几何解决了计算机视觉中长期存在的稀疏重建问题,应用于机器人 RL 环境、场景生成和房产设计等领域。
推荐理由:原文补充了公开公司可查的收购价格,并梳理 Atlas 的稀疏重建能力,读者可了解这笔交易背后的技术底细。
Claude Opus 5.5 本周发布,以 88.4% 登顶 SimpleBench,并被 Anthropic 评为迄今最强视觉模型,成本比 Fable 5.1 低约 60%。在 Terminal-Bench-Science 上,其得分从低推理投入的 24% 升至 xhigh 的 62%,max 档反降至 59%。社区反馈称 200 美元的 Claude Code 套餐已胜过 Codex。
Latent Space 播客邀请 Anthropic 的 Thariq Shihipar 讨论Claude Code的演进方向,涵盖Claude Mods自定义harness、artifacts作为持久生成式界面、云脑与本地双手分离的架构,以及Claude Tag和Projects的多智能体协作。
自一年前成立以来,微软亚洲研究院新加坡实验室已打下坚实基础,深化了与政府、学术界和产业界的合作,并探索了前沿 AI 研究如何创造现实价值:https://msft.it/6019acwE5
美国:250 年致敬。 我制作了这部 5 分钟纪录片,完全由 opus 编排,混剪了美国历史上最具标志性时刻的重制版。
So excited to welcome @theworldlabs and @drfeifei to the @AMD family! I’ve always been a huge fan of Fei-Fei and her pioneering research in AI. Together, we’ll combine World Labs’ deep expertise in AI and world models with AMD’s compute leadership to power the future of AI and strengthen the open AI ecosystem. Can’t wait for all we’ll accomplish!
推荐理由:AMD 收购 World Labs 与李飞飞的消息结合 World Labs 专注世界模型与开放生态的定位,读者可了解这次结合对 AI 开源生态的影响。
9 月 28 日 Manus 面向海外用户发布 2.0 版本,并推出面向个人生活场景的智能助理 Cue。上线不到 12 小时,用户已用其打电话、做机器人游戏、多 Agent 协作规划迪拜旅行等。Cue 中每个 Agent 可拥有自己的邮箱、电话号码、钱包和电脑,代表用户与现实服务交互,多 Agent 可进群聊点餐取号;Manus 正在组建团队开发国内市场产品。
Seedance 2.5 草稿模式现已登陆 Krea。 用 480p 生成做实验——场景合适时再切换到 1080p。 立即体验 👇
研究者提出 RouteFM,将 LLM 路由从针对特定查询负载和候选池的局部拟合,转向可复用的基础模型能力:它从行为上下文刻画匿名候选模型并推断其目标能力,而非绑定固定模型身份。
作者认为 2026 年起 Anthropic 与 OpenAI 的竞争重心从技术创新转向商业模式创新。Anthropic 在 2026 年 3 月推出企业按量计费,一个季度内收入翻倍;OpenAI 约三个月后将其最便宜模型 Luna 降价 80%,run rate 逼近 $70b,两者年内收入均将接近 $100b。
Tacit-TTS 是一个从 IndexTTS2 蒸馏而来的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。在四个中英文数据集上,其对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,同时保持有竞争力的零样本质量。无转写条件还支持跨语言及非词汇参考,如其他八种语言、婴儿咿呀声和合成乱语。
Rules to Tools(R2T)为科学计算场景的 LLM 智能体提供公开科学需求的可执行检查,在 SciCode 修复任务中,工具组完整修复达 29/30,纯文本组为 26/30。
FlexRouter 是一个显式建模模型互补性的 LLM 路由框架,以「答案覆盖」为目标,最大化所选模型中至少一个给出正确答案的概率。它用 Determinantal Point Processes(DPPs)建模路由策略,并通过基于失败集边缘化的训练目标直接优化覆盖,推理时采用边际对数行列式增益的贪心策略,无需预设预算即可自适应确定子集大小。
研究者提出检索增强技能优化框架 RASO,利用外部技能语料库作为先验知识,通过跨 Harness 适配解决领域与 Harness 不匹配问题。RASO 包含无需 agent rollout 即可构建初始技能的 RASI,以及依据执行反馈迭代优化技能的 RASU 两个阶段。在四个 agent benchmark 和两个模型上,RASO 持续优于无检索增强的基线方法。
OpenRouter 比较了自家平台四条图生视频模型线的分辨率、时长、帧控制、音频和价格,覆盖 Veo 3.1、Seedance 2.5 与 2.0 系列、Kling v3.0 和 Grok Imagine Video 1.5,价格数据核查于 2026 年 9 月 11 日。
研究提出 MIST(Misleading-Image Stress Test),用 200 句可作比喻或字面理解的英文句子,分别配对齐图像、误导图像或无图像,要求仅凭句子作答。
arXiv 论文 2609.38349 提出 MILO(Meta-evolutionary Island Orchestration),协同演化 agent harness 与发现 harness 的搜索策略,包含岛屿树层级谱系记忆、重写完整 harness 的 mutator agent 和自适应 orchestrator。
SkillGym 是一套自动流水线,可从互联网抓取技能、筛选可离线复现的工作流,并通过 builder-reviewer 流程构建难度可控的任务,最终生成 6.8k 个环境和 19k 条已验证成功轨迹用于监督微调。
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间完成图像与视频的理解和生成,将图像表示为空间 patch、视频表示为时空 tubelet,通过单层线性投影接入共享多模态主干。
音频-视觉大语言模型(AVLLM)存在源混淆接地幻觉,即未使用模态的线索会诱发所需模态不支持的回答。路径干预与表征分析揭示“问题接力”机制是成因,据此提出的免训练方法 SECRET 通过对比不同模态路径干预诱发的问题表征,将问题状态引向所需源证据。
LoopVL 将 Loop Transformer 扩展到视觉语言模型,通过 Module-Loop 与 Model-Loop 计算,用共享模块迭代更新统一的视觉语言状态。该模型从零开始经语言预训练、多模态训练和后训练,在多模态理解与视觉推理基准上超过同规模及更大规模的非循环模型。研究还观察到 LoopVL 出现"视觉顿悟时刻",即视觉注意力随循环次数发生显著转移。
NEEDLE 提出一种无需训练的后门移除方法,在识别触发词后,通过激活向量估计后门方向和拒绝子空间,并应用顺序权重正交化来抑制后门,同时防止拒绝相关表征发生变化。该方法无需干净参考模型或原始中毒训练数据。在多个模型家族和攻击类型上的评估中,NEEDLE 取得了最低的平均攻击成功率(ASR),在具有挑战性的代码注入攻击上达到 0%,且 KL 散度最低,能力和安全性变化最小。
OpenAI 推出 dots,一种可跨复杂项目与日常任务持续推进工作的主动式助手。dots 让用户在任务推进过程中保持掌控。
HeteroFold 是一种免预填充的跨模型族 KV Cache 传输方法,可在发送方与接收方均冻结的前提下对齐模型结构、映射并校准缓存。在六个传输方向上,它于四个长上下文基准上均取得最佳缓存传输表现,并在多智能体基准上追平文本通信。
TERRA 是一套端到端流水线,仅凭运动学轨迹即可结合地形先验、估计接触与负自由空间证据恢复支撑几何,并在重定向中考虑解剖、肌腱连续性与接触约束。基于五个数据集生成的运动-地形配对,团队用 9.4 小时多样化运动数据训练出单一肌肉驱动控制策略,在重建、重定向与留出跟踪基准上提升地形精度、大幅减少解剖与交互违规,并在各类支撑地形上取得最高完成率。
研究者推出 RLE-Bench,一个覆盖交互控制、策略学习、感知与估计、机械设计四类机器人开发工作流的基准,用于评估编码智能体的工程能力。该基准按任务特定指标评估智能体提交的产物,并汇总为 RLE Index,同时给出各工作流的能力画像。论文还通过案例研究分析了智能体在代表性任务上的表现与局限。
针对音视频联合扩散模型的多奖励强化学习,研究者提出 Adaptive Reward Routing,在 DiffusionNFT 前向过程 RL 中同时自适应调整更新位置与奖励组合。
E-MoE提出将反向生成过程构建为基于MoE骨干网络专家路由决策的离散共享隐变量上的因子化分布混合,在不增加活跃参数的前提下提升少步生成质量。在合成多模态基准、二值化MNIST和LM1B上,E-MoE均优于因子化基线模型,缓解了掩码扩散模型在少步场景下因位置因子化导致的样本质量限制。
一项研究提出"预测信用"协议,通过配对预测衡量研究智能体给出的科学解释对实验预测的增益,在336个前瞻状态、12个Tox21端点和24个OpenML任务上测试,v5的冻结信用判定未能得出结论。
OTRetarget 提出一种统一方法,可从人类演示中联合重定向机器人与多物体运动,通过熵最优传输在人体、机器人和物体几何间迁移表面交互量,并融入约束逆运动学以兼顾接触保持与运动风格。
研究通过保留每个注意力头、层和查询中注意力权重最高的 token 并测量 NLL 增幅,估算语言模型维持损失容差所需的有效注意力集合大小。基于注意力的选择显著优于随机选择,扩展上下文会增大所需集合大小但其占上下文比例下降,对保留权重重新归一化可大幅缩小该集合。
Prompt2Skill 是一个仅凭自然语言任务描述即可构建技能的无监督框架,能从提示词中推导任务规范、发现或合成数据集,并通过反思式编辑闭环迭代优化技能。在问答、阅读理解、电子表格操作和数学推理四个领域,该框架平均提升 10.8 分,持续优于直接提示基线。
CorrGRPO 提出将 GRPO 中成对奖励协方差归一化为皮尔逊相关系数,在不改变中心化总奖励的前提下,平衡不同尺度奖励对归一化的影响,避免大尺度奖励主导优势值计算。研究者在代码生成、工具调用和智能体安全三类任务上,使用 0.5B 至 8B 参数的模型进行对比,结果显示 CorrGRPO 在三项任务上均优于 GRPO 及其他变体。代码已开源。
Apple 研究者提出往返协议,用生成器把算术表达式转成应用题、再由提取器还原,以符号等价作为精确判定,测试十六个模型的全部两两组合。结果显示该信道有损且不对称:交换生成与提取角色可使准确率变化最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开源权重模型超过未训练的 Gemini-3.1-Pro。
研究者提出受控解码攻击框架,可在仅返回采样文本的黑盒 LLM 接口上绕过安全对齐。该方法通过采样分布重建、风险门控残差控制和推测式多 token 执行,将采样成本集中在少数关键位置。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。
MIT Technology Review 发布圆桌讨论,检视美国南部边境"虚拟墙"的失效。过去 25 年美国投入数十亿美元沿边境建造监控塔,但该媒体的调查记录了超过一千名在监控塔覆盖区域内未被拦截、最终死亡的人,其中部分人处于新装的 AI 自动识别监控塔的监视范围内。