Google 发布 AI 视频联合导演研究,多智能体框架实现分钟级连贯长视频生成
Google Research 发布 AI video co-director 研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题,自动完成多模型提示、镜头衔接和闭环视觉精修。
Google Research 发布 AI video co-director 研究,基于 Gemini 和 Veo 构建统一多智能体框架,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,将长视频生成转化为全局优化与世界状态跟踪问题,自动完成多模型提示、镜头衔接和闭环视觉精修。
Datasette 1.0a41 发布,Alec Garcia 为该版本加入了 OpenTelemetry 支持。该版本还把 Datasette 所有模态对话框重构为单一 Web Component,并已提供文档供其他插件使用。
Claude Code 发布 v2.1.282,新增 maxProseWidth 设置,可限制宽终端中 Claude 正文宽度,表格与代码块仍保持全宽。该版本还新增启动提示及 /status、claude doctor 条目,列出项目设置文件中被忽略或关闭遥测的变量,并修复了会话续接重发旧消息、扩展思考丢失及多处 API 报错等问题。
GitHub Security Lab 的 Antonio Morales 基于自家的 Taskflow Agent 框架构建了 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。
推荐理由:原文给出完整的架构设计、覆盖反馈循环和分层判断方法,读者可以据此把 LLM 智能体接到自己的模糊测试流程里。




在 Krea Agent 中推出自定义应用。 构建按你想要的方式工作的创意工具。角色工作室、3D 查看器、动态效果。只需描述这个应用。 了解更多 + 示例见下方 👇
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为对话模型加入近实时视频生成与视觉形象,今日起在 Gemini Enterprise 提供。该功能支持精确唇形同步、异步工具调用不中断对话、跨 97 种语言的语音到语音同步,并可用参考图定制头像(需企业允许名单),所有输出带 SynthID 水印。
SGLang 的 /v1/score 接口让调用方通过 label_token_ids 显式声明所需标签分数,避免依赖生成响应 top-k logprobs 中是否出现该标签。
物理学家 Matt von Hippel 发文复盘,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 用 Fable 5.1 驱动的 Claude Science 完成他提出的挑战。
推荐理由:物理学家亲历 Claude 用千元级预算独立完成九圈振幅计算,给出对 AI 科研能力和低垂果实的第一手判断。
Anthropic 开放 Claude 插件目录提交,开发者可通过新的提交门户上传插件并在审核通过后上架。插件可打包 MCP 连接器、Agent Skills 或两者,在 Claude Code 中还可包含 LSP、命令、钩子和 agents;门户支持自动校验、安全扫描、审核状态跟踪,上线后提供按产品面和版本划分的安装分析。
推荐理由:官方说明了插件提交、审核与使用分析的完整流程,开发者可以据此决定如何把现有 MCP 连接器或技能打包上架。
Penn,你的新 Buddy 将于 9 月 27 日来到校园! 带上朋友,一起来参加 WorkBuddy 校园见面会。
在北美找工作?💼 让 WorkBuddy 在每一步帮你——从打磨简历、准备面试到比较工作机会。 你的下一个机会,可能始于一个正确的问题。
推出 Agora-2,我们的新一代多智能体世界模型。 Agora-2 支持最多 20 个人类与智能体在同一共享环境中互动,全部实时模拟。 我们的多人研究预览版现已开放体验!
Endura Therapeutics CEO Adrian Sanborn 提出 AI 变革科学研究的两种路径:Foundries 用新技术把实验数据生成速度提高一个数量级,Navigators 用语言模型消化思考盈余、改进运营决策。
Sakana AI 在「日本スタートアップ大賞2026」中获总务大臣奖(信息通信领域),表彰其受自然界进化与集合知启发的高效 AI 开发手法,以及在有限计算资源下实现高性能推理的架构。Sakana AI 表示其采用多个小型高效模型组合的路线,不依赖巨型基础设施,并已在指挥统制(C2)系统中应用 AI 技术。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下加速推理。解码最高提速 3.13x(M5 Max 设备端)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构合作,通过 AlphaFold Database 公开超过 2,800 种病毒的蛋白复合物预测 3D 结构,数据由 AlphaFold2 结合 NVIDIA BioNeMo Inference Runtime 优化推理生成,其中约 30% 的蛋白相互作用此前未被 Protein Data Bank 记录。



Gary Marcus 引用 Jensen Huang 与 Ezra Klein 访谈中“若无法控制软件就应关停实验室”的说法,指出按此逻辑应至少暂时关停 OpenAI。
inclusionAI 开源 Ling 2.0 系列首个模型 Ling-mini-2.0,总参数 16.26B、每 token 激活 1.4B(非嵌入 789M),采用 1/32 激活比 MoE 架构,称可达到 7–8B dense 模型的等效性能,在 H20 上简单 QA 场景生成速度超过 300 token/s,支持 128K 上下文(YaRN)。
推荐理由:官方发布了完整的参数配置、推理速度、训练吞吐和预训练检查点,读者可以据此评估小激活 MoE 在端侧和继续训练中的可用性。
inclusionAI 正式开源 Ling 2.0 架构下的第三个 MoE 大语言模型 Ling-flash-2.0,总参数 100B、激活参数 6.1B(非嵌入 4.8B),基于 20T+ tokens 数据训练并经 SFT 和多阶段强化学习。
推荐理由:官方给出参数结构、基准对比和推理速度数据,读者可据此评估小激活 MoE 替代 40B 稠密模型的可行性。
inclusionAI 发布 Ling 2.0 系列首款旗舰非思考模型 Ling-1T,总参数 1T、每 token 激活约 50B,支持 128K 上下文。
推荐理由:官方模型卡给出架构、训练规模和基准对比细节,读者可据此评估这款万亿参数非思考模型的推理效率与部署方式。
inclusionAI 在 Hugging Face 开源 Ming-UniVision-16B-A3B,基于 MingTok 连续视觉 token,在单一自回归 NTP 框架内统一图像理解与生成,官方称联合训练收敛速度提升 3.5 倍。
inclusionAI 基于 Ling 2.0 架构正式发布 Ring-mini-2.0,总参数 16.8B、激活参数仅 1.4B,经 Long-CoT SFT。
inclusionAI 正式开源思考模型 Ring-flash-2.0,总参数 100B、每次推理仅激活 6.1B,基于 Ling-flash-2.0-base 深度优化。
推荐理由:官方发布完整披露了 icepop 算法、多阶段 RL 训练流程和部署参数,读者可以评估其推理性价比与可复现性。
inclusionAI 正式发布开源思考模型 Ring-1T,总参数 1 万亿、激活 50B,基于 Ling 2.0 架构和 Ling-1T-base,上下文经 YaRN 扩展至 128K,权重可在 Hugging Face 与 ModelScope 下载,并支持 Ling Chat 和 ZenMux 体验与 API 调用。
推荐理由:官方发布开源万亿参数思考模型,给出 IMO 与 ICPC 实测结果和 Icepop、ASystem 训练细节,便于评估其推理与部署价值。
inclusionAI 发布开源万亿参数思考模型 Ring-2.5-1T,采用 1:7 MLA + Lightning Linear Attention 混合线性注意力架构,激活参数从 51B 增至 63B。
推荐理由:原文给出了混合线性注意力的具体效率数字和多项基准成绩,读者可以据此评估它在长程智能体场景中的实际取舍。
inclusionAI 发布并开源 Ling-2.5-1T,总参数 1T、激活 63B,预训练语料扩至 29T tokens,经 YaRN 外推支持最长 1M tokens 上下文。
推荐理由:官方模型卡给出架构、token 效率和长上下文评测细节,可帮助读者评估这款万亿参数即时模型对现有部署工作流的适配。
inclusionAI 开源 Ling 家族旗舰模型 Ling-2.6-1T,参数量达 1T,面向复杂推理、编码和 Agent 工作流。
推荐理由:官方发布万亿参数旗舰开源模型,给出架构设计、benchmark 结果和 SGLang/vLLM 部署细节,便于评估其实际可用性。
inclusionAI 正式开源 instruct 模型 Ling-2.6-flash,总参数 104B、激活 7.4B,采用 1:7 MLA + Lightning Linear 混合线性注意力与高稀疏 MoE 架构。
推荐理由:官方给出架构细节、340 tokens/s 推理速度和 15M tokens 评测用量等数据,也坦承工具幻觉局限,读者可据此评估高频率 Agent 部署场景的适配度。
inclusionAI 发布万亿参数旗舰推理模型 Ring-2.6-1T,主打真实生产环境中的 Agent 执行与复杂推理,上下文长度由 128K 扩展到 256K(YaRN),采用 MIT License 开源。
推荐理由:官方发布页给出 Agent 执行、推理档位和异步 RL 训练的具体做法与基准数字,读者可据此评估其在生产场景的适配价值。
inclusionAI 发布 Ling-3.0-flash-VL,基于 Ling-3.0-flash 扩展原生图像与视频理解,总参数 124B,每 token 激活 5.5B,上下文窗口最高 256K tokens。
inclusionAI 在 Hugging Face 发布 Ling-3.0-flash,为原生混合线性注意力 MoE 模型,总参数 124B、每 token 激活 5.1B,约为此前 1T 级旗舰 Ring-2.6-1T 的 12.4% 和 8.1%,官方称在关键基准上持平或超越前代。
Hy Image 3.5 preview is now live on GMI Cloud @TencentHunyuan $0.024 per image 8.8x cheaper than GPT Image 2 5.6x cheaper than Nano Banana Pro Create now 👇
inclusionAI 发布轻量混合推理 MoE 模型 Ling-3.0-tiny,总参数 7.9B,每 token 仅激活 1.3B,采用 3:1 KDA-MLA 混合线性架构加 128 专家稀疏 MoE FFN。
蚂蚁集团联合多家金融机构与领域专家推出 Ling-3.0-flash-Fin,这是 Ling 系列首个金融增强模型,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,总参数 124B、激活参数 5.1B、上下文窗口 256K。
inclusionAI 在 Hugging Face 发布 AI-Transparency 仓库,按欧盟法规 Article 53(1)(d) 模板公开 Ling、Ring、Ming 系列模型的训练内容摘要。