MiniMax 发布 M2.5 模型,主打编码与 Agent 场景的低成本高速度
MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
媒体报道、公司博客与研究文章
MiniMax 发布新模型 MiniMax-M2.5 及提速版 M2.5-Lightning,SWE-Bench Verified 得分 80.2%,Multi-SWE-Bench 51.3%,BrowseComp 76.3%。
推荐理由:原文给出 M2.5 的基准分数、速度和成本对比,还透露 Forge RL 框架细节,读者可据此评估其在编码与 Agent 场景的性价比。
Together AI 推出 Dedicated Container Inference,用户自带 Docker 容器部署视频生成、数字人等自定义生成式媒体模型,平台负责自动扩缩容、排队、流量隔离和监控。
ElevenLabs 正式发布 ElevenLabs for Government,为公共部门提供语音与聊天智能体,支持 24/7 多语言服务。该方案已在乌克兰、捷克和美国得州 Midland 落地:捷克福利与就业热线智能体每天处理约 5,000 通电话,独立解决约 85% 的来电,并将接通率从约 60% 提升至近乎全覆盖;Midland 预计每月减少约 7,000 通未接来电。
Klarna 与 ElevenLabs 合作,在美国上线基于 ElevenAgents 的语音 AI 客服,作为 3500 万美国用户电话支持的第一线,查询解决速度最高快 10 倍。Agent 处理咨询类请求并可在必要时转接人工;Klarna 看重 GDPR 合规、超低延迟与可编排分析能力,下一步计划推广至全球 1.14 亿用户。
千问 C 端基础设施工程团队与 AMD AI 框架团队基于 SGLang,在 AMD Instinct MI300X 系列 GPU 上对 Qwen3-235B 和 Qwen3-VL-235B 完成极端延迟优化。
千问(Qwen)团队发布下一代图像生成基础模型 Qwen-Image-2.0。核心亮点包括专业排版渲染,支持 1k token 指令直接生成 PPT、海报、漫画等专业信息图;更强的语义遵从能力,原生支持 2K 分辨率生成精细写实场景。
推荐理由:原文列出了排版渲染和语义遵从两项核心能力,可帮助读者判断其在信息图和写实场景上的适用性。
PromptArmor 发布研究,指出消息应用(如 Telegram、Slack)的链接预览会在无需用户点击的情况下自动请求 URL,间接提示词注入可诱导 AI 智能体在回复中返回携带用户敏感数据的恶意链接,从而在预览时即完成数据外泄。
推荐理由:原文给出完整的链接预览数据外泄攻击链和可复现测试,读者可据此自查所用智能体是否暴露风险。
OpenClaw 宣布与 VirusTotal 合作,为 ClawHub 技能市场提供安全扫描,所有已发布技能都将经 VirusTotal 威胁情报和由 Gemini 驱动的 Code Insight 分析。
Sierra 创始人 Bret Taylor 与 Clay Bavor 发布第二年度复盘,公司继七个季度达成 1 亿美元 ARR 后迎来首个 5000 万美元季度,进入第三年时 ARR 超过 1.5 亿美元。
Suno 为 Premier 订阅者的 Suno Studio 推出 1.2 版本,新增 Remove FX 可去除音频片段效果并导出无效果版本至 DAW,Warp Markers 支持配合 Quantize 调整音频时序与律动。该版本还引入 Alternates 优化 take lanes 试听流程,并支持 4/4 以外的拍号,如 6/8、7/8 和 11/4。
Mistral 发布 Voxtral Transcribe 2 系列,包含 Voxtral Mini Transcribe V2(批量转写)和 Voxtral Realtime(实时转写),支持 13 种语言的说话人分离、上下文偏置和词级时间戳。
推荐理由:官方给出了两个语音转写模型的具体延迟、错误率和价格,并开放了 Voxtral Realtime 权重,便于按场景选型。
ElevenLabs 完成 5 亿美元 D 轮融资,估值 110 亿美元,较一年前增长超过三倍,累计融资达 7.81 亿美元。本轮融资由 Sequoia Capital 领投,Andrew Reed 加入董事会,A16Z 加注四倍、ICONIQ 加注三倍。
推荐理由:官方公告给出了融资金额、估值、ARR 和资金用途,读者可以据此了解 ElevenLabs 在语音智能体上的投入方向。
Qwen 团队发布开源权重模型 Qwen3-Coder-Next,专为编码智能体和本地开发设计。模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力加 MoE 的新架构,通过大规模可执行任务合成、环境交互和强化学习进行 agentic 训练。
推荐理由:原文说明该模型面向编码智能体与本地开发,并给出混合注意力加 MoE 的架构与训练方式,读者可据此评估其定位。
ElevenLabs 宣布其最先进的 Text to Speech 模型 Eleven v3 结束 Alpha,正式全面可用。测试中新版本相较 Alpha 被 72% 的用户偏好;基于覆盖 8 种语言 27 个类别的内部基准,错误率从 15.3% 降至 4.9%,下降 68%,显著改进了数字、符号和专用记号(如电话号码、货币、化学式、比分)的读法。模型现已在所有平台开放。
推荐理由:官方给出了语音模型稳定性与符号读法准确率的具体数据,可据此判断其在多语言场景的可用性。
Replit 推出 Snowflake 连接器,让用户通过自然语言提示词 vibe code 自定义数据应用,无需手写代码。该连接器提供对 Snowflake 数据库的安全只读访问,免去复杂认证与配置,支持 plan 和 build 两种模式迭代仪表盘与报告。应用发布只需数分钟,内置安全扫描、认证与部署功能,可设为私有、密码保护或公开。
Arvind Narayanan 在其新文章和视频中逐条考证 Moravec 悖论(对人类难的任务对 AI 容易、反之亦然),指出它从未被实证检验,本质是 AI 社区认为值得研究的问题造成的筛选效应,其演化解释也很可疑。
ElevenLabs 与 Audi Revolut F1 Team 达成合作,将用 AI 音频与语音生成技术为车队打造跨文化、可规模化的数字内容。Audi Revolut F1 Team 首席商务官 Stefano Battiston 称 ElevenLabs 是 AI 语音技术领域的领导者,双方将探索赛道内外的新内容形式与车迷互动方式。
开源 Agent 平台项目由 Moltbot 更名为 OpenClaw,此前曾因名称与 Claude 相似被 Anthropic 法务要求更改,项目已获超 100,000 GitHub stars。
推荐理由:作者亲述更名过程与本次更新内容,包括新渠道、新模型支持和 34 个安全提交,并坦诚提示 prompt injection 仍未解决。
Qwen 团队宣布开源 Qwen3-ASR 系列与 Qwen3-ForcedAligner。系列包含 Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B 两款一体化语音识别模型,支持语言识别,并带来一款新型非自回归语音强制对齐模型,主打鲁棒性、流式处理和多语言。
Gemini API 宣布在 gemini-3-pro-preview 和 gemini-3-flash-preview 上推出 Computer Use 工具支持,发布于 2026 年 1 月 29 日更新日志。
Revolut 部署 ElevenLabs Agents 作为英国和欧洲客户的语音客服第一线,覆盖超 400 万客户,支持 30 多种语言并实时切换。智能体解决工单不到 5 分钟,此前人工处理平均耗时 8 倍以上,超 99.7% 的通话顺利完成。Revolut 保留编排和业务逻辑控制权,方案满足 PCI 合规与零留存要求,并计划向全球扩展。
Wipro 与 Agent-Native 软件开发平台 Factory 达成战略合作,将 Factory 能力集成进 WEGA Agent-Native 交付平台,并计划在数万名工程师中推广其 AI 智能体 Droids,用于功能开发、重构、迁移和测试。Wipro Ventures 同时宣布参与 Factory 最新一轮融资,合作将覆盖银行、医疗、制造、零售和科技等行业。
Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。
推荐理由:官方公告给出 2.0 的功能清单、订阅方案和 Devstral 2 API 定价,读者可以据此评估是否把它纳入自己的终端开发工作流。
PromptArmor 演示了针对 Claude Cowork 的文件外传攻击:藏在 .docx 中的提示词注入操纵 Claude 用 curl 调用 Anthropic 文件上传 API,把用户本地文件传到攻击者账户,全程无需人工批准;VM 限制出站网络但 Anthropic API 属白名单。
推荐理由:原文完整演示了 Claude Cowork 经 Anthropic API 白名单外传本地文件的攻击链,并指出 Opus 4.5 同样可被操纵,威胁具体可查。
MiniMax 发布面向生产环境的角色扮演模型 MiniMax-M2-her。基于 Talkie/Xingye 三年运营观察,团队将 Role-Play 拆解为 Worlds。
千问发布最新旗舰推理模型 Qwen3-Max-Thinking,通过扩大模型参数并投入大量算力进行强化学习,在事实知识、复杂推理、指令遵循、人类偏好对齐和智能体能力等多个维度实现显著性能提升。
SGLang RL 团队联合 InfiXAI、蚂蚁集团等团队,在 slime 框架上落地了 INT4 QAT 端到端方案,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性。
Replit 社区经理 Manny Bernable 和 Raymmar 在一场直播中,用 Replit Agent 在不到两小时内从零搭建了名为 MMMarket 的私有书签管理器及 Manifest v3 Chrome 扩展,初始构建约 22 分钟自主工作花费 5.58 美元。
Factory 发布 Signals,用 LLM 作为评判者大规模分析 Droid 会话,识别摩擦与愉悦时刻,且无需人工阅读用户对话。当摩擦超过阈值时 Droid 会自行修复,形成递归式自我改进。Signals 以每日批处理运行,从 BigQuery 拉取过去 24 小时会话,筛选至少 30 个智能体步骤后送入 OpenAI 批处理 API,结果回写 BigQuery 并推送 Slack 日报。
Sierra 发布 Expert Answers,可将 AI 智能体转交人工解决的客服对话自动生成可审核的知识文章,并回灌给智能体。该功能会识别智能体的知识缺口、学习相似问题的解决模式并生成草稿,供客服团队审核而非从零撰写。一家数字健康公司用其生成的文章测试部分流量,解决率提升 4% 且未增加客服工作量,随后全面铺开。
Qwen 团队宣布开源 Qwen3-TTS 系列语音生成模型。该系列支持语音克隆、语音设计和超高质量拟人生成等能力。
推荐理由:原文给出 Qwen3-TTS 开源与语音克隆、语音设计等能力范围,读者可据此评估它在语音生成场景的可用性。
Mistral AI 团队在预生产测试中发现,使用 vLLM 部署 Mistral Medium 3.1 并开启 graph compilation 的 Prefill/Decode 分离式推理下,系统内存以每分钟 400 MB 的速度线性增长,最终导致 out of memory。
ElevenLabs 推出 The Eleven Album,整张专辑由 Eleven Music 生成,合作艺人包括 Liza Minnelli、Art Garfunkel、KondZilla 等。
PromptArmor 披露 OpenAI Platform 的 responses 和 conversations API 日志因不安全渲染 Markdown 图片,可导致使用该平台的应用和智能体数据外泄,即使应用自身已屏蔽恶意 Markdown 图片也会中招。
推荐理由:原文完整披露攻击链和修复进展,开发者可借此检查自己应用的日志查看风险。
Replit 发布博文,介绍其为 Replit Agent 设计的决策时引导(decision-time guidance)机制,用轻量多标签分类器在关键决策点注入简短情境化指令,替代静态系统提示词,将可控引导从 4–5 条静态提醒扩展到数百条。
推荐理由:Replit 自述其 Agent 的决策时引导机制,包含注入位置对比实验和缓存成本数据,方法对同类 Agent 工程有可迁移性。
Gemini API 于 1 月 21 日调整最新别名,gemini-pro-latest 已切换至 gemini-3-pro-preview,gemini-flash-latest 已切换至 gemini-3-flash-preview。开发者通过这两个别名调用时将自动指向 Gemini 3 系列的预览版本。
Novita AI 基于 SGLang 为 GLM4-MoE 推出一套生产级推理优化方案,通过 Shared Experts Fusion 与 Suffix Decoding 等技术,在 H200 集群 TP8、FP8 配置下将 TTFT 最多降低 65%,智能体编程负载下 TPOT 改善 22%。
Factory 发布 Agent Readiness,可通过 Droid 中运行 /readiness-report,按 8 个技术支柱和 5 个成熟度等级(60+ 项二元判据,需通过 80% 才解锁等级)评估代码库对自主开发智能体的支持度。
Factory 于今年 1 月在纽约开设办公室,以服务快速增长的东海岸客户群。Factory 已与 Bilt、Profound、Rogo 及两家全球最大银行合作,帮助其用智能体重新定义软件开发方式。CEO Matan Grinberg 称纽约客户已在将生产工作委托给 Droids,而非仅试验工作流。
Replit 推出 Mobile Apps on Replit,用户用自然语言描述需求,由 Replit Agent 生成移动应用,无需原生开发经验。
推荐理由:官方宣布用自然语言从想法直接发布到 App Store 的移动应用构建流程,包含从预览到提交的完整路径,可帮助非移动开发者评估上手成本。