DeepSeek 发布 V4.1-Flash 多模态模型并下调 API 价格
DeepSeek 发布全新模型结构系列中最小尺寸的 DeepSeek-V4.1-Flash,具备原生多模态视觉理解能力,GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471。
推荐理由:DeepSeek 官方更新日志给出 V4.1-Flash 的基准成绩、API 调用方式与定价变化,可据此判断多模态小模型的落地成本。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
当前仅显示精选新闻DeepSeek 发布全新模型结构系列中最小尺寸的 DeepSeek-V4.1-Flash,具备原生多模态视觉理解能力,GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471。
推荐理由:DeepSeek 官方更新日志给出 V4.1-Flash 的基准成绩、API 调用方式与定价变化,可据此判断多模态小模型的落地成本。
ByteDance Seed 正式发布视频生成模型 Seedance 2.5,延续 Seedance 2.0 的多模态音视频联合生成架构,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,可生成数分钟连贯内容。
推荐理由:官方公布单次生成 30 秒、30 张图参考和时间戳编辑等具体能力变化与上线入口,读者可据此评估视频创作工作流。
DeepSeek-V4-Flash 正式版 API 上线公测,调用方式不变,模型名设为 deepseek-v4-flash 即可使用。
推荐理由:官方给出完整的 Agent 基准分数和调用方式,读者可以直接评估是否切换到 deepseek-v4-flash 正式版。
Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型,可通过连续视频流追踪任务进度、编排多步任务,并支持多机器人协作,将运动执行交给下层 VLA 模型。
推荐理由:官方公布具身推理模型的能力指标与 API 入口,开发者可以据此评估它在实体机器人任务编排中的可用性。
Google DeepMind 发布 Gemini Robotics 2 系列模型,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和可本地运行的 Gemini Robotics On-Device 2,实现人形机器人全身控制、精细操作和多机器人协作。
推荐理由:官方完整说明了三个模型的能力分工、适配速度和安全基准,读者可了解机器人全身体智能的最新进展与获取方式。
Kimi K3 发布开放权重并公开 47 页技术报告,包含 2.8T 总参数、104B 激活参数和 100 万 token 上下文。报告重点在 KDA、AttnRes 与 Stable LatentMoE 三项架构改动,分别处理模型变长、变深、变宽后的信息流问题。
推荐理由:技术报告披露的 KDA、AttnRes 与 LatentMoE 三项架构改动,可帮读者理解长上下文和长程 Agent 训练的工程取舍。
月之暗面于 7 月 27 日晚开放 Kimi K3 的模型权重、技术报告和关键 Infra 技术,Anthropic 联合创始人兼 CEO Dario Amodei 随后发文回应称,Anthropic 从未主张禁止开放权重模型。
推荐理由:材料把 K3 开源所需的千万级硬件门槛与开放权重政策争论并置,读者可据此判断开源模型的实际使用边界。
月之暗面正式开源 Kimi K3,参数量 2.8 万亿、激活参数 1040 亿,支持 100 万 token 上下文并具备原生视觉理解,同步发布技术报告。
推荐理由:技术报告公开了注意力、跨层残差与 MoE 负载均衡的具体改动,可借此看清单个开源模型在万亿参数规模上的工程取舍。
月之暗面开源 Kimi K3 的模型权重和技术报告,2.8 万亿参数 MoE,具备原生视觉理解能力,支持 100 万 token 上下文窗口。
推荐理由:权重、技术报告与训练 Infra 一并公开,呈现 2.8 万亿参数 MoE 从架构到线上服务的工程链路。
月之暗面开源 Kimi K3 模型,参数规模 2.8 万亿,同步放出模型权重、技术报告以及 MoonEP、FlashKDA、AgentEnv 三项支撑训练的 Infra 技术。
推荐理由:2.8 万亿参数开源模型把权重、技术报告与训练 Infra 一并放出,可对照开源模型的规模上限与工程路径。
Anthropic 发布 Opus 5 模型,在公告列出的多项基准中表现优于 Fable 5,而 API 价格仅为后者的一半,维持每百万输入 token 5 美元、每百万输出 token 25 美元。
推荐理由:原文给出定价、基准对比与安全策略变化,读者可据此判断 Opus 5 在成本与可用性上的取舍。
Anthropic 正式发布 Opus 5,定价与上一代 Opus 4.8 持平,为每百万 token 输入 5 美元、输出 25 美元,只有 Fable 5 的一半。
推荐理由:Opus 5 以 Fable 5 一半的价格在多项编程评测上反超,读者可以据此比较这代模型的性价比。
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,并继续提供价格为基础模型两倍的 fast mode。发布帖提到,它在某个 Frontier-Bench 任务中无法直接查看图纸,于是自建计算机视觉流程,从原始像素中提取几何并重建出完整零件;它在发现安全漏洞方面接近 Mythos 5,但利用漏洞的能力仍明显落后,因为未被训练相关攻击任务。
推荐理由:文中援引发布帖里的零件重建案例,呈现了模型在缺少直接视图时自行搭建视觉流程的过程。
Anthropic 发布旗舰模型 Claude Opus 5,已成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最高能力模型,输入每百万 token 5 美元、输出每百万 token 25 美元,与 Opus 4.8 价格一致。
推荐理由:Opus 5 以约 Fable 5 一半的价格提供接近的能力,可用于比较现有旗舰模型的性价比取舍。
Anthropic 发布 Opus 5,支持 1M 上下文、最大 128k 输出,网页版已可直接使用,API 与 Claude Code 中的模型名为 claude-opus-5。
推荐理由:原文梳理了 Opus 5 的官方评测与 System Card 细节,读者可对照价格和单任务成本理解其定位。
Anthropic 发布 Opus 5,定价与 Opus 4.8 相同,多项测评成绩大幅优于 Opus 4.8,且相当多成绩高于 Fable 5。
推荐理由:给出了与 Opus 4.8 和 Fable 5 的逐项测评对比,可看这一代在 Agent 编程与电脑操作上的位置。
inclusionAI 在 Hugging Face 发布面向智能体的 MoE 扩散语言模型 LLaDA2.2-flash,非嵌入总参数量 100B,上下文窗口扩展至 128K。
推荐理由:模型卡列出与 Ling-2.6-flash 的智能体基准和吞吐对比,可据此比较扩散架构在工具调用场景的表现。
微软宣布 MAI 模型落地 GitHub Copilot 和 Excel,通过 hill-climbing 方法从 MAI-Code-1-Flash 出发训练出更高效的专用模型。
推荐理由:微软用自家产品数据展示小模型在 Copilot 和 Excel 的效率与成本对比,读者可据此评估专用小模型替代大模型的路径。
Microsoft AI 发布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,两款模型均进入公开预览。
推荐理由:原文给出两款新模型的定价、性能数字和产品落地情况,可据此比较其质量速度成本取舍。
Anthropic 发布 Claude Opus 5(claude-opus-5),较 Claude Opus 4.8 有显著提升,支持 1M token 上下文窗口、128k 最大输出 token,默认开启 thinking,定价维持 $5/$25 美元每 MTok。
推荐理由:官方发布说明给出完整规格、定价与破坏性变更,开发者可直接据此评估迁移方案。