推荐理由:给出了 V4.1-Flash 的稀疏激活与记忆查找设计,读者可据此对比 V4-Flash 的持久 KV 占用变化。
DeepSeek
全部主题DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。
当前仅显示精选新闻最新精选
第 21–40 条 · 共 106 条@SemiAnalysis_@SemiAnalysis_精选AI 评分7272 
@kimmonismus@kimmonismus精选AI 评分7474 DeepSeek 发布 V4.1-Flash,作者引用 DeepSeek 的测试称其在多项编码与智能体基准上追平或超过 GPT-5.6 Sol,而输出 token 价格低 94%。

引用@kimmonismus@kimmonismusDeepSeek just released V4.1-Flash with a new architecture, six weeks after its July V4-Flash update. July’s release improved post-training while keeping the architecture unchanged. (Same with GLM-5.3/Flash) V4.1 introduces a Causal Encoder–Decoder architecture with native visual understanding. DeepSeek reports: - 552B MoE parameters, with 8B active during input processing and 16B during output generation. - KV-cache requirements cut to ¼ of the HBM and ⅛ of the SSD storage versus the previous generation. - Lower API prices. These are *significant* jumps in just a few weeks with post training. This is the new reality we have to adapt to: weekly releases with significant improvements. The company says Flash now beats V4-Pro on capability, cost and speed. Starting September 14, V4-Pro API requests will temporarily route to V4.1-Flash until V4.1-Pro arrives.
推荐理由:文中给出 DeepSeek V4.1-Flash 的定价与 DeepSWE 基准对比,读者可据此判断价格战对智能体调用成本的影响。
@kimmonismus@kimmonismus精选AI 评分8585 DeepSeek 发布 V4.1-Flash,距离 7 月的 V4-Flash 更新约六周,改用 Causal Encoder–Decoder 新架构并具备原生视觉理解能力。

引用@deepseek_ai@deepseek_ai🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6
推荐理由:距上代仅六周,DeepSeek 在新架构下同时给出参数量、KV-cache 占用与 API 价格的变化,可与前代直接对照。
MarkTechPost精选AI 评分8080 DeepSeek 发布 DeepSeek-V4.1-Flash,支持 1M 上下文与 FP4 KV 缓存
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,具备 1M token 上下文窗口,全局 KV 缓存占用约 890 字节每 token,约为 DeepSeek-V4-Flash 的 1/4。
推荐理由:DeepSeek-V4.1-Flash 把全局 KV 缓存压到 890 字节每 token,长上下文推理的部署成本变化构成主要看点。
@AravSrinivas@AravSrinivas精选AI 评分6666 引用@deepseek_ai@deepseek_ai🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6
推荐理由:DeepSeek 新架构家族最小模型亮相,配图给出它在四个基准上与其他模型的对比数据,可据此了解该型号的定位与表现。
@testingcatalog@testingcatalog精选AI 评分7777 
引用@deepseek_ai@deepseek_ai🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6
推荐理由:原文给出 552B MoE 新架构、原生视觉理解的规格与 Hugging Face 入口,可据此判断这款模型的定位。
@deepseek_ai@deepseek_ai精选AI 评分6868 推荐理由:官方给出 V4.1-Flash 与 V4-Pro 在性能、成本、速度和总运行时间上的比较结论及旧模型的迁移时间表,可供选择接入版本时参考。
IT Home精选AI 评分8484 DeepSeek 发布 V4.1 Flash 模型,称全面超越 V4 Pro 并下调 API 定价
深度求索正式发布 DeepSeek V4.1 Flash,这是一款 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B,具备原生多模态视觉理解能力,官方称在基准测试中超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型。
推荐理由:官方称其在性能、费用和速度上全面超越 V4 Pro,并同步下调 API 定价,读者可据此判断现有旗舰模型的替换时机。
DeepSeek · 微信公众号精选AI 评分8282 DeepSeek 发布 V4.1 Flash:原生多模态并下调 API 定价
DeepSeek 正式发布 V4.1 Flash 模型,这是其新模型结构系列中最小尺寸的版本,具备原生多模态视觉理解能力,已同步上线 API,模型名改为 deepseek-flash 即可调用。
推荐理由:原文给出非对称 MoE 结构与 KV Cache 压缩的具体数字,可据此判断多模态模型的部署成本变化。
DeepSeek API updates精选AI 评分7878 DeepSeek 发布 DeepSeek-V4.1-Flash,API 价格同步下调
DeepSeek 正式发布 DeepSeek-V4.1-Flash,是全新模型结构系列中最小尺寸模型,具备原生多模态视觉理解能力,设计目标是能力上限更高、推理更快、吞吐更大。
推荐理由:官方公布了新结构系列最小模型的多项基准成绩和 API 迁移方式,开发者可据此评估切换成本与价格变化。
LMSYS Blog精选AI 评分6767 SGLang 与 Miles 发布 DeepSeek-V4.1 Day-0 支持
SGLang 与 Miles 团队宣布为 DeepSeek-V4.1 提供 Day-0 支持,讲解其 SWA、mHC、Engram 记忆等架构及推理与 RL 训练优化。
推荐理由:原文详解 SGLang 与 Miles 对 DeepSeek-V4.1 的 Day-0 支持,给出 Engram offload、bounded replay 等实测数字和可复现配置。
@thexpin@thexpin精选AI 评分6565 
推荐理由:美国三家机构指控多家中国公司以蒸馏方式大规模提取美国模型能力,争议焦点落在授权与访问同意上。
@rohanpaul_ai@rohanpaul_ai精选AI 评分7979 
推荐理由:公告列出了被指控的蒸馏渠道与行为检测指标,读者可看到模型输出和账号用量如何被当作判定依据。
@thexpin@thexpin精选AI 评分6565 
推荐理由:转述 Bloomberg 的报道呈现国产算力供应与部署选择的现状,读者可据此了解算力紧缺对模型运行的影响。
虎嗅APP · 微信公众号精选AI 评分7979 虚构的百亿份额:投资人为抢 DeepSeek 融资额度落空
《财经》杂志报道,投资人追逐 DeepSeek 新一轮融资份额数月,最终发现嘉兴时远、青岛浩正等机构兜售的通道份额均未出现在首轮融资交割名单中。多位参与交易人士称,DeepSeek 最新估值约5000亿元,计划在第二轮融资500亿元,并要求投资者锁定期五年。月之暗面已于8月14日声明不存在所谓的朋友基金、老股额度或授权中介,并已就虚假融资乱象向公安机关反映。
推荐理由:报道还原了围绕 DeepSeek 与月之暗面份额交易的虚假通道和高额费率细节,呈现一级市场 AI 融资的信息不对称。
@rohanpaul_ai@rohanpaul_ai精选AI 评分6969 

推荐理由:报道给出 16 万颗芯片的规模与 950DT 的规格与排期,可据此观察国产算力承接推理负载的进度。
LMSYS Blog精选AI 评分6060 SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3
SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。
推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。
@rohanpaul_ai@rohanpaul_ai精选AI 评分7070 
推荐理由:MLE-bench 的对比数据展示了自主研发系统的成绩,共享研究图谱的复用机制是其中可关注的设计。
量子位 · 微信公众号精选AI 评分7777 阿里开源 Qwen3.8-Flash-Next 权重,125B MoE 外加 51B N-gram 嵌入,4090 可跑满血版
阿里开源 Qwen3.8-Flash-Next 全部权重,这是 Qwen4 新架构的早期预览版,采用 125B 参数 MoE 配 6B 激活参数,并附加 51B 的 N-gram Embedding 参数。
推荐理由:原文给出了新架构的权重配置与 N-gram 嵌入设计细节,可据此了解消费级硬件部署百亿级 MoE 的路径。
机器之心 · 微信公众号精选AI 评分7777 阿里发布 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next
阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。
推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。