跳到正文

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

当前仅显示精选新闻
106条精选相关主题千问 Qwen开源生态模型发布

最新精选

第 21–40 条 · 共 106 条
9月10日周四
  1. @kimmonismus74

    DeepSeek 发布 V4.1-Flash,作者引用 DeepSeek 的测试称其在多项编码与智能体基准上追平或超过 GPT-5.6 Sol,而输出 token 价格低 94%。

    引用@kimmonismus@kimmonismus

    DeepSeek just released V4.1-Flash with a new architecture, six weeks after its July V4-Flash update. July’s release improved post-training while keeping the architecture unchanged. (Same with GLM-5.3/Flash) V4.1 introduces a Causal Encoder–Decoder architecture with native visual understanding. DeepSeek reports: - 552B MoE parameters, with 8B active during input processing and 16B during output generation. - KV-cache requirements cut to ¼ of the HBM and ⅛ of the SSD storage versus the previous generation. - Lower API prices. These are *significant* jumps in just a few weeks with post training. This is the new reality we have to adapt to: weekly releases with significant improvements. The company says Flash now beats V4-Pro on capability, cost and speed. Starting September 14, V4-Pro API requests will temporarily route to V4.1-Flash until V4.1-Pro arrives.

    推荐理由:文中给出 DeepSeek V4.1-Flash 的定价与 DeepSWE 基准对比,读者可据此判断价格战对智能体调用成本的影响。

  2. @kimmonismus85

    DeepSeek 发布 V4.1-Flash,距离 7 月的 V4-Flash 更新约六周,改用 Causal Encoder–Decoder 新架构并具备原生视觉理解能力。

    引用@deepseek_ai@deepseek_ai

    🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

    推荐理由:距上代仅六周,DeepSeek 在新架构下同时给出参数量、KV-cache 占用与 API 价格的变化,可与前代直接对照。

  3. @AravSrinivas66

    DeepSeek 发布新架构家族中最小模型 DeepSeek-V4.1-Flash,具备原生视觉理解,主打更强能力、更快推理、更高吞吐,并称可扩展至更大模型。官方以 1/6 系列推文介绍该模型,Perplexity CEO Aravind Srinivas 转发并配文 Wow。配图给出它在 Terminal-Bench 3.0、DeepSWE v1.1、CyberGym 和 Automation-Bench 上的对比数据。

    引用@deepseek_ai@deepseek_ai

    🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

    推荐理由:DeepSeek 新架构家族最小模型亮相,配图给出它在四个基准上与其他模型的对比数据,可据此了解该型号的定位与表现。

  4. @testingcatalog77

    DeepSeek V4.1 Flash 已在 Hugging Face 上线,是 DeepSeek 新架构家族中最小的一款模型,采用 552B 参数的 MoE 与新的 Encoder-Decoder 结构,具备原生视觉理解能力。该模型采用新的预训练方法,并进行了更大规模的强化学习后训练。随附的基准表中还列出它与 DeepSeek V4-Pro、V4-Flash 等模型的评测对比。

    引用@deepseek_ai@deepseek_ai

    🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

    推荐理由:原文给出 552B MoE 新架构、原生视觉理解的规格与 Hugging Face 入口,可据此判断这款模型的定位。

  5. IT Home84

    DeepSeek 发布 V4.1 Flash 模型,称全面超越 V4 Pro 并下调 API 定价

    深度求索正式发布 DeepSeek V4.1 Flash,这是一款 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B,具备原生多模态视觉理解能力,官方称在基准测试中超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型。

    推荐理由:官方称其在性能、费用和速度上全面超越 V4 Pro,并同步下调 API 定价,读者可据此判断现有旗舰模型的替换时机。

9月9日周三
  1. @thexpin65

    美国 NSA、FBI 与 CISA 指控 DeepSeek、月之暗面、阿里巴巴、MiniMax、阶跃星辰等公司自至少 2024 年起以工业规模从美国模型中提取知识。这些机构称相关公司通过多个渠道提交请求以绕过规则,用于提升数学和编码能力。授权情况下的知识蒸馏本身合法,争议集中在访问权限与同意问题上;美方敦促美国开发者立即行动并共享情报,涉事公司暂未回应。

    推荐理由:美国三家机构指控多家中国公司以蒸馏方式大规模提取美国模型能力,争议焦点落在授权与访问同意上。

9月7日周一
  1. @thexpin65

    据 Bloomberg 报道,DeepSeek 计划在内蒙古数据中心用华为昇腾 950DT 运行模型,部署规模取决于芯片供应,这些芯片目前不计划用于训练。华为据称已投入 $20B+ 囤积内存并自行完成封装,950DT 年产量估计在 200K 至 400K–500K 之间,阿里和字节跳动也在争取供应。阿里、腾讯和字节跳动还通过第三方租用 Nvidia B 系列芯片,反映出算力依然紧缺。

    推荐理由:转述 Bloomberg 的报道呈现国产算力供应与部署选择的现状,读者可据此了解算力紧缺对模型运行的影响。

9月5日周六
  1. 虎嗅APP · 微信公众号79

    虚构的百亿份额:投资人为抢 DeepSeek 融资额度落空

    《财经》杂志报道,投资人追逐 DeepSeek 新一轮融资份额数月,最终发现嘉兴时远、青岛浩正等机构兜售的通道份额均未出现在首轮融资交割名单中。多位参与交易人士称,DeepSeek 最新估值约5000亿元,计划在第二轮融资500亿元,并要求投资者锁定期五年。月之暗面已于8月14日声明不存在所谓的朋友基金、老股额度或授权中介,并已就虚假融资乱象向公安机关反映。

    推荐理由:报道还原了围绕 DeepSeek 与月之暗面份额交易的虚假通道和高额费率细节,呈现一级市场 AI 融资的信息不对称。

  2. @rohanpaul_ai69

    据 Bloomberg 报道,DeepSeek 计划在内蒙古吉瓦级数据中心部署 16 万颗华为 950DT 芯片,若建成将是已知最大的华为 AI 集群之一。华为 950DT 面向解码推理与训练,配备 144GB 内存、4TB/s 内存带宽和 2TB/s 互联带宽,按华为路线图定于 2026 年 Q4。报道称这批芯片只能填满该吉瓦级站点的一部分,DeepSeek 其余加速器组合尚未明确。

    推荐理由:报道给出 16 万颗芯片的规模与 950DT 的规格与排期,可据此观察国产算力承接推理负载的进度。

8月29日周六
  1. LMSYS Blog60

    SGLang 发布 SSD Expert Pack,在消费级硬件上运行 DeepSeek-V4-Flash 和 Kimi-K3

    SGLang 将 SSD-LLaMA 的核心思路引入 MoE 推理,把放不进 VRAM 和内存的路由专家权重放在 NVMe SSD 上,通过 Expert Pack 连续布局、O_DIRECT 直接 I/O、pinned 暂存和 GPU 缓存,只加载 router 选中的专家。

    推荐理由:原文给出完整机制说明和单卡实测数据,读者可以据此评估 NVMe SSD 承载超大 MoE 模型的可行性。

8月28日周五
8月27日周四
  1. 量子位 · 微信公众号77

    阿里开源 Qwen3.8-Flash-Next 权重,125B MoE 外加 51B N-gram 嵌入,4090 可跑满血版

    阿里开源 Qwen3.8-Flash-Next 全部权重,这是 Qwen4 新架构的早期预览版,采用 125B 参数 MoE 配 6B 激活参数,并附加 51B 的 N-gram Embedding 参数。

    推荐理由:原文给出了新架构的权重配置与 N-gram 嵌入设计细节,可据此了解消费级硬件部署百亿级 MoE 的路径。

8月26日周三
  1. 机器之心 · 微信公众号77

    阿里发布 Qwen3.8-Flash,同步开源 Qwen3.8-Flash-Next

    阿里发布 Qwen3.8-Flash,并在 Hugging Face 与 ModelScope 开放同一模型的 Qwen3.8-Flash-Next 权重,主模型 125B 参数、每 token 仅激活 6B,千问 AI 平台定价为每百万 token 输入 1 元、输出 3 元。

    推荐理由:文章拆解了 Qwen3.8-Flash 在注意力、残差与嵌入上的四处架构改动,并把它放进每任务成本的行业对比框架里。