跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

当前仅显示精选新闻
328条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 41–60 条 · 共 328 条
9月20日周日
  1. Qwen66

    Qwen 官方宣布 Qwen-Image-2.1 现已支持 ComfyUI。引用内容显示该模型为开源权重,单一 7B checkpoint 即可生成和编辑图像,支持原生 2K 图像生成、单次最多 10 张参考图的指令编辑,以及带 alpha 通道的 RGBA 输出。

    引用ComfyUI@ComfyUI

    Qwen-Image-2.1 is now supported in ComfyUI! Open weights. One 7B checkpoint that generates and edits. → Image generation at native 2K → Instruction editing from up to 10 reference images in a single pass → RGBA output, alpha included

    推荐理由:原文列出了原生 2K 生成、多参考图编辑等具体能力,读者可以据此判断是否迁移到 ComfyUI 工作流。

9月17日周四
  1. Anthropic Research75

    Anthropic:Claude 四周内将 30 多个开源生物分子模型平均加速约 4 倍并开源代码

    Anthropic 发布研究结果,Claude 在近四周内优化 30 多个开源生物分子模型(覆盖结构预测、蛋白质设计、基因组学等),平均加速约 4 倍,在输出完全一致时约 2 倍,并开源全部优化代码。

    推荐理由:原文给出加速倍数、成本对比和开源代码入口,读者可以据此评估 Claude 优化对生物建模工作流的实际影响。

9月16日周三
  1. Anthropic Newsroom60

    Dario Amodei 阐述 Anthropic 对开源权重模型的立场

    Anthropic CEO Dario Amodei 发文表示,Anthropic 从未主张禁止开源权重模型,并明确提出三项替代措施:禁止向中国出售高端芯片及芯片制造设备、打击工业规模的蒸馏行为、要求所有足够强大的模型无论开源闭源都接受强制安全测试。

    推荐理由:Anthropic CEO 逐条回应了封禁开源权重模型的指责,并给出芯片管制、打击蒸馏、强制安全测试三条替代政策主张。

9月11日周五
  1. @rohanpaul_ai70

    K2 Horizon 各模型预训练约使用 20T token,语料混合网页、代码、数学、科学、多语言与合成数据,其中约 17% 的预训练语料包含显式推理轨迹。IFM 称预训练阶段约用了 10T 合成 token,后训练生成 1 亿+ 唯一任务,管线通过监督微调、模型合并、强化学习和专用智能体训练发布。已开源的预训练数据集之一 TxT360-v2(5.3 TB)已上线 Hugging Face。

    推荐理由:K2 Horizon 披露预训练用约 20T token 且 17% 含显式推理轨迹,读者可借此对照模型的训练数据构成。

9月10日周四
  1. @testingcatalog77

    DeepSeek V4.1 Flash 已在 Hugging Face 上线,是 DeepSeek 新架构家族中最小的一款模型,采用 552B 参数的 MoE 与新的 Encoder-Decoder 结构,具备原生视觉理解能力。该模型采用新的预训练方法,并进行了更大规模的强化学习后训练。随附的基准表中还列出它与 DeepSeek V4-Pro、V4-Flash 等模型的评测对比。

    引用@deepseek_ai@deepseek_ai

    🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient. 🔹 Introducing the smallest model in our new architecture family, with native visual understanding. 🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models. 1/6

    推荐理由:原文给出 552B MoE 新架构、原生视觉理解的规格与 Hugging Face 入口,可据此判断这款模型的定位。

  2. IT Home84

    DeepSeek 发布 V4.1 Flash 模型,称全面超越 V4 Pro 并下调 API 定价

    深度求索正式发布 DeepSeek V4.1 Flash,这是一款 552B 参数的 MoE 模型,采用新的 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B,具备原生多模态视觉理解能力,官方称在基准测试中超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型。

    推荐理由:官方称其在性能、费用和速度上全面超越 V4 Pro,并同步下调 API 定价,读者可据此判断现有旗舰模型的替换时机。

9月9日周三
  1. Sierra Blog64

    Sierra 开源 Hyper-𝜏-bench 基准,评测模型构建智能体的能力

    Sierra 开源 Hyper-𝜏-bench(论文发表为 𝜏^𝜏-bench),一个长程智能体评测,衡量模型能否端到端构建出可用的客服智能体。开发者智能体在沙箱内从模拟业务记录和模拟客户端恢复规格、设计架构并生成工具,成品在未见过的 𝜏-bench 式测试上验证。

    推荐理由:该基准由 Sierra 开源,独立与协同工程师两种配置的分数对比和五类失败模式,为理解智能体构建能力提供了参考。

9月8日周二
  1. Google DeepMind70

    Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部 90 亿种单碱基变异

    Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组约 90 亿个单核苷酸变异的分子效应预测,数据规模 1 petabyte,超过 AlphaFold Database 30 倍以上。

    推荐理由:官方平台发布,覆盖 90 亿个单核苷酸变异预测并附应用案例,可用于了解基因组变异数据资源的最新规模与获取方式。

  2. @ClementDelangue69

    Mistral AI 宣布完成 30 亿欧元 D 轮融资,称这是欧洲科技公司有史以来规模最大的股权融资,距其成立仅三年。Hugging Face CEO Clément Delangue 转发了这一消息并表示祝贺,称 Mistral 是所有人的灵感,世界需要更多主权与开源 AI,他会继续支持 Mistral。

    引用@MistralAI@MistralAI

    Today marks a major step for Mistral: we’re announcing a €3B Series D, the largest equity round ever raised by a European tech company, just three years after launch. https://t.co/5AexUxyrZM

    推荐理由:Mistral 三年内完成 30 亿欧元 D 轮融资,可作为观察欧洲主权 AI 公司资本动向的一个参考。

  3. Mistral AI76

    Mistral 完成 €3B Series D 融资,估值超 €21B

    Mistral 宣布完成 €3B Series D 融资,投后估值超过 €21B,为欧洲科技公司迄今最大规模股权融资,由三星电子领投,EQT 旗下 Scaleup Europe Fund 和 PSG Equity 联合领投。

    推荐理由:原文是官方融资公告,给出了金额、估值、领投方和资金用途,读者可以据此了解 Mistral 下一阶段的扩张方向。

9月7日周一
  1. @OpenBMB68

    面壁智能发布 MiniCPM5-2B,除模型权重外还开放其数据、训练配方与 RL 栈。公开数据包含 UltraData-Code(约 550B tokens)、UltraData-SFT-Agent-2609(约 50 万样本)、UltraData-RL-2609(8 万+样本)和 UltraX(约 100B tokens、1.14 亿样本)。训练与 RL 方面提供 Meshy 可扩展 RL 训练框架,以及 JustRL II 的 token 级信用分配。

    推荐理由:面壁智能随 MiniCPM5-2B 一并公开数据、训练配方和 RL 框架,读者可了解小模型训练栈的完整构成。

  2. @OpenBMB66

    面壁智能 OpenBMB 宣布开源 MiniCPM5-2B,除模型权重外还开放数据、训练配方和 RL 栈。数据侧包括 UltraData-Code(约 550B tokens)、UltraData-SFT-Agent-2609(约 500K 样本)、UltraData-RL-2609(80K+ 样本)和 UltraX(约 100B tokens / 114M samples)。训练与 RL 部分包括 Meshy 可扩展强化学习框架和 JustRL II 的 token-level credit assignment。

    推荐理由:MiniCPM5-2B 将模型权重与训练数据、配方和 RL 栈一并开放,读者可据此了解其开源范围与资源规模。