跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

当前仅显示精选新闻
574条精选相关主题产品更新论文研究开源生态

最新精选

第 341–360 条 · 共 574 条
7月10日周五
  1. InfoQ · 微信公众号85

    OpenAI 推出 GPT-5.6 三档模型并上线 ChatGPT Work

    OpenAI 正式推出 GPT-5.6 系列,包含旗舰版 GPT-5.6 Sol、均衡版 GPT-5.6 Terra 和轻量版 GPT-5.6 Luna 三款模型,现已通过 ChatGPT、Codex 和 OpenAI API 上线,三档定价分别为每百万输入 Token 5、2.5、1 美元。

    推荐理由:原文给出三档模型的定价与 Token 效率数据,并说明 ChatGPT Work 从问答转向自主执行任务的定位变化。

  2. IT Home81

    OpenAI 上线 GPT-5.6 系列,分 Sol、Terra、Luna 三档

    OpenAI 上线 GPT-5.6 系列模型,覆盖 ChatGPT、Codex 和 API,共分 Sol、Terra、Luna 三档。旗舰 Sol 每 100 万 Tokens 输入 5 美元、输出 30 美元,并新增 Max 推理强度与 Ultra 模式,在 Terminal-Bench 2.1 标准模式得分 88.8%,Ultra 模式达 91.9%。

    推荐理由:原文给出三档模型的定价与 Terminal-Bench 得分,便于比较不同推理强度下的成本与能力取舍。

  3. 数字生命卡兹克 · 微信公众号80

    GPT-5.6 上线并合并 ChatGPT 与 Codex,推出 Sol、Terra、Luna 三个模型

    OpenAI 在直播中正式上线 GPT-5.6,一次推出 Sol、Terra、Luna 三个模型,并把 Codex 应用与 ChatGPT 合并成同一产品。作者实测 GPT-5.6 Sol 在编码和 Agent 执行上幻觉率低,在 Agents' Last Exam 中以 53.6 分比 Claude Fable 5 高 13.1 分。

    推荐理由:作者以数天高强度实测记录了 GPT-5.6 Sol 在编码、Agent 和安全防护任务上的表现,可与 Claude Fable 5 对照参考。

  4. Simon Willison82

    OpenAI 发布 GPT-5.6 系列:Luna、Terra、Sol

    OpenAI 正式发布 GPT-5.6 系列三款模型 Luna、Terra、Sol,按每百万输入/输出 token 计价分别为 1/6、2.5/15、5/30 美元,三者均为 2026 年 2 月 16 日知识截止、100 万 token 上下文窗口与 12.8 万最大输出 token。

    推荐理由:原文给出三档定价并与 Claude 对标,读者可看到双方在智能体与编码基准上的互有胜负。

  5. 赛博禅心 · 微信公众号80

    OpenAI 发布 GPT-5.6 三款模型与 ChatGPT Work

    OpenAI 发布 GPT-5.6,包含 Sol、Terra、Luna 三款模型,并推出对标 Claude Work 的 ChatGPT Work。旗舰款 Sol 在 Agents' Last Exam 测试的 55 个行业长程工作流上得分 53.6,比 Claude Fable 5 高 13.1 分。

    推荐理由:原文梳理了 GPT-5.6 三款模型的分档与命名规则,读者可以据此了解这次发布的产品结构与能力分层。

7月8日周三
  1. ByteDance Seed Research62

    字节跳动 Seed 发布 Seedream 5.0 Pro 图像创作模型

    字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,主打复杂信息可视化、交互式精准编辑、真实影像质感与原生多语种生成四大能力。模型已上线火山方舟体验中心,并将陆续在豆包、即梦上线,项目主页见 https://seed.bytedance.com/seedream5_0_pro。

    推荐理由:官方介绍给出四大能力方向和具体生成案例,读者可以判断它在专业设计场景中的可用性。

7月2日周四
  1. Mistral AI64

    Mistral 发布 Leanstral 1.5:6B 激活参数的开源形式化证明模型

    Mistral 发布 Apache-2.0 开源的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明。模型饱和 miniF2F(验证与测试集均 100%),在 PutnamBench 解出 587/672 题,FATE-H 87%、FATE-X 34% 达到 SOTA,单题成本约 $4。

    推荐理由:官方给出完整基准数据和训练细节,还展示了在 57 个真实仓库中发现 5 个未知 bug 的案例,可了解形式化验证的实际落地。

  2. 赛博禅心 · 微信公众号76

    Fable 5 回归 Claude,输入 10 美元、输出 50 美元每百万 token

    Fable 5 回归,目前可在 Claude 中使用。Pro、Max、Team 和 Enterprise「高级版」每周使用量限额的 50% 可用于 Fable 5,7 月 7 日之后改为按使用积分(usage credits)计费,标准 Enterprise 席位没有免费额度、全部按积分计费。

    推荐理由:原文列出 Fable 5 回归后的可用平台、额度规则与按量计费价格,可与 Opus 4.8 对比使用成本。

7月1日周三
  1. InfoQ · 微信公众号76

    Anthropic 发布 Claude Sonnet 5,成为 Free 和 Pro 默认模型

    Anthropic 突然发布 Claude Sonnet 5,官方称这是迄今最具智能体能力的 Sonnet 模型,重点提升计划制定、工具调用与自主执行,已面向所有套餐开放并成为 Free 和 Pro 用户的默认模型,同时上线 Claude Code 和 Claude Platform。

    推荐理由:文章把 Sonnet 5 的发布放在 Anthropic 高端模型受出口管制、社区反馈平淡的背景下,梳理其性价比定位与争议。

  2. 量子位 · 微信公众号79

    Anthropic 发布 Sonnet 5,标价持平但分词器换代推高实际账单

    Anthropic 发布性价比模型 Sonnet 5,主打 Agentic 能力,agentic coding 跑分 SWE-bench Pro 达 63.2%,标价与 Sonnet 4.6 一致,约为 Opus 4.8 的六成。开发者实测发现,新分词器让同一段英文的 Token 数增加 42%,在 Artificial Analysis 任务上的实际花费反比 Opus 4.8 高出 27%。

    推荐理由:原文用实测对比展示标价不变背后的Token消耗变化,帮助开发者估算迁移到 Sonnet 5 的真实成本。

  3. AI寒武纪 · 微信公众号80

    Anthropic 发布 Claude Sonnet 5 与科研工作台 Claude Science

    Anthropic 发布 Claude Sonnet 5,Agent 能力接近 Opus 4.8,即日起在免费版、Pro、Max、Team 和 Enterprise 套餐开放,API 代号 claude-sonnet-5,上线初期输入每百万 token 2 美元、输出 10 美元,优惠持续到 8 月 31 日。

    推荐理由:Sonnet 5 把此前多在 Opus 系列出现的 Agent 能力下放到更低价位,读者可据此权衡模型选型与成本。

6月30日周二
  1. Google Research60

    Google Research 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为 in-context learning 问题,无需手动训练、超参数调优和特征工程。

    推荐理由:官方一手发布,把表格预测重构为上下文学习问题,读者可以了解其混合注意力架构、合成数据训练与基准结果。

  2. Claude Platform release notes79

    Anthropic 发布 Claude Sonnet 5,1M 上下文、$2/$10 每 MTok 定价并说明迁移变化

    Anthropic 发布 Claude Sonnet 5(claude-sonnet-5),定价 $2/$10 每 MTok(2026 年 8 月 10 日起为标准价),支持 1M token 上下文窗口和 128k 最大输出,工具与平台功能与 Claude Sonnet 4.6 相同,但不含 Priority Tier。

    推荐理由:原文给出迁移行为变化、定价与上下文规格,可供正在评估升级或迁移的开发者直接对照排查。

6月27日周六
  1. AI前线 · 微信公众号82

    OpenAI 发布 GPT-5.6 有限预览版,双推理模式并受政府白名单限制

    OpenAI 发布 GPT-5.6 有限预览版,包含旗舰级 Sol、中端 Terra 和日常 Luna 三款模型,并引入最大推理努力与超模式两种新推理模式。应美国政府要求,目前仅经批准的企业可访问该模型,个人用户暂无获取途径。外部评估机构 METR 称 GPT-5.6 Sol 的检测作弊率高于其评估过的任何公开模型,其时间跨度评估结果不可靠。

    推荐理由:原文把分阶段白名单发布与外部评测发现的作弊问题并列,读者可据此判断此次能力定位的实际边界。